← 返回技术规格

恢复规格 · 2019

汽车口碑分析平台技术规格

从 Go 后端、Vue 前端与汽车采集器恢复出的车型主数据、评论清洗、相似检测与分析查询规格。

汽车数据GoVueMongoDB

1. 系统目标

系统把汽车网站上的品牌、车系、车款、配置和车主口碑转换为统一数据,并为研究人员提供车型筛选、评分比较、评论查看、异常标签和结果导出。

2. 组件架构

  • 采集器:Python、Selenium、HTML 解析、字体解码、Cookie 与代理管理,负责列表和详情获取。
  • 清洗命令:Go 命令行程序分别处理车型、车系、评论、评分、标签、去重和对象存储。
  • 在线 API:Go 服务提供车型、索引、评分、标签、评论、用户与文件能力,并生成接口说明。
  • 数据库:MongoDB 保存面向查询的车型和口碑文档。
  • 分析前端:Vue 2、Vuex、Element UI 与图表组件实现检索、列表、对比和登录。

3. 领域模型

核心层级为品牌、车系、年款或车型、具体配置和评论。评论关联来源、发布时间、车型、评分维度、里程或能耗等属性,并可附加重复、相似或异常规则标签。

统一内部标识是模型成立的前提。来源名称只能作为显示字段,不能直接承担跨来源主键;停售、改款、同名车系和新能源字段都需要显式状态。

4. 数据处理流程

  1. 采集器维护会话和访问状态,发现车系列表与评论详情任务。
  2. 解析器处理动态页面、混淆字体和字段缺失,保存原始来源标识。
  3. 清洗命令按车型、评论、评分和标签分别转换数据。
  4. 去重程序用精确规则及 SimHash、汉明距离生成相似内容信号。
  5. API 按车型、来源、评分和标签查询,前端提供筛选、对比与导出。

5. 技术亮点

  • 采集与清洗分离,来源页面变化不会直接改变在线查询模型。
  • 动态字体解码、会话维护和多进程任务体现了对真实反爬环境的处理。
  • 相似度结果作为风险标签而非直接删除依据,保留人工解释空间。
  • 清洗程序按领域对象拆成独立命令,可局部重跑。
  • API 和前端提交历史能与排序、筛选、能耗及导出功能相互验证。

6. 运行和质量约束

采集任务需要记录来源版本、客户端版本、最近成功时间、失败原因和重试次数。清洗输出必须保存批次、输入校验和及规则版本。在线查询应区分缺失、零值和不适用,避免把没有油耗或电耗数据解释为零。

7. 已知缺口

  • 采集器与主平台不在同一版本体系,无法确认某批数据对应哪次清洗提交。
  • 自动测试很少,动态字体、异常日期和跨来源重复缺少固定回归样本。
  • MongoDB 文档结构没有独立版本定义,字段演进依赖代码理解。
  • 相似文本只能表示可疑,不足以独立判断内容真实性或账号行为。

8. 重建验收标准

  • 使用固定样本可重复生成车型层级、评分与相似标签。
  • 每条评论能够回溯到来源记录和清洗规则。
  • 来源改版只需替换采集适配器,不修改查询接口的领域模型。
  • API 对分页、排序、筛选、缺失值和导出提供一致契约。
  • 前端覆盖桌面与常用窄屏宽度,并能解释异常标签含义。

9. 证据边界

Go 后端保留 252 次提交,Vue 前端保留 33 次提交,采集器是一次导入的 21 文件快照。代码可以证明主要处理模块与界面能力,不能证明采集器长期稳定、全部来源均获授权或所有评论已完成跨来源去重。