恢复规格 · 2019
汽车口碑分析平台技术规格
从 Go 后端、Vue 前端与汽车采集器恢复出的车型主数据、评论清洗、相似检测与分析查询规格。
1. 系统目标
系统把汽车网站上的品牌、车系、车款、配置和车主口碑转换为统一数据,并为研究人员提供车型筛选、评分比较、评论查看、异常标签和结果导出。
2. 组件架构
- 采集器:Python、Selenium、HTML 解析、字体解码、Cookie 与代理管理,负责列表和详情获取。
- 清洗命令:Go 命令行程序分别处理车型、车系、评论、评分、标签、去重和对象存储。
- 在线 API:Go 服务提供车型、索引、评分、标签、评论、用户与文件能力,并生成接口说明。
- 数据库:MongoDB 保存面向查询的车型和口碑文档。
- 分析前端:Vue 2、Vuex、Element UI 与图表组件实现检索、列表、对比和登录。
3. 领域模型
核心层级为品牌、车系、年款或车型、具体配置和评论。评论关联来源、发布时间、车型、评分维度、里程或能耗等属性,并可附加重复、相似或异常规则标签。
统一内部标识是模型成立的前提。来源名称只能作为显示字段,不能直接承担跨来源主键;停售、改款、同名车系和新能源字段都需要显式状态。
4. 数据处理流程
- 采集器维护会话和访问状态,发现车系列表与评论详情任务。
- 解析器处理动态页面、混淆字体和字段缺失,保存原始来源标识。
- 清洗命令按车型、评论、评分和标签分别转换数据。
- 去重程序用精确规则及 SimHash、汉明距离生成相似内容信号。
- API 按车型、来源、评分和标签查询,前端提供筛选、对比与导出。
5. 技术亮点
- 采集与清洗分离,来源页面变化不会直接改变在线查询模型。
- 动态字体解码、会话维护和多进程任务体现了对真实反爬环境的处理。
- 相似度结果作为风险标签而非直接删除依据,保留人工解释空间。
- 清洗程序按领域对象拆成独立命令,可局部重跑。
- API 和前端提交历史能与排序、筛选、能耗及导出功能相互验证。
6. 运行和质量约束
采集任务需要记录来源版本、客户端版本、最近成功时间、失败原因和重试次数。清洗输出必须保存批次、输入校验和及规则版本。在线查询应区分缺失、零值和不适用,避免把没有油耗或电耗数据解释为零。
7. 已知缺口
- 采集器与主平台不在同一版本体系,无法确认某批数据对应哪次清洗提交。
- 自动测试很少,动态字体、异常日期和跨来源重复缺少固定回归样本。
- MongoDB 文档结构没有独立版本定义,字段演进依赖代码理解。
- 相似文本只能表示可疑,不足以独立判断内容真实性或账号行为。
8. 重建验收标准
- 使用固定样本可重复生成车型层级、评分与相似标签。
- 每条评论能够回溯到来源记录和清洗规则。
- 来源改版只需替换采集适配器,不修改查询接口的领域模型。
- API 对分页、排序、筛选、缺失值和导出提供一致契约。
- 前端覆盖桌面与常用窄屏宽度,并能解释异常标签含义。
9. 证据边界
Go 后端保留 252 次提交,Vue 前端保留 33 次提交,采集器是一次导入的 21 文件快照。代码可以证明主要处理模块与界面能力,不能证明采集器长期稳定、全部来源均获授权或所有评论已完成跨来源去重。