← 返回技术规格

恢复规格 · 2019

产业链知识网络技术规格

从产业链前端、演示系统和并行解析器恢复出的产业节点、企业画像、资本关系与资讯聚合规格。

产业链知识图谱Vue数据融合

1. 系统目标

系统以产业链节点为主索引,连接成员企业、园区、协会、基金、融资、股权、风险和资讯,使使用者能从一个产业向上下游、区域和企业关系继续探查。

2. 组件架构

  • 数据适配器:Python 与 Scrapy 程序处理产业定义、企业、园区和新闻来源。
  • 解析与融合:多个并行仓库把来源字段转换为产业节点、成员关系和公司映射。
  • 业务接口:当前快照没有完整后端,前端 API 模块表明其按产业链、公司、基金、园区和资讯域取数。
  • 主前端:Vue、Vuex 与路由系统,包含产业链、成员、企业画像、融资、基金、园区、协会、规模、云图、资讯和 PDF 页面。
  • 演示前端:较小的 Vue 仓库用于验证产业链与企业页面,是主前端的早期或裁剪版本。

3. 逻辑数据模型

核心实体包括产业、产业节点、企业、园区、协会、基金、人物、融资事件和资讯。关系至少包括上下游、产业成员、投资、股权、地域归属、园区入驻与资讯提及。

每个实体和关系都需要来源、有效时间、置信度与审核状态。企业更名不能创建无法关联的新实体;产业分类调整也应保留历史版本,避免旧关系失去语义。

4. 核心流程

  1. 解析器载入产业链结构并生成稳定节点。
  2. 企业来源数据经名称、别名与外部标识映射到公司主实体。
  3. 股权、融资、基金和园区记录转为带来源的关系。
  4. 新闻采集器按产业或企业关键词持续获取资讯,并执行去重与关联。
  5. 前端从产业全景进入成员、公司画像、资本和区域页面,再下钻到原始资料。

5. 技术亮点

  • 前端页面结构体现了“产业—企业—资本—区域—资讯”的完整探查路径。
  • 图谱画布包含节点布局、坐标与交互逻辑,并非只有静态设计稿。
  • 数据采集按来源拆分,新闻任务已有按日或按月运行的调度形态。
  • 多个解析仓保留了不同尝试,为理解产业实体融合规则提供了历史样本。

6. 已知缺口

  • 完整后端仓库缺失,不能恢复实际图查询语言、索引设计和权限模型。
  • 多个解析器存在复制与分叉,相同字段规则可能在不同版本产生不同结果。
  • 文档规划的功能明显多于单一前端版本能确认的实现。
  • 企业更名、重复来源标识和关系指向错误是已知的数据一致性风险。
  • 新闻关键词命中不能独立证明资讯与产业或企业确实相关。

7. 重建建议与验收

  • 建立版本化的产业本体、实体解析服务和关系来源表,再恢复图谱展示。
  • 对合并与拆分操作保存审核记录,所有关系可回溯到原始来源。
  • 统一多个解析器的输入输出契约,并用固定样本比较结果。
  • 图谱接口必须支持按时间和来源过滤,避免把历史关系当作当前事实。
  • 前端每个统计和关系都应能下钻到组成记录。

8. 证据边界

主前端有 93 次提交,演示前端有 26 次提交;其余七个仓库多为单来源采集或解析快照。现存代码可以证明页面、图谱交互和部分数据加工,但缺少完整业务后端、生产图数据库模式与统一部署配置,因此本规格不假定所有规划模块曾经同时上线。