Skip to content

知识图谱

知识图谱把实体和关系组织成图结构,常用于结构化知识建模、推理、搜索和问答。

核心知识点

重点掌握:

  • 实体:人、公司、产品、疾病、地点等对象。
  • 关系:实体之间的连接,例如属于、购买、治疗、依赖。
  • 属性:实体或关系的附加信息。
  • Schema / Ontology:定义实体类型、关系类型和约束。
  • 三元组:主体、关系、客体,例如“张三 - 任职于 - A 公司”。
  • 图查询:根据关系路径查找信息。
  • Graph RAG:结合知识图谱和大模型做问答。

知识图谱构建流程

数据源文档、数据库、网页、日志
->
抽取实体识别、关系抽取、属性抽取
->
融合实体对齐、去重、消歧
->
存储图数据库或 RDF 存储
->
应用搜索、问答、推荐、风控

知识图谱和向量数据库有什么区别?

向量数据库擅长语义相似度检索。

知识图谱擅长结构化关系查询和路径推理。

对比:

  • 向量库:适合“语义相近内容在哪里?”
  • 知识图谱:适合“实体之间有什么关系?”
  • 向量库更适合非结构化文本召回。
  • 知识图谱更适合强关系、强约束、可解释场景。

实际项目中可以结合使用:向量检索找相关文档,图谱补充实体关系和事实约束。

Graph RAG 是什么?

Graph RAG 是把知识图谱能力和 RAG 结合起来。

常见方式:

  • 从用户问题中识别实体。
  • 在图谱中查找相关实体和关系。
  • 把子图或关系路径作为上下文。
  • 结合文档片段一起交给大模型回答。

适合场景:

  • 金融风控
  • 医疗知识问答
  • 企业组织关系
  • 供应链关系
  • 法律法规关联分析

知识图谱如何构建?

常见步骤:

  1. 定义 schema。
  2. 收集数据源。
  3. 抽取实体、关系、属性。
  4. 做实体对齐和消歧。
  5. 写入图数据库。
  6. 建立查询和应用服务。
  7. 持续更新和治理。

难点不是画图,而是数据质量、实体对齐、关系准确率和持续维护。

知识图谱面试常见问题

什么是三元组?

三元组是知识图谱的基本表达形式,通常是“实体 - 关系 - 实体”或“实体 - 属性 - 值”。例如“张三 - 任职于 - A 公司”。

它把非结构化知识转成可查询的结构化关系,便于做推理、路径查询和可解释问答。

知识图谱和向量数据库有什么区别?

向量数据库擅长语义相似度检索,适合找“意思相近”的内容。知识图谱擅长表达实体、关系和约束,适合回答关系明确、需要推理和解释的问题。

实际项目中可以组合使用:向量库负责召回相关文本,图谱负责关系约束和结构化推理。

Graph RAG 解决什么问题?

Graph RAG 把图谱关系引入 RAG,让检索不只依赖文本相似度,还能利用实体关系、路径和社区结构。

它适合企业组织关系、产品依赖、法规条款、医学知识等关系密集场景,可以提升答案的可解释性和一致性。

知识图谱怎么构建?

常见流程是定义本体和关系类型,抽取实体和关系,做实体对齐和消歧,写入图数据库,再提供查询和问答服务。

难点在数据质量和持续维护。抽取阶段可以用规则、NLP 模型或大模型,但最终要有校验和人工审核机制。

实体消歧怎么做?

实体消歧是判断不同文本是否指向同一个实体。例如“苹果”“Apple Inc.”和“苹果公司”可能是同一实体,但“苹果水果”不是。

常见方法包括别名词典、上下文匹配、规则、相似度计算和人工审核。关键业务实体要尽量用唯一 ID 管理。

知识图谱如何更新?

更新方式可以是定时批处理,也可以是事件驱动增量更新。每次更新要记录来源、时间、版本和置信度。

如果关系会变化,例如组织架构、产品价格、人员职位,要设计过期策略和历史版本,避免旧知识污染答案。

图谱问答和普通 RAG 有什么区别?

普通 RAG 多依赖文本片段召回,图谱问答会先识别实体和关系,再查询图谱或结合路径推理。它更适合“谁和谁有什么关系”“某实体受哪些因素影响”这类问题。

缺点是建设成本更高,对数据结构化要求更强。不是所有文档问答都需要图谱。

什么场景适合知识图谱,不适合纯向量检索?

适合关系复杂、实体明确、需要可解释路径和强约束的场景,例如企业组织关系、供应链、法规条款、金融风控、医学知识。

如果只是普通 FAQ、文档段落问答、语义搜索,纯向量检索或 Hybrid Search 往往更简单高效。

回答时可以强调:知识图谱适合关系明确、可解释性要求高的场景,不适合所有知识库都强行图谱化。

Built with VitePress and GitHub Pages.