跳到正文

知识图谱中的实体存在度

速览要点

是什么
AI 引擎信任的图谱中是否收录了你的结构化实体节点(Wikipedia 词条、Wikidata 条目、Google 知识图谱或知识面板条目),以及该节点是否准确、是否已被认领
为什么重要
它会在训练阶段增强模型对你的初始认知,并在检索阶段帮助引擎区分同名实体,但不能直接让你的某句话进入答案
在哪里起作用
它是持续发挥作用的基础信息:训练阶段用于形成先验,检索阶段用于消歧。这两个环节都早于可引用性与 E-E-A-T 决定是否采信内容的环节
适用边界
它能增强模型对实体的认知,但不能直接让内容进入答案;它必须得到外部认可,不能靠自我声明成立。没有外部佐证的节点不构成存在度,只是一项无人佐证的声明
与实体识别的区别
存在度关注节点本身是否存在;实体识别关注如何把页面上的名称与该节点对应起来。两者讨论的是不同环节

1. 什么是知识图谱中的实体存在度

GEO Wiki 工作定义:作为一项 GEO 信号,知识图谱中的实体存在度是指 AI 引擎信任的某张图谱中是否收录了你的结构化实体节点(Wikipedia 词条、Wikidata 条目、Google 知识图谱或知识面板条目),以及该节点是否准确、是否已被认领。

可信节点是否存在,决定了模型能否识别你,并进一步增强对你的认知。如何把页面上出现的名称与节点对应起来,见 实体识别。

2. 节点能增强实体认知,但不能直接让内容进入答案

这一点与几个相邻条目的结论一致。实体识别 §6 指出「解析靠外部信息相互印证,不靠你自己说了算」,品牌提及 §5 指出「光有链接、没有提及,撑不起权威」,Schema.org for AI 指出「标记是申报,不是奖项」,E-E-A-T §6 则强调「靠赢得,不靠贴标签」。它们共同说明:节点可以增强模型对实体的初始认知,并为解析提供明确对象,但不能直接让某句话被引用,也不能靠单方面声明凭空成立。

这种增强作用会出现在两个环节:

   站外关注度、提及     ◄── 来源:品牌提及
            │
            ▼
   [ 结构化节点 ]   ◄── 实体存在度
   Wikipedia、Wikidata、Google 知识图谱
      │                       │
      ▼(训练阶段)            ▼(检索、采信阶段)
   先验更强               帮助消歧与回忆
   (Wikipedia 在            (在直接调用
   预训练语料里)             Google 索引的
                              AI 界面上)
      └──────────┬───────────┘
                 ▼
   节点能增强实体认知,但具体内容仍须便于引述
   (可引用性),来源也须受到信任(E-E-A-T)

节点发挥作用的时间很重要。它是持续生效的基础信息,并非引擎生成答案时临时计算的结果:在训练阶段,它会增强模型对你的先验认知;在检索阶段,它会帮助引擎区分同名实体。这两个环节都发生在 Answer Loop §3 所述的采信环节之前,后者才会依据 可引用性 与 E-E-A-T 决定是否采用内容。最终引用哪段话,并不由节点本身决定。

需要区分三组概念:

  • 存在度 ≠ 可被引述。一句话能否被原样采用,取决于 可引用性。
  • 存在度 ≠ 被信任。节点本身是否具有可信的权威性,取决于 E-E-A-T。
  • 存在度 ≠ 解析。存在度关注节点本身是否存在;实体识别 关注如何把页面上的名称与该节点对应起来。这与 实体识别 §2 的第三条边界是对同一区别的两种表述。

3. 机制:三类节点如何关联

知识图谱中的实体存在度并非单一状态,而是由三张图谱中的三类节点共同构成。各类节点的收录门槛不同,数据也会按固定方向传递。

类型节点是什么收录门槛为什么能增强 AI 引用表现
Wikipedia由人工编辑并通过关注度门槛审核的百科词条最高(必须先通过编辑流程审核)在三类节点中影响最大:它是预训练语料中权重最高的来源之一;§6 所引研究恰好以 Wikipedia 页面浏览量作为衡量实体热度的代理指标
Wikidata结构化、机器可读的条目(带 Q 编号)比 Wikipedia 低得多外部的 sameAs 通常指向此处;Wikidata 数据还会进入 Google 知识图谱和许多其他图谱
Google 知识图谱、知识面板Google 自己维护的实体库(MID、KGMID)可以认领,但不能自由修改为 Google AI Overviews 与 Google Gemini 理解实体提供基础信息;数据来自 Wikipedia、Wikidata 与公开网络

数据按以下方向传递。站外关注度促成节点的建立,节点随后增强模型对实体的认知:

  站外关注度 ─► Wikipedia ─► (预训练先验)
            │               └─────►┐
            └─► Wikidata ──────────┼─► Google 知识图谱 ─► Google 各 AI 界面
                                    (sameAs 通常就指它)

sameAs 将页面与 Schema 关联起来。它是一项明确声明,用来说明页面对应图谱中的哪个节点;哪些标记包含 sameAs,见 Schema.org for AI §4。具体的 JSON-LD 代码见 Schema.org for AI 与 Schema 落地 playbook。简而言之,sameAs 表示「本页所述实体就是 wikidata.org/wiki/Q… 对应的实体」,其目标必须是一条可信节点。

4. 如何建立有效的实体节点

以下方法分别对应 §3 中的不同类型。提交条目、认领面板和配置 sameAs 的具体步骤,见 Schema 落地 playbook;如何积累关注度目前还没有对应的操作手册,§8 会再次说明。

方法如何建立或增强存在度对应的节点类型常见失败情形
独立、可靠的站外报道(关注度的来源)这是获得可信节点的必要条件Wikipedia、Wikidata在缺乏关注度的情况下强行创建页面,页面会被回退(关注度需要通过 品牌提及 积累)
准确、有可靠来源且标识符无误的 Wikidata 条目在开放图谱中建立清晰、机器可读的节点Wikidata条目内容单薄,引用的来源全都来自自身,因而可信度低,随时可能被删除
已认领、已验证的 Google 实体(认领知识面板)取得修正并维护这条私有节点的权限Google 知识图谱未认领面板或认领了错误的面板,导致面板显示过时或与实体不符的信息
站内指向节点的 sameAs明确声明页面对应的图谱节点,告诉引擎哪个节点属于你全部节点虽然存在,却始终无法与你建立对应关系(建立这种对应关系属于 实体识别)
节点信息与站内身份保持一致(名称、NAP、限定词均一致)使节点信息与站点信息相互印证全部节点信息与站点信息不一致,无法形成外部印证

这与 实体识别 §4 所说的「身份不是你说有就有」含义相同:自行创建并不足以使节点有效;只有先获得足够的站外关注度,才具备创建节点的条件。存在度是外部佐证长期积累的结果。节点本身是否可信,见 E-E-A-T。

5. 实体存在度在不同平台上的作用

§2、§3 所述的增强机制适用于所有平台,这一点不变。不同之处在于各平台主要使用哪一类节点。

平台主要依赖哪类节点
Google AI Overviews、AI Mode直接读取 Google 自有的知识图谱和 Wikidata,可以使用知识面板级别的实体信息
Google Gemini由 Google 的实体图谱提供支持;采信环节会使用知识图谱中的节点
ChatGPT、Perplexity(采用实时抓取的平台)无法读取 Google 知识图谱;实体存在度主要来自模型先验中的 Wikipedia 信息,以及实时抓取的 Wikipedia 页面,而 Wikipedia 内容往往被过度引用

「过度引用」并非主观印象,而有实测数据支持:2025 年的一份引用模式分析显示,Wikipedia 是 ChatGPT 引用次数最多的单一来源,约占全部引用的 7.8%(Profound,AI Platform Citation Patterns)。这是一家厂商的实测数据,只能用于判断大致趋势,不能视为精确系数。

在多语言场景中,同一实体需要在每种语言中分别拥有节点(中文 Wikipedia、Wikidata 与英文版分别计算),具体见 Multilingual GEO。

6. 证据支持哪些结论,又有哪些边界

现有可靠证据支持实体节点能够增强模型认知这一总体结论,但在品牌层面,投入越多是否必然带来更稳定的回报,目前尚无定论。阅读下表时,应像解读 Aggarwal 一样关注总体趋势,不要过度解读具体数字。

现有证据支持的结论结论的适用边界
一个实体在外部被讨论得越多,模型对相关事实的回忆就越稳定:热门实体的处理结果较稳定,长尾实体则不然(Kandpal 等,arXiv:2211.08411;Mallen 等,ACL 2023)在共同引用这两项研究的三个条目中,实体存在度与原研究的测量对象关系最直接:研究以 Wikipedia 页面浏览量衡量实体热度,以 Wikidata 事实衡量事实回忆,因此图谱语料中的实体存在度几乎就是研究实际测量的变量。但需要注意,研究测量的是事实问答,并未证明「品牌有了 Wikipedia 页面,引用率就会提高」。将结论延伸到品牌层面只是类比,并非直接结论。同一组来源还支持另外两个方面:品牌提及 §4 关注先验信号,实体识别 §6 关注「知名度越高,越容易被解析」的规律
直接调用 Google 索引的平台,需要依靠明确的知识图谱进行解析并增强实体认知。Google 提出的「实体,而非字符串」理念,最早可追溯至 知识图谱,2012它影响实体能否被识别,以及识别效果能否得到增强,并不是排名加分项(参见 Schema.org for AI §6)
AI 答案引擎在合成答案时确实高度依赖 Wikipedia:至少在 2025 年的一次引用审计中,Wikipedia 是 ChatGPT 引用次数最多的来源(Profound,2025)这是来自厂商实测的行业证据,可以说明 Wikipedia 节点确实具有增强作用,但不能独立证明其作用机制或效应量,只能用于判断总体趋势

现有证据仍有一处空白:生成式引擎优化 所述的代表性方法来自 Aggarwal 等(KDD ‘24,arXiv:2311.09735;论文精读),研究测量的是页内内容改写(增加引用、统计数据和引述),与知识图谱中的实体存在度完全不同。研究得出的「最高约 40%」不能直接用于估算获得 Wikipedia 页面后的效果,否则就属于站内多个条目反复提醒应当避免的过度外推。

这与 实体识别 §6 所说的「靠多方印证,不靠自己说了算」以及 E-E-A-T §6 所说的「靠赢得,不靠贴标签」含义相同:只有获得足够的外部关注度,实体存在度才能成立。缺乏外部佐证、完全由自己创建的节点不构成有效的存在度,只是一项没有依据的声明。

7. 常见错误:强行创建节点与伪造关联

以下误区与 实体识别 §7、品牌提及 §8、Schema.org for AI §7 所讨论的问题属于同一类错误。

常见误判表面上为何可行实际问题
「花钱找代理『保证』给我们创建 Wikipedia 页面」似乎可以绕过编辑流程,直接获得影响最大的节点Wikipedia 是否具有关注度由编辑流程判断。付费创建却不披露身份属于违规,页面会被回退,甚至被加上违规标记(Wikipedia:Notability;Paid-contribution disclosure);页面被删除比从未创建更糟
「自己创建一条 Wikidata 条目,不就进入图谱了吗?」创建门槛似乎不高,而且规则允许自行编辑内容单薄且只引用自身来源的条目,达不到 Wikidata 对「严肃、公开可查的参考来源」的收录要求(Wikidata:Notability),可信度很低,随时可能被删除;节点存在也不代表节点值得信任(E-E-A-T)
「我们已经有知识面板了,所以会被引用」知识面板似乎表明所有条件都已满足面板只是实体识别的一种呈现形式,并不等于内容会被引用。内容能否被原样引述取决于 可引用性,来源是否可信取决于 E-E-A-T;节点只能增强实体认知,不能直接让内容进入答案
「我们已经有 Wikipedia 页面了,所以已经被解析了」Wikipedia 页面似乎表明实体识别已经完成这与 实体识别 §7 中的误判相同,只是观察角度相反:实体存在度关注节点是否存在,实体识别 则关注如何把页面上的名称与节点对应起来
「伪造一条指向某个知名 Wikidata 条目的 sameAs」似乎可以立即让页面与知名节点建立关联这项声明无法通过外部信息的交叉验证,与伪造作者署名无法通过 E-E-A-T §7 的验证、伪造 Organization 标记无法通过 Schema.org for AI §7 的验证是同一回事;这种虚假关联迟早会被识破

总结来说,节点用于汇集外部提及所形成的实体信息,不能由自己强行创建。只有获得足够的站外关注度,才具备建立节点的条件;自行创建却无人佐证的节点,本质上只是一项没有依据的声明。

8. 对 GEO 的意义与后续行动

知识图谱中的实体存在度是实体层的一项基础信号:它能增强模型先验,也为解析提供明确对象。理解这项信号时,还要结合形成它的站外信号(品牌提及)、使用节点完成的解析(实体识别),以及指向节点的标记(Schema.org for AI)。目前仍缺少一部分配套内容:Schema 落地 已经说明如何配置 sameAs,但站外关注度和 Wikipedia 方面暂时还没有现成的操作手册。对应页面尚不存在,因此无法提供链接。

目标建议阅读
获得足以支持可信节点的站外报道品牌提及
在解析过程中,将关于你的提及与该节点对应起来实体识别
配置用于关联页面与节点的 sameAsSchema 落地
弄清楚哪些标记会影响实体层Schema.org for AI
检查节点本身是否可信E-E-A-T
了解节点在答案生成全流程中的位置Answer Loop
了解如何综合运用以上方法生成式引擎优化

参考资料

学术:

  • Kandpal, N., Deng, H., Roberts, A., Wallace, E. & Raffel, C. (2023). Large Language Models Struggle to Learn Long-Tail Knowledge. ICML 2023 (PMLR v202). arXiv:2211.08411
  • Mallen, A., Asai, A., Zhong, V., Das, R., Khashabi, D. & Hajishirzi, H. (2023). When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories. ACL 2023. ACL Anthology · arXiv:2212.10511
  • Aggarwal, P. et al. (2024). GEO: Generative Engine Optimization. KDD ‘24. arXiv:2311.09735 · 论文精读。用于界定结论边界;知识图谱中的实体存在度不是该研究测量的变量

官方:

政策:

  • Wikipedia — Notability:「获得独立于其自身、可靠来源的大量报道,即被推定为适合收录」
  • Wikipedia — Paid-contribution disclosure:付费编辑必须披露
  • Wikidata — Notability:条目需对应「一个可清晰辨识的概念或实体,且能以严肃、公开可查的参考来源描述」

业界:

  • Profound — AI Platform Citation Patterns(2025-06-05):Wikipedia 是 ChatGPT 被引用最多的来源(约 7.8%);看方向,厂商实测

常见问题

为什么 Wikipedia 对 AI 引用的增强作用这么明显?
在这套图谱体系中,Wikipedia 词条是影响最大的单个节点。Wikipedia 是 LLM 预训练语料中权重最高的来源之一,其内容会直接影响模型先验;相关数据还会进入 Wikidata 和 Google 知识图谱,因此也会影响直接调用 Google 索引的 AI 界面。长尾知识研究(Kandpal 等,ICML 2023;Mallen 等,ACL 2023)甚至直接以 Wikipedia 页面浏览量衡量实体热度,结果显示,一个实体在外部被讨论得越多,模型对相关事实的回忆就越稳定。Wikipedia 会同时影响这几个层面,但它只能增强模型对实体的认知,不能替你生成答案。它能改善初始认知并为消歧提供明确对象,却不会让你的某段具体内容原样进入回答。
它和实体识别、品牌提及到底差在哪?
知识图谱存在度关注节点本身:是否有一条属于你的可信节点,该节点是否准确、是否已被认领。实体识别关注如何把页面上出现的名称与该节点对应起来。品牌提及则是站外不带链接、能够为节点积累关注度的口碑信号。提及逐步提高关注度,这些关注最终归于相应节点,实体识别再将名称与节点对应起来。实体识别 §2 也从另一个角度说明了这条边界:「解析 ≠ 节点存在」。
我们已经有了知识面板,是不是就一定会被引用?
不会。知识面板只是实体识别的一种呈现形式,说明 Google 内部已经认可了你的实体节点。这确实能增强模型对实体的认知,但与内容是否被引用是两回事。你的某段内容能否进入答案,取决于内容本身的结构(可引用性)和来源是否受到信任(E-E-A-T),由引擎在采信环节决定,节点不参与这项决定。有了节点,你确实更容易被检索到,模型对你的初始认知也会更好,但页面不会因此自动变得值得原样引述。
自己动手建一个 Wikidata 条目或者 Wikipedia 页面,能不能算存在度?
不算。Wikipedia 的关注度门槛由编辑流程把关:一个主题只有得到独立、可靠来源的大量报道,才会被推定为适合收录;付费创建却不披露身份属于违规,页面可能被回退甚至加上违规标记,而页面被删除比从未创建更糟。同理,自行创建但没有正式公开参考来源的 Wikidata 条目可信度很低,随时可能被删除。存在度来自站外关注度,不能靠自我声明成立。只有你自己担保的节点,本质上仍是一项无人佐证的声明,与 E-E-A-T 中伪造作者署名属于同一种错误。
伪造一条指向某个知名 Wikidata 条目的 sameAs,能不能把别人的存在度借过来?
不能,这种造假迟早会被识破。sameAs 是一项明确声明,用于将页面与图谱中的节点关联起来(哪些标记包含它,参见 Schema.org for AI §4),但引擎只有在全网其他信息能够相互印证时,才会用这项声明缩小候选范围。如果 sameAs 指向的知名节点其实并不属于你,就无法通过外部信息的交叉验证。这与伪造的 Organization 标记无法通过 Schema.org for AI §7 的验证、伪造的作者署名无法通过 E-E-A-T §7 的验证是同一回事。这项声明必须指向真正属于你的节点;至于如何将名称与节点对应起来,则属于实体识别。

延伸阅读

参考来源

一手来源

  1. Large Language Models Struggle to Learn Long-Tail Knowledge (Kandpal, Deng, Roberts, Wallace & Raffel, ICML 2023) · arXiv / ICML 2023 (PMLR v202) · 2023-07-27
  2. When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories (Mallen et al., ACL 2023) · ACL 2023 (Long Papers) · 2023-07-02
  3. Introducing the Knowledge Graph: things, not strings · Google (Amit Singhal, The Keyword) · 2012-05-16
  4. Organization structured data (sameAs disambiguation) · Google Search Central · 2026-04-15
  5. sameAs — Schema.org property · Schema.org
  6. Get verified on Google (claim a knowledge panel) · Google Knowledge Panel Help
  7. Wikipedia:Notability — the general notability guideline · Wikipedia (Wikimedia Foundation)
  8. Wikipedia:Paid-contribution disclosure · Wikipedia (Wikimedia Foundation)
  9. Wikidata:Notability · Wikidata (Wikimedia Foundation)
  10. GEO: Generative Engine Optimization (Aggarwal et al., KDD '24) · arXiv / ACM SIGKDD · 2024-08-25

二手来源

  1. AI Platform Citation Patterns (Wikipedia = ChatGPT's most-cited source) · Profound
最近更新: 2026-05-19 作者: Ray Yang 主题: 信号