知识图谱中的实体存在度
速览要点
- 是什么
- AI 引擎信任的图谱中是否收录了你的结构化实体节点(Wikipedia 词条、Wikidata 条目、Google 知识图谱或知识面板条目),以及该节点是否准确、是否已被认领
- 为什么重要
- 它会在训练阶段增强模型对你的初始认知,并在检索阶段帮助引擎区分同名实体,但不能直接让你的某句话进入答案
- 在哪里起作用
- 它是持续发挥作用的基础信息:训练阶段用于形成先验,检索阶段用于消歧。这两个环节都早于可引用性与 E-E-A-T 决定是否采信内容的环节
- 适用边界
- 它能增强模型对实体的认知,但不能直接让内容进入答案;它必须得到外部认可,不能靠自我声明成立。没有外部佐证的节点不构成存在度,只是一项无人佐证的声明
- 与实体识别的区别
- 存在度关注节点本身是否存在;实体识别关注如何把页面上的名称与该节点对应起来。两者讨论的是不同环节
1. 什么是知识图谱中的实体存在度
GEO Wiki 工作定义:作为一项 GEO 信号,知识图谱中的实体存在度是指 AI 引擎信任的某张图谱中是否收录了你的结构化实体节点(Wikipedia 词条、Wikidata 条目、Google 知识图谱或知识面板条目),以及该节点是否准确、是否已被认领。
可信节点是否存在,决定了模型能否识别你,并进一步增强对你的认知。如何把页面上出现的名称与节点对应起来,见 实体识别。
2. 节点能增强实体认知,但不能直接让内容进入答案
这一点与几个相邻条目的结论一致。实体识别 §6 指出「解析靠外部信息相互印证,不靠你自己说了算」,品牌提及 §5 指出「光有链接、没有提及,撑不起权威」,Schema.org for AI 指出「标记是申报,不是奖项」,E-E-A-T §6 则强调「靠赢得,不靠贴标签」。它们共同说明:节点可以增强模型对实体的初始认知,并为解析提供明确对象,但不能直接让某句话被引用,也不能靠单方面声明凭空成立。
这种增强作用会出现在两个环节:
站外关注度、提及 ◄── 来源:品牌提及
│
▼
[ 结构化节点 ] ◄── 实体存在度
Wikipedia、Wikidata、Google 知识图谱
│ │
▼(训练阶段) ▼(检索、采信阶段)
先验更强 帮助消歧与回忆
(Wikipedia 在 (在直接调用
预训练语料里) Google 索引的
AI 界面上)
└──────────┬───────────┘
▼
节点能增强实体认知,但具体内容仍须便于引述
(可引用性),来源也须受到信任(E-E-A-T)
节点发挥作用的时间很重要。它是持续生效的基础信息,并非引擎生成答案时临时计算的结果:在训练阶段,它会增强模型对你的先验认知;在检索阶段,它会帮助引擎区分同名实体。这两个环节都发生在 Answer Loop §3 所述的采信环节之前,后者才会依据 可引用性 与 E-E-A-T 决定是否采用内容。最终引用哪段话,并不由节点本身决定。
需要区分三组概念:
- 存在度 ≠ 可被引述。一句话能否被原样采用,取决于 可引用性。
- 存在度 ≠ 被信任。节点本身是否具有可信的权威性,取决于 E-E-A-T。
- 存在度 ≠ 解析。存在度关注节点本身是否存在;实体识别 关注如何把页面上的名称与该节点对应起来。这与 实体识别 §2 的第三条边界是对同一区别的两种表述。
3. 机制:三类节点如何关联
知识图谱中的实体存在度并非单一状态,而是由三张图谱中的三类节点共同构成。各类节点的收录门槛不同,数据也会按固定方向传递。
| 类型 | 节点是什么 | 收录门槛 | 为什么能增强 AI 引用表现 |
|---|---|---|---|
| Wikipedia | 由人工编辑并通过关注度门槛审核的百科词条 | 最高(必须先通过编辑流程审核) | 在三类节点中影响最大:它是预训练语料中权重最高的来源之一;§6 所引研究恰好以 Wikipedia 页面浏览量作为衡量实体热度的代理指标 |
| Wikidata | 结构化、机器可读的条目(带 Q 编号) | 比 Wikipedia 低得多 | 外部的 sameAs 通常指向此处;Wikidata 数据还会进入 Google 知识图谱和许多其他图谱 |
| Google 知识图谱、知识面板 | Google 自己维护的实体库(MID、KGMID) | 可以认领,但不能自由修改 | 为 Google AI Overviews 与 Google Gemini 理解实体提供基础信息;数据来自 Wikipedia、Wikidata 与公开网络 |
数据按以下方向传递。站外关注度促成节点的建立,节点随后增强模型对实体的认知:
站外关注度 ─► Wikipedia ─► (预训练先验)
│ └─────►┐
└─► Wikidata ──────────┼─► Google 知识图谱 ─► Google 各 AI 界面
(sameAs 通常就指它)
sameAs 将页面与 Schema 关联起来。它是一项明确声明,用来说明页面对应图谱中的哪个节点;哪些标记包含 sameAs,见 Schema.org for AI §4。具体的 JSON-LD 代码见 Schema.org for AI 与 Schema 落地 playbook。简而言之,sameAs 表示「本页所述实体就是 wikidata.org/wiki/Q… 对应的实体」,其目标必须是一条可信节点。
4. 如何建立有效的实体节点
以下方法分别对应 §3 中的不同类型。提交条目、认领面板和配置 sameAs 的具体步骤,见 Schema 落地 playbook;如何积累关注度目前还没有对应的操作手册,§8 会再次说明。
| 方法 | 如何建立或增强存在度 | 对应的节点类型 | 常见失败情形 |
|---|---|---|---|
| 独立、可靠的站外报道(关注度的来源) | 这是获得可信节点的必要条件 | Wikipedia、Wikidata | 在缺乏关注度的情况下强行创建页面,页面会被回退(关注度需要通过 品牌提及 积累) |
| 准确、有可靠来源且标识符无误的 Wikidata 条目 | 在开放图谱中建立清晰、机器可读的节点 | Wikidata | 条目内容单薄,引用的来源全都来自自身,因而可信度低,随时可能被删除 |
| 已认领、已验证的 Google 实体(认领知识面板) | 取得修正并维护这条私有节点的权限 | Google 知识图谱 | 未认领面板或认领了错误的面板,导致面板显示过时或与实体不符的信息 |
| 站内指向节点的 sameAs | 明确声明页面对应的图谱节点,告诉引擎哪个节点属于你 | 全部 | 节点虽然存在,却始终无法与你建立对应关系(建立这种对应关系属于 实体识别) |
| 节点信息与站内身份保持一致(名称、NAP、限定词均一致) | 使节点信息与站点信息相互印证 | 全部 | 节点信息与站点信息不一致,无法形成外部印证 |
这与 实体识别 §4 所说的「身份不是你说有就有」含义相同:自行创建并不足以使节点有效;只有先获得足够的站外关注度,才具备创建节点的条件。存在度是外部佐证长期积累的结果。节点本身是否可信,见 E-E-A-T。
5. 实体存在度在不同平台上的作用
§2、§3 所述的增强机制适用于所有平台,这一点不变。不同之处在于各平台主要使用哪一类节点。
| 平台 | 主要依赖哪类节点 |
|---|---|
| Google AI Overviews、AI Mode | 直接读取 Google 自有的知识图谱和 Wikidata,可以使用知识面板级别的实体信息 |
| Google Gemini | 由 Google 的实体图谱提供支持;采信环节会使用知识图谱中的节点 |
| ChatGPT、Perplexity(采用实时抓取的平台) | 无法读取 Google 知识图谱;实体存在度主要来自模型先验中的 Wikipedia 信息,以及实时抓取的 Wikipedia 页面,而 Wikipedia 内容往往被过度引用 |
「过度引用」并非主观印象,而有实测数据支持:2025 年的一份引用模式分析显示,Wikipedia 是 ChatGPT 引用次数最多的单一来源,约占全部引用的 7.8%(Profound,AI Platform Citation Patterns)。这是一家厂商的实测数据,只能用于判断大致趋势,不能视为精确系数。
在多语言场景中,同一实体需要在每种语言中分别拥有节点(中文 Wikipedia、Wikidata 与英文版分别计算),具体见 Multilingual GEO。
6. 证据支持哪些结论,又有哪些边界
现有可靠证据支持实体节点能够增强模型认知这一总体结论,但在品牌层面,投入越多是否必然带来更稳定的回报,目前尚无定论。阅读下表时,应像解读 Aggarwal 一样关注总体趋势,不要过度解读具体数字。
| 现有证据支持的结论 | 结论的适用边界 |
|---|---|
| 一个实体在外部被讨论得越多,模型对相关事实的回忆就越稳定:热门实体的处理结果较稳定,长尾实体则不然(Kandpal 等,arXiv:2211.08411;Mallen 等,ACL 2023) | 在共同引用这两项研究的三个条目中,实体存在度与原研究的测量对象关系最直接:研究以 Wikipedia 页面浏览量衡量实体热度,以 Wikidata 事实衡量事实回忆,因此图谱语料中的实体存在度几乎就是研究实际测量的变量。但需要注意,研究测量的是事实问答,并未证明「品牌有了 Wikipedia 页面,引用率就会提高」。将结论延伸到品牌层面只是类比,并非直接结论。同一组来源还支持另外两个方面:品牌提及 §4 关注先验信号,实体识别 §6 关注「知名度越高,越容易被解析」的规律 |
| 直接调用 Google 索引的平台,需要依靠明确的知识图谱进行解析并增强实体认知。Google 提出的「实体,而非字符串」理念,最早可追溯至 知识图谱,2012 | 它影响实体能否被识别,以及识别效果能否得到增强,并不是排名加分项(参见 Schema.org for AI §6) |
| AI 答案引擎在合成答案时确实高度依赖 Wikipedia:至少在 2025 年的一次引用审计中,Wikipedia 是 ChatGPT 引用次数最多的来源(Profound,2025) | 这是来自厂商实测的行业证据,可以说明 Wikipedia 节点确实具有增强作用,但不能独立证明其作用机制或效应量,只能用于判断总体趋势 |
现有证据仍有一处空白:生成式引擎优化 所述的代表性方法来自 Aggarwal 等(KDD ‘24,arXiv:2311.09735;论文精读),研究测量的是页内内容改写(增加引用、统计数据和引述),与知识图谱中的实体存在度完全不同。研究得出的「最高约 40%」不能直接用于估算获得 Wikipedia 页面后的效果,否则就属于站内多个条目反复提醒应当避免的过度外推。
这与 实体识别 §6 所说的「靠多方印证,不靠自己说了算」以及 E-E-A-T §6 所说的「靠赢得,不靠贴标签」含义相同:只有获得足够的外部关注度,实体存在度才能成立。缺乏外部佐证、完全由自己创建的节点不构成有效的存在度,只是一项没有依据的声明。
7. 常见错误:强行创建节点与伪造关联
以下误区与 实体识别 §7、品牌提及 §8、Schema.org for AI §7 所讨论的问题属于同一类错误。
| 常见误判 | 表面上为何可行 | 实际问题 |
|---|---|---|
| 「花钱找代理『保证』给我们创建 Wikipedia 页面」 | 似乎可以绕过编辑流程,直接获得影响最大的节点 | Wikipedia 是否具有关注度由编辑流程判断。付费创建却不披露身份属于违规,页面会被回退,甚至被加上违规标记(Wikipedia:Notability;Paid-contribution disclosure);页面被删除比从未创建更糟 |
| 「自己创建一条 Wikidata 条目,不就进入图谱了吗?」 | 创建门槛似乎不高,而且规则允许自行编辑 | 内容单薄且只引用自身来源的条目,达不到 Wikidata 对「严肃、公开可查的参考来源」的收录要求(Wikidata:Notability),可信度很低,随时可能被删除;节点存在也不代表节点值得信任(E-E-A-T) |
| 「我们已经有知识面板了,所以会被引用」 | 知识面板似乎表明所有条件都已满足 | 面板只是实体识别的一种呈现形式,并不等于内容会被引用。内容能否被原样引述取决于 可引用性,来源是否可信取决于 E-E-A-T;节点只能增强实体认知,不能直接让内容进入答案 |
| 「我们已经有 Wikipedia 页面了,所以已经被解析了」 | Wikipedia 页面似乎表明实体识别已经完成 | 这与 实体识别 §7 中的误判相同,只是观察角度相反:实体存在度关注节点是否存在,实体识别 则关注如何把页面上的名称与节点对应起来 |
| 「伪造一条指向某个知名 Wikidata 条目的 sameAs」 | 似乎可以立即让页面与知名节点建立关联 | 这项声明无法通过外部信息的交叉验证,与伪造作者署名无法通过 E-E-A-T §7 的验证、伪造 Organization 标记无法通过 Schema.org for AI §7 的验证是同一回事;这种虚假关联迟早会被识破 |
总结来说,节点用于汇集外部提及所形成的实体信息,不能由自己强行创建。只有获得足够的站外关注度,才具备建立节点的条件;自行创建却无人佐证的节点,本质上只是一项没有依据的声明。
8. 对 GEO 的意义与后续行动
知识图谱中的实体存在度是实体层的一项基础信号:它能增强模型先验,也为解析提供明确对象。理解这项信号时,还要结合形成它的站外信号(品牌提及)、使用节点完成的解析(实体识别),以及指向节点的标记(Schema.org for AI)。目前仍缺少一部分配套内容:Schema 落地 已经说明如何配置 sameAs,但站外关注度和 Wikipedia 方面暂时还没有现成的操作手册。对应页面尚不存在,因此无法提供链接。
| 目标 | 建议阅读 |
|---|---|
| 获得足以支持可信节点的站外报道 | 品牌提及 |
| 在解析过程中,将关于你的提及与该节点对应起来 | 实体识别 |
| 配置用于关联页面与节点的 sameAs | Schema 落地 |
| 弄清楚哪些标记会影响实体层 | Schema.org for AI |
| 检查节点本身是否可信 | E-E-A-T |
| 了解节点在答案生成全流程中的位置 | Answer Loop |
| 了解如何综合运用以上方法 | 生成式引擎优化 |
参考资料
学术:
- Kandpal, N., Deng, H., Roberts, A., Wallace, E. & Raffel, C. (2023). Large Language Models Struggle to Learn Long-Tail Knowledge. ICML 2023 (PMLR v202). arXiv:2211.08411
- Mallen, A., Asai, A., Zhong, V., Das, R., Khashabi, D. & Hajishirzi, H. (2023). When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories. ACL 2023. ACL Anthology · arXiv:2212.10511
- Aggarwal, P. et al. (2024). GEO: Generative Engine Optimization. KDD ‘24. arXiv:2311.09735 · 论文精读。用于界定结论边界;知识图谱中的实体存在度不是该研究测量的变量
官方:
- Google — Introducing the Knowledge Graph: things, not strings(2012-05-16):提出「实体,而非字符串」这一模型
- Google Knowledge Panel Help — Get verified on Google:认领知识面板
- Google Search Central — Organization structured data:sameAs「在后台用于把你的组织与其他组织区分开」
- Schema.org —
sameAs:「无歧义地标明该项身份的参考网页 URL」
政策:
- Wikipedia — Notability:「获得独立于其自身、可靠来源的大量报道,即被推定为适合收录」
- Wikipedia — Paid-contribution disclosure:付费编辑必须披露
- Wikidata — Notability:条目需对应「一个可清晰辨识的概念或实体,且能以严肃、公开可查的参考来源描述」
业界:
- Profound — AI Platform Citation Patterns(2025-06-05):Wikipedia 是 ChatGPT 被引用最多的来源(约 7.8%);看方向,厂商实测
常见问题
为什么 Wikipedia 对 AI 引用的增强作用这么明显?
它和实体识别、品牌提及到底差在哪?
我们已经有了知识面板,是不是就一定会被引用?
自己动手建一个 Wikidata 条目或者 Wikipedia 页面,能不能算存在度?
伪造一条指向某个知名 Wikidata 条目的 sameAs,能不能把别人的存在度借过来?
延伸阅读
参考来源
一手来源
- Large Language Models Struggle to Learn Long-Tail Knowledge (Kandpal, Deng, Roberts, Wallace & Raffel, ICML 2023) · arXiv / ICML 2023 (PMLR v202) · 2023-07-27
- When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories (Mallen et al., ACL 2023) · ACL 2023 (Long Papers) · 2023-07-02
- Introducing the Knowledge Graph: things, not strings · Google (Amit Singhal, The Keyword) · 2012-05-16
- Organization structured data (sameAs disambiguation) · Google Search Central · 2026-04-15
- sameAs — Schema.org property · Schema.org
- Get verified on Google (claim a knowledge panel) · Google Knowledge Panel Help
- Wikipedia:Notability — the general notability guideline · Wikipedia (Wikimedia Foundation)
- Wikipedia:Paid-contribution disclosure · Wikipedia (Wikimedia Foundation)
- Wikidata:Notability · Wikidata (Wikimedia Foundation)
- GEO: Generative Engine Optimization (Aggarwal et al., KDD '24) · arXiv / ACM SIGKDD · 2024-08-25