跳到正文

实体识别

速览要点

是什么
把页面上出现的名称(品牌、产品、作者)对应到引擎已知的规范实体,并与同名实体区分开的机制
为什么重要
解析是整条链路中最关键的一步。只有将提及、引用或 sameAs 对应到正确的实体节点,相关信用才会记到应归属的实体名下;一旦解析失败,信用就会失去归属、被归到错误对象名下或不被计入
在哪里起作用
作用于检索前的解析与实体层。随后,可引用性和 E-E-A-T 才会影响采信与选择;解析决定相应信用归给哪个实体,而不是决定取用哪段内容
解析的关键凭据
sameAs 是最直接的显式解析凭据。Google 明确说它「在后台用于把你的组织与其他组织区分开」
判断依据
解析依赖多方相互印证,而非单方声明;一条孤立的 sameAs 不足以完成解析,还要有全网一致的身份信息作为佐证

1. 实体识别是什么

实体识别是一套机制,决定 AI 引擎能否分辨你是谁、你是什么,并把你获得的各种信号归到正确的实体节点上。

GEO Wiki 工作定义:在 GEO 语境下,实体识别是 AI 引擎把一个表层名称(surface form,也就是页面或查询中出现的品牌、产品、作者字符串)对应到已知的规范实体(canonical entity),并与同名实体区分开的过程。只有完成这一步,与这串字符相关的信用才能归于正确的节点。

2. 为什么未解析的实体拿不到信用

未被解析的实体,拿不到信用。 只有把一次提及、一次引用或一处标记断言对应到正确的实体节点,相关信用才会记到应归属的实体名下。名称未能解析时,即使被点名或引用,相应信用也不会生效。正如 品牌提及 §5 所说:「没有提及的链接,权威动作不完整」;可引用性 §2 也强调:「可引用是必要条件,不是充分条件」。解析是整条链路的关键一步,不是锦上添花。

   提及 / 引用 / sameAs 断言
            │
            ▼
   [ 实体解析层 ]   ◄── 本条目
     表层名称 → 候选 → 消歧 → 节点
            │
   ┌────────┴─────────┐
   ▼                  ▼
 已解析            未解析 / 错配
 → 先验与          → 信用被丢弃,或
   信用记到           附着到错误实体
   你的节点           上(同名冲突)

解析发生在检索之前的解析与实体层,Schema.org for AI §2 所讨论的标记也在这一环节发挥作用。完成实体解析后,系统才进入 Answer Loop §3 所述的采信与选择环节,可引用性 与 E-E-A-T 会在这一环节影响判断。解析并不决定取用哪段内容,而是决定相应信用最终归于哪个实体。

实体识别需要与三个相关概念区分:

  • 解析 ≠ 可被引述。 让一段话可被原样取用,见 可引用性。
  • 解析 ≠ 被信任。 解析出的实体是否可信,见 E-E-A-T。
  • 解析 ≠ 节点存在。 Wikidata 节点本身见 知识图谱存在度;实体识别解决的是如何把一次提及正确对应到该节点。

3. 机制:实体解析流程

解析的基本机制是先做命名实体识别(NER),再做实体链接(entity linking)。在 GEO 语境下,流程如下:

  表层名称        "Acme"  (页面或查询里的字符串)
       │
       ▼
  候选生成        "Acme" 可能是哪些已知实体?
       │          (Acme 公司 · Acme 工具 · 同名乐队 …)
       ▼
  消歧            上下文 + 共现 + 先验,挑出其一
       │
       ▼
  规范实体        信用最终附着的那个节点

消歧依赖三类输入,三者的权重并不相同;§5 之所以按平台区分,正是因为各平台主要依赖的输入不同。

输入如何影响解析来自哪里何时占主导
① 显式解析凭据一条直接指向正确实体节点、不会产生歧义的链接,让引擎无须再做推测sameAs、结构化标识符、权威主页链接会读取并解析结构化数据的索引集成型平台
② 消歧上下文提供足够线索,从多个可能匹配的实体中确定唯一对象一致的规范名称、各渠道一致的 NAP、每次提及附近的描述性共现词没有显式凭据时(开放网络上的大多数情形)
③ 模型既有先验在多个候选中,优先选择训练时反复得到印证的实体训练数据和检索结果中有多少相互一致的信息支持该实体,也就是 §6 所说的「越知名越容易被解析」这条规律没有结构化层可读的纯 LLM 平台

Schema.org for AI §4 指出,sameAs 可以作为显式的解析凭据。Google 明确说,它「在后台用于把你的组织与其他组织区分开」(见 Organization 结构化数据)。完整的 JSON-LD 代码块见 Schema.org for AI 或 Schema 落地 playbook。具体而言,sameAs 声明本页所指的实体就是相应 Wikipedia/Wikidata 链接指向的实体;只有当全网其他信息都不与这项声明矛盾,引擎才会接受,并从多个候选中确定唯一节点。

4. 怎样让实体得到可靠解析

提高解析的可靠性,关键在以下几项措施,以及它们各自对应的 §3 输入:

可采取的措施如何帮助解析对应输入常见失败
sameAs 或结构化标识符给引擎一条直接指向正确实体节点的显式链接①缺少这条显式链接,实体始终无法对应到知识图谱中的节点
全网统一的规范名称与 NAP使不同渠道的提及都能对应到同一个候选实体②各渠道身份信息不一致,系统会持续生成多个候选,无法确定唯一节点
每次提及附近都附带消歧上下文(角色、领域、限定词)通过提及周围的语境把你与同名者区分开②同名冲突未解决,相应信用会归给规模更大的同名实体
一个已认领的知识图谱节点,作为解析的目标让解析最终能对应到一个已有权威记录的实体① 与 ③缺少可对应的目标节点(节点机制见 知识图谱存在度)
为品牌、作者、产品选择一个有辨识度且能避开同名的名称从源头减少可能混淆的同名候选②每次生成候选列表时,同名实体都更占优势

品牌提及 §6 指出:「你赢得的是成为那个被点名的对象」。实体识别遵循相同的逻辑:单方声明不足以确立身份;全网信息必须相互印证,形成唯一且一致的身份。实体能否被可靠解析,正是这种一致性带来的结果。 这个身份是否可信,见 E-E-A-T。

5. 不同平台如何解析实体(共性与差异)

各平台都遵循 §3 所述的流程,差异在于主要依赖哪一类输入。

平台占主导的解析输入
Google AI Overviews 与 AI Mode索引与知识图谱;主要依赖显式标识符(①),知识图谱用于补充判断
Google Gemini依赖共现与知识图谱节点(② 与 ③),知识图谱在无法明确解析时补充判断
ChatGPT 与 Perplexity(实时抓取)模型先验与实时抓取页面中的上下文(② 与 ③);JSON-LD 在生成答案时不会被当作知识图谱来解析(Schema.org for AI §5);解析主要依赖模型先验与知识图谱,而不是抓取时读取页面上的标记

6. 证据说明了什么、又没说明什么

现有证据已充分支持实体解析机制的基本方向;但在品牌层面,投入越多是否就一定解析得越可靠,目前并无定论。解读 Aggarwal 时也要注意同样的证据边界:研究可以说明总体方向,却不能把某个具体系数直接用于不同对象。下表区分了已有证据与不能据此推出的结论:

证据能支持什么不能据此推出什么
一个实体获得的佐证越广泛,模型对它的回忆与处理就越可靠:模型能够稳定解析热门实体,长尾实体则不能(Kandpal 等,arXiv:2211.08411;Mallen 等,ACL 2023)这些论文度量的是对 Wikidata 事实的 QA 准确率,并以 Wikipedia 页面浏览量衡量热度,并没有度量品牌实体解析。将结论推广到品牌实体,只能视为类比,不能当作直接结论。品牌提及 §4 引用同一批论文时也作了相同区分:这些研究能说明模型先验的作用,并能支持实体越知名越容易被解析这一规律
索引集成型平台依靠显式标识符和知识图谱这一层完成解析:Google 说 sameAs 用于把你的组织与其他组织区分开(Organization 文档;这套模型可追溯到 知识图谱,2012)这只说明实体达到了基本解析门槛,并不表示会因此获得排名加成;详见 Schema.org for AI §6
业界实践现已把实体消歧(「实体漂移」「身份坍缩」)视为 AI 搜索中的首要问题(Search Engine Land,2026)这只能从业界实践层面佐证该问题确实存在,不能独立证明相应机制或效应量

Aggarwal 等关于生成式引擎优化的研究(KDD ‘24,arXiv:2311.09735;论文精读)度量的是页内内容改写(加引用、加统计、加引述),并不是实体解析。研究中最高约 40% 的提升并不适用于「改善实体识别」;将这个数字直接用于实体解析,属于过度外推。

解析依赖多方相互印证,而非单方声明。 单凭一条 sameAs 无法完成解析;只有多个独立来源提供一致的身份信息,才能形成足以支持解析的佐证。这与 Schema.org for AI 所说的「标记是声明,不是奖励」、E-E-A-T §6 所说的「靠挣得,不靠标注」含义一致。

7. 反模式:身份含混与认错实体

以下几类失败模式必须避免;相关问题也见 品牌提及 §8 与 Schema.org for AI §7。

误读为什么看似合理实际问题
「我们到处都被点名,那肯定被解析了」提及次数多,似乎代表权威度高一个未妥善处理的同名冲突会使模型先验分散到几个同名实体;决定结果的是能否正确解析,而不是提及次数
「各渠道用不同名称/账号,做品牌没关系」在不同渠道使用不同表达,似乎更灵活信息会分散到多个候选实体,系统始终无法确定唯一节点(§3 输入 ②)
「伪造一条指向知名节点的 sameAs」似乎可以立即建立关联这与在 E-E-A-T §7 伪造署名、在 Schema.org for AI §7 伪造 Organization 的结果相同:多方信息不一致,最终会使声明失效;造假的解析链接也会被识别出来
「光靠标记就能解析我们」似乎已经提供了明确凭据纯 LLM 平台在生成答案时并不解析 JSON-LD(§5);这项显式凭据还要得到多方一致信息的支持
「我们有 Wikipedia 页面,所以被解析了」似乎已经具备明确身份Wikipedia 页面只能证明知识图谱节点存在(见 知识图谱存在度);实体识别还要把具体提及正确对应到这个节点

实体识别失败,几乎从来不是「没有身份」,而是认错了对象,或者根本无法确认。解决办法是保持一致,而不是一味增加数量。

8. 这对 GEO 为什么重要,以及怎么做

实体解析是前置的几个关键环节之一。相应信用最终能否被计入,取决于这些环节是否成立;因此,应把实体解析与内容能否被采信(可引用性)、站外信息形成的模型先验(品牌提及)放在一起理解。

目标参考内容
部署 sameAs 或修正身份标记Schema 落地
建立对应的结构化节点知识图谱存在度
获得能够推动解析的站外提及品牌提及
了解哪些标记会作用于实体层Schema.org for AI
判断解析出的实体是否可信E-E-A-T
让同一实体跨语言被解析Multilingual GEO
了解实体解析在答案流程中的作用Answer Loop
将这些环节系统整合起来生成式引擎优化

参考资料

学术:

  • Kandpal, N., Deng, H., Roberts, A., Wallace, E. & Raffel, C. (2023). Large Language Models Struggle to Learn Long-Tail Knowledge. ICML 2023 (PMLR v202). arXiv:2211.08411
  • Mallen, A., Asai, A., Zhong, V., Das, R., Khashabi, D. & Hajishirzi, H. (2023). When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories. ACL 2023. ACL Anthology · arXiv:2212.10511
  • Aggarwal, P. et al. (2024). GEO: Generative Engine Optimization. KDD ‘24. arXiv:2311.09735 · 论文精读。可用于界定证据边界;该研究并未度量实体解析

官方:

业界:

常见问题

实体识别不就是个 NLP 细节吗,为什么对 GEO 重要?
因为这一步决定整条链路能否成立,绝非无关紧要的细节。生成式答案署名给的是一个实体,而不是一串字符。如果引擎无法把页面上的名称对应到已知的规范实体,提及、引用或标记带来的信用就无法归属,或者会被归到其他实体名下。实体识别把结构化节点本身(知识图谱存在度)与站外的提及信号(品牌提及)联系起来。
它和知识图谱存在度、品牌提及有什么区别?
三者分工明确。品牌提及关注站外不带链接的提及,以及这些提及如何强化模型先验。知识图谱存在度关注结构化节点本身(Wikidata 或 Google 知识图谱中的条目)。实体识别则负责把一个名称无歧义地对应到这个节点。提及强化模型先验,节点提供明确的归属对象,实体识别负责把一次提及中的名称对应到该节点。
加了 sameAs 标记,实体就一定能被解析吗?
不一定。sameAs 是最强的显式解析凭据(Google 明确说它用于把你的组织与其他组织区分开),但解析依赖多方相互印证,而非单方声明。在纯 LLM 的实时抓取场景中,系统生成答案时不会把 JSON-LD 当作知识图谱来解析;实体识别主要依赖模型先验与知识图谱,而不是通过抓取页面标记来完成。孤立的 sameAs 若没有全网一致的身份信息佐证,只能算单方声明,不能完成解析。标记是必要条件,远不是充分条件。
为什么知名品牌比我更容易被解析?
因为实体能否被可靠解析,取决于佐证是否广泛。长尾知识研究(Kandpal 等,ICML 2023;Mallen 等,ACL 2023)显示,模型对热门实体的回忆与处理远比冷门实体可靠,研究以 Wikipedia 页面浏览量衡量热度。同样的规律也会影响消歧:知名实体更容易被模型准确回忆和提及,也更容易得到正确识别。不过,将这条规律应用于品牌实体只是一种类比,并不是已经测得的品牌结论。
实体识别最常见的失败是什么?
失败几乎从来不是「没有身份」,而是认错了对象,或者根本无法确认。一个未妥善处理的同名冲突(你的品牌和一个更大的实体共用同一串字符),会让相应信用归到规模更大的同名实体名下。名称、账号或 NAP 在各渠道不一致,会使信息分散到多个候选实体,始终无法确定唯一节点。解决办法是保持一致,而不是一味增加数量:身份本就分裂时,提及越多只会加剧分裂。伪造一条指向知名节点的 sameAs,与在 E-E-A-T 中伪造署名一样,最终都会因缺乏多方相互印证而失效。

延伸阅读

参考来源

一手来源

  1. Large Language Models Struggle to Learn Long-Tail Knowledge (Kandpal, Deng, Roberts, Wallace & Raffel, ICML 2023) · arXiv / ICML 2023 (PMLR v202) · 2023-07-27
  2. When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories (Mallen et al., ACL 2023) · ACL 2023 (Long Papers) · 2023-07-02
  3. Introducing the Knowledge Graph: things, not strings · Google (Amit Singhal, The Keyword) · 2012-05-16
  4. Organization structured data (sameAs disambiguation) · Google Search Central · 2026-04-15
  5. sameAs — Schema.org property · Schema.org
  6. GEO: Generative Engine Optimization (Aggarwal et al., KDD '24) · arXiv / ACM SIGKDD · 2024-08-25

二手来源

  1. Why entity authority is the foundation of AI search visibility · Search Engine Land (Benu Aggarwal)
最近更新: 2026-05-19 作者: Ray Yang 主题: 信号