实体识别
速览要点
- 是什么
- 把页面上出现的名称(品牌、产品、作者)对应到引擎已知的规范实体,并与同名实体区分开的机制
- 为什么重要
- 解析是整条链路中最关键的一步。只有将提及、引用或 sameAs 对应到正确的实体节点,相关信用才会记到应归属的实体名下;一旦解析失败,信用就会失去归属、被归到错误对象名下或不被计入
- 在哪里起作用
- 作用于检索前的解析与实体层。随后,可引用性和 E-E-A-T 才会影响采信与选择;解析决定相应信用归给哪个实体,而不是决定取用哪段内容
- 解析的关键凭据
- sameAs 是最直接的显式解析凭据。Google 明确说它「在后台用于把你的组织与其他组织区分开」
- 判断依据
- 解析依赖多方相互印证,而非单方声明;一条孤立的 sameAs 不足以完成解析,还要有全网一致的身份信息作为佐证
1. 实体识别是什么
实体识别是一套机制,决定 AI 引擎能否分辨你是谁、你是什么,并把你获得的各种信号归到正确的实体节点上。
GEO Wiki 工作定义:在 GEO 语境下,实体识别是 AI 引擎把一个表层名称(surface form,也就是页面或查询中出现的品牌、产品、作者字符串)对应到已知的规范实体(canonical entity),并与同名实体区分开的过程。只有完成这一步,与这串字符相关的信用才能归于正确的节点。
2. 为什么未解析的实体拿不到信用
未被解析的实体,拿不到信用。 只有把一次提及、一次引用或一处标记断言对应到正确的实体节点,相关信用才会记到应归属的实体名下。名称未能解析时,即使被点名或引用,相应信用也不会生效。正如 品牌提及 §5 所说:「没有提及的链接,权威动作不完整」;可引用性 §2 也强调:「可引用是必要条件,不是充分条件」。解析是整条链路的关键一步,不是锦上添花。
提及 / 引用 / sameAs 断言
│
▼
[ 实体解析层 ] ◄── 本条目
表层名称 → 候选 → 消歧 → 节点
│
┌────────┴─────────┐
▼ ▼
已解析 未解析 / 错配
→ 先验与 → 信用被丢弃,或
信用记到 附着到错误实体
你的节点 上(同名冲突)
解析发生在检索之前的解析与实体层,Schema.org for AI §2 所讨论的标记也在这一环节发挥作用。完成实体解析后,系统才进入 Answer Loop §3 所述的采信与选择环节,可引用性 与 E-E-A-T 会在这一环节影响判断。解析并不决定取用哪段内容,而是决定相应信用最终归于哪个实体。
实体识别需要与三个相关概念区分:
- 解析 ≠ 可被引述。 让一段话可被原样取用,见 可引用性。
- 解析 ≠ 被信任。 解析出的实体是否可信,见 E-E-A-T。
- 解析 ≠ 节点存在。 Wikidata 节点本身见 知识图谱存在度;实体识别解决的是如何把一次提及正确对应到该节点。
3. 机制:实体解析流程
解析的基本机制是先做命名实体识别(NER),再做实体链接(entity linking)。在 GEO 语境下,流程如下:
表层名称 "Acme" (页面或查询里的字符串)
│
▼
候选生成 "Acme" 可能是哪些已知实体?
│ (Acme 公司 · Acme 工具 · 同名乐队 …)
▼
消歧 上下文 + 共现 + 先验,挑出其一
│
▼
规范实体 信用最终附着的那个节点
消歧依赖三类输入,三者的权重并不相同;§5 之所以按平台区分,正是因为各平台主要依赖的输入不同。
| 输入 | 如何影响解析 | 来自哪里 | 何时占主导 |
|---|---|---|---|
| ① 显式解析凭据 | 一条直接指向正确实体节点、不会产生歧义的链接,让引擎无须再做推测 | sameAs、结构化标识符、权威主页链接 | 会读取并解析结构化数据的索引集成型平台 |
| ② 消歧上下文 | 提供足够线索,从多个可能匹配的实体中确定唯一对象 | 一致的规范名称、各渠道一致的 NAP、每次提及附近的描述性共现词 | 没有显式凭据时(开放网络上的大多数情形) |
| ③ 模型既有先验 | 在多个候选中,优先选择训练时反复得到印证的实体 | 训练数据和检索结果中有多少相互一致的信息支持该实体,也就是 §6 所说的「越知名越容易被解析」这条规律 | 没有结构化层可读的纯 LLM 平台 |
Schema.org for AI §4 指出,sameAs 可以作为显式的解析凭据。Google 明确说,它「在后台用于把你的组织与其他组织区分开」(见 Organization 结构化数据)。完整的 JSON-LD 代码块见 Schema.org for AI 或 Schema 落地 playbook。具体而言,sameAs 声明本页所指的实体就是相应 Wikipedia/Wikidata 链接指向的实体;只有当全网其他信息都不与这项声明矛盾,引擎才会接受,并从多个候选中确定唯一节点。
4. 怎样让实体得到可靠解析
提高解析的可靠性,关键在以下几项措施,以及它们各自对应的 §3 输入:
| 可采取的措施 | 如何帮助解析 | 对应输入 | 常见失败 |
|---|---|---|---|
| sameAs 或结构化标识符 | 给引擎一条直接指向正确实体节点的显式链接 | ① | 缺少这条显式链接,实体始终无法对应到知识图谱中的节点 |
| 全网统一的规范名称与 NAP | 使不同渠道的提及都能对应到同一个候选实体 | ② | 各渠道身份信息不一致,系统会持续生成多个候选,无法确定唯一节点 |
| 每次提及附近都附带消歧上下文(角色、领域、限定词) | 通过提及周围的语境把你与同名者区分开 | ② | 同名冲突未解决,相应信用会归给规模更大的同名实体 |
| 一个已认领的知识图谱节点,作为解析的目标 | 让解析最终能对应到一个已有权威记录的实体 | ① 与 ③ | 缺少可对应的目标节点(节点机制见 知识图谱存在度) |
| 为品牌、作者、产品选择一个有辨识度且能避开同名的名称 | 从源头减少可能混淆的同名候选 | ② | 每次生成候选列表时,同名实体都更占优势 |
品牌提及 §6 指出:「你赢得的是成为那个被点名的对象」。实体识别遵循相同的逻辑:单方声明不足以确立身份;全网信息必须相互印证,形成唯一且一致的身份。实体能否被可靠解析,正是这种一致性带来的结果。 这个身份是否可信,见 E-E-A-T。
5. 不同平台如何解析实体(共性与差异)
各平台都遵循 §3 所述的流程,差异在于主要依赖哪一类输入。
| 平台 | 占主导的解析输入 |
|---|---|
| Google AI Overviews 与 AI Mode | 索引与知识图谱;主要依赖显式标识符(①),知识图谱用于补充判断 |
| Google Gemini | 依赖共现与知识图谱节点(② 与 ③),知识图谱在无法明确解析时补充判断 |
| ChatGPT 与 Perplexity(实时抓取) | 模型先验与实时抓取页面中的上下文(② 与 ③);JSON-LD 在生成答案时不会被当作知识图谱来解析(Schema.org for AI §5);解析主要依赖模型先验与知识图谱,而不是抓取时读取页面上的标记 |
6. 证据说明了什么、又没说明什么
现有证据已充分支持实体解析机制的基本方向;但在品牌层面,投入越多是否就一定解析得越可靠,目前并无定论。解读 Aggarwal 时也要注意同样的证据边界:研究可以说明总体方向,却不能把某个具体系数直接用于不同对象。下表区分了已有证据与不能据此推出的结论:
| 证据能支持什么 | 不能据此推出什么 |
|---|---|
| 一个实体获得的佐证越广泛,模型对它的回忆与处理就越可靠:模型能够稳定解析热门实体,长尾实体则不能(Kandpal 等,arXiv:2211.08411;Mallen 等,ACL 2023) | 这些论文度量的是对 Wikidata 事实的 QA 准确率,并以 Wikipedia 页面浏览量衡量热度,并没有度量品牌实体解析。将结论推广到品牌实体,只能视为类比,不能当作直接结论。品牌提及 §4 引用同一批论文时也作了相同区分:这些研究能说明模型先验的作用,并能支持实体越知名越容易被解析这一规律 |
| 索引集成型平台依靠显式标识符和知识图谱这一层完成解析:Google 说 sameAs 用于把你的组织与其他组织区分开(Organization 文档;这套模型可追溯到 知识图谱,2012) | 这只说明实体达到了基本解析门槛,并不表示会因此获得排名加成;详见 Schema.org for AI §6 |
| 业界实践现已把实体消歧(「实体漂移」「身份坍缩」)视为 AI 搜索中的首要问题(Search Engine Land,2026) | 这只能从业界实践层面佐证该问题确实存在,不能独立证明相应机制或效应量 |
Aggarwal 等关于生成式引擎优化的研究(KDD ‘24,arXiv:2311.09735;论文精读)度量的是页内内容改写(加引用、加统计、加引述),并不是实体解析。研究中最高约 40% 的提升并不适用于「改善实体识别」;将这个数字直接用于实体解析,属于过度外推。
解析依赖多方相互印证,而非单方声明。 单凭一条 sameAs 无法完成解析;只有多个独立来源提供一致的身份信息,才能形成足以支持解析的佐证。这与 Schema.org for AI 所说的「标记是声明,不是奖励」、E-E-A-T §6 所说的「靠挣得,不靠标注」含义一致。
7. 反模式:身份含混与认错实体
以下几类失败模式必须避免;相关问题也见 品牌提及 §8 与 Schema.org for AI §7。
| 误读 | 为什么看似合理 | 实际问题 |
|---|---|---|
| 「我们到处都被点名,那肯定被解析了」 | 提及次数多,似乎代表权威度高 | 一个未妥善处理的同名冲突会使模型先验分散到几个同名实体;决定结果的是能否正确解析,而不是提及次数 |
| 「各渠道用不同名称/账号,做品牌没关系」 | 在不同渠道使用不同表达,似乎更灵活 | 信息会分散到多个候选实体,系统始终无法确定唯一节点(§3 输入 ②) |
| 「伪造一条指向知名节点的 sameAs」 | 似乎可以立即建立关联 | 这与在 E-E-A-T §7 伪造署名、在 Schema.org for AI §7 伪造 Organization 的结果相同:多方信息不一致,最终会使声明失效;造假的解析链接也会被识别出来 |
| 「光靠标记就能解析我们」 | 似乎已经提供了明确凭据 | 纯 LLM 平台在生成答案时并不解析 JSON-LD(§5);这项显式凭据还要得到多方一致信息的支持 |
| 「我们有 Wikipedia 页面,所以被解析了」 | 似乎已经具备明确身份 | Wikipedia 页面只能证明知识图谱节点存在(见 知识图谱存在度);实体识别还要把具体提及正确对应到这个节点 |
实体识别失败,几乎从来不是「没有身份」,而是认错了对象,或者根本无法确认。解决办法是保持一致,而不是一味增加数量。
8. 这对 GEO 为什么重要,以及怎么做
实体解析是前置的几个关键环节之一。相应信用最终能否被计入,取决于这些环节是否成立;因此,应把实体解析与内容能否被采信(可引用性)、站外信息形成的模型先验(品牌提及)放在一起理解。
| 目标 | 参考内容 |
|---|---|
| 部署 sameAs 或修正身份标记 | Schema 落地 |
| 建立对应的结构化节点 | 知识图谱存在度 |
| 获得能够推动解析的站外提及 | 品牌提及 |
| 了解哪些标记会作用于实体层 | Schema.org for AI |
| 判断解析出的实体是否可信 | E-E-A-T |
| 让同一实体跨语言被解析 | Multilingual GEO |
| 了解实体解析在答案流程中的作用 | Answer Loop |
| 将这些环节系统整合起来 | 生成式引擎优化 |
参考资料
学术:
- Kandpal, N., Deng, H., Roberts, A., Wallace, E. & Raffel, C. (2023). Large Language Models Struggle to Learn Long-Tail Knowledge. ICML 2023 (PMLR v202). arXiv:2211.08411
- Mallen, A., Asai, A., Zhong, V., Das, R., Khashabi, D. & Hajishirzi, H. (2023). When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories. ACL 2023. ACL Anthology · arXiv:2212.10511
- Aggarwal, P. et al. (2024). GEO: Generative Engine Optimization. KDD ‘24. arXiv:2311.09735 · 论文精读。可用于界定证据边界;该研究并未度量实体解析
官方:
- Google — Introducing the Knowledge Graph: things, not strings(2012-05-16):奠定「实体,而非字符串」这一模型
- Google Search Central — Organization structured data:sameAs「在后台用于把你的组织与其他组织区分开」
- Schema.org —
sameAs:「无歧义地标明该项身份的参考网页 URL」
业界:
- Search Engine Land — Why entity authority is the foundation of AI search visibility(Benu Aggarwal,2026-03-16)
常见问题
实体识别不就是个 NLP 细节吗,为什么对 GEO 重要?
它和知识图谱存在度、品牌提及有什么区别?
加了 sameAs 标记,实体就一定能被解析吗?
为什么知名品牌比我更容易被解析?
实体识别最常见的失败是什么?
延伸阅读
参考来源
一手来源
- Large Language Models Struggle to Learn Long-Tail Knowledge (Kandpal, Deng, Roberts, Wallace & Raffel, ICML 2023) · arXiv / ICML 2023 (PMLR v202) · 2023-07-27
- When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories (Mallen et al., ACL 2023) · ACL 2023 (Long Papers) · 2023-07-02
- Introducing the Knowledge Graph: things, not strings · Google (Amit Singhal, The Keyword) · 2012-05-16
- Organization structured data (sameAs disambiguation) · Google Search Central · 2026-04-15
- sameAs — Schema.org property · Schema.org
- GEO: Generative Engine Optimization (Aggarwal et al., KDD '24) · arXiv / ACM SIGKDD · 2024-08-25
二手来源
- Why entity authority is the foundation of AI search visibility · Search Engine Land (Benu Aggarwal)