跳到正文

多模态信号

速览要点

是什么
AI 引擎依据这组信息理解、采信并在答案中引用图片、视频、音频和图表等非文本资产
2026 年的主导通道
网页抓取主要读取 alt、说明、文字稿、schema 和周边正文等文本信息,而不是像素。目前,AI 答案所用的网页内容仍以文本为主
两种读取方式的差别
索引集成型(Google AIO)沿用 Google 已有的图片和视频索引;实时调取型(ChatGPT、Perplexity、带浏览的 Claude)抓取时读取 HTML,基本不做 OCR 或转录
视频最值得做的一步
在视频所在页面补上文字稿。自托管视频如果没有文字稿,实时调取型 AI 几乎无法获取其中的内容
speakable schema 的适用范围
截至 2025 年 12 月仍处于 beta 阶段,只适用于美国、英语、新闻网站和 Google Assistant TTS,并不是通用的 AI 可读性信号

1. 多模态信号是什么

AI 引擎能否理解、采信并在答案中引用图片、视频、音频和图表等非文本资产,取决于围绕这些资产提供的信息,也就是多模态信号。它属于 生成式引擎优化 的「多模态」信号,也会影响 E-E-A-T 对非文本资产可信度的判断。

先要分清两种信息来源:当前的 AI 引擎既会直接分析像素,也会读取文本通道。GPT-4V、Gemini 和带视觉功能的 Claude 等前沿多模态大模型,在直接收到图片时确实能够分析图像(见 OpenAI GPT-4V 系统卡片、Gemini 技术报告)。但答案引擎抓取网页时,绝大多数情况下传给模型的仍是文本,不是像素。此时,模型通常只能根据 alt 文本、说明、文字稿和 schema 标记来理解资产。

GEO Wiki 工作定义:多模态信号是帮助 AI 理解非文本资产的一组信息,主要包括三层:文本通道(alt、说明、文字稿、周边正文)、结构化数据通道(ImageObject、VideoObject、AudioObject、Dataset)和溯源通道(C2PA 内容凭证、EXIF、IPTC)。这三层信息共同影响 AI 生成答案时是否采信相关资产。

图片、视频、音频、图表与数据这四类资产,都要分别考虑索引集成型 AI 和实时调取型 AI。两者在处理方式上的差别(见 §3),直接决定 AI 能从各类资产中获取多少信息。

2. 四类资产,一表概览

下表汇总了四类资产各自依赖的文本、结构化数据,以及它们在 AI 答案中的常见呈现方式。

资产类型主要文本通道主要结构化数据通道在 AI 答案中的呈现方式
图片alt 属性、说明、周边正文ImageObject(caption、contentUrl、license、creator、embeddedTextCaption)AIO 答案里的图片卡片;图片结果中的横向浏览;带引用答案旁的缩略图
视频同页文字稿、字幕(SRT/VTT)、描述VideoObject(description、transcript、thumbnailUrl、uploadDate、contentUrl、duration)AIO 视频卡片;带时间戳的「跳到这一段」;从 YouTube 抓取的文字稿被整段引用
音频文字稿、节目说明、单集介绍AudioObject(transcript、contentUrl、caption)与 PodcastEpisode(audio、partOfSeries、episodeNumber)AIO 播客卡片;Google Assistant TTS(speakable 的窄场景)
图表、表格、示意图同页 HTML 数据表、说明、正文中明确写出的关键数字Dataset(distribution、variableMeasured、measurementTechnique)以数据表内容的形式进入答案,几乎不会直接引用像素图

表中的「主要文本通道」正是答案引擎实际能够读取的信息。VideoObject 也明确提供 transcript 字段,Schema.org 将其定义为「该对象的文字稿」,可见文本通道始终是理解非文本资产的重要基础。索引集成与实时调取利用这些文本的方式不同,§3 所述的这种差别会影响所有四类资产。

3. 两种读取方式:索引集成型 vs 实时调取型

AI 读取非文本资产的方式,延续了 Schema.org for AI §5 所述的「索引集成 vs 实时抓取」之分。

索引集成型 AI(Google AI Overviews、通过 Search 检索的 Gemini)沿用 Google 已有十余年的图片和视频索引。Google 很早就开始解析图片的 alt 属性;YouTube 的自动字幕和上传字幕共用一套基础设施,并且早在 AIO 出现之前就用于 Google Video Search。AIO 的图片卡片来自 Google 图片库,所需的多模态信息在常规索引阶段已经提取,不会等到生成答案时才临时处理。Core Web Vitals 和多模态信号是否达标,也仍由 Google 原有的质量系统判断,并非 AIO 另设的一套机制(见 Google Search Central — AI features and your website)。

实时调取型 AI(ChatGPT search、Perplexity、带浏览的 Claude)抓取网页时直接读取 HTML,因此可以获得 alt 属性和周边正文。这类引擎在抓取阶段不会对图片做 OCR,不会转录视频,也不会处理音频。文本通道如果没有说明资产内容,引擎就几乎得不到其中的信息。

用户直接上传图片、视频或 PDF,与引擎抓取网页是两种不同场景。直接收到文件时,ChatGPT 或 Perplexity 确实会进行视觉识别和 OCR;处理站点上的图片时,检索流程获得的却是 alt 和说明,而不是图像像素。模型具备某项能力,不代表检索流程一定会调用它。

引擎图片读取方式视频读取方式音频读取方式
Google AI Overviews索引阶段进行视觉识别,并结合 alt、说明和 ImageObject;AIO 答案会直接显示图片卡片结合索引阶段的处理、YouTube CC 基础设施和 VideoObject;AIO 答案会显示带时间戳的视频卡片索引阶段结合 AudioObject;可显示播客卡片;speakable 仅用于新闻 TTS 这一有限场景
ChatGPT search读 alt 与周边正文;抓取时不做 OCR读文字稿与描述;抓取时不做转录读文字稿与节目说明;抓取时不做转录
Perplexity读 alt 与周边正文;抓取时不做 OCR读文字稿与描述读文字稿与节目说明
Google Gemini通过 Search 索引读取(索引集成型),底层是原生多模态模型通过 Search 索引读取,并结合 YouTube 基础设施通过 Search 索引读取,并结合 AudioObject
Genspark采用多模态优先的答案形态(Sparkpages),公开资料较少同样采用多模态优先的答案形态,公开资料较少同样采用多模态优先的答案形态,公开资料较少

无论采用哪种读取方式,文本通道都是非文本资产的主导信号。索引集成型 AI 早在生成答案之前就已把这些文本收入索引;实时调取型 AI 的抓取流程则至今没有纳入像素处理。因此,§4–§7 所述的四类资产都应优先完善文本通道;溯源和像素级能力目前只能带来边际影响。

4. 图片:alt、说明、ImageObject、溯源

在四类资产中,图片相关信号的应用历史最长,文本通道也最成熟,可以从三个方面理解。

文本通道最为关键。无论哪类 AI,都能读取 alt 属性、紧邻图片的说明文字,以及图片附近具有描述性的标题。Google 的图片最佳实践明确写道:「Google 综合使用 alt 文本、计算机视觉算法以及页面内容,来理解一张图片的主题」(Google Search Central,2026-03-02 更新)。WCAG 的无障碍要求与 AI 提取内容的方式在这里高度一致:屏幕阅读器需要读取的信息,也恰好是实时调取型 AI 能够获取的信息。W3C 1.1.1 准则(非文本内容)明确要求「所有面向用户的非文本内容必须配有等效作用的文字替代」(W3C WAI)。

结构化数据通道:ImageObject 包含 caption、contentUrl、license、creator、embeddedTextCaption、exifData、representativeOfPage 等字段(schema.org/ImageObject)。商品使用 Product.image,文章使用 Article.image。完整的标记规范见 Schema.org for AI;在多模态场景中,实际传递信息的正是上述字段。

溯源通道:C2PA 内容凭证使用跨厂商的密码学证明,记录图片来源和编辑历史。EXIF 相机元数据可以记录拍摄信息,IPTC 图片署名则记录摄影师、版权和来源。2025-11,IPTC 图片元数据标准 v2025.1 新增了「AI System Used」字段,用来标明生成图片所用的模型;官方示例直接列出 ChatGPT、DALL-E 和 Google Gemini(IPTC)。这类新出现的溯源信号可以帮助判断资产是否可信,其作用与 E-E-A-T 要求文字内容注明作者相近。

信号索引集成型如何读取实时调取型如何读取
alt 属性读取;AIO 用它评估图片卡片的相关性读取;这是主要的文本通道
说明 / 周边正文读取读取
ImageObject JSON-LDAIO 解析为结构化数据作为页面文本读取(见 Schema.org for AI §5)
C2PA、EXIF、IPTCAIO 可在索引阶段核验一般不抓取这类二进制元数据;HTML 中通常也不提供这些信息

实时调取型 AI 无法直接读取图片本身,只能获取与图片相连的文本。电商商品图通常在 alt 中写明商品名和关键变体,编辑用途的摄影图片则写清场景、主体和背景;同样的方法适用于所有图片。

5. 视频:文字稿、字幕、VideoObject 与托管选择

对于视频,托管方式直接决定 AI 能获取哪些信息。同一段视频如果上传到 YouTube,或改为自行托管但不提供文字稿,AI 在两种情况下可读取的内容会相差很大;结构化标记再完整,也弥补不了文字稿的缺失。

文本通道:包括同页文字稿、SRT/VTT 字幕、视频描述和视频标题。对多数站点来说,同页文字稿最值得优先补齐;对实时调取型抓取流程而言,它也是读取视频语音内容的唯一形式。

结构化数据通道:VideoObject 明确提供 transcript 字段,Schema.org 将其定义为「该对象的文字稿」(schema.org/VideoObject)。其他关键字段包括 description、thumbnailUrl、uploadDate、contentUrl、embedUrl 和 duration(ISO 8601)。如 Schema.org for AI 所述,AIO 会直接解析这些数据,实时调取型 AI 则把它们作为页面文本读取。

托管选择带来的差别:YouTube 和 Vimeo 会自动生成字幕与文字稿,Google 的索引系统也早已持续收录这些数据。Google 的视频 SEO 最佳实践建议「为每段视频建立独立的观看页」(Google Search Central,2025-12-18 更新)。自托管视频如果没有文字稿,页面上就只有一个 <video> 标签,没有其他文字信息,两类 AI 都几乎无法读取视频内容。

托管选择文字稿是否可得AI 可读性
YouTube 或 Vimeo 嵌入自动字幕,上传者可手动补充高:AIO 可直接获取文字稿;实时调取型 AI 可读取嵌入代码周围的 HTML,也能读取平台开放访问的文字稿
自托管,配同页文字稿人工撰写,正文中直接提供高:两种读取方式都能获取这段文字稿
自托管,只配 VTT 或 SRT只提供外挂字幕文件,正文中没有文字稿中等:索引集成型会抓取外挂文件;许多实时调取型抓取器不会获取这类文件
自托管,无文字稿无AI 几乎无法获取视频内容

还要注意,字幕如果直接烧录在视频画面中,依赖文本通道的系统仍然无法读取;只有外挂字幕文件才有效。这与「把文字渲染成图片」是同一类失误:像素不是文本。对于出版机构、教育科技公司,以及其他以视频为主的内容业务,托管方式对 AI 可读性的影响通常大于标记是否完整。

6. 音频与 speakable schema:适用范围远比想象中窄

多模态领域有一个流传很广的误解:speakable schema 能让内容「对语音 AI 友好」。实际上,它并不是人们通常理解的通用语音 AI 信号。

根据 Google 最近一次(2025-12-10)更新的官方文档,speakable 仍处于beta 阶段,只面向「在美国将 Google Home 设备设为英语的用户,以及发布英语内容的出版方」(Google Search Central — Speakable)。「美国、英语、新闻」这三项限制已经维持多年,2025-12-10 的更新也没有放宽任何一项。它的用途是 Google Assistant 的 TTS 朗读,并非通用的 AI 可读性信号。

对音频来说,真正有效的做法如下:

  • 文字稿对音频和视频同样重要。没有文字稿的播客,其语音从未转成文本,实时调取型 AI 因而几乎无法获取节目内容。
  • 节目说明、单集介绍为搜索引擎提供可见的摘要,也是实时调取型 AI 实际读取的文字。
  • AudioObject 包括 transcript、contentUrl、caption、encodingFormat、duration 等字段(schema.org/AudioObject)。PodcastEpisode 则包括 partOfSeries、episodeNumber、duration、datePublished 和内嵌的 audio(一个 AudioObject)(schema.org/PodcastEpisode)。文字稿应当写在内嵌的 AudioObject 上,不能直接写在 PodcastEpisode 上。

speakable 用于 TTS 朗读,文字稿则帮助 AI 读取内容,二者不可混淆。厂商或平台常把 speakable 标记宣传为通用的 AI 可读性手段,但规范本身并不支持这种用途。

7. 图表、表格与示意图:把数据当作文本

对于以数据为核心的分析型内容,关键是把图表中的数据同时写成文本。

内容提取过程读取的是HTML 数据表,不是渲染成像素的图表。实时调取型 AI 无法读取 PNG 柱状图中的数据;只要同时提供图表对应的数据表,系统就能完整读取相关信息。具体有两种做法:

  • 图表同时提供数据表:可视化部分供人阅读,同时把对应数字以 HTML <table>(或纯文本)形式放在同一页面,供系统通过文本通道读取。
  • 说明配关键数字:在说明中写清楚关键数字、来源和时间区间,无论系统能否读取图表本身,这段信息都可以被引用。
<!-- 给人看 -->
<img src="/charts/q1-revenue.png" alt="季度营收走势,2024 Q1 至 2026 Q1,单位百万美元">

<!-- 给 AI 用:数据表回退 -->
<figcaption>季度营收从 1200 万美元(2024 Q1)增长到 1900 万美元(2026 Q1),上涨 58%。</figcaption>
<table>
  <thead><tr><th>季度</th><th>营收(百万美元)</th></tr></thead>
  <tbody>
    <tr><td>2024 Q1</td><td>12</td></tr>
    <tr><td>2025 Q1</td><td>15</td></tr>
    <tr><td>2026 Q1</td><td>19</td></tr>
  </tbody>
</table>

Schema.org 提供了发布数据集所用的 Dataset(schema.org/Dataset),也提供表示表格内容的 Table 类型;但首要条件仍是提供 HTML 数据表,标记只能作为补充。数据表也是 可引用性 中可引用度最高的内容形态之一:把图表写成系统可以读取的形式,通常也便于 AI 将其中的信息整段引用到答案里。

8. 信任与溯源:非文本资产同样需要 E-E-A-T

判断非文本资产是否可信,也要核查相应证据。批量生成却没有任何溯源信息的 AI 图片、作者署名不对应真实人物的视频,以及数据醒目却无法核验来源的图表,都面临同样的可信度问题。这与 AI 内容检测 判断文字内容是否由 AI 规模化批量产出时采用的逻辑相同,区别只在于资产形态。

资产溯源信号成熟度(截至 2026-05)
图片C2PA 内容凭证;EXIF 相机元数据;IPTC 图片署名 + 新增的「AI System Used」字段(v2025.1);ImageObject.creatorC2PA 的应用范围正在扩大(指导委员会包含 Adobe、Microsoft、BBC、OpenAI、Sony;普通成员包含 NYT、Nikon、Canon,见 C2PA Membership);EXIF/IPTC 已经成熟;IPTC v2025.1 的 AI 生成字段是新引入的(IPTC,2025-11-27)
视频VideoObject.creator/publisher;平台频道认证(YouTube);上传时间一致性;AI 生成视频上的 SynthID 水印(Google DeepMind)以 YouTube 托管为前提时较成熟;SynthID 对 Google 出品的 AI 视频已在使用
音频AudioObject.creator;托管平台认证;AI 生成音频上的 SynthID 水印中等成熟;SynthID 对 Google 出品的 AI 音频已在使用
图表/数据标注数据来源;附上方法说明;放出可下载的原始数据;让背后的数字本身可被核验完全成熟。这就是常规的引用规范

SynthID 是 Google DeepMind 的水印技术,覆盖图片、视频、音频和文本四种形态。据官方页面介绍,这类水印已嵌入 Google 面向消费者的各类生成式 AI 产品,肉眼无法察觉,但能由 SynthID 技术检出(Google DeepMind)。该页面没有公布具体的检出准确率,因此只能确认这项技术的发展方向,尚无数据衡量其影响程度。这与 AI 内容检测 §6 对水印类机制的整体建议一致。

需要注意的是,图片溯源生态(C2PA、SynthID、IPTC 的 AI 生成字段)确实已经开始落地,应用范围也在扩大,但截至 2026-05,尚无任何一家主流 AI 引擎确认将它作为引用门槛。发展趋势已经明确,实际影响却仍无数据可供衡量。

9. 证据边界:哪些结论可靠,哪些仍需验证

评估证据应分两步:先确认机制是否有据可循,再确认影响幅度是否经过测量。多语言 GEO §7 与 实体识别 §6 也作了同样的区分。机制方向有据可循,不代表「某项标记带来 N% 的引用率提升」这类具体数字经过了公开、严谨的测量。

已可成立的结论需要谨慎解读的部分
Google 已明确建议改善多模态内容质量。「用高质量的图片和视频补充正文」是 8 条官方建议之一(Google Search Central, 2025-05、Search Engine Land 的报道)这说明覆盖范围最大的搜索厂商认可这一方向,却不能证明具体提升幅度。Google 没有公布相关数据;行业报道也指出,官方「给出的具体可执行细节有限」
AIO 答案中确实会出现图片卡片与视频卡片。商品、菜谱、教程和视觉类研究查询的 AIO 回答中都能看到这类卡片这是可以观察到的产品形态,不是测量结果。没有公开文档说明具体哪张图会被选入卡片,也不能根据卡片出现的位置反推「排名要素」
YouTube 文字稿确实能进入 Google 索引。AI Overviews 回答里出现过逐句来自 YouTube 自动字幕的引用这是行业观察,不是严谨的基准测试。可以确认 YouTube 文字稿会进入 AIO,但无法据此算出某个频道或某段视频的引用率
多模态大模型在直接收到图像时可以描述图片(GPT-4V 系统卡片、Gemini 技术报告)这是模型本身的能力,不是检索流程的能力。目前,为答案引擎提供内容的检索流程仍主要传递文本,而不是像素。因此,不能据此认定 AI 搜索引擎可以读取网页中的图片
C2PA、SynthID 等溯源方案的应用范围正在扩大。Adobe、Microsoft、BBC、OpenAI、Sony 在 C2PA 指导委员会,NYT、Nikon、Canon 是普通成员(C2PA Membership);SynthID 已嵌入 Google 面向消费者的生成式 AI 产品应用范围的扩大已经得到证实,但它对 AI 引用行为有多大影响仍未经过测量。截至 2026-05,尚无任何一家主流 AI 引擎确认将它作为引用门槛
无论哪种读取方式,文本通道都是主导信号。从实时调取型 AI 的实际结果来看,最终引用的内容来自资产的 alt、周边正文和文字稿这一结论只反映 2026-05 的技术现状。随着原生多模态检索器得到更广泛应用,它可能不再完全成立;本条目的 lastUpdated 与 nextReviewDue 已据此安排了复核时间

截至 2026-05,尚无严谨且已公开发表的基准研究,能够说明单项多模态做法(alt 文本质量、ImageObject 完整度、是否提供文字稿、C2PA 证明是否齐全)可将引用率提高多少。以上四项都有可信依据,方向明确,但具体幅度没有可靠数据。任何「图片让 AI 引用率提升了 N%」的说法都属于过度宣称。因此,应优先完善文本通道,不要把未经公开测量的系数用于投资决策。

10. 多模态内容最常见的误读

多模态内容常见的误读如下;类似问题还可见 可引用性 §6 与 多语言 GEO §8。

误读看上去为什么对实际为什么不对
「alt 文本堆关键词能帮 AI 找到我的图片」误以为 alt 属性也适用常见的关键词堆砌手法Google 明确警告:在 alt 属性里堆砌关键词「会带来负面的用户体验,也可能让你的站点被判定为垃圾」(Google Images best practices)。AI 质量系统会识别并降低这类内容的权重,见 AI 内容检测
「把正文渲染成图片」:用图片输出整段文字设计感强,而且可以完全控制排版依赖文本通道的系统无法读取像素中的文字;OCR 并不是实时调取型检索流程的常规环节。这些文字只有直接接收图像的视觉模型才能看到,网页检索流程无法获取
「自托管视频不配文字稿也没事:音频本身会说话」人可以直接听懂,容易误以为 AI 也能听到视频语音如果没有转成文本,实时调取型 AI 只能读到一个 <video> 标签。对于以视频为主的站点,应当优先在同一页面补上文字稿
「speakable schema 能让我的内容变成语音 AI 友好」名称看起来正好对应 AI 和语音场景speakable 至今仍处于 beta 阶段,只适用于美国、英语、新闻和 Google Assistant TTS(Google Search Central — Speakable,2025-12-10)。这些限制多年未曾放宽,它并不是通用的 AI 可读性信号
「柱状图做成图片就够了,反正人能看懂」图已经清楚显示在页面上,看似足以传递数据内容提取流程读取的是 HTML 数据表,不是像素图。实时调取型 AI 只能获取一个 <figure> 和一段 alt。图中的数字只有写成文字,才能进入答案生成流程
「批量上线 AI 生成的库存图,不带任何溯源」似乎可以用较低成本迅速获得大量视觉素材文字内容由 AI 规模化批量产出时会触发 AI 内容检测 所述的判断,图片也不例外。C2PA、IPTC v2025.1 的「AI System Used」字段和 SynthID 水印都能提供这类可信度信息;不附任何来源凭证的 AI 图片也会被视为批量生成内容
「我刚把这张图输入 GPT-4o,它认得出来,AI 搜索引擎肯定也看得到」使用的是同一家公司的同一个模型,容易把两种场景混为一谈模型能力不等于检索流程能力。用户上传图片时会启用视觉识别,网页抓取通常仍只把文本传给模型。对于页面中的图片,检索流程获得的依然是 alt 和说明,不是像素

问题通常不在于少写了某项标记,而在于把「多模态」只当成视觉问题。到 2026 年,相关优化在绝大多数情况下仍应先解决文本通道的问题。

11. 多模态信号与 GEO 的关系及实施顺序

多模态 GEO 并不是一门独立的新学科。它是把可引用性与 E-E-A-T 应用到非文本资产上,再根据 §3 所述的读取方式差别,判断各项做法对哪类通道有效。具体方法本身并不新,只是针对不同资产类型重新组合了已有做法。

你的需求从这里开始
把图片、视频、音频或图表的标记做对Schema 实施 手册
选择标记格式(JSON-LD、RDFa、Microdata)JSON-LD
全面审计一个站点的多模态内容完整 GEO 审计 手册
让页面文本通道中的内容可被正常提取可引用性手册、可引用性概念
完善非文本资产的信任信号E-E-A-T、AI 内容检测(AI 规模化批量产出反模式)
理解结构化标记词汇Schema.org for AI
把资产作者与对应的创作者实体关联起来实体识别、知识图谱存在度
判断它处于答案循环的哪个环节Answer Loop
综合运用上述方法生成式引擎优化

实际执行时,应先逐项检查非文本资产的文本通道,再调整标记或溯源信息。多数团队会发现,主要问题并不是没有 ImageObject 标记,而是视频缺少文字稿、内容图片没有 alt、图表只有 PNG 而没有底层数据,或者批量上线的 AI 生成图片不附任何来源凭证。文本通道应当优先完善;溯源和像素级能力目前只能带来边际影响。

术语定义及相邻概念见 GEO 术语表。

参考资料

官方与标准:

厂商与技术:

行业:

常见问题

GEO 中的多模态信号是指什么?
多模态信号是 AI 引擎用来理解、采信并在答案中引用图片、视频、音频和图表等非文本内容的信息。到 2026 年,AI 对这类资产的理解主要来自与资产一同出现的 alt 文本、说明文字、文字稿和 schema 标记,并不是直接分析像素。即使底层模型具备原生多模态能力,为答案引擎提供内容的检索流程目前传给模型的仍以文本为主。
GPT-4V 和 Gemini 不是能直接看图吗?文本通道为什么还重要?
模型具备的能力,不等于检索流程实际会调用的能力。用户上传图片后,GPT-4V 确实可以描述图片(见 OpenAI 系统卡片);Gemini 从预训练阶段起也是原生多模态模型(见 Gemini 技术报告)。但 ChatGPT search 或 Perplexity 抓取网页时,通常只把提取出的正文交给模型,不会连同图片一起传入。因此到 2026 年,底层模型即使很擅长识图,答案模型实际接收的通常仍是图片周围的 alt、正文和文字稿。
多模态内容里最值得优先做的一项改动是什么?
对多数站点来说,应当优先为每段视频提供同页文字稿。嵌入 YouTube 的视频可以利用 Google 的自动字幕基础设施;自托管的 <video> 如果没有文字稿,其中的语音就从未转成文本,实时调取型 AI 几乎无法获取视频内容。对于这类视频,答案生成流程只能通过文字稿读取内容。
speakable schema 能让我的内容变成「语音 AI 可读」吗?
不能。这是多模态领域最常见的误解之一。speakable 结构化数据至今仍处于 beta 阶段,只面向美国的英语新闻站点,用于 Google Assistant 的 TTS 朗读(详见 Google 官方文档,最近一次更新为 2025-12-10)。这些限制维持多年,至今没有放宽。speakable 不是通用的 AI 可读性信号;对音频真正有用的是同页文字稿。
AI 搜索引擎真的会因为页面里有图片就把它排得更高吗?
Google 官方表示,网站要出现在 AI Overviews 或 AI Mode 中,并不需要满足常规 SEO 之外的额外要求(见「AI features and your website」官方文档)。不过,Google 在 2025 年 5 月发布的「在 AI 搜索里取得成功的 8 种方式」中,确实建议用高质量图片和视频补充正文。这说明 Google 重视多模态内容的质量,却不能证明「图片能让 AI 引用率提升 N%」这类未经公开测量的具体说法。

延伸阅读

参考来源

一手来源

  1. ImageObject — Schema.org · Schema.org
  2. VideoObject — Schema.org · Schema.org
  3. AudioObject — Schema.org · Schema.org
  4. PodcastEpisode — Schema.org · Schema.org
  5. Dataset — Schema.org · Schema.org
  6. Google Images best practices · Google Search Central · 2026-03-02
  7. Video SEO best practices · Google Search Central · 2025-12-18
  8. Speakable (SpeakableSpecification) structured data · Google Search Central · 2025-12-10
  9. AI features and your website · Google Search Central · 2025-12-10
  10. Top ways to ensure your content performs well in Google's AI experiences on Search · Google Search Central · 2025-05-21
  11. Understanding Success Criterion 1.1.1: Non-text Content · W3C Web Accessibility Initiative
  12. Coalition for Content Provenance and Authenticity (C2PA) · C2PA
  13. C2PA Membership · C2PA
  14. C2PA Specifications · C2PA
  15. SynthID — identifying AI-generated content · Google DeepMind
  16. IPTC Photo Metadata Standard (v2025.1) · International Press Telecommunications Council · 2025-11-27
  17. GPT-4V(ision) system card · OpenAI · 2023-09-25
  18. Gemini: A Family of Highly Capable Multimodal Models · Google DeepMind / arXiv · 2023-12-19
  19. Introducing Gemini: our largest and most capable AI model · Google · 2023-12-06

二手来源

  1. Google shares 8 ways to be successful with AI Search experiences · Search Engine Land (Danny Goodwin)
最近更新: 2026-05-23 作者: Ray Yang 主题: 信号