跳到正文

内容新鲜度

速览要点

这个词混淆了什么
新近度是页面有多新,日期由发布方自行标注;现时有效性是页面说的还成不成立,发布方无从声明。所有新鲜度上的取巧做法,都是想拿到前者,却不愿付出后者的代价
它在哪里起作用
共两处。检索环节,看你改过的版本有没有进入索引;采信与重排环节,看几段候选内容里最终选中哪一段
最该记住的一个数字
被 AI 引用的网址平均年龄约 1,064 天(约 2.9 年),自然搜索前十名约 1,432 天。被到处转引的「新 25.7%」说的就是这个差距:那只是比另一组新一些,并不等于内容本身新
新近度真正的作用
在相关性本就相当的两段内容之间起决定作用。它救不了一个在相关性、可信度或可提取性上落后的页面
为什么单改日期不管用
Google 明确表示,只有当 lastmod「稳定且可核实地准确」时才会采用。声明的日期会与实际改动比对:内容没改而日期往前挪,损失的是可信度,得不到任何提升

1. 什么是内容新鲜度

内容新鲜度决定的是:当引擎检索到一份文档、并据此生成答案时,这个页面的年龄和更新历史是在为它加分还是减分。

但「新鲜度」这个词其实包含两件性质完全不同的事:

  • 新近度(recency):时间戳。距离上次发布或修改过去了多久。这是一个机器可读的事实。
  • 现时有效性(currency):内容本身。页面所主张的东西是不是还成立。这是一个语义层面的事实,任何时间戳都无法代为声明。

这个区分是后面所有讨论的基础。§7 里的每一种取巧做法,本质上都是想拿到新近度,却不愿付出现时有效性的代价;§6 里每一种正当做法则恰好相反:把内容改对,新近度自然会跟上。

新鲜度也不只在一个环节起作用,它在答案循环里出现两次。第一次在检索:你改过的版本究竟有没有进到索引里,这是一个重新抓取的问题。第二次在采信与重排:几段候选内容摆在一起,最终选中的是哪一段。只把新鲜度当成发布节奏问题,会漏掉前一半;有些页面明明做了实质更新、表现却像没更新过,根源常常就在这里。新鲜度是 GEO 里的一个信号,本身并不构成一套策略。

2. 新近度与现时有效性:各自能证明什么

属性是什么机器怎么读它它证明不了什么
新近度距离发布或上次修改的时长dateModified、页面上可见的署名日期、站点地图的 lastmod、重新抓取时比对出的内容差异证明不了页面上任何一条主张现在仍然准确
现时有效性页面当前的主张是否仍然成立没有直接信号,只能从其他来源的旁证和改动幅度去推断发布方无法直接声明它

这里的不对称决定了后面的一切:新近度可以由发布方自行声明,现时有效性无法这样声明。 发布方想把 dateModified 写成什么都可以,但没有谁能把「这话现在仍然成立」写进标记里。

因此引擎把页面声明的日期当作有待印证的说法,而不是既成事实。§7 那几种失误之所以会伤到可信度,而不只是单纯无效,根源正在于此。现时有效性说的正是 E-E-A-T §4.4 可信度那一项里的「准确、透明、时效」;它和页面在结构上能不能被整段引述是两件独立的事,后者见可引用性。内容是对的,也还得能被提取出来;能被提取出来,也还得是对的。

3. 实测证据说了什么,又没说什么

「AI 系统偏好较新的内容」这个说法背后有两组彼此独立的证据。一组是观察性的,一组是反事实的,二者支撑的结论并不相同。

3.1 观察性证据:AI 确实更常引用较新的内容,但「较新」比想象中老得多

目前公开规模最大的数据来自 Ahrefs,覆盖 ChatGPT、Perplexity、Gemini、Copilot、AI Overviews 以及 Google 自然搜索结果中的 1,697.5 万条被引用网址Law 与 Guan,2025 年 7 月)。结论一句话:被 AI 引用的网址比自然搜索结果「新 25.7%」。

真正值得记住的,是这个百分比背后的那组绝对数字。25.7% 是这样算出来的:被引用网址的平均年龄约 1,064 天,自然搜索结果约 1,432 天。也就是说,被 AI 引用的页面平均已有 2.9 年

所以这里所谓的「较新」,比的是一个本身就相当老的基准,并不等于「新」。「每周不发新内容就会失去引用」这类说法,从这组数据里推不出来;就总体而言,这组数据恰恰否定了它。不过这项研究里各家引擎的高低次序是稳定的:主流助手里 ChatGPT 最偏新,而 Google AI Overviews 的表现更接近自然搜索,不像其他几种 AI 答案那样偏向新内容。

有一点必须讲清楚:这是观察性数据。较新的页面被引用得更多,可能是因为它们新,也可能是因为新页面往往结构更好、外链更多、写的正好是当下有人在问的话题。这几种解释,观察性数据本身分不开,这正是 §3.2 要解决的问题。

3.2 因果证据:新近偏好出自模型本身,不只是语料分布的结果

Fang、Tao、Chen、Chang 与 Sakai(2025)补上了反事实的另一半,也是这两组证据里分量最重的一份。

关键在方法:作者在 TREC Deep Learning 数据集(DL21 与 DL22)的段落前注入人造的发布日期,再让大模型重新排序。段落正文一个字都没改,变的只有那个标注上去的日期。因此排序上的任何变化,都只能归因于日期。

测量项结果为什么重要
注入日期后前十名的平均发表年份最多变新 4.78 年仅凭一个日期信号,重排器给出的结果就换了一批
单条内容的位次变动最多移动 95 位效应量很大,不是可以忽略的小幅波动
相关性完全相同的两段内容,二选一时偏好哪一段平均最多反转 25%相关性持平时,新近度起的是决定作用
覆盖的模型7 个:GPT-3.5-turbo、GPT-4、GPT-4o、LLaMA-3 8B 与 70B、Qwen-2.5 7B 与 72B不是小模型才有的问题
模型规模的影响更大的模型会减弱但无法消除这一偏好不要指望前沿模型已经解决了它

由此还引出一个不便回避、也不该含糊带过的推论:这种偏好认的是标注上去的日期,而不是内容是否真的改过。从机制上讲,这就是一个可利用的漏洞。至于为什么这么做仍然不划算,见 §7。

3.3 这些结论的边界

成立的部分审慎的读法
引擎确实偏好较新的内容,而且这是因果关系,不只是统计上的相关被测出来的效应发生在重排环节。实验用的是跑在 TREC 数据集上的重排器,不是线上的检索系统,后者本身就带有新鲜度处理逻辑
新近度最强的作用是在相关性持平时做决定它救不了一个在相关性、可信度或可提取性上已经落后的页面
被引用页面的整体平均年龄约 2.9 年厂商内容里流传的绝对门槛(「30 天以内」「13 周以内」)是查询构成不同造成的,不是普遍规律,见 §4

这个话题在选材上还有一处需要特别当心:二手资料里充斥着厂商的营销内容,彼此转引对方的数字。真正有分量的只有三类来源:拥有原始数据的研究、经过同行评议或以预印本发表的论文、引擎方的一手文档。其余的至多用来判断方向。

另有一项研究划出了新近度所能带来的上限:当模型要在互相冲突的来源之间做选择时,主导因素是主题相关性,而人类看重的那些体现可信度的文风特征几乎不起作用(Wan 等,ACL 2024)。新鲜度是这套偏好里的一个特征,不是主题契合度的替代品。

4. 新鲜度的权重取决于查询类型

§3.1 说被引用页面平均已有约 2.9 年,厂商研究却说有一半的 AI 引用来自 13 周以内的内容。两组数字可以同时成立,因为新鲜度的权重由查询类型决定,而这两份样本问的根本不是同一类问题。

这套机制沿用自传统搜索,在生成式检索里同样成立:新近度的权重,取决于一个答案自写下之后预计会有多大变化。Google 的排名系统指南对此有明文表述,把新鲜度系统单列为一类:「多套『query deserves freshness』系统,用于在预期需要较新内容的查询上呈现较新的结果」(Google 搜索排名系统指南)。值得留意的是「预期需要」这个限定:这种加权本就是有条件的,并不是笼统地偏爱新页面。

查询类型例子新鲜度权重实用的检查节奏
突发、易变「X 今天出了什么事」、实时价格、服务状态起决定作用。过时的内容不是被降权,而是直接就错了持续更新或按事件更新
变动快的技术类「做 X 用哪个模型最好」、API 与版本问题、工具对比至少每季度一次
周期性、季节性「2026 年最好的 X」、年度榜单临近时间节点时高,其余时间低每年一次,赶在时间节点前
变动慢的实操类操作指南、方法论中等每半年一次
定义性、概念性「什么是 X」、术语解释低。正确的定义不会过期仅在事实发生变化时

这条规律在两个方向上都容易被违背。一个定义性页面每月重写一遍,几乎得不到什么回报,却容易犯下 §7 那几种失误;而一个价格页面一年没动过,无论结构做得多好,都已经在现时有效性上输了。

不同引擎对新鲜度的敏感程度也不一样:

引擎观察到的新鲜度倾向意味着什么
ChatGPT search主流助手里最偏新新近度在这里的作用最强
Perplexity实时检索,对新近度敏感重新抓取快,真实更新能较快得到回报
Google Gemini偏好较新的内容,介于两端之间中等水平
Google AI Overviews倾向最弱,表现接近自然搜索新鲜度在这里最难拉开差距

上表只给方向。各平台具体的天数只来自一份厂商研究,查询构成也未公开,因此不该当作稳定的系数来用。可引用性 §5 在处理 GEO 基准数字时用的也是同样的尺度。

5. 引擎究竟从哪里读到新鲜度

既然新鲜度有用,引擎读的到底是什么?一共五条通道,其中发布方能控制的只有三条。

通道是什么发布方的控制力
结构化日期JSON-LD 里的 datePublisheddateModified,标记写法见 JSON-LD面向 AI 的 Schema.org完全自行声明
页面上可见的日期给人看的署名日期,Google 建议标注成「发布」或「最后更新」完全自行声明
站点地图的 lastmod用来宣告改动的协议,见站点地图与 IndexNow先声明,再被核实
重新抓取时比对出的改动引擎自己在两次抓取之间做的差异比对,取决于爬虫什么时候回来
旁证其他来源有没有反映同样的更新,也就是 E-E-A-T 所说的周边可信来源

要点是:发布方控制不了的那两条通道,恰恰决定了它能控制的那三条会不会被采信。

这一点有明文依据,不是推断。Google 表示,只有当站点地图的 lastmod「稳定且可核实地准确,例如通过与页面上一次实际修改做比对」时才会采用;并且所谓实质更新指的是正文、结构化数据或页面链接发生变化,明确不包括把版权年份往前挪一年(站点地图的构建与提交)。在署名日期上,Google 的建议是:在页面显著位置标注可见日期,用 datePublisheddateModified 标记出来,让可见值与结构化值保持一致,同时避免写未来的日期,也避免写页面所描述事件本身的日期(为搜索结果添加署名日期)。

有一点值得直说,因为大量新鲜度建议给人的印象恰恰相反:Google 自己关于 AI 功能的文档并没有把新鲜度列为一项要求,而且明确写着「要出现在 AI Overviews 或 AI Mode 中,没有额外要求,也不需要其他特别的优化」,也不需要专门的 schema.org 标记(AI 功能与你的网站面向生成式 AI 功能的优化指南)。日期标记的作用是消除歧义:当一个页面上有好几个日期时,它帮引擎挑对那一个。它本身并不能提升新鲜度。

6. 内容失效的触发条件与更新节奏

6.1 五种失效触发条件

页面该改的时机,是下面某一条被触发的时候,而不是日历上又过去了一个周期。

触发条件怎么发现该改什么
事实变化定期把页面上可查证的内容核一遍那条主张,以及标注的日期
呈现方式变化可见度监测发现引擎回答这类查询的方式变了那段直接作答的内容,做法见为 AI 引用而写
被竞争对手挤掉针对目标查询做引用追踪在对方胜出的地方补上深度和具体细节
依赖项变动盯住页面点名的那些依赖项有没有发新版本只改受影响的那一节
数据过期检查页面上每一处带年份的数据及其来源年份那个统计数字及其出处

第二条和第三条光看自己的页面发现不了,需要借助 GEO 指标里的监测手段。

6.2 什么才算一次更新

层级例子它能支撑什么
表面改动错别字、排版、只改日期什么都支撑不了,不要动 dateModified
实质改动某条主张变了、某一节重写、补充了新数据更新 dateModifiedlastmod,并重新向引擎宣告一次
结构性改动页面的论点或范围发生了实质变化更新 dateModified,并重新考虑它是否还算同一个页面

6.3 把节奏拼起来

按 §4 的表格,依查询类型定一个检查间隔;按 §6.1 的表格,依触发条件决定改不改。

间隔的作用是逼你去看一眼,不是逼你去改一笔。大多数关于更新节奏的建议恰恰把这两件事混为一谈,而这种混淆直接催生了改日期的习惯:如果把「每季度检查」执行成「每季度更新」,那么在一个什么都没过时的页面上,为了让这次检查有个结果,就只剩下改日期这一条路。一次检查下来结论是「没有任何东西过时」,这就是一次成功的检查,它应该以不做任何改动收尾。

本站每个条目的 frontmatter 里都有一个 nextReviewDue 字段,作用正是安排这一次查看;多数检查结束时,lastUpdated 并不会跟着改。

7. 反模式:改日期的陷阱

§3.2 已经表明,注入的日期确实能撼动重排器。漏洞是真实存在的,因此更要把不去用它的理由讲清楚,而不是当成不言自明的事。

反模式它为什么看起来像新鲜度它实际上为什么会失败
只改日期dateModified 往前挪,内容一字未动声明的日期会与实际改动交叉比对。内容没变、日期却在往前挪,这是可信度上的失分,而不是一次无害的空动作
年份滚动式改标题「2026 年最好的 X」每年换个年份,正文照旧标题声称的现时有效性,被正文当场否定;而现时有效性正是 §2 所说的、发布方无法自行声明的那一项
换个网址重新发布老内容换个新页面,时间从头开始算丢掉已经积累的链接与引用资产,还会造出一个与自己竞争的近似重复页面
用 AI 重写来「翻新」把页面改写一遍,重新抓取时确实能比对出改动有改动却没有现时有效性,而且这种做法本身就能被识别出来,见 AI 内容识别
给定义性页面强行加节奏每月更新,让常青内容看起来一直在动这类查询上新鲜度的权重接近于零,成本真实存在,收益却几乎为零

表格第一行不是 GEO Wiki 自己的推断。Google 把它列为「以搜索引擎为先的内容」的示例之一,并写成一道供发布方自查的问题:「你是否在内容并无实质改动的情况下,改动页面日期让它显得较新?」(创作有帮助、可信、以人为本的内容)。

归结成一句话:新鲜度是靠现时有效性挣来的,新近度只是它的收据,顺序反过来不成立。

还有一点必须说明白,否则很容易被人反驳,进而连累前面所有结论。不去改日期的理由,并不是「这么做没用」,它确实能撼动实验室里的重排器;理由是收益小、持续时间短,而可信度上的代价既不小,也不会很快过去。Fang 等人的结果更应该读作对一种偏好的描述,而引擎有充分动机削弱这种偏好,长期依靠它并不可行。刻意操纵日期信号本身就是一类公认的作弊手法,见 GEO 作弊与操纵。此外,一旦竞争对手也开始做同样的优化,单方的收益就会明显衰减(C-SEO Bench,Puerto 等,NeurIPS ‘25 D&B)。

8. 这件事对 GEO 为什么重要,以及该怎么做

在所有采信信号里,新鲜度最容易伪造,真要守住却相当昂贵,而它的价值恰恰来自这一点。它还是唯一一个会被动衰减的主要信号:可引用性E-E-A-T 就算衰减也很慢,而一个页面的现时有效性,是按别人设定的时钟在走。

你的目的先看哪里
排查我的哪些页面已经失效GEO 审计
重写一个已经过时的页面为 AI 引用而写
确认我的来源本身是否可信E-E-A-T
确保更新后的页面能被整段引述可引用性
把改动宣告给引擎站点地图与 IndexNow
看清新鲜度在整套方法里的位置生成式引擎优化

参考文献

学术论文:

  • Fang, H., Tao, S., Chen, N., Chang, K.-X. & Sakai, T. (2025). Do Large Language Models Favor Recent Content? A Study on Recency Bias in LLM-Based Reranking. SIGIR-AP ‘25. arXiv:2509.11353 · ACM DL · 本站论文条目
  • Wan, A., Wallace, E. & Klein, D. (2024). What Evidence Do Language Models Find Convincing? ACL 2024 Main. arXiv:2402.11782 · 论文解读
  • Puerto, H., Gubri, M., Green, C., Oh, S. J. & Yun, S. (2025). C-SEO Bench: Does Conversational SEO Work? NeurIPS ‘25 Datasets & Benchmarks. arXiv:2506.11097

原始数据研究:

  • Law, R. & Guan, X. (2025). New Study: AI Assistants Prefer to Cite ‘Fresher’ Content (17 Million Citations Analyzed). Ahrefs

引擎方一手文档(截至 2026 年 7 月):

常见问题

为了 AI 搜索,内容该多久更新一次?
没有一个通用的间隔,因为新鲜度的权重取决于页面回答的是哪一类查询。价格、服务状态、任何带实时数字的页面需要随时改或按事件改;技术类、变动快的页面至少每季度看一遍;定义性和概念性的页面,只在事实发生变化时才需要改。真正管用的做法是:按查询类型定一个检查间隔,但改不改要看触发条件,而不是看间隔到没到。一次检查下来发现没有任何东西过时,这本身就是一次成功的检查,不应该以改日期收尾。
把页面上的日期改一下,算不算更新?
不算,而且有风险。Google 的站点地图文档写得很清楚,只有当 lastmod「稳定且可核实地准确,例如通过与页面上一次实际修改做比对」时才会采用这个值,也就是说声明的日期要拿实际改动来印证,并不会被照单全收。dateModified 往前挪,渲染出来的内容却一字未变;这样一条声明,引擎有能力核查,也确实会查出它不实。收益小而短暂,可信度上的代价却既不小也不短暂。
常青内容需要定期翻新吗?
只有当页面上某处已经不成立时才需要。正确的定义不会过期,而定义性查询上新鲜度的权重接近于零,所以把一个概念页每月重写一遍几乎没有收益,反而容易犯下 §7 那几种失误。常青页面真正需要的是定期核一遍可查证的内容:引用的统计数字、版本号、价格,以及任何涉及第三方目前做法的说法。
我明明更新了页面,为什么还是没被引用?
新近度是相关性相当时的决定因素,不是相关性的替代品。在日期影响最大的那些重排实验里,最强的新近效应出现在相关性本就持平的两段内容之间,所以把日期改得再新,也救不了一个在主题匹配、来源可信度或可提取性上落后的页面。如果页面确实做了实质更新却仍未被引用,瓶颈多半就在这三者之一:先看这段内容能不能被整段引述(可引用性),再看来源有没有旁证支撑(E-E-A-T),最后看爬虫到底有没有重新抓过新版本。
为了 AI 搜索,需要加 datePublished 和 dateModified 结构化标记吗?
作为入选门槛来说,不需要。Google 说得很直接:「要出现在 AI Overviews 或 AI Mode 中,没有额外要求,也不需要其他特别的优化」,并且不需要任何专门的 schema.org 标记。结构化日期仍然值得加,但它的作用是消除歧义,而不是拿来提升新鲜度:当一个页面上同时存在好几个日期时,它帮引擎挑对那一个。Google 自己的建议是让页面上可见的日期与结构化标记里的日期保持一致,并且不要写未来的日期,也不要写页面所描述事件本身的日期。

延伸阅读

参考来源

一手来源

  1. New Study: AI Assistants Prefer to Cite 'Fresher' Content (17 Million Citations Analyzed) · Ahrefs · 2025-07-28
  2. Do Large Language Models Favor Recent Content? A Study on Recency Bias in LLM-Based Reranking (Fang et al., SIGIR-AP '25) · arXiv / SIGIR-AP 2025 · 2025-09-14
  3. Do Large Language Models Favor Recent Content? (SIGIR-AP '25 Proceedings) · ACM SIGIR-AP · 2025-12-07
  4. Add a Byline Date to Google Search Results · Google Search Central · 2025-03-12
  5. Build and Submit a Sitemap · Google Search Central · 2025-11-04
  6. AI features and your website · Google Search Central · 2025-12-10
  7. Optimizing your website for generative AI features on Google Search · Google Search Central · 2026-07-10
  8. A Guide to Google Search Ranking Systems · Google Search Central · 2025-12-10
  9. Creating Helpful, Reliable, People-First Content · Google Search Central · 2025-12-10
  10. Help Google Search know the best date for your web page · Google Search Central Blog · 2019-03-01

二手来源

  1. What Evidence Do Language Models Find Convincing? (Wan et al., ACL '24) · arXiv / ACL 2024 Main
  2. C-SEO Bench: Does Conversational SEO Work? (Puerto et al., NeurIPS '25 D&B) · arXiv / NeurIPS '25 D&B
最近更新: 2026-07-25 作者: Ray Yang 主题: 信号