Claude
速览要点
- 运营方
- Anthropic
- 官方文档
- https://support.claude.com/en/articles/10684626-enable-and-use-web-search
- 引擎类型
- Claude 属于检索增强型对话产品。除非用户明确要求搜索,否则它会自行判断当前提示是否需要实时网页检索。
- 搜索入口
- Claude 聊天、多步骤 Research,以及 Messages API 的网页搜索工具
- 爬虫分工
- ClaudeBot 收集潜在训练数据,Claude-SearchBot 支持搜索索引,Claude-User 按用户请求抓取页面。
- 引用方式
- 网页搜索答案会附上为内容提供依据的来源链接;开发者自行提供的搜索结果块则需主动启用引用。
- 证据边界
- Anthropic 未公布 Claude 用户端的排名算法、索引完整覆盖范围或通用的来源选择权重。
爬虫 User-Agent
- ClaudeBot
- Claude-SearchBot
- Claude-User
1. Claude 是什么
Claude 是 Anthropic 推出的对话式 AI 产品。网页搜索可用时,如果问题需要近期信息或专业资料,Claude 可以实时检索(retrieval)网页来源,综合生成答案,并附上直接引用(citation)。启用搜索后的 Claude 属于检索增强型生成式引擎,并非传统的搜索结果列表,也是生成式引擎优化(GEO)所关注的一类产品。
Claude 这个名称可能指产品、模型家族或 API 集成。这几种含义有交集,但不能混为一谈。Anthropic 运营相关模型与服务;Claude 聊天是面向普通用户的界面;Messages API 则为开发者提供可单独配置的网页搜索工具。
| 使用方式 | 实时检索 | 如何搜索 | 如何显示引用 |
|---|---|---|---|
| 标准 Claude 聊天 | 按需调用 | 启用网页搜索后,Claude 会在提示需要近期信息或专业资料时搜索 | 网页结果为答案提供依据时,会显示直接来源链接 |
| Claude Research | 多步骤检索 | Claude 会连续搜索网页;如果连接了获准访问的工作资料,也会检索其中的内容 | 研究答案附有引用 |
| Messages API 网页搜索 | 由开发者配置,按需调用 | 开发者在请求中配置服务器端工具,Claude 在限制范围内决定何时调用 | 响应中返回结构化搜索结果块和引用块 |
| 未配置检索工具的 Claude 模型 | 不访问实时网页 | 模型根据已有上下文和训练所得知识回答 | 不会生成网页搜索引用 |
Anthropic 当前的用户端文档说明,Claude 会处理多个来源,并在适当情况下提供直接引用、来源链接和相关原文。文档也区分了网页搜索与网页抓取(Web Fetch):前者用于发现来源,后者读取用户通过 URL 指定的页面。Research 可以连续进行多轮检索,无需依赖单次搜索完成任务。
ChatGPT Search 同样属于检索增强型对话,Perplexity AI则更常默认使用检索。产品分类只能作为理解差异的起点;引用密度和搜索调用率仍需用同一组提示、在同一时期内测量。
2. Claude 网页搜索如何运作
Claude 遵循通用的答案循环:理解提示,判断是否需要检索,生成一条或多条查询(query),处理搜索结果,写出答案,再在有来源依据的段落中附上引用。开发者可以为模型配置该工具,普通用户也可以在产品中开启该功能,但这都不意味着 Claude 每个问题都会调用搜索。
整个过程可以概括为:
提示 → 搜索判断 → 生成查询 → 检索并筛选结果 → 综合答案 → 附上引用
工具可用与实际调用之间的区别很重要。Anthropic 的 API 上线说明指出,Claude 可以生成有针对性的查询;如果早期结果显示有必要继续追查,它还会逐步开展后续搜索。面对答案相对稳定的一般性问题,Claude 可能不经搜索直接作答。用户明确要求获取近期信息时,Claude 更可能触发搜索,但 Anthropic 没有公布固定的判断公式。
| 已公开的行为 | 实际影响 |
|---|---|
| 搜索按需调用 | 如果 Claude 在某轮没有调用搜索,页面也就不可能在该轮被检索到 |
| Research 可以在前一次搜索基础上继续查找 | Claude 可能通过范围更窄的后续查询发现来源,而不是直接采用用户原本的表述 |
| Web Fetch 接受指定 URL | 用户直接提供的页面与开放式搜索采用不同的发现方式 |
| API 可以限制搜索次数并筛选域名 | 实验配置会改变哪些来源有机会进入候选范围 |
| 引用附在有来源依据的答案文本上 | 被检索到与最终获得引用是两个相关但不同的事件 |
Anthropic 没有公开 Claude 用户端的完整搜索索引和排名公式,也没有说明选择不同来源时各项因素占多大权重。页面在外部搜索引擎中排名靠前,可以作为诊断线索,却不能证明 Claude 就是通过该引擎找到它。Claude 能够访问页面后,清晰且脱离上下文仍能读懂的段落有助于提高可引用性,但任何页面结构都无法保证被检索或引用。
3. 爬虫与用户代理
Anthropic 公开了三类用途各异的网页爬虫。发布者可以退出潜在训练数据收集,同时保留与搜索有关的访问权限。
| 用户代理 | 官方用途 | 触发方式 | 屏蔽后可能产生的影响 |
|---|---|---|---|
ClaudeBot | 收集可能用于模型训练的公开网页内容 | 后台收集 | 可要求 Anthropic 不再将后续内容纳入训练数据集;它不控制搜索可见度 |
Claude-SearchBot | 浏览网页,以改善搜索结果的相关性和准确性 | 在后台建立索引并改善搜索质量 | 阻止网页被用于建立或改善搜索索引,可能降低内容在 Claude 搜索结果中的可见度或准确性 |
Claude-User | 根据单个用户的请求访问网站 | 用户要求 Claude 抓取相关网页内容 | 阻止该次抓取,也可能降低内容在用户发起的网页搜索中被发现的机会 |
这些定义来自 Anthropic 的站点所有者爬虫指南。Anthropic 表示,这三类爬虫都遵守标准 robots.txt 指令,不会绕过 CAPTCHA 或其他访问控制,并在适当情况下支持非标准的 Crawl-delay 扩展。需要屏蔽哪些子域名,就必须分别在相应子域名上设置规则。
按 IP 屏蔽不能长期替代针对不同爬虫设置的 robots.txt 规则。Anthropic 提醒,IP 屏蔽可能使爬虫无法读取这些规则,也未必能准确表达站点的访问策略。其动态更新的爬虫 IP 前缀列表汇总了 Anthropic 各类爬虫使用的网段,并未为每类爬虫提供固定不变的专用范围。因此,核对日志时应读取最新列表,不宜把其中的地址复制到静态白名单后长期沿用。
ClaudeBot条目说明 Anthropic 的具体控制方式,AI 爬虫则介绍如何核验用户代理、IP 范围、页面渲染和服务器日志。发布者应分别设置三类访问权限:训练数据收集、搜索索引和按用户请求抓取,不宜直接使用 User-agent: * 一并屏蔽。
4. 引用偏好
Claude 的文档说明了引用如何显示,却没有说明来源如何排名。Anthropic 确认,使用网页来源的答案会带引用,API 也会返回引用对应的来源位置;但它没有公布权威度、时效性、页面格式或域名类型的通用权重。
| 证据层级 | 能支持的结论 | 不能支持的结论 |
|---|---|---|
| 官方文档 | 搜索可以返回直接来源链接;API 搜索可以按域名和位置加以限制;引用会标明答案文本所依据的来源 | 公开的排名公式,或保证有效的内容形式 |
| 当前观察性研究 | 在特定日期和提示样本中,来源构成、搜索调用率及其与外部结果集的重合情况 | 具有因果作用的排名因素,或适用于所有 Claude 用户的固定比率 |
| 旧模型受控实验 | 在候选文档已经给定的情况下,指定模型版本如何从中选择来源 | 当前 claude.ai 的检索、索引方式或用户端引用占比 |
虽然 Anthropic 没有把它们列为排名权重,仍有两个内容属性值得关注。E-E-A-T考察来源能否提供可信的作者信息、出处和证据;可引用性考察 Claude 能否完整提取一项主张,并正确标明来源。页面可能在其中一方面表现突出,另一方面却较弱。
受控实验的结论也应严格限定范围。Wan、Wallace 与 Klein 预先向 Claude Instant 和另外四个较早模型提供候选网页。他们发现,当页面内容相互冲突时,主题相关性会显著影响模型的选择。GEO Wiki 的论文解读说明了研究限制,ACL 2024 原论文则给出完整方法。该研究没有测试 2026 年的 Claude 网页搜索,也不能证明采用贴近查询措辞的标题就会触发检索。
来源被引用和品牌被提及,代表两种不同结果。引用与提及区分了明确标出来源的证据与未附来源的品牌提及。两者都应跟踪:页面内容可能影响答案,却没有显示来源链接;即使品牌自己的页面未被检索,品牌仍可能出现在答案中。
5. API 与集成
Messages API 把 Anthropic 网页搜索作为服务器端工具提供。以下精简请求采用截至 2026 年 8 月 28 日最新的文档版本,限制搜索次数和可用域名,并提供大致位置:
{
"model": "YOUR_CURRENT_SUPPORTED_MODEL",
"max_tokens": 1200,
"messages": [
{
"role": "user",
"content": "Compare the current evidence for this question."
}
],
"tools": [
{
"type": "web_search_20260318",
"name": "web_search",
"max_uses": 4,
"allowed_domains": ["example.org", "docs.example.com/research"],
"user_location": {
"type": "approximate",
"country": "US",
"timezone": "America/New_York"
}
}
]
}
allowed_domains 与 blocked_domains 只能二选一。Anthropic 的网页搜索工具文档列出三个仍在使用的版本:web_search_20250305 提供基础搜索,web_search_20260209 增加动态筛选,web_search_20260318 增加控制已完成搜索块是否保留在响应中的功能。每个版本提供不同能力;新版本出现后,旧版本仍可继续使用。
| 响应元素 | 可以观察到什么 |
|---|---|
server_tool_use | Claude 发出的查询,可据此确认搜索已被调用 |
web_search_tool_result | 返回的搜索结果块,包括标题、URL、页面时间信息和加密内容 |
web_search_result_location | 与答案片段对应的 URL、标题、加密索引和被引文本 |
cited_text | 相应答案片段所依据的来源文本,最多 150 个字符 |
response_inclusion | 使用最新版本时,已完成的嵌套搜索块是否保留在响应中 |
网页搜索始终启用引用。开发者自行提供的 search_result 块则不同:引用默认不启用,开发者必须为整个请求主动开启。更广泛的引用文档还介绍了如何用上传文档为答案提供依据,这是另一种提供来源的方式。
截至本文复核日期,Anthropic 的收费为每 1,000 次网页搜索 10 美元,另计 token 费用;搜索失败不收费。较新版本默认使用代码执行来完成动态筛选,这会改变零数据保留(Zero Data Retention,ZDR)的适用条件。Anthropic 的服务器端工具文档指出,只要把 allowed_callers 设为 ["direct"],新版搜索也可以采用符合 ZDR 条件的直接调用配置。模型兼容性、托管平台支持、组织设置和数据保留条件都可能变化,因此每次实验都应记录适用的模型、托管平台、组织设置和数据保留状态。
API 输出会给出查询和引用对象,因此适合用于AI 引用追踪。但它仍只能作为判断 Claude 用户端行为的间接参考。模型、位置、域名规则、工具版本或账户设置不同,都可能改变候选来源和最终答案。
6. 历史与时间线
Claude 的搜索和引用能力分阶段上线。下表日期对应功能发布或文档变更,不表示相关功能此后不会再变化。
| 日期 | 变化 | 对 GEO 的实际影响 |
|---|---|---|
| 2025 年 1 月 23 日 | Anthropic 的发布说明记载,API Citations 功能上线,可依据开发者提供的文档生成引用 | 开发者先获得了段落级来源标注,实时 API 网页搜索随后才上线 |
| 2025 年 3 月 20 日 | 网页搜索上线,最初面向美国付费用户预览;5 月 27 日的更新宣布向全球所有 Claude 套餐开放 | Claude 用户端开始支持实时公开网页检索 |
| 2025 年 4 月 15 日 | Research 上线,可在网页和连接的工作资料中迭代搜索 | 引用监测从单次回答扩展到多步骤研究任务 |
| 2025 年 5 月 1 日 | Integrations 与高级 Research扩大了可连接的内部和外部来源范围 | 公开网页引用可以和经过授权的私有来源证据一同出现 |
| 2025 年 5 月 7 日 | API 网页搜索上线,提供渐进式搜索、域名控制、max_uses 和来源引用 | 开发者获得了可配置、可重复测试的使用方式 |
| 2026 年 2 月和 3 月 | Anthropic 先后记录了两个新版网页搜索工具,一个支持动态筛选,另一个可控制已完成的搜索块是否保留在响应中 | 实验从此需要记录工具版本 |
| 2026 年 4 月 7 日 | Anthropic 记录了当前三类爬虫 | 发布者可以分别控制训练数据收集、搜索索引和用户请求触发的抓取 |
2025 年公告中的模型名称、套餐限制和地域限制只代表当时的情况。Anthropic 更新受支持模型和部署环境的速度快于静态文章,因此当前兼容性应以实时文档为准。
7. 实测引用行为
没有哪一项研究足以确定 Claude 的排名逻辑。较有参考价值的结果应明确说明模型或产品使用方式、提示集合、搜索设置、采集日期和数据开放限制。
| 证据 | 实验设置 | 结果 | 适用边界 |
|---|---|---|---|
| Blyskal 与 Singh(Profound),2026 年 7 月 | 已启用网页搜索;提示涵盖当前的产品推荐问题和基础解释问题 | Claude 在 36.6% 的受测提示上调用搜索;研究覆盖的约 400 条查询共关联约 35,000 个 URL,其中 79.2% 的被引 URL 同时出现在 Brave 前十名 | 商业机构的观察性研究;用于计算搜索调用率的确切分母、采集日期、完整抽样方法和原始数据未公开 |
| C-SEO Bench,2025 年 | Claude 3.5 Haiku 对已经放入上下文的文档进行引用排序 | 在论文所述实验条件下,受测白帽改写方法均未显著改善该模型的引用排序表现 | 没有测试实时检索、当前 Claude 用户端,也没有测试搜索候选来源的生成过程 |
| Wan 等,ACL 2024 | 预先向 Claude Instant v1 提供内容相互冲突的候选页面,再让模型作出选择 | 主题相关性的影响强于若干文体层面的可信度线索 | 该模型版本早于当前 Claude,且检索已经完成 |
2026 年 Claude 分析同时报告了搜索调用和结果重合情况,因此具有参考价值。36.6% 的搜索调用率只描述该研究中由多类提示组成的样本,不能代表 Claude 的普遍情况。Brave 结果重合率达到 79.2%,说明在这组样本中可以把 Brave 用作诊断参照;但作者明确指出,这不能证明两者之间存在直接因果依赖。
C-SEO Bench的结果也需要谨慎解读。其 NeurIPS 2025 实验发现,对 Claude 3.5 Haiku 而言,受测改写方法均未带来统计上显著的改善;在整个基准中,上下文位置的影响则更稳定。由于文档在实验开始前已经被检索到,这一结果只能说明受测改写并非在所有情况下都有效,不能据此否定检索优化本身。
这些研究表明,测量必须谨慎,但它们并未揭示排名公式。测试时应记录 Claude 是否搜索、生成了哪些查询、结果中出现了哪些页面、最终引用了哪些段落,以及品牌是否获得提及。同一提示也要重复运行,因为 Claude 是否搜索、生成多少条查询都可能变化。还应保留完整配置,避免把模型或工具版本变化误判为内容调整带来的效果。
8. 如何针对 Claude 优化
针对 Claude 的优化既要确保页面能被稳定访问,也要反复观察实际表现。下列做法的证据基础并不相同。
| 做法 | 为什么对 Claude 有影响 | 证据层级 | 相关参考 |
|---|---|---|---|
分别配置 ClaudeBot、Claude-SearchBot 和 Claude-User | 发布者可以分别设置训练数据收集、搜索索引和按用户请求抓取的访问权限 | 官方文档 | ClaudeBot |
| 确保公开答案以渲染后的 HTML 提供 | 搜索工具和按用户请求运行的抓取工具必须能够读取相关正文 | 官方文档说明了这种访问机制,但具体实现效果仍需测试 | AI 爬虫 |
| 在相关标题附近给出直接且可独立理解的答案 | 内容被检索后,完整段落更容易被引述并标明来源 | 通用引用原则,并非 Claude 已公开的排名权重 | 可引用性 |
| 标明作者、来源、日期和原始证据 | 读者可以核验出处,Claude 也可以保留具体的来源信息 | 这是提高内容可信度的编辑做法,并非 Claude 已公开的排名权重 | E-E-A-T |
| 覆盖受众实际提出的近期、比较型和专业问题 | 与稳定的基础解释相比,这类问题更可能需要实时检索 | 官方公布的按需搜索行为,加上特定样本中的观察结果 | 生成式引擎优化 |
| 保持主张和日期为最新状态 | Claude 的搜索查询经常寻找近期证据,陈旧主张会削弱答案质量 | 观察性结论,效果取决于提示 | 生成式引擎优化 |
| 分别衡量搜索、检索、引用和提及 | 任何一个环节都可能造成可见度损失,必须采用不同方法分别诊断 | 方法论 | AI 引用追踪 |
没有官方来源表示,llms.txt、Schema.org 标记、固定字数或某一种改写可以保证获得 Claude 引用。结构化元数据有助于搜索系统发现并理解内容,但应作为一个变量单独测试,不能视为能够直接控制排名的因素。早期受控研究也显示,一项看似合理的内容做法,在特定模型和上下文中可能没有可靠效果。
测试时应使用稳定的提示集合,并记录日期、位置、产品使用方式、模型、搜索设置和工具版本。测试 Claude 用户端时,要记录是否真的发生搜索;测试 API 时,应保留工具调用和引用对象,但不能把 API 与用户端结果合并计算同一个声量份额。
9. Claude 为什么对 GEO 重要
Claude 的三个特点会直接影响衡量方法:搜索按需发生;检索到的来源为答案提供依据时才显示引用;Anthropic 分别控制训练数据收集、搜索索引和按用户请求进行的抓取。因此,发布者可以分阶段管理访问权限并测量结果。
| Claude 特点 | 可观察指标 | 常见误读 |
|---|---|---|
| 网页搜索已经启用,但只按需调用 | 触发搜索调用的提示占比 | 认为每条可以使用搜索的提示都会访问网页 |
| 搜索可以生成多条查询 | 生成的查询数量,以及重复提示之间的一致性 | 只针对用户原本的措辞优化 |
| 检索发生在引用选择之前 | 对比被检索 URL 与最终被引 URL | 把每个被检索页面都算作一次引用 |
| 三类爬虫各有分工 | 分别核验各类用户代理的访问记录 | 认为当前获得引用必须开放 ClaudeBot |
| API 控制项明确 | 按工具版本、模型、域名规则和位置分别统计结果 | 把单次 API 运行结果视为用户端排名结果 |
面对同一个问题,Claude 可能采用不同于 ChatGPT Search 的检索方式和来源集合。与 Perplexity 相比,普通 Claude 聊天可以不经检索直接回答,因此搜索调用可能更少。如果没有统一提示、测试时的模型版本、位置和搜索配置,就无法稳妥比较哪个平台引用更多。
与其猜测没有公开的排名公式,不如保留 Claude 访问页面所需的权限,发布能直接回答真实问题、所依据证据也可核验的段落,再依次测量 Claude 是否调用搜索、页面是否被检索、引用是否显示。即使 Claude 的模型、工具版本和来源构成继续变化,这种方法仍然适用。
常见问题
Claude 会自动搜索网页吗?
ClaudeBot、Claude-SearchBot 和 Claude-User 有什么区别?
屏蔽 ClaudeBot 会让网站失去 Claude 引用吗?
怎样才能让页面获得 Claude 引用?
Claude API 能复现 claude.ai 的排名行为吗?
相关
参考来源
一手来源
- Enable and use web search · Anthropic Help Center
- Claude can now search the web · Anthropic · 2025-03-20
- Claude takes research to new places · Anthropic · 2025-04-15
- Claude can now connect to your world · Anthropic · 2025-05-01
- Introducing web search on the Anthropic API · Anthropic · 2025-05-07
- Web search tool · Anthropic
- Server tools · Anthropic
- Search results · Anthropic
- Citations · Anthropic
- Claude Platform release notes · Anthropic
- Does Anthropic crawl data from the web, and how can site owners block the crawler? · Anthropic Help Center · 2026-04-07
- Anthropic bots IP prefixes · Anthropic
- C-SEO Bench: Does Conversational SEO Work? · arXiv / NeurIPS 2025 Datasets and Benchmarks Track · 2025-06-06
- What Evidence Do Language Models Find Convincing? · Association for Computational Linguistics · 2024-08-11
二手来源
- The state of AEO in 2026: Claude is not ChatGPT · Josh Blyskal / Profound