DeepSeek
速览要点
- 运营方
- DeepSeek
- 官方文档
- https://api-docs.deepseek.com/
- 引擎类型
- 采用检索(retrieval)增强方式的对话产品;DeepSeek 官方用户端提供由用户选择是否开启的联网搜索模式
- 当前用户端模型
- 截至 2026 年 8 月,官方 App 和网页端提供 DeepSeek V4 Pro 与 V4 Flash
- 爬虫披露
- 截至 2026 年 8 月 29 日,DeepSeek 尚未公开爬虫或用户代理名称
- 程序化搜索
- Responses API 支持服务端 web_search 工具,并返回 web_search_call 动作
- 证据边界
- DeepSeek 未公开用户端搜索索引、来源排序公式,也未说明 API 与用户端结果是否等同;现有测量均为特定时点的观察
1. DeepSeek 是什么
DeepSeek 是一款提供可选联网搜索模式的对话式 AI 产品。启用搜索后,官方托管产品可以检索当前网页内容,将这些内容用于生成回答,并显示来源信息。因此,在生成式引擎优化中,它属于检索增强型生成引擎,而不是按排名展示链接的传统搜索结果页。
DeepSeek 这一名称还用于一系列模型、一套 API 和开放权重版本。这些产品形态共享技术与品牌,但没有证据表明它们共用同一套来源索引或排序系统。DeepSeek 的 V4 公告显示,V4 Pro 和 V4 Flash 同时面向官方网页端、App、API 和开放权重发行渠道提供,但没有说明自部署或第三方部署会沿用官方产品的搜索系统。
| 产品形态 | 谁控制检索 | 引用测试观察什么 |
|---|---|---|
| DeepSeek 官方网页端和 App | DeepSeek 负责托管搜索并生成回答 | 在指定日期、模式、语言和地区下,来源在用户端产品中的可见度 |
| DeepSeek 官方 API | 调用方选择可用工具和模型,DeepSeek 执行文档列明的服务端工具 | 该 API 配置下的行为,不能据此推定用户端排序相同 |
| 开放权重或自部署模型 | 部署方提供索引、搜索服务、抓取器、提示词和界面 | 部署方自己的检索系统 |
| 使用 DeepSeek 的第三方产品 | 第三方将 DeepSeek 模型与自有数据和工具结合 | 第三方产品的行为 |
比较 DeepSeek 与其他同时提供模型和用户端产品的产品体系时,这一区分尤其重要,例如通义和豆包。模型基准可以描述推理或工具使用能力,却不能揭示 DeepSeek 官方用户端实际检索了哪些网页,又为哪些网页标明了来源。
2. DeepSeek 联网搜索如何工作
DeepSeek 于 2024 年 12 月 10 日在官网推出联网搜索。上线公告称,产品可以提取多个关键词并行搜索。2025 年 1 月发布的官方 App又加入了联网搜索、DeepThink、文件上传和聊天记录同步。
根据这些公开说明,答案循环大致可以概括为:理解问题、生成搜索查询(query)、检索候选页面、选择证据、合成答案并呈现来源。DeepSeek 当前的隐私政策说明,搜索功能由第三方 API 提供,并将用户输入的关键词分享给这些提供方。政策没有公布提供方名称,也没有说明排序模型、重排特征以及哪些检索结果会得到可见的来源标注。
| 环节 | 公开证据 | 仍然未知的信息 |
|---|---|---|
| 启用搜索 | 用户端产品提供联网搜索模式 | 启用后是否每轮对话都实际检索 |
| 生成查询 | 2024 年公告提到提取多个关键词并行搜索 | 当前 V4 的查询数量、改写规则和语言处理方式 |
| 检索候选页面 | DeepSeek 说明搜索由第三方 API 提供,独立测试也发现回答采用了近期网页信息并显示来源 | 提供方身份、语料范围和候选结果排序 |
| 选择证据 | 系统选用部分检索材料,同时舍弃其他候选来源 | 重排权重和来源质量门槛 |
| 来源归属 | 用户端测试可以记录来源链接或标签 | 系统如何决定为哪些检索证据显示引用 |
搜索模式、模型模式和对话状态需要分别记录。2026 年 5 月的一项用户端研究同时启用了 DeepSeek V4 Flash 的 Deep Think 和 Web Search,但这种设置不能证明所有模式组合都表现相同。文件上传和前序对话也可能成为回答所用的上下文材料,而这些材料未必来自公开网页检索。
测试还要把语言作为独立变量加以控制。中文和英文提示词可能生成不同查询、检索不同域名,也可能使用不同的实体名称。多语言 GEO 测试应保持意图一致,同时记录查询语言、来源语言、地区和具体产品端。与百度 AI 搜索、夸克 AI 搜索和 Kimi 比较时,也要按相同条件进行测试。
3. 爬虫与用户代理
截至 2026 年 8 月 29 日,审阅的官方资料中没有发现 DeepSeek 为用户端搜索公开的爬虫或用户代理名称。Tow Center 的一项 2025 年 3 月审计也指出,DeepSeek 的爬虫名称并未公开。斯坦福在 2025 年 12 月的透明度评估中审查 DeepSeek 的公开信息后,得出了相同结论。
没有公开身份,并不表示系统从未访问网页。搜索系统发现内容的途径可能包括后台索引、用户触发的实时抓取、第三方搜索服务、转载页面,以及引用原文的其他公开网页。不同途径需要采用不同的访问控制方法。
| 访问用途 | 已公开的 DeepSeek 标识 | 目前可核验的发布者控制措施 |
|---|---|---|
| 收集模型训练数据 | 无公开记录 | 制定通用数据使用政策并检查日志;不要猜测 DeepSeek 专用用户代理 |
| 搜索索引 | 无公开记录 | 保持常规搜索可访问性,并检查已核验的请求 |
| 用户触发的网页抓取 | 无公开记录 | 用受控页面测试公开产品,并与服务器日志对照 |
| 第三方搜索或内容转载 | 未公开提供方 | 检查转载副本、页面的规范链接,以及答案实际注明的来源 |
访问审计应记录完整用户代理字符串、来源 IP、请求 URL、响应状态、渲染内容、时间戳和请求模式。如有可用资料,还应核验 IP 归属,并检查请求 IP 是否属于厂商官方公布的地址范围。用户代理字符串很容易伪造,仅仅出现 DeepSeek 字样不足以确认身份。即使厂商没有公布爬虫名称,也可以采用通用的 AI 爬虫审计方法。
虚构一条 robots.txt 规则会让人误以为问题已经解决,系统实际采用的检索方式却可能完全不受影响。百度 AI 搜索也需要单独评估,因为其他中国平台即使拥有公开的搜索爬虫或既有索引关系,也不能说明 DeepSeek 采用相同方式。
4. 来源引用偏好
DeepSeek 没有公开用户端来源排序公式。官方产品公告确认了联网搜索功能,但没有说明系统普遍偏好第一方网站、近期页面、中文域名、学术来源或某种特定内容格式。此类假设必须通过具体查询逐一检验。
在推断任何偏好之前,应先区分几类可见结果:
| 结果 | 可观察证据 | 代表什么 |
|---|---|---|
| 引用或来源链接 | 页面或域名获得链接,并被标为答案依据 | 界面明确为该来源提供了可见署名 |
| 只显示来源名称、不提供链接 | 发布者、作者或品牌被点名,但没有链接到具体页面 | 构成一次提及,但所依据的页面可能不明确 |
| 无来源回答 | 没有显示来源 | 回答可能来自模型已有知识、检索结果、用户提供的上下文,或多种信息的混合 |
| 错误归属 | 回答将所给材料链接至错误的原始来源,或把错误来源标为原始出处 | 即使回答文字看似合理,可见的来源归属仍不准确 |
引用、提及与链接之间的差别很重要:品牌可能出现,但其页面没有被检索;系统也可能使用了页面内容,却没有显示相应链接。因此,是否出现在检索结果中、是否入选来源,以及最终归属都需要分别测量。
目前最明确的 DeepSeek 来源准确性证据来自一项来源准确性审计。2025 年,Tow Center 向 DeepSeek Search 提供了 200 篇新闻文章的摘录,要求系统找出原始标题、发布者、发布日期和 URL。DeepSeek 在 115 个案例中错误识别了来源。这说明可见的来源归属可能出错,但无法据此判断哪些因素影响排序,而且测试早于当前 V4 产品。
另一项规模更大的 2026 年中文生成式搜索研究发现,DeepSeek 网页端和 App 的每个回答平均包含 9.2 条引用。在 580 组配对查询中,两个产品端引用的具体 URL 重合率为 40.8%,域名重合率为 50.7%。这些结果体现了产品端差异,但不构成系统公开的来源偏好,也不能视为长期稳定的平台整体比例。这项研究仍是预印本,数据采集时间为 2026 年 6 月至 7 月;解读其公开数据集时,也应限定在相同的研究范围内。
实际实验可以检验来源类型、时效、语言和段落结构,但不能仅凭相关性断定平台规则。系统完成检索后,直接、完整且能独立理解的证据更容易核验和引用。这与为 AI 引用而写采用的编辑思路一致,但不代表 DeepSeek 已将其公开为排序权重。
5. API 与集成
DeepSeek API 目前有两种不同的工具使用方式。普通函数调用中,模型提出调用开发者所定义函数的请求,再由开发者执行函数并返回结果。当前 Responses API 还支持由 DeepSeek 执行的服务端 web_search 工具。
最简工具声明如下:
{
"tools": [{ "type": "web_search" }],
"tool_choice": { "type": "web_search" }
}
文档说明,响应中可以出现 web_search_call 输出项,其中的动作可能表示搜索、打开页面或在页面中查找文本。当前参考文档没有规定独立的引用对象或来源 URL 对象,因此不能假定每次搜索动作都会产生机器可读的引用。API 本身不保存状态,多轮测试必须再次发送相关对话历史。支持的模型和字段可能发生变化。请求内容、返回的模型、工具选择、搜索动作、回答文本,以及任何显示或返回的 URL 都应一起保存。
| 产品端 | 搜索能力 | 测量用途 | 主要限制 |
|---|---|---|---|
| 用户网页端或 App | 面向用户的 Web Search | 测量实际托管产品的体验 | 自动化和结果提取可能受限 |
| Responses API | DeepSeek 托管的服务端 web_search 工具 | 通过重复提示词记录是否执行了搜索,以及返回了什么回答 | 没有文档证明它与用户端排序相同,也没有独立的引用对象规范 |
| 使用函数调用的 Chat Completions | 开发者提供搜索函数和结果 | 测试受控的检索流程 | 测量的是开发者自己的搜索系统 |
| 开放权重部署 | 部署方选择所有检索组件 | 支持可复现的自定义实验 | 不能复现官方 DeepSeek Search |
2026 年,API 已经更适合用于测量搜索行为,但仍只能作为用户端产品的替代观察渠道。AI 引用追踪应分别保存用户端与 API 的观察结果。模型名称、地区、工具配置或账户环境都可能在系统选择引用之前改变可供选择的来源范围。
6. 历史与时间线
DeepSeek 与 GEO 相关的发展历程不仅包括模型发布,也包括产品和工具的变化。
| 日期 | 变化 | 对网页可见度的影响 |
|---|---|---|
| 2024 年 7 月 25 日 | API 增加函数调用 | 开发者可以把 DeepSeek 模型连接到外部爬虫或搜索函数,但工具仍由开发者提供 |
| 2024 年 12 月 10 日 | 官网上线联网搜索 | 用户端产品获得实时检索能力;公告明确说明当时 API 尚不支持搜索 |
| 2025 年 1 月 15 日 | 官方移动 App 上线,提供联网搜索和 DeepThink | 托管 App 与网页端均可使用搜索 |
| 2025 年 9 月 22 日 | DeepSeek-V3.1-Terminus 称 Search Agent 性能得到改善 | 模型更新改变了搜索代理表现,但公告没有披露排序细节 |
| 2026 年 4 月 24 日 | V4 Preview 覆盖 App、网页端、API 和开放权重渠道 | 同一模型系列用于不同检索系统时,测试必须分别记录产品端和模型标签 |
| 2026 年 8 月 13 日 | V4 Pro GA 覆盖 App、网页端和 API,同时加入原生 Responses API 支持 | 官方 API 获得有文档记录的服务端联网搜索能力,可以作为单独标注的测试对象 |
API 更新日志是目前记录模型和接口变化最完整的官方资料。搜索实验应保留采集日期,因为 V4 Pro GA 前后取得的结果对应不同的产品版本。
7. 实测引用表现
现有公开证据包括一套大规模中文观察数据,但各项研究回答的问题不同。根据这些公开基准,无法得出适用于 DeepSeek 所有主题、语言、日期和产品端的引用率、来源偏好或排序公式。
| 证据 | 产品端与方法 | 可直接采用的结果 | 适用边界 |
|---|---|---|---|
| Tow Center,2025 年 3 月 | 向 DeepSeek Search 分别提供 200 篇新闻文章的摘录,要求识别原始来源 | DeepSeek 在 200 条摘录中有 115 条来源识别错误 | 来源识别压力测试,不是普通用户查询;早于 V4 |
| Stanford FMTI,2025 年 12 月 | 审计 DeepSeek 文档及相关资料的披露情况 | 没有披露爬虫名称或爬虫退出协议 | 透明度结果,不是检索或引用性能测试 |
| Zheng 等,2026 年 8 月 | 官方用户端界面,显示模型为 DeepSeek V4 Flash,同时启用 Deep Think 和 Web Search;2026 年 5 月在温州对 52 个猴痘问题各运行一次 | 记录了一套近期用户端测试设置,明确启用了联网搜索,并提供回答质量指标 | 单一健康主题、单一地区、没有重复运行,也不提供整体引用率 |
| 中文生成式搜索研究,2026 年 7 月 | 614 个中文查询,覆盖四个平台的网页端和 App,每个查询重复三次;原始记录 214,119 条,清洗后引用记录 160,860 条 | DeepSeek 两个产品端平均每个回答均有 9.2 条引用;580 组配对查询的具体 URL 重合率为 40.8%,域名重合率为 50.7% | 预印本,仅观察 2026 年 6 月至 7 月的数据;没有被淘汰的候选来源集合,也无法解释排序机制 |
Frontiers 研究的价值在于明确记录了产品端、模式、地区、日期、账户类型和查询流程。研究也提醒,界面显示的模型名称不能独立证明托管后端实际使用的模型。规模更大的中文引用研究进行了重复测试和跨产品端比较,并公开了清洗后的引用数据。两项研究都没有披露被淘汰的候选来源,也无法解释排序机制中的因果关系。
一套可靠的 DeepSeek 测试至少应记录五类结果:是否执行搜索、显示了哪些来源、答案是否正确引用原始来源、目标品牌是否被提及,以及多次运行能否得到一致结果。启用与关闭搜索的结果应分开保存。中文和英文提示词也应分别成组,不能合并成一个比例。
API 可以支持重复采集,但结果不能与用户端观察合并。来自 Kimi、秘塔 AI 搜索或百度 AI 搜索的结果,也不能作为 DeepSeek 的测量数据。使用相同查询和指标只是必要条件;只有产品端、日期、语言、地区和检索设置也保持一致,结果才具备可比性。
8. 如何优化 DeepSeek 可见度
针对 DeepSeek 的优化应从可测试的部分着手。DeepSeek 没有公开排序公式,因此每项内容优化建议都要注明证据强度,并对应一种可以观察的结果。
| 做法 | 为什么合理 | 如何验证 |
|---|---|---|
| 用可正常访问、完成渲染的 HTML 发布答案 | 无论爬虫身份是否公开,实时检索都需要读取来源文本 | 对照服务器响应、日志,以及受控页面在用户端答案中的表现 |
| 同时呈现事实、日期和原始证据 | 搜索答案可能错误识别来源;清楚注明出处更便于核验原始来源 | 检查获引 URL 是否为原始页面,且能支持引用所对应的说法 |
| 在含义明确的标题下撰写能独立理解的段落 | 系统检索后更容易提取完整段落并标明来源 | 追踪该段落或其中有辨识度的事实是否出现在带有引用的回答中 |
| 在中英文中保持实体描述一致 | 跨语言查询可能检索不同域名或使用不同别名 | 成对测试中英文提示词,并记录来源语言和实体名称 |
| 持续维护标明版本号的开发者文档 | 模型、模式和 API 字段变化后,技术问题的答案也会改变 | 每次相关产品更新后重新测试版本问题 |
| 重复运行固定提示词集 | 单次回答无法区分稳定规律与生成波动 | 确保产品端、搜索设置、地区和日期范围一致,并保存多次结果 |
不要在 robots.txt 中加入猜测的 DeepSeek 用户代理。应通过 AI 爬虫审计方法核验请求,并继续开放发布政策所允许的常规访问。只有厂商公布可验证标识,或自身日志确认受控访问规律后,DeepSeek 专用允许列表才有依据。
多语言 GEO的重点不是逐字翻译,而是确保产品名称、公司名称、技术术语、日期和版本号在不同语言中能够一致地标识同一实体。为 AI 引用而写可以提高段落清晰度,AI 引用追踪则可用于判断内容调整改变的是搜索、引用还是提及,抑或没有产生可观察变化。
比较中国市场的产品时,不能把一个平台的假设直接套到另一个平台。通义和豆包同时提供模型与用户助手;夸克 AI 搜索和秘塔 AI 搜索则面向不同的搜索场景。各家的爬虫披露、来源范围和引用界面都需要独立证据。
9. DeepSeek 为什么对 GEO 重要
DeepSeek 的影响来自三类产品形态:带联网搜索的托管用户端产品、具备服务端联网搜索能力的 API,以及用于独立部署的开放权重。这些形态覆盖的场景越多,网页来源获得可见度的机会也越多,但测量时也越容易混淆不同产品。如果某个自部署 DeepSeek 模型通过第三方搜索服务引用了一个来源,并不能证明该来源在 DeepSeek 官方用户端也有可见度。
跨平台比较应采用同一套测量记录:
| 字段 | 必须记录的内容 |
|---|---|
| 产品端 | 官方用户端 App、官方 API、自部署环境或第三方产品 |
| 模型与模式 | 界面显示的模型名称、思考模式和搜索设置 |
| 查询环境 | 完整提示词、语言、地区、账户状态和前序对话 |
| 检索结果 | 是否执行搜索,以及显示或返回了哪些来源页面 |
| 可见度结果 | 引用、链接、提及、内容被采用但未注明来源,或完全没有出现 |
| 可靠性 | 来源准确性、来源是否支持回答中的对应说法、多次运行的差异,以及网页端与 App 的重合程度 |
在得出中国市场整体结论之前,应先用这套记录方式分别测试百度 AI 搜索、豆包、Kimi、通义、夸克 AI 搜索和秘塔 AI 搜索。使用同一张表不会掩盖平台差异,反而可以按统一标准解释这些差异。
DeepSeek 对 GEO 的重要性在于,同一模型系列可以用于许多产品,但网页来源最终是否得到注明,取决于产品如何检索内容和显示来源。发布者需要标明具体产品端、核验来源准确性,并把引用与提及分开测量,才能得到更明确的证据。即使 DeepSeek 继续更换模型、搜索工具和产品模式,这套方法仍然适用。
参考资料
DeepSeek 官方资料:
- DeepSeek V2.5: The Grand Finale(联网搜索上线,2024 年 12 月 10 日)
- Introducing DeepSeek App(2025 年 1 月 15 日)
- DeepSeek-V3.1-Terminus(2025 年 9 月 22 日)
- DeepSeek-V4 Preview(2026 年 4 月 24 日)
- DeepSeek-V4-Pro GA Release(2026 年 8 月 13 日)
- Responses API reference、Responses API guide与 API change log
- DeepSeek Privacy Policy(更新于 2026 年 2 月 10 日)
独立证据:
- Tow Center for Digital Journalism,AI Search Has a Citation Problem(2025 年 3 月 6 日)
- Stanford Center for Research on Foundation Models,DeepSeek Transparency Report(2025 年 12 月)
- Zheng 等,Evaluating search-enabled large language model interfaces for mpox public health consultation(2026 年 8 月 26 日)
- What Do Chinese-Language Generative Search Engines Cite and Surface? A Large-Scale Empirical Study及配套的 CN-GEO Citation Dataset(2026 年 7 月)
常见问题
DeepSeek 会自动联网搜索吗?
DeepSeek 是否公开了爬虫或用户代理名称?
DeepSeek API 能联网搜索吗?
开放权重的 DeepSeek 模型能复现 DeepSeek Search 吗?
发布者应如何测量在 DeepSeek 中的可见度?
相关
参考来源
一手来源
- DeepSeek V2.5: The Grand Finale · DeepSeek · 2024-12-10
- Introducing DeepSeek App · DeepSeek · 2025-01-15
- DeepSeek-V3.1-Terminus · DeepSeek · 2025-09-22
- DeepSeek-V4 Preview: Entering the Era of Affordable Million-Token Context · DeepSeek · 2026-04-24
- DeepSeek-V4-Pro GA Release · DeepSeek · 2026-08-13
- Responses API · DeepSeek API Docs
- Responses API Guide · DeepSeek API Docs
- DeepSeek API Change Log · DeepSeek API Docs
- DeepSeek Privacy Policy · DeepSeek · 2026-02-10
- Evaluating search-enabled large language model interfaces for mpox public health consultation: a guideline-based comparative study · Frontiers in Public Health · 2026-08-26
- What Do Chinese-Language Generative Search Engines Cite and Surface? A Large-Scale Empirical Study · arXiv · 2026-07-17
- CN-GEO Citation Dataset · WENDAOstudy
二手来源
- AI Search Has a Citation Problem · Columbia Journalism Review / Tow Center for Digital Journalism
- DeepSeek Transparency Report · Stanford Center for Research on Foundation Models