一个品牌在 DeepSeek 里被推荐了,或者没被推荐,最常见的追问是:它到底看了哪些网站。
这个问题有一半能从官方文档里找到答案,另一半官方没有公开。把两半分清楚,比猜测有用得多。
DeepSeek 的答案有两个来源
DeepSeek 在官网公开了一份模型原理与训练方法说明。按这份说明,训练数据来自两类:互联网上公开可用的信息,以及与第三方合作获取的信息。这是模型在不联网时回答问题的全部底子。
第二个来源是联网搜索。DeepSeek 用户协议对这个功能的描述是:开启后,产品会按照输入信息和指令先检索互联网的公开信息,再根据检索到的公开信息生成内容。协议同时写明,开启联网搜索会在一定程度上提升准确性和时效性,但生成内容不准确的问题无法完全避免。
两层来源的性质完全不同。
| 维度 | 不联网 | 联网搜索 |
|---|---|---|
| 取材范围 | 训练时吸收的公开信息与合作数据 | 当下检索到的互联网公开信息 |
| 新内容生效时间 | 取决于模型更新,无法排期 | 页面可被检索后即有机会进入 |
| 能否看到依据 | 看不到 | 答案可附带第三方网站链接 |
| 品牌能做什么 | 长期积累公开可信材料 | 让可被检索的页面准确、完整 |
官方用户协议提到,服务可能包含第三方网站链接,访问这些链接后的行为与 DeepSeek 无关。这从侧面确认了联网模式下答案会带出外部网页。
DeepSeek 联网搜索引用哪些网站,官方说了什么
说得很少。无论是用户协议、隐私政策还是模型原理说明,都没有列出联网搜索使用哪家搜索服务、优先检索哪些站点、按什么标准挑选引用。隐私政策只提到使用搜索服务时会接收用户主动输入的信息,用来提供实时搜索结果。
所以任何声称掌握 DeepSeek 引用网站白名单的说法,都拿不出官方出处。
能做的只有观察:在联网模式下用固定问题反复提问,把答案正文里实际标注的来源域名记下来。这里有个经常被混淆的点,检索过程中拉回来的候选网页不等于被引用的网页,只有答案正文里真正标注出来的那几条才算。把候选当引用统计,引用率会被严重高估。
引用了不等于支持了
即使拿到了引用列表,也不要默认答案里的每句话都有出处支撑。
一项 2023 年的同行评审研究人工审查了四个海外生成式搜索引擎,结果是只有 51.5% 的句子得到引用来源的完整支持,引用中确实支撑其所在句子的只有 74.5%。这项研究没有测 DeepSeek,不能直接套用数字,但它说明了一个结构性问题:模型先检索、后合成,合成这一步可能把几条来源的内容揉在一起,也可能补上来源里没有的话。
DeepSeek 自己的用户协议也写得很直白:所有输出都由人工智能模型答复,可能出现错误或遗漏,仅供参考,不应作为专业建议。平台在协议里把这件事说在前面,品牌就更没有理由把一条带链接的答案当成已经被核实过的结论。
对品牌来说,这意味着核查要落到句子层面。答案说某品牌的某项参数是多少,就去看标注的那条来源里是不是真这么写。很多时候错误不在来源,而在合成。
API 和网页版测出来的结果为什么不一样
这是做监测时最容易踩的坑。
DeepSeek 官方 API 的对话接口参数里,没有联网搜索相关的选项。换句话说,直接调用官方 API 得到的是不联网的回答,和用户在网页版或 App 里开启联网搜索看到的不是一回事。
任何通过 API 批量跑问题的工具,如果没有自己另外接入检索,测到的都是模型的训练记忆,而不是联网推荐。两种结果必须分开记录,不能合并成一个平均数,否则既看不出新内容多久能生效,也判断不出问题出在训练数据还是检索环节。
DeepSeek 推荐品牌的依据,能确认到哪一步
官方没有公开推荐逻辑,所以这一节只能分成三层说:确定的、有研究支撑的、只是观察。
确定的是,联网模式下答案基于检索到的互联网公开信息生成。品牌的公开网页、第三方报道和各类平台资料,只要能被检索到,就都在候选范围里;检索不到的内容,联网模式下不可能被引用。
有研究支撑的,是海外 AI 搜索对第三方权威来源的偏好。2025 年一项研究测了四家海外 AI 搜索,发现它们系统性地偏向第三方媒体内容,品牌自有内容和社交内容的比重明显低于 Google。这项研究没有覆盖 DeepSeek,是否适用只能测了才知道。
只是观察的,是我们在 DeepSeek 平台页 里总结的测量经验:具体、可核对的事实更容易被保留,宣传性形容词更容易被跳过,同一事实在不同页面说法不一时会拖累整体表现。这些是实测中反复出现的模式,不是官方说明,放在这里是为了把三层分清。
品牌没被 DeepSeek 推荐,按什么顺序排查
第一步看联网还是不联网。如果只在不联网时缺席,问题在训练数据的覆盖,短期内能改变的空间有限;如果联网时也缺席,就要看检索这一环。
第二步看引用了谁。把联网模式下答案标注的来源域名汇总起来,这就是这一类问题上 DeepSeek 实际在读的网站清单。竞品出现在哪些来源里,自家没出现在哪些来源里,差距一目了然。
第三步看自家页面能不能被读到。页面是否对爬虫开放,内容是否依赖 JavaScript 才显示,关键事实是否只存在于图片里。检索取不回来的页面,写得再好也进不了答案。
最后才是内容本身。联网搜索的概念和测量口径,在 联网搜索词条 里有更完整的说明。
模型本身也在变。DeepSeek 在 2025 年 8 月发布 V3.1 时专门提到,新版本在多项搜索评测指标上较前代有较大提升,并把这类能力称为搜索智能体。检索能力一变,取回哪些网页、引用哪几条,都可能跟着变。一份三个月前记录的引用域名清单,不能默认今天仍然成立。
没有官方白名单,也就没有捷径。DeepSeek 引用来源的清单只能从自己的问题、自己的记录里得出,而且会随模型版本变化,需要定期重测。
参考来源
- 深度求索 (2025). DeepSeek 用户协议. DeepSeek.
- 深度求索 (2026). DeepSeek 隐私政策. DeepSeek.
- 深度求索. 模型原理与训练方法说明. DeepSeek.
- 深度求索 (2025). DeepSeek-V3.1 发布. DeepSeek API Docs.
- 深度求索. 对话补全 API 文档. DeepSeek API Docs.
- Liu, N. F., Zhang, T., & Liang, P. (2023). Evaluating Verifiability in Generative Search Engines. Findings of EMNLP 2023.
- Chen, M., Wang, X., Chen, K., & Koudas, N. (2025). Generative Engine Optimization: How to Dominate AI Search. arXiv.
- 中国互联网络信息中心 (2025). 生成式人工智能应用发展报告(2025). CNNIC.