一个品牌在 DeepSeek 里被推荐了,或者没被推荐,最常见的追问是:它到底看了哪些网站。

这个问题有一半能从官方文档里找到答案,另一半官方没有公开。把两半分清楚,比猜测有用得多。

DeepSeek 的答案有两个来源

DeepSeek 在官网公开了一份模型原理与训练方法说明。按这份说明,训练数据来自两类:互联网上公开可用的信息,以及与第三方合作获取的信息。这是模型在不联网时回答问题的全部底子。

第二个来源是联网搜索。DeepSeek 用户协议对这个功能的描述是:开启后,产品会按照输入信息和指令先检索互联网的公开信息,再根据检索到的公开信息生成内容。协议同时写明,开启联网搜索会在一定程度上提升准确性和时效性,但生成内容不准确的问题无法完全避免。

两层来源的性质完全不同。

维度不联网联网搜索
取材范围训练时吸收的公开信息与合作数据当下检索到的互联网公开信息
新内容生效时间取决于模型更新,无法排期页面可被检索后即有机会进入
能否看到依据看不到答案可附带第三方网站链接
品牌能做什么长期积累公开可信材料让可被检索的页面准确、完整

官方用户协议提到,服务可能包含第三方网站链接,访问这些链接后的行为与 DeepSeek 无关。这从侧面确认了联网模式下答案会带出外部网页。

DeepSeek 联网搜索引用哪些网站,官方说了什么

说得很少。无论是用户协议、隐私政策还是模型原理说明,都没有列出联网搜索使用哪家搜索服务、优先检索哪些站点、按什么标准挑选引用。隐私政策只提到使用搜索服务时会接收用户主动输入的信息,用来提供实时搜索结果。

所以任何声称掌握 DeepSeek 引用网站白名单的说法,都拿不出官方出处。

能做的只有观察:在联网模式下用固定问题反复提问,把答案正文里实际标注的来源域名记下来。这里有个经常被混淆的点,检索过程中拉回来的候选网页不等于被引用的网页,只有答案正文里真正标注出来的那几条才算。把候选当引用统计,引用率会被严重高估。

5.15亿截至 2025 年 6 月我国生成式人工智能用户规模CNNIC
90% 以上首先选择使用国产大模型的用户比例CNNIC
51.5%海外生成式搜索回答中被引用来源完整支持的句子比例Liu 等

引用了不等于支持了

即使拿到了引用列表,也不要默认答案里的每句话都有出处支撑。

一项 2023 年的同行评审研究人工审查了四个海外生成式搜索引擎,结果是只有 51.5% 的句子得到引用来源的完整支持,引用中确实支撑其所在句子的只有 74.5%。这项研究没有测 DeepSeek,不能直接套用数字,但它说明了一个结构性问题:模型先检索、后合成,合成这一步可能把几条来源的内容揉在一起,也可能补上来源里没有的话。

DeepSeek 自己的用户协议也写得很直白:所有输出都由人工智能模型答复,可能出现错误或遗漏,仅供参考,不应作为专业建议。平台在协议里把这件事说在前面,品牌就更没有理由把一条带链接的答案当成已经被核实过的结论。

对品牌来说,这意味着核查要落到句子层面。答案说某品牌的某项参数是多少,就去看标注的那条来源里是不是真这么写。很多时候错误不在来源,而在合成。

API 和网页版测出来的结果为什么不一样

这是做监测时最容易踩的坑。

DeepSeek 官方 API 的对话接口参数里,没有联网搜索相关的选项。换句话说,直接调用官方 API 得到的是不联网的回答,和用户在网页版或 App 里开启联网搜索看到的不是一回事。

任何通过 API 批量跑问题的工具,如果没有自己另外接入检索,测到的都是模型的训练记忆,而不是联网推荐。两种结果必须分开记录,不能合并成一个平均数,否则既看不出新内容多久能生效,也判断不出问题出在训练数据还是检索环节。

DeepSeek 推荐品牌的依据,能确认到哪一步

官方没有公开推荐逻辑,所以这一节只能分成三层说:确定的、有研究支撑的、只是观察。

确定的是,联网模式下答案基于检索到的互联网公开信息生成。品牌的公开网页、第三方报道和各类平台资料,只要能被检索到,就都在候选范围里;检索不到的内容,联网模式下不可能被引用。

有研究支撑的,是海外 AI 搜索对第三方权威来源的偏好。2025 年一项研究测了四家海外 AI 搜索,发现它们系统性地偏向第三方媒体内容,品牌自有内容和社交内容的比重明显低于 Google。这项研究没有覆盖 DeepSeek,是否适用只能测了才知道。

只是观察的,是我们在 DeepSeek 平台页 里总结的测量经验:具体、可核对的事实更容易被保留,宣传性形容词更容易被跳过,同一事实在不同页面说法不一时会拖累整体表现。这些是实测中反复出现的模式,不是官方说明,放在这里是为了把三层分清。

品牌没被 DeepSeek 推荐,按什么顺序排查

第一步看联网还是不联网。如果只在不联网时缺席,问题在训练数据的覆盖,短期内能改变的空间有限;如果联网时也缺席,就要看检索这一环。

第二步看引用了谁。把联网模式下答案标注的来源域名汇总起来,这就是这一类问题上 DeepSeek 实际在读的网站清单。竞品出现在哪些来源里,自家没出现在哪些来源里,差距一目了然。

第三步看自家页面能不能被读到。页面是否对爬虫开放,内容是否依赖 JavaScript 才显示,关键事实是否只存在于图片里。检索取不回来的页面,写得再好也进不了答案。

最后才是内容本身。联网搜索的概念和测量口径,在 联网搜索词条 里有更完整的说明。

模型本身也在变。DeepSeek 在 2025 年 8 月发布 V3.1 时专门提到,新版本在多项搜索评测指标上较前代有较大提升,并把这类能力称为搜索智能体。检索能力一变,取回哪些网页、引用哪几条,都可能跟着变。一份三个月前记录的引用域名清单,不能默认今天仍然成立。

没有官方白名单,也就没有捷径。DeepSeek 引用来源的清单只能从自己的问题、自己的记录里得出,而且会随模型版本变化,需要定期重测。

参考来源