很多 GEO 项目在第三个月陷入同一种争论:到底有没有效果。服务方拿出几张截图说品牌出现了,企业方说以前好像也出现过。两边都拿不出一个开工前的数。

这场争论在第一天就已经注定没有结论。

GEO 基线测量要解决的就是这件事。它不复杂,但顺序不能错:必须在改动任何内容之前完成。

做 GEO 之前先测什么

先测的是一组固定问题在各个平台上的现状。每个问题在每个平台跑下来,记录四件事:品牌有没有被点名,被点名时的语境是正面、中性还是负面,同一条答案里还出现了哪些品牌,答案引用了哪些来源域名。

这四个字段是刻意压缩过的。字段一多,执行的人就会在细节上走样,而基线最怕的就是走样。

记录字段记什么常见错误
是否点名答案里是否出现本品牌把提示词里自带品牌名的问题也算进去
点名语境正面、中性、负面三选一负面提及也当成一次有效点名
同时出现的品牌答案里所有其他品牌只盯着事先认定的几家竞品
被引用域名答案正文实际标注的来源把检索过程中的候选网页当成引用

这里没有排名这一栏。生成式答案不存在稳定的第几名,能测的是比例。

问题集从哪里来,为什么一定要冻结

问题的来源决定了基线测的是什么。关键词工具给出的词,测的是搜索习惯;销售和客服记录里客户的原话,测的才是客户真会问 AI 的问题。两者经常对不上。

我们的做法是控制在 15 至 30 条。太少时单条问题就能左右百分比,太多则每轮耗时太长,复测坚持不下去。三类意图都要覆盖:刚开始了解品类的认知类问题,在几家之间比较的对比类问题,以及临近下单的决策类问题。

写定之后,问题集要连同标点一起冻结。

听起来过于严格,但研究给了很具体的理由。一项发表在 ICLR 2024 的研究专门测了不改变语义的提示词格式调整,发现在 LLaMA-2-13B 上,仅凭格式不同,准确率差距最高可达 76 个百分点。问题措辞的细微变化,足以让两轮测量测的不是同一件事。

AI 可见度基线为什么每题至少测三次

生成式答案会波动,这一点常被当成经验之谈,其实有测量数据。

一项 2024 年的研究让五个大模型在八类常见任务上各跑十次,设置都是理论上应当输出确定结果的参数。结果是自然运行之间的准确率差异最高达 15%,最好与最差可能表现之间的差距最高达 70%,而且没有一个模型在所有任务上都能稳定复现。

76仅改变提示词格式造成的准确率差距上限,单位为百分点Sclar 等
15%同一设置下多次自然运行之间的准确率差异上限Atil 等
70%最好与最差可能表现之间的差距上限Atil 等

这些研究测的是任务准确率,不是品牌点名,数字不能直接换算。但结论是同一个方向:单次运行不构成测量。每题至少测三次,记录的是品牌被点名的运行次数占比,这个占比才是测量值。

带品牌名的问题要不要放进基线

要放,但必须单独分组。

「某某品牌的售后怎么样」这类问题,答案里一定会出现这个品牌,它测的是模型怎么描述这个品牌,而不是模型会不会在品类问题里想到它。前者有价值,尤其适合发现错误信息和负面语境;但如果把它们和品类问题一起计入被点名率,这个数会被系统性抬高,也就失去了竞争意义。

同样的道理也适用于竞品。对自己和对竞品要用同一套匹配规则,提示词里已经点了某家名字的问题,从这家的计数里排除。计数规则不对称,比出来的份额就没有意义。

点名语境只取三个值。被描述为低价选项,或者和投诉一起出现,记为负面,不算一次有效点名。这条规则执行起来会让数字变难看,但它让数字变得可信。

联网和不联网,为什么要分开记

各家平台的联网行为并不一致,也不总是由用户控制。

豆包的用户协议写明,当系统识别到联网搜索意图,或者用户主动选择 AI 搜索功能时,才会自动搜索第三方网页的公开信息。也就是说,同一个问题是否触发联网,部分取决于平台自己的判断。DeepSeek 则把联网搜索作为用户可开启的功能,其官方 API 的对话接口里没有联网搜索参数。

联网答案反映的是当下能检索到的网页,不联网答案反映的是训练时吸收的内容。前者可能几天内就因为新页面发生变化,后者要等模型更新。把两种结果混在一起,既判断不了新内容多久生效,也分不清问题出在哪一层。

基线能说明什么,不能说明什么

基线记录的是某个时点的状态。它说明品牌在哪些问题、哪些平台上缺席,被点名时是什么语境,模型心里的替代选项是谁,答案在读哪些网站。

它不能预测平台未来的行为,不能分析竞品为什么表现好,也不能直接告诉补齐某个缺口需要多少工作量。最后这件事要靠下一步的信源分析:看被引用域名清单里,哪些渠道能介入,哪些不能。

还有一点容易被忽视。研究同样显示,生成式引擎优化的效果因领域而异。一个品类里测出的规律,不能直接用到另一个品类,所以每个品牌的基线只能用自己的问题集测。

情形有基线没有基线
三个月后被点名率上升可以对照同一问题集核实无法区分是工作效果还是测量时点
某平台数据下降能回到原始答案找原因只能猜测
更换服务方新服务方有明确起点一切从头再测,旧工作无法评估

自己做还是交给别人做

方法本身不依赖专用工具,一张表格加大约半天时间,就能做出第一份基线。完整的步骤和记录模板,我们写在 基线测量指南 里。工具的价值在于规模化重复执行和整理原始答案,而不是方法本身。

如果交给服务方,核对的重点不是报告好不好看,而是三件事:问题集有没有冻结并写进合同,每题测了几次,原始答案能不能随时调出来。我们的 AI 可见度诊断 就是按这套方法交付的书面基线,报告无论是否签约都归客户所有,因为签约之后才存在的基线起不到基线的作用。

一个基线的价值,要到第二轮测量时才真正显现。第一轮只是一个数,第二轮开始才有了比较。

参考来源