很多 GEO 项目在第三个月陷入同一种争论:到底有没有效果。服务方拿出几张截图说品牌出现了,企业方说以前好像也出现过。两边都拿不出一个开工前的数。
这场争论在第一天就已经注定没有结论。
GEO 基线测量要解决的就是这件事。它不复杂,但顺序不能错:必须在改动任何内容之前完成。
做 GEO 之前先测什么
先测的是一组固定问题在各个平台上的现状。每个问题在每个平台跑下来,记录四件事:品牌有没有被点名,被点名时的语境是正面、中性还是负面,同一条答案里还出现了哪些品牌,答案引用了哪些来源域名。
这四个字段是刻意压缩过的。字段一多,执行的人就会在细节上走样,而基线最怕的就是走样。
| 记录字段 | 记什么 | 常见错误 |
|---|---|---|
| 是否点名 | 答案里是否出现本品牌 | 把提示词里自带品牌名的问题也算进去 |
| 点名语境 | 正面、中性、负面三选一 | 负面提及也当成一次有效点名 |
| 同时出现的品牌 | 答案里所有其他品牌 | 只盯着事先认定的几家竞品 |
| 被引用域名 | 答案正文实际标注的来源 | 把检索过程中的候选网页当成引用 |
这里没有排名这一栏。生成式答案不存在稳定的第几名,能测的是比例。
问题集从哪里来,为什么一定要冻结
问题的来源决定了基线测的是什么。关键词工具给出的词,测的是搜索习惯;销售和客服记录里客户的原话,测的才是客户真会问 AI 的问题。两者经常对不上。
我们的做法是控制在 15 至 30 条。太少时单条问题就能左右百分比,太多则每轮耗时太长,复测坚持不下去。三类意图都要覆盖:刚开始了解品类的认知类问题,在几家之间比较的对比类问题,以及临近下单的决策类问题。
写定之后,问题集要连同标点一起冻结。
听起来过于严格,但研究给了很具体的理由。一项发表在 ICLR 2024 的研究专门测了不改变语义的提示词格式调整,发现在 LLaMA-2-13B 上,仅凭格式不同,准确率差距最高可达 76 个百分点。问题措辞的细微变化,足以让两轮测量测的不是同一件事。
AI 可见度基线为什么每题至少测三次
生成式答案会波动,这一点常被当成经验之谈,其实有测量数据。
一项 2024 年的研究让五个大模型在八类常见任务上各跑十次,设置都是理论上应当输出确定结果的参数。结果是自然运行之间的准确率差异最高达 15%,最好与最差可能表现之间的差距最高达 70%,而且没有一个模型在所有任务上都能稳定复现。
这些研究测的是任务准确率,不是品牌点名,数字不能直接换算。但结论是同一个方向:单次运行不构成测量。每题至少测三次,记录的是品牌被点名的运行次数占比,这个占比才是测量值。
带品牌名的问题要不要放进基线
要放,但必须单独分组。
「某某品牌的售后怎么样」这类问题,答案里一定会出现这个品牌,它测的是模型怎么描述这个品牌,而不是模型会不会在品类问题里想到它。前者有价值,尤其适合发现错误信息和负面语境;但如果把它们和品类问题一起计入被点名率,这个数会被系统性抬高,也就失去了竞争意义。
同样的道理也适用于竞品。对自己和对竞品要用同一套匹配规则,提示词里已经点了某家名字的问题,从这家的计数里排除。计数规则不对称,比出来的份额就没有意义。
点名语境只取三个值。被描述为低价选项,或者和投诉一起出现,记为负面,不算一次有效点名。这条规则执行起来会让数字变难看,但它让数字变得可信。
联网和不联网,为什么要分开记
各家平台的联网行为并不一致,也不总是由用户控制。
豆包的用户协议写明,当系统识别到联网搜索意图,或者用户主动选择 AI 搜索功能时,才会自动搜索第三方网页的公开信息。也就是说,同一个问题是否触发联网,部分取决于平台自己的判断。DeepSeek 则把联网搜索作为用户可开启的功能,其官方 API 的对话接口里没有联网搜索参数。
联网答案反映的是当下能检索到的网页,不联网答案反映的是训练时吸收的内容。前者可能几天内就因为新页面发生变化,后者要等模型更新。把两种结果混在一起,既判断不了新内容多久生效,也分不清问题出在哪一层。
基线能说明什么,不能说明什么
基线记录的是某个时点的状态。它说明品牌在哪些问题、哪些平台上缺席,被点名时是什么语境,模型心里的替代选项是谁,答案在读哪些网站。
它不能预测平台未来的行为,不能分析竞品为什么表现好,也不能直接告诉补齐某个缺口需要多少工作量。最后这件事要靠下一步的信源分析:看被引用域名清单里,哪些渠道能介入,哪些不能。
还有一点容易被忽视。研究同样显示,生成式引擎优化的效果因领域而异。一个品类里测出的规律,不能直接用到另一个品类,所以每个品牌的基线只能用自己的问题集测。
| 情形 | 有基线 | 没有基线 |
|---|---|---|
| 三个月后被点名率上升 | 可以对照同一问题集核实 | 无法区分是工作效果还是测量时点 |
| 某平台数据下降 | 能回到原始答案找原因 | 只能猜测 |
| 更换服务方 | 新服务方有明确起点 | 一切从头再测,旧工作无法评估 |
自己做还是交给别人做
方法本身不依赖专用工具,一张表格加大约半天时间,就能做出第一份基线。完整的步骤和记录模板,我们写在 基线测量指南 里。工具的价值在于规模化重复执行和整理原始答案,而不是方法本身。
如果交给服务方,核对的重点不是报告好不好看,而是三件事:问题集有没有冻结并写进合同,每题测了几次,原始答案能不能随时调出来。我们的 AI 可见度诊断 就是按这套方法交付的书面基线,报告无论是否签约都归客户所有,因为签约之后才存在的基线起不到基线的作用。
一个基线的价值,要到第二轮测量时才真正显现。第一轮只是一个数,第二轮开始才有了比较。
参考来源
- Sclar, M., Choi, Y., Tsvetkov, Y., & Suhr, A. (2024). Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design. ICLR 2024.
- Atil, B., Aykent, S., Chittams, A., et al. (2024). Non-Determinism of "Deterministic" LLM Settings. arXiv.
- Aggarwal, P., Murahari, V., Rajpurohit, T., Kalyan, A., Narasimhan, K., & Deshpande, A. (2024). GEO: Generative Engine Optimization. Proceedings of KDD 2024.
- 北京春田知韵科技有限公司 (2026). 豆包用户协议. 豆包.
- 深度求索 (2025). DeepSeek 用户协议. DeepSeek.
- 深度求索. 对话补全 API 文档. DeepSeek API Docs.