GEO 最容易出问题的地方不是执行,是验收。因为生成式答案本身是浮动的,所以只要测量方法不固定,任何结论都能被「说成」有效。

这篇讲的是怎么把测量方法固定下来。

一、先冻结问题集

第一步,也是决定后面一切是否成立的一步:把用来衡量效果的那组问题写死

  • 数量 15 到 30 条,覆盖认知、对比、决策三类意图。
  • 用词固定,包括标点。改一个字,结果就不能和上一轮比。
  • 单独存档,和「用来扩展业务的词表」分开管理。词表可以随时加,问题集不行。

问题集一旦冻结,「提升了多少」才有意义。

二、统一执行条件

同一批问题,在各平台之间也要统一条件:

  • 是否开启联网搜索:分开记录,不要混在一个平均数里。
  • 账号状态:尽量用同一种状态(都登录或都不登录),个性化会影响结果。
  • 时间:同一轮测量集中在一两天内跑完。
  • 每条问题跑几次:生成式答案有随机性,跑三次取出现比例,比跑一次可靠得多。

三、记录四个字段,不要更多

每次测量对每个「问题 × 平台」记四项:

  1. 是否点名(是 / 否)
  2. 点名语境(正面 / 中性 / 负面)
  3. 同时出现的其他品牌
  4. 答案引用的来源域名

字段再多,执行就会走样。这四项已经足够支撑所有结论。

四、三个真正有用的指标

  • 被点名率:点名次数 ÷ 总组合数。最核心的那个数。
  • 相对份额:你的点名次数 ÷ 所有品牌点名总次数。它能排除「这个品类整体被提及变多」带来的假上涨。
  • 来源覆盖率:答案引用的域名里,有你内容的占比。这是先行指标 —— 它通常比被点名率更早出现变化。

注意一点:负面提及不算赢。被点名但语境是负面的,在统计上要单独拿出来,不能和正面提及混在一起充数。

五、线索侧怎么对上

GEO 带来的转化经常是断链的:用户看完答案直接打电话或直接搜品牌名。所以线索侧只能做近似归因:

  • 表单里加一项「您是怎么知道我们的」,把「AI / 大模型推荐」作为独立选项。
  • 关注品牌词搜索量的变化趋势。AI 推荐带来的一个典型后果是品牌词搜索上涨。
  • 销售接电话时问一句客户具体问了什么,这条信息还能反哺问题集。

不要对 GEO 强行做精确归因。能证明的是「被点名率上升、品牌词搜索同步上升」这样的相关性,把它如实讲清楚,比编一个精确的 ROI 数字更站得住。

六、多久测一次

一个月一次比较合适。更频繁会被生成式答案的随机波动淹没,更稀疏又来不及纠偏。

每轮出一份两页的东西就够:这轮的三个指标、和上一轮的差、变化最大的三条问题及原因推测。长报告没人看,也掩盖不了方法上的漏洞。