GEO 最容易出问题的地方不是执行,是验收。因为生成式答案本身是浮动的,所以只要测量方法不固定,任何结论都能被「说成」有效。
这篇讲的是怎么把测量方法固定下来。
一、先冻结问题集
第一步,也是决定后面一切是否成立的一步:把用来衡量效果的那组问题写死。
- 数量 15 到 30 条,覆盖认知、对比、决策三类意图。
- 用词固定,包括标点。改一个字,结果就不能和上一轮比。
- 单独存档,和「用来扩展业务的词表」分开管理。词表可以随时加,问题集不行。
问题集一旦冻结,「提升了多少」才有意义。
二、统一执行条件
同一批问题,在各平台之间也要统一条件:
- 是否开启联网搜索:分开记录,不要混在一个平均数里。
- 账号状态:尽量用同一种状态(都登录或都不登录),个性化会影响结果。
- 时间:同一轮测量集中在一两天内跑完。
- 每条问题跑几次:生成式答案有随机性,跑三次取出现比例,比跑一次可靠得多。
三、记录四个字段,不要更多
每次测量对每个「问题 × 平台」记四项:
- 是否点名(是 / 否)
- 点名语境(正面 / 中性 / 负面)
- 同时出现的其他品牌
- 答案引用的来源域名
字段再多,执行就会走样。这四项已经足够支撑所有结论。
四、三个真正有用的指标
- 被点名率:点名次数 ÷ 总组合数。最核心的那个数。
- 相对份额:你的点名次数 ÷ 所有品牌点名总次数。它能排除「这个品类整体被提及变多」带来的假上涨。
- 来源覆盖率:答案引用的域名里,有你内容的占比。这是先行指标 —— 它通常比被点名率更早出现变化。
注意一点:负面提及不算赢。被点名但语境是负面的,在统计上要单独拿出来,不能和正面提及混在一起充数。
五、线索侧怎么对上
GEO 带来的转化经常是断链的:用户看完答案直接打电话或直接搜品牌名。所以线索侧只能做近似归因:
- 表单里加一项「您是怎么知道我们的」,把「AI / 大模型推荐」作为独立选项。
- 关注品牌词搜索量的变化趋势。AI 推荐带来的一个典型后果是品牌词搜索上涨。
- 销售接电话时问一句客户具体问了什么,这条信息还能反哺问题集。
不要对 GEO 强行做精确归因。能证明的是「被点名率上升、品牌词搜索同步上升」这样的相关性,把它如实讲清楚,比编一个精确的 ROI 数字更站得住。
六、多久测一次
一个月一次比较合适。更频繁会被生成式答案的随机波动淹没,更稀疏又来不及纠偏。
每轮出一份两页的东西就够:这轮的三个指标、和上一轮的差、变化最大的三条问题及原因推测。长报告没人看,也掩盖不了方法上的漏洞。