清单本身就是测量口径
问题换了,所有数字都会跟着变。因此清单必须在第一轮测量前固定,直到复测为止不再改动,否则两轮之间无法比较。应当把它当作调研工具看待。
问题从哪里来
四个来源,按可靠性排列。销售通话记录与售前咨询记录,因为那是客户真实问过的话;搜索后台已经带来流量的查询词;客服工单,它反映的是阻碍成交的疑虑;竞品对比页,它说明市场认为的替代方案是什么。
不属于来源的是关键词工具导出。关键词不是问题。「GEO 优化」说明不了提问者想知道什么,模型收到这种输入只会给出定义,而不是推荐。
点名问题必须单独统计
已经包含品牌名的问题测不出可见度。问模型「某某品牌靠谱吗」,它当然会提到这个品牌,因为名字是你放进去的。与品类问题混在一起统计,少数几道点名问题就会把整体数值抬上去,而这个抬升完全是人为的。
这类问题仍然要保留、要测、要单独报告:它回答的是另一个确实有用的问题 —— 当别人已经知道你的名字时,模型会怎么评价你。
多少题才够
标准是:任何单独一道题改变答案,都不会显著移动总体数值。低于二十题时,一道题就值五个百分点,曲线会出现没有实际原因的波动。超过一百题之后,新增的题通常只是已有问题的变体。
冻结并记录版本
给清单标上版本号与日期。后续增加问题时应当新建版本,而不是在旧版本上追加,并在报告中注明每一轮使用的是哪个版本。用 40 题的一轮去比 60 题的一轮,是测量序列悄悄失去意义的最常见方式。