一份 GEO 合同里,价格、周期、服务范围通常写得很细,验收那一栏却常常只有一句「提升品牌在 AI 平台的曝光度」。这句话签的时候没人反对,结项的时候谁也说服不了谁。

问题不在于哪一方不诚实。这句话本身没有给出任何可以核对的对象。

GEO 合同里的验收条款为什么经常是空的

《民法典》第四百七十条列出合同一般包括的条款,「质量」单独占一项。第五百一十一条接着规定:质量要求不明确、又无法补充协商的,依次按强制性国家标准、推荐性国家标准、行业标准履行;都没有的,按通常标准或者符合合同目的的特定标准履行。

GEO 眼下既没有国家标准,也没有行业标准。落到这类合同上,一旦验收条款写空,最后能援引的只剩「通常标准」和「合同目的」,而这恰恰是双方理解分歧最大的地方。验收条款写得越虚,结项时的争议就越依赖事后解释。

外包的 GEO 服务在法律上归入哪一类合同,要看具体约定,这里不下结论。承揽合同一章的思路倒是值得借用:第七百八十条要求承揽人交付工作成果并提供必要的技术资料,定作人应当验收。把这个结构搬到 GEO 上,验收对象就不该是一句结论,而是一组能复核的记录。

为什么一张截图撑不起 GEO 效果验收

很多服务商的阶段汇报是一组截图:某个问题问下去,答案里出现了客户的品牌名。截图是真的,但它只证明了一次。

Ouyang 等人发表在 ACM TOSEM 的研究,对 829 个代码生成题目反复向 ChatGPT 发出相同请求,在 CodeContests 数据集上,不同请求之间测试输出完全不相同的题目占 75.76%;把温度参数调到 0 能减弱这种不确定性,但不能消除。这项研究测的是代码,不是品牌推荐。它说明的机制却是共通的:同一个问题问两次,答案可以不一样。

GEO 方向的学术研究本身也是按这个前提做实验的。Aggarwal 等人在 KDD 2024 发表的 GEO 论文,对每个查询生成 5 个不同回答再取平均,用来压低随机波动。

75.76%重复请求同一代码题时,各次测试输出互不相同的题目占比,CodeContests 数据集Ouyang 等 2024
5 个GEO 论文实验中每个查询采样的回答数量,用于压低随机波动Aggarwal 等 2024
40%GEO 论文在其自建基准上报告的可见度最高提升幅度Aggarwal 等 2024

最后那个 40% 经常被服务商拿来当宣传口径。它是实验室基准上的上限,测的是论文作者设计的生成式引擎和查询集,不是国内任何一家平台,更不是某个具体品牌的承诺值。合同里出现这个数字,值得多问一句它从哪来。

截图的问题正在于此。服务商可以多问几次,挑出现了品牌名的那一次截下来;客户自己问一次没看到,也不能据此说没效果。两边拿到的都是单个样本,谁都证明不了什么。

GEO 效果验收标准可以写哪几条

能写进合同的验收标准,共同点是事后能被第三方复核。下面这张表把常见的写法分成两列:

条款可以验收的写法无法验收的写法
测量对象冻结的问题集作为合同附件,连标点一起固定「核心关键词」但不列清单
测量方法写明平台、每题测量次数、联网与非联网分别记录「定期监测」
指标被点名率、声量份额、来源覆盖率,按平台分列合成的「AI 排名」分值
证据每轮交付问题原文、答案全文、被引用链接挑选过的截图集
结果义务按周期复测并如实汇报升降及原因保证进入前三名或保证被推荐

左边一列的每一项,都能在结项时拿出文件对照。右边一列的每一项,结项时都只能靠口头解释。

表里没有列出的一个前提是基线。验收比的是前后差异,「前」必须在任何改动开始之前测好,并且和后续各轮用同一套问题、同一套条件。签约之后、内容已经开始投放才补测的数字,只能叫一次抽查,拿它当起点,后面所有的「提升」都说不清有多少是工作带来的。所以合同里最好把基线报告列为第一项交付物,并写明它的测量日期早于首批内容发布。

其中最关键的是问题集冻结。服务期内一旦悄悄换掉几道题,前后两轮的数字就不再可比,哪怕每一轮单独看都是真的。确实需要新增问题时,旧问题集要继续并行测量。复测与验收的完整方法里把这一条和另外两条合同条款放在一起讲过,这里不重复。

GEO 合同能不能约定「保证被 AI 推荐」

写不进去,也不该写。

原因有两层。第一层是上面那项研究说明的:答案本身在波动,「被推荐」这个状态在不同次运行之间就不稳定,没有一个固定位置可以保证。第二层是平台的取材与排序方式不公开,任何一家服务商都控制不了平台。承诺一个自己控制不了的结果,要么是没弄懂机制,要么是准备在结项时换一种算法来兑现。

能写进去的是过程义务:按约定周期复测、按约定格式交付原始记录、每一篇内容发布前经委托方确认。结果那一侧,写成汇报义务比写成保证更站得住,即如实报告升了多少、降了多少、最可能的原因是什么。

我们自己的方法也没办法消除波动,只能靠固定条件和多次测量,把它压到前后可以比较的范围。某一轮没有上升,这种情况会出现,而且应当被如实写进报告。

签约之前怎样核对服务商给的数字

最直接的办法是抽测。拿冻结问题集里的一部分,在相同平台、相同联网设置下自己问几轮,再和服务商交来的答案原文对照。两边数字对得上,说明方法是一致的;对不上,双方的原始记录能指出分歧出在哪一步,是问题措辞变了,是平台设置不同,还是计数规则有差异。

这件事不需要专门工具,花半天就能做完。自己做还是找服务商那篇对比里也提到,测量自己做、其余环节外包,是一种合理的分工,它顺带给了委托方一个独立核对的手段。

数字没有变化的一轮算不算没完成

这要看是哪个数字没变。来源覆盖率动了、被点名率没动,说明投放的材料已经被读到,只是还没被优先采用,工作在起作用,问题在内容本身。三项指标都没动,而且这一轮也没有记录到模型版本变化,才更接近真正无效的一轮。

建议把「无效轮次」的判定规则在签约时写下来。写在前面,结项时核对的是事实;等到结项再讨论,核对的就变成了措辞。

参考来源