官网把 GEO 服务拆成四个环节,各自独立成页:AI 可见度诊断、内容生产与信源投放、效果监测、官网 AI 可读性体检。
为什么要拆
一个服务页写完整套流程,读者很难判断自己现在需要哪一段。
实际情况是:有的客户只想先知道现状;有的已经测过、想解决内容问题;有的站点基础还没做好,谈投放为时尚早。拆开之后可以从任一环节进入。
拆开也让顺序关系更清楚。四个环节是有次序的:先测基线,再修站点基础,然后产内容与投放,最后复测。
跳过前面直接做后面,工作仍然会发生,只是无法评估效果。实际项目里最常见的错误是先产内容,半年后才开始测量,结果最有价值的那段变化没有记录。
| 环节 | 解决什么 | 交付物 | 典型周期 |
|---|---|---|---|
| 可见度诊断 | 现在是什么状况 | 书面基线与答案全文 | 七到十个工作日 |
| 官网体检 | 有没有技术障碍 | 逐项判定与实测证据 | 与诊断并行 |
| 内容与信源 | 有没有可引用的材料 | 页面与投放记录 | 按月 |
| 效果监测 | 变化是谁带来的 | 按轮次报表与归档 | 按月,需连续 |
诊断和体检为什么可以并行
次序上诊断在体检之前,时间上两者可以同时开始。
原因是它们互不依赖。诊断测的是模型现在怎么回答客户真会问的那些问题,这和站点改没改无关。体检查的是技术障碍,和模型怎么回答无关。
真正的次序要求是另一条:体检发现的修复必须在内容产出之前完成。首屏正文不在服务端返回的那份 HTML 里的时候,写多少内容都不计入。
前两个数字说明技术层面的基础失误在真实样本里并不罕见。第三个数字说明为什么监测必须连续且每题重复多次:生成式回答本身带着不小的噪声,单次结果不构成证据。
每页都写了不包含什么
四页都有一段说明服务范围之外的内容。
诊断不包含修复。它交的是一份现状,不含改动。
体检不包含代码改造。涉及渲染方式调整的,由客户的开发执行,我们提供问题定位与证据。
内容与信源不包含事实供给。内容里需要的具体数值、流程、边界只有客户的业务部门清楚,这一段无法外包。
监测不包含效果承诺。它交的是可比的数据,不是达到某个数值的保证。
这一部分通常是询价时最容易产生误会的地方。写在页面上,比等到报价环节再逐条解释更有效率,也让客户能提前判断我们是否合适。
第四个环节之后还有一轮,但它不单独成页
严格说流程不止四段。复测之后还有一段,就是根据复测结果决定下一轮做什么。
这一段没有单独成页,因为它不是一项可以单独购买的服务,而是监测环节的一部分。但它的内容值得说一句:复测拿到的不只是数字,还有答案原文的变化。原文里经常能看到比数字更有用的东西,比如模型开始引用某一页了,或者描述方式从笼统变成了具体。
这些观察决定下一轮的重点。看到某一类页面的引用效率明显高,就加强那一类;看到某一组问题的名单连续几轮纹丝不动,就把它移出主攻列表。
不把这一段写成独立服务,是因为把它单卖容易变成按月出一份报告而没有人对解释负责。它应当和监测绑在一起,由同一个人既出数据又给判断。
报价为什么在诊断之后
代运营服务的工作量取决于站点现状、要追踪的问题数量、竞品数量和现有内容基础,差异可能达到数倍。固定价目表无法如实反映。
所以先做一轮诊断看清现状,再给报价,对双方都更准确。首次现状评估不收费,报告无论是否继续合作都归客户所有。
这一条还有一个方法上的理由:签约之后才存在的基线起不到基线的作用,因为它已经包含了签约前为准备演示而做的改动。
工作台套餐的情况不同,档位与价格在套餐页上是公开的,因为那一侧的工作量由档位本身界定。
四个环节各自交付什么
交付物的形态决定了这件服务能不能被核对,所以逐个说明。
诊断交的是一份书面基线。里面有问题集原文、每题的提问次数与条件、每一条答案的全文,以及按意图分组的统计结果。注意答案全文是必须项而不是附件:复测时需要比对的是两段话的具体差异,只存百分比的报告到了第二轮什么都说明不了。
体检交的是逐项判定。每一项附实测证据,判定首屏正文不在服务端返回的 HTML 里时附源码片段,判定抓取器被拒时附访问日志里的请求记录与返回码。不给结论式的分数。
内容与信源交的是页面与投放记录。页面在发布前由客户确认,发布后记录写入位置与时间。
监测交的是按轮次的报表与答案归档,报表里把能归因的和不能归因的分开写。
四样的共同点是都能被核对,而不是一个结论。这一点是拆开成四页之后更容易说清楚的:每一页都能把自己的交付物讲具体。
不拆开会发生什么
拆开之前这些内容在一个服务页上,实际遇到的问题有三种。
客户看完不知道自己该买哪一段,于是倾向于要一个全包方案,而全包方案在预算评估阶段更容易被否掉。
技术修复这一段被淹没了。它在整条链路里投入产出最明确,周期也最短,但写在一个长页面的中间位置时,没有人会单独来问。
范围之外的内容说不清。一个页面里只能有一段讲不包含什么,而四个环节的边界各不相同,压在一起写就只能写得笼统,而笼统的边界说明等于没有说明。
拆开之后这三件事都好办了。附带的效果是每一页都可以针对自己那一段写得更具体,而具体的页面在被引用时才有位置。
四个环节里最容易被省掉的那个
是监测。
它不产出任何可见的东西,所以预算紧的时候第一个被砍。而它一断,之前所有的对比就没了,前面的投入变成不可评估的。
更具体地说,第一轮测量只是一个数,意义不大;从第二轮开始才有了比较,才能分辨某个变化是自己做出来的,还是模型版本更新带来的。只做第一轮等于把最贵的那部分买了一半。
如果预算确实不够,正确的省法是降规模而不是降频率:三十道题比三百道少十倍工作量,但只要口径不变,时间序列同样有效。
四个环节各自的交付物与边界,见GEO 服务。首轮现状评估包含什么、报告里有哪些字段,见AI 可见度诊断。
参考来源
- HTTP Archive (2024). Web Almanac 2024: SEO. HTTP Archive.
- Atil, B., Aykent, S., Chittams, A., et al. (2024). Non-Determinism of "Deterministic" LLM Settings. arXiv.
- Liu, N. F., Zhang, T., & Liang, P. (2023). Evaluating Verifiability in Generative Search Engines. EMNLP 2023 Findings.
- Aggarwal, P., Murahari, V., Rajpurohit, T., Kalyan, A., Narasimhan, K., & Deshpande, A. (2024). GEO: Generative Engine Optimization. Proceedings of KDD 2024.