生成式引擎优化,也就是常说的 GEO,并不是营销圈先造出来的词。它最早是一篇计算机论文的标题,2023 年底挂到预印本网站,2024 年发表在数据挖掘领域的 KDD 会议上。后来市面上关于 GEO 是什么、GEO 原理是什么的说法,大多能追溯到这篇论文和它引出的几项后续研究。
问题在于,转述的过程中数字留下了,条件丢掉了。
这篇文章只做一件事:把研究原文里写了什么、没写什么对照着摆出来。
GEO 是什么,这个词最初指的是什么
论文给的定义很朴素:生成式引擎会先检索网页,再用大模型把多个来源合成为一段回答。内容方能做的,是调整自己网页的写法,让它在这段合成回答里占到更多篇幅、更靠前的位置。论文把这件事叫作生成式引擎优化。
注意这里的对象是网页写法,不是投放渠道,也不是账号运营。这决定了原始研究能回答的问题范围:同一篇内容,换一种写法,被合成进答案的程度会不会变。它回答不了投到哪里更有用,也回答不了品牌在整个品类里的份额。
这件事为什么值得研究,国内的数据给了背景。
GEO 研究结论里最常被引用的那组数字
研究者构建了一个一万条查询的测试集,叫 GEO-bench,用 GPT-3.5-turbo 充当生成式引擎,又在 Perplexity 上做了真实环境验证。他们测了九种改写方法,指标有两个:按位置加权的字数占比,以及一个主观印象分。
| 改写方法 | 论文给出的结果 |
|---|---|
| 标注引用来源、加入引语、加入统计数据 | 表现最好的三种,位置加权字数相对提升 30% 至 40%,主观印象提升 15% 至 30% |
| 提升流畅度、易读化、权威语气、专业术语、独特用词 | 同样测试,未进入表现最好的三种,效果因领域而异 |
| 关键词堆砌 | 对生成式引擎的回答几乎没有改善 |
论文摘要里那个被广泛转述的数字是:GEO 最多可以把可见度提升 40%。
两个细节经常被略过。其一,这是相对提升,基数是原网页自己的占比,不是全网份额。其二,论文明确写到效果因领域而异,需要针对领域调整方法。一个在历史类问题上有效的写法,放到法律或医疗类问题上可能完全是另一回事。
GEO 原理:为什么引语和数据会被多用
论文没有给出一个关于机制的完整理论,但结果的方向本身很说明问题。引语、统计数据、明确标注的来源,这三样东西的共同点是可以被原样搬进答案。一段带数字的陈述,模型拿来就能用;一段形容词堆起来的宣传语,模型要么改写,要么跳过。
另一项 2023 年的研究从反方向印证了这一点。研究者人工审查了四个生成式搜索引擎的回答,发现只有 51.5% 的句子得到了引用来源的完整支持,而引用里真正支撑对应句子的只有 74.5%。
也就是说,生成式引擎在合成答案时本来就不太擅长把说法和出处严格对齐。内容里事实越具体、出处越清楚,被准确采用的机会越大。这不是讨好算法,而是降低了模型出错的空间。
关键词堆砌为什么在生成式引擎里失灵
在传统搜索里,关键词密度曾经有用过。论文的结论很直接:往内容里塞更多相关关键词,这种在搜索优化里被广泛使用的办法,对生成式引擎的回答几乎没有改善。
原因不难理解。生成式引擎输出的是改写后的一段话,不是网页原文的排序。重复的词不增加任何可被引用的信息量。
还有一个反直觉的结果:同样是标注来源,搜索结果排第五的网页可见度提升了 115.1%,排第一的网页平均反而下降了 30.3%。改写方法对原本弱势的内容更有帮助。这对规模不大的品牌是个好消息,但前提是内容里真的有东西可以被引用。
这些研究的样本是谁,哪些结论不能直接搬
这一节是转述时最常被删掉的部分。
原始论文的测试集里,80% 是信息类查询,交易类和导航类各占 10%。而品牌最关心的问题恰恰是交易类:哪家好、买哪个、选谁。样本结构和商业场景并不匹配。
被测的引擎也全部是海外产品。后续一项 2025 年的研究测了 Perplexity、Claude、Gemini 和 ChatGPT,发现 AI 搜索对第三方权威来源存在系统性偏好,远高于对品牌自有内容和社交内容的采用。汽车品类在加拿大的样本里,AI 搜索的引用有 69.1% 来自第三方媒体,社交内容为零;同一批查询在 Google 上,社交内容占 22.8%。
这项研究做过中文,但做法是把英文问题翻译成中文,再交给同样那几家海外引擎。DeepSeek、豆包、文心一言、通义千问、腾讯元宝、Kimi,没有一家在这些论文的被测名单里。
| 研究 | 被测引擎 | 查询构成 | 与国内平台的距离 |
|---|---|---|---|
| Aggarwal 等 2024 | GPT-3.5-turbo,Perplexity | 八成信息类 | 引擎与查询结构都不同 |
| Liu 等 2023 | 四个海外生成式搜索 | 多来源公开问题 | 只审计引用质量 |
| Chen 等 2025 | 四个海外 AI 搜索 | 汽车、电子、软件等 | 含中文翻译查询,引擎仍是海外 |
研究同时提醒的另一面:操纵
GEO 的研究路线里还有一支专门研究攻击。一篇 2024 年的论文在虚构的咖啡机商品页里插入一段经过优化的文本序列,就明显提高了原本排名靠后的产品被大模型列为首选推荐的机会。另一篇论文在 Bing 和 Perplexity 等真实产品上演示了所谓偏好操纵攻击,结论是每一方都有动机去做,而集体的结果是所有人拿到的答案都变差。
这两篇论文说明的不是这条路能走,而是平台一定会补这个口子。依赖漏洞得来的可见度,寿命取决于平台修复的速度。
落到实际工作上,研究能指导什么
把研究和它的局限一起看,能留下来的判断其实不多,但都比较硬。可被引用的具体事实比形容词有用;第三方来源的分量在海外引擎上已经被测到很重;样本外的平台只能自己测。
我们在 GEO 服务 里把工作拆成机器可读、把材料放到模型会看的地方、用固定问题集反复测量这几块,最后一块正是对上面那个局限的回应:论文没测过的平台,只能靠自己的冻结问题集去测。词条层面的定义和常见误读,整理在 GEO 词条 里。
研究给的是方向,不是保证。一个在 GPT-3.5 上测出来的百分比,没有理由原样出现在另一家平台、另一个品类、另一个年份里。
参考来源
- Aggarwal, P., Murahari, V., Rajpurohit, T., Kalyan, A., Narasimhan, K., & Deshpande, A. (2024). GEO: Generative Engine Optimization. Proceedings of KDD 2024.
- Liu, N. F., Zhang, T., & Liang, P. (2023). Evaluating Verifiability in Generative Search Engines. Findings of EMNLP 2023.
- Chen, M., Wang, X., Chen, K., & Koudas, N. (2025). Generative Engine Optimization: How to Dominate AI Search. arXiv.
- Kumar, A., & Lakkaraju, H. (2024). Manipulating Large Language Models to Increase Product Visibility. arXiv.
- Nestaas, F., Debenedetti, E., & Tramèr, F. (2024). Adversarial Search Engine Optimization for Large Language Models. arXiv.
- 中国互联网络信息中心 (2025). 生成式人工智能应用发展报告(2025). CNNIC.
- 中国互联网络信息中心 (2025). 我国生成式人工智能用户规模实现翻一番. CNNIC.