生成式引擎优化,也就是常说的 GEO,并不是营销圈先造出来的词。它最早是一篇计算机论文的标题,2023 年底挂到预印本网站,2024 年发表在数据挖掘领域的 KDD 会议上。后来市面上关于 GEO 是什么、GEO 原理是什么的说法,大多能追溯到这篇论文和它引出的几项后续研究。

问题在于,转述的过程中数字留下了,条件丢掉了。

这篇文章只做一件事:把研究原文里写了什么、没写什么对照着摆出来。

GEO 是什么,这个词最初指的是什么

论文给的定义很朴素:生成式引擎会先检索网页,再用大模型把多个来源合成为一段回答。内容方能做的,是调整自己网页的写法,让它在这段合成回答里占到更多篇幅、更靠前的位置。论文把这件事叫作生成式引擎优化。

注意这里的对象是网页写法,不是投放渠道,也不是账号运营。这决定了原始研究能回答的问题范围:同一篇内容,换一种写法,被合成进答案的程度会不会变。它回答不了投到哪里更有用,也回答不了品牌在整个品类里的份额。

这件事为什么值得研究,国内的数据给了背景。

5.15亿截至 2025 年 6 月我国生成式人工智能用户规模CNNIC
80.9%用生成式 AI 产品回答问题的用户占比,为各场景最高CNNIC
10000原始 GEO 论文构建的测试问题数量Aggarwal 等

GEO 研究结论里最常被引用的那组数字

研究者构建了一个一万条查询的测试集,叫 GEO-bench,用 GPT-3.5-turbo 充当生成式引擎,又在 Perplexity 上做了真实环境验证。他们测了九种改写方法,指标有两个:按位置加权的字数占比,以及一个主观印象分。

改写方法论文给出的结果
标注引用来源、加入引语、加入统计数据表现最好的三种,位置加权字数相对提升 30% 至 40%,主观印象提升 15% 至 30%
提升流畅度、易读化、权威语气、专业术语、独特用词同样测试,未进入表现最好的三种,效果因领域而异
关键词堆砌对生成式引擎的回答几乎没有改善

论文摘要里那个被广泛转述的数字是:GEO 最多可以把可见度提升 40%。

两个细节经常被略过。其一,这是相对提升,基数是原网页自己的占比,不是全网份额。其二,论文明确写到效果因领域而异,需要针对领域调整方法。一个在历史类问题上有效的写法,放到法律或医疗类问题上可能完全是另一回事。

GEO 原理:为什么引语和数据会被多用

论文没有给出一个关于机制的完整理论,但结果的方向本身很说明问题。引语、统计数据、明确标注的来源,这三样东西的共同点是可以被原样搬进答案。一段带数字的陈述,模型拿来就能用;一段形容词堆起来的宣传语,模型要么改写,要么跳过。

另一项 2023 年的研究从反方向印证了这一点。研究者人工审查了四个生成式搜索引擎的回答,发现只有 51.5% 的句子得到了引用来源的完整支持,而引用里真正支撑对应句子的只有 74.5%。

51.5%生成式搜索回答中被引用来源完整支持的句子比例Liu 等
74.5%引用中确实支撑其所在句子的比例Liu 等
115.1%排名第五的网页标注来源后的可见度提升Aggarwal 等

也就是说,生成式引擎在合成答案时本来就不太擅长把说法和出处严格对齐。内容里事实越具体、出处越清楚,被准确采用的机会越大。这不是讨好算法,而是降低了模型出错的空间。

关键词堆砌为什么在生成式引擎里失灵

在传统搜索里,关键词密度曾经有用过。论文的结论很直接:往内容里塞更多相关关键词,这种在搜索优化里被广泛使用的办法,对生成式引擎的回答几乎没有改善。

原因不难理解。生成式引擎输出的是改写后的一段话,不是网页原文的排序。重复的词不增加任何可被引用的信息量。

还有一个反直觉的结果:同样是标注来源,搜索结果排第五的网页可见度提升了 115.1%,排第一的网页平均反而下降了 30.3%。改写方法对原本弱势的内容更有帮助。这对规模不大的品牌是个好消息,但前提是内容里真的有东西可以被引用。

这些研究的样本是谁,哪些结论不能直接搬

这一节是转述时最常被删掉的部分。

原始论文的测试集里,80% 是信息类查询,交易类和导航类各占 10%。而品牌最关心的问题恰恰是交易类:哪家好、买哪个、选谁。样本结构和商业场景并不匹配。

被测的引擎也全部是海外产品。后续一项 2025 年的研究测了 Perplexity、Claude、Gemini 和 ChatGPT,发现 AI 搜索对第三方权威来源存在系统性偏好,远高于对品牌自有内容和社交内容的采用。汽车品类在加拿大的样本里,AI 搜索的引用有 69.1% 来自第三方媒体,社交内容为零;同一批查询在 Google 上,社交内容占 22.8%。

这项研究做过中文,但做法是把英文问题翻译成中文,再交给同样那几家海外引擎。DeepSeek、豆包、文心一言、通义千问、腾讯元宝、Kimi,没有一家在这些论文的被测名单里。

研究被测引擎查询构成与国内平台的距离
Aggarwal 等 2024GPT-3.5-turbo,Perplexity八成信息类引擎与查询结构都不同
Liu 等 2023四个海外生成式搜索多来源公开问题只审计引用质量
Chen 等 2025四个海外 AI 搜索汽车、电子、软件等含中文翻译查询,引擎仍是海外

研究同时提醒的另一面:操纵

GEO 的研究路线里还有一支专门研究攻击。一篇 2024 年的论文在虚构的咖啡机商品页里插入一段经过优化的文本序列,就明显提高了原本排名靠后的产品被大模型列为首选推荐的机会。另一篇论文在 Bing 和 Perplexity 等真实产品上演示了所谓偏好操纵攻击,结论是每一方都有动机去做,而集体的结果是所有人拿到的答案都变差。

这两篇论文说明的不是这条路能走,而是平台一定会补这个口子。依赖漏洞得来的可见度,寿命取决于平台修复的速度。

落到实际工作上,研究能指导什么

把研究和它的局限一起看,能留下来的判断其实不多,但都比较硬。可被引用的具体事实比形容词有用;第三方来源的分量在海外引擎上已经被测到很重;样本外的平台只能自己测。

我们在 GEO 服务 里把工作拆成机器可读、把材料放到模型会看的地方、用固定问题集反复测量这几块,最后一块正是对上面那个局限的回应:论文没测过的平台,只能靠自己的冻结问题集去测。词条层面的定义和常见误读,整理在 GEO 词条 里。

研究给的是方向,不是保证。一个在 GPT-3.5 上测出来的百分比,没有理由原样出现在另一家平台、另一个品类、另一个年份里。

参考来源