问 AI「GEO 服务商哪家好」,答案里出现的多半是几个反复被提到的名字。换成「深圳做代理记账的小公司,想在豆包里被推荐,第一步该做什么」,模型要同时处理地域、行业、平台三个限定条件,全网能直接回答这个组合的材料少得多,头部品牌的名气在这里未必派得上用场。
这就是长尾问题值得单独讨论的原因。它不是「搜索量小的关键词」换了个说法,而是另一种问法,对应模型另一种取材方式。
长尾问题和长尾词是一回事吗
在传统搜索里,长尾词指的是由多个词组合、单条搜索量低、合起来总量可观的查询。放到 AI 问答里,同样的现象换了形态:人们不再把问题压缩成三四个关键词,而是直接用整句描述自己的处境。
Pew Research Center 在 2025 年发表的一项研究可以说明这种差别。研究者分析了 900 名美国成年人在 2025 年 3 月的真实浏览数据,共 68879 次 Google 搜索。只有一两个词的搜索,8% 出现了 AI 摘要;十个词以上的搜索,这个比例是 53%;以问句形式提出的搜索,比例达到 60%。
这组数据的样本是美国用户和 Google,不能直接套到国内的豆包、DeepSeek 或文心一言上。但它指向的方向很清楚:问题越长、越具体,越可能落进生成式答案的范围。长尾问题恰好就是这一类。
为什么模型在具体问题上更依赖检索到的材料
研究显示,模型记得住的主要是被大量文本反复提及的知识。 Kandpal 等人 2023 年发表在 ICML 的论文发现,模型能否答对一个事实问题,和预训练语料里与这个问题相关的文档数量直接相关;相关文档越少,答对的概率越低,而靠扩大模型规模来弥补,需要的规模增长是数量级的。论文同时指出,检索增强能降低模型对预训练知识的依赖。
Mallen 等人同年在 ACL 发表的研究得出了相近的结论。他们用约 1.4 万个问题测试了 10 个模型,发现模型在冷门实体上表现明显变差,扩大规模也改善有限;带检索的小模型在这类问题上大幅胜过规模大得多的模型,而在热门实体上,不带检索的模型仍有竞争力。
把这两项研究放到品牌推荐的语境里,可以得到一个推论:在品类大词上,模型对头部品牌已有相当多的既有知识,答案里点谁,很大程度上取决于训练语料里谁被提得多;在长尾问题上,模型自己「记得」的东西不够,更依赖联网检索当场找到的材料。
需要说明的是,这两篇论文研究的是事实问答,不是品牌推荐。上面的推论是合理延伸,不是它们直接证明的结论。
| 维度 | 品类大词 | 长尾问题 |
|---|---|---|
| 典型问法 | 某品类哪家好 | 某地区、某行业、某条件下怎么选 |
| 模型的主要依据 | 训练语料里的既有印象加检索 | 更依赖当场检索到的材料 |
| 能直接回答的材料数量 | 多,头部品牌占优 | 少,候选池浅 |
| 新品牌的进入难度 | 高 | 相对低 |
| 单个问题的商业量 | 大 | 小,合起来可观 |
| 容易犯的错 | 只盯着这一层 | 把长尾当成堆关键词 |
长尾词与 AI 推荐:什么样的材料会被拿来回答
既然长尾问题的答案更依赖检索材料,接下来的问题就是:什么样的材料更容易被模型采用。
Aggarwal 等人提出「生成式引擎优化」这一概念的论文,2024 年发表在 KDD,给出了目前最系统的实验证据。研究者构建了包含 1 万个查询的 GEO-bench,比较了多种改写方法对内容在生成式答案中可见度的影响。加入引用来源、加入引语、加入统计数据这几种方法,在位置加权的字数指标上带来了 30% 到 40% 的相对提升;而关键词堆砌这种传统做法,几乎没有带来改善。
对长尾问题更有意思的是另一个发现:对原本在搜索结果中排名第五的网站,「引用来源」这一方法让其可见度提升了 115.1%,而排名第一的网站平均下降了 30.3%。
这项实验是在研究者自己搭建的生成式引擎上完成的,没有涉及国内平台,数值不能照搬。它能说明的是一种结构性倾向:内容本身的可引用程度,可以部分抵消原有排名的劣势。长尾问题上的新品牌,处境正好类似于那个排名第五的网站。
落到写法上,这意味着一篇面向长尾问题的材料,最好把限定条件写进正文,把结论放在前面,并给出可以核对的事实和出处。一篇泛泛介绍公司实力的文章,在任何具体问题上都很难被整段拿去用。
具体问题里被 AI 点名,先得知道是哪些问题
长尾问题的难点不在写,而在选。
关键词工具给出的长尾词,反映的是过去人们在搜索框里打了什么,不一定是现在人们会怎样问 AI。更可靠的来源是销售和客服的对话记录:客户第一次联系时怎么描述自己的需求,用的是哪些词,带着哪些限定条件。这些原话往往就是现成的长尾问题。
问题选定之后,要先测一轮现状,再动手写内容。在固定的问题集上,记录每个平台的答案里有没有点名、在什么语境下点名、同时出现了哪些品牌、引用了哪些来源域名。我们的 AI 可见度诊断 做的就是这件事,问题集取自企业自己的客户原话,并在服务期内冻结不变,这样后面的任何变化才有比较的基准。
没有这一步,长尾内容写了多少篇都无法判断有没有用。某个问题上本来就被点名了,再写一篇是浪费;某个问题上答案引用的全是行业媒体,只在官网发一篇很可能不够。
长尾策略做不到的事
长尾问题是进入成本最低的一层,但它有明确的边界。
最常见的误解,是把它当成通往品类大词的捷径。品类问题的商业价值最高,也最难只靠自有渠道打动,模型回答这类问题时倾向于引用第三方来源。长尾上的进展,不能直接换算成品类问题上的进展,汇报时也不该混在一起。
单个长尾问题的量确实小,价值来自覆盖的数量。这意味着持续的内容投入,写几篇就停下,结果多半看不出来。
还有研究本身的局限。Pew 的样本是美国的 Google 用户,两篇长尾知识论文研究的是事实问答,GEO 论文用的是实验环境。方向一致,可没有一项是在国内 AI 平台上测品牌推荐。放到具体品类里,结论只能靠自己的问题集去测。
关于长尾问题在术语上的定义,以及它和品类词、语义词组的关系,可以参考词条 长尾语义词。
参考来源
- Chapekis, A. & Lieb, A. (2025). Google users are less likely to click on links when an AI summary appears in the results. Pew Research Center.
- Kandpal, N., Deng, H., Roberts, A., Wallace, E. & Raffel, C. (2023). Large Language Models Struggle to Learn Long-Tail Knowledge. ICML 2023.
- Mallen, A., Asai, A., Zhong, V., Das, R., Khashabi, D. & Hajishirzi, H. (2023). When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories. ACL 2023.
- Aggarwal, P., Murahari, V., Rajpurohit, T., Kalyan, A., Narasimhan, K. & Deshpande, A. (2024). GEO: Generative Engine Optimization. KDD 2024.