多模态这件事,在 GEO 里目前的实际影响比宣传的要小,但有几处是真的、现在就该做的。把这两者分开看,能省掉不少无效投入。
一、目前确定有用的:图片的文字信息
模型处理网页时,图片周边的文字信息是可靠的输入:
- `alt` 属性。 写清楚图里是什么,不要塞关键词。一张产品对比图的 alt 写成「产品对比图」等于没写,写成「六家 AI 平台信源偏好对比」才有信息量。
- 图注。 图片下方的说明文字是模型最容易取用的部分之一。重要的数据图一定要配一句能独立成立的图注。
- 文件名。 成本几乎为零,顺手写成有意义的英文或拼音即可。
一个常见的浪费:把关键数据做成图片,正文里一个字不写。模型读不到图里的数字,这块内容等于没有。重要的结论必须以文字形式在正文里出现一次,图只是辅助。
二、目前确定有用的:视频的文字伴随物
视频本身被直接理解的程度有限,但它的标题、简介、字幕、评论区是纯文本,这些是会被检索到的。
所以视频做 GEO 的重点不在画面,在:
- 标题用用户的问法,不用内部术语。
- 简介里把视频讲了什么、结论是什么写成一段完整的文字。
- 上传字幕文件,不要只靠平台自动识别。
- 在自己的官网上给视频配一篇图文版,正文里把关键结论写全。
三、还不确定的:不要过度投入
「让 AI 看懂你的产品图」这类说法目前更多是概念。各家对图片内容的实际利用程度差别很大,而且在商业推荐类问题上,权重明显低于文字信源。
所以现阶段合理的分配是:先把文字侧的信源矩阵做完整,再考虑多模态的增量。反过来做,投入会浪费在还没成熟的通道上。
四、一个例外:平台内的内容生态
有个方向值得现在就投:某些 AI 助手会检索其所在平台生态内的内容。在这类场景下,内容发在哪个平台,比它是图是文更重要。
判断方法很简单:在各平台跑一遍你的核心问题,看答案引用了哪些域名。如果某一家明显偏好某个内容社区,那就是需要布局的地方。
五、可以现在就做的清单
- 全站图片补 `alt`,重要图配图注。
- 数据类图片的核心结论在正文里写一遍。
- 视频标题按用户问法改写,简介补成完整段落,上传字幕。
- 官网给每条视频配图文版。
- 复测时记录引用来源,看有没有内容社区类的域名反复出现。
这五条都是低成本、当下就生效的。剩下的等各家能力再明确一些再说。