为什么这一步排在内容之前

官网是唯一完全由你控制的信源,也是模型需要核实时回溯查询的对象。若其无法被抓取、在不执行 JavaScript 的情况下无法读取,或内容自相矛盾,则在该环节,其他所有 GEO 工作的效果都会被削弱。

检查一:爬虫可达性

以各家 AI 爬虫的 UA 实际发起一次请求并查看返回码。仅查阅 robots.txt 不构成测试:该文件常已放行,而 CDN 或防火墙仍会拦截同一 UA。

随后测试未知路径。对不存在的路径返回 200 状态码与首页内容,等同于告知爬虫任意数量的无效地址均为有效页面。该情况极为常见,且在浏览器中完全无法察觉。

检查二:关闭 JavaScript 后的内容留存

在浏览器中关闭 JavaScript 后打开关键页面,剩余内容大致即为爬虫可见的内容。现代建站方案常将全部内容置于客户端渲染,使页面对多数爬虫而言是一个空壳。

检查三:结构是否显式表达

  • 每页一个 h1,标题层级不跳级。
  • 加粗文本不等于标题。模型读取的是标题层级,不会从样式中推断。
  • 并列信息用列表,对比用表格。
  • 关键事实须以文本形式存在,不应仅存在于图片中。

检查四:结构化数据

Organization 须包含法人全称、地址与电话;内容页添加 Article;问答块添加 FAQPage;位置信息使用 BreadcrumbList。仅标注页面上真实可见的内容:标记与可见内容不符属于违规,而非优化。

完整配置清单见官网 GEO 优化 15 项清单,实操细节见结构化数据实战

检查五:事实一致性

建立一份事实表,包含法人全称、成立时间、服务范围、地址与电话,并据此比对这些事实出现的每一处:官网、地图、平台资料、社交账号与百科词条。

此处的矛盾会降低模型对整个实体的确信度,而不限于出现矛盾的单个页面。该项盘点通常是整个项目中单位时间回报最高的工作。

检查六:canonical 与跳转

选定一个规范域名,其余域名跳转至该域名。确认 canonical 指向的是实际返回内容的地址,而非仍会再次跳转的地址。并检查链接中的尾斜杠口径与服务器实际行为是否一致。

最后加一份 llms.txt

置于站点根目录的纯文本索引,说明机构性质、重点页面与不提供的业务范围。成本接近于零。具体内容见术语表词条