官网是唯一完全由你控制的信源。模型对它的解读出问题,后面所有内容投放都要打折扣。这份清单按「先让它能读到,再让它读得懂,最后让它愿意引用」的顺序排。

一、可抓取性:先让爬虫进得来(5 项)

  1. robots.txt 放行 AI 爬虫。 明确列出 GPTBot、PerplexityBot、ClaudeBot、Bytespider、Baiduspider 等,不要只写 `User-agent: *` 就以为万事大吉 —— 很多站点的 CDN 规则比 robots 更严。
  2. 检查 CDN / 防火墙的 UA 拦截。 实际用各家爬虫的 UA 发一次请求,看返回码。这一步经常直接发现 403。
  3. 确认页面不靠 JavaScript 才有内容。 关掉 JS 打开官网,如果只剩一个空壳,爬虫看到的就是空壳。
  4. sitemap.xml 有效且被 robots 引用。 地址写规范形式,不要指向一串 301。
  5. 404 是真的 404。 不存在的路径返回 200 加首页,会让爬虫把无限多的垃圾地址当成有效页面 —— 这个坑非常常见。

二、结构化数据:让机器读得懂(5 项)

  1. Organization。 公司全称、法人主体、地址、电话、logo。这几项在工商与备案系统里可核查,是模型判断品牌真实性最硬的信号。
  2. 每页的 WebPage / Article。 标题、描述、语言、发布与更新时间。
  3. FAQPage。 问答型内容配 FAQ 结构化数据,这是被整段引用概率最高的形态之一。
  4. BreadcrumbList。 让模型知道这一页在站点结构里的位置。
  5. 实体信息跨页一致。 公司名、成立时间、服务范围在不同页面上必须一模一样。对不上,模型会降低对整个实体的确信度。

三、内容架构:让它愿意引用(5 项)

  1. 每页有且只有一个 `h1`,标题层级不跳级。 用加粗冒充标题,结构信号就没了。
  2. canonical 指向真实可访问的规范地址。 带不带尾斜杠要和服务器实际行为一致,否则每一页的规范地址都指向一个跳转。
  3. 多语言版本用 hreflang 互指,x-default 指向主受众的语言版本。
  4. 关键事实写成可核查的具体表述。 「响应快」换成「工作日 30 分钟内响应」。
  5. 加一份 `llms.txt`。 面向大模型的站点索引,把主要页面、主体信息和「我们不做什么」写清楚。这是新兴约定,成本极低。

怎么用这份清单

按顺序做。第一模块没过,后面两块的收益都是零 —— 爬虫进不来,结构化数据写得再全也没人读。

做完一轮之后,用固定的一组客户问题在各 AI 平台复测一次,对比基线。官网侧的修复通常是所有 GEO 动作里见效最快、成本最低的一块,值得先做完再谈投放。