官网是唯一完全由你控制的信源。模型对它的解读出问题,后面所有内容投放都要打折扣。这份清单按「先让它能读到,再让它读得懂,最后让它愿意引用」的顺序排。
一、可抓取性:先让爬虫进得来(5 项)
- robots.txt 放行 AI 爬虫。 明确列出 GPTBot、PerplexityBot、ClaudeBot、Bytespider、Baiduspider 等,不要只写 `User-agent: *` 就以为万事大吉 —— 很多站点的 CDN 规则比 robots 更严。
- 检查 CDN / 防火墙的 UA 拦截。 实际用各家爬虫的 UA 发一次请求,看返回码。这一步经常直接发现 403。
- 确认页面不靠 JavaScript 才有内容。 关掉 JS 打开官网,如果只剩一个空壳,爬虫看到的就是空壳。
- sitemap.xml 有效且被 robots 引用。 地址写规范形式,不要指向一串 301。
- 404 是真的 404。 不存在的路径返回 200 加首页,会让爬虫把无限多的垃圾地址当成有效页面 —— 这个坑非常常见。
二、结构化数据:让机器读得懂(5 项)
- Organization。 公司全称、法人主体、地址、电话、logo。这几项在工商与备案系统里可核查,是模型判断品牌真实性最硬的信号。
- 每页的 WebPage / Article。 标题、描述、语言、发布与更新时间。
- FAQPage。 问答型内容配 FAQ 结构化数据,这是被整段引用概率最高的形态之一。
- BreadcrumbList。 让模型知道这一页在站点结构里的位置。
- 实体信息跨页一致。 公司名、成立时间、服务范围在不同页面上必须一模一样。对不上,模型会降低对整个实体的确信度。
三、内容架构:让它愿意引用(5 项)
- 每页有且只有一个 `h1`,标题层级不跳级。 用加粗冒充标题,结构信号就没了。
- canonical 指向真实可访问的规范地址。 带不带尾斜杠要和服务器实际行为一致,否则每一页的规范地址都指向一个跳转。
- 多语言版本用 hreflang 互指,x-default 指向主受众的语言版本。
- 关键事实写成可核查的具体表述。 「响应快」换成「工作日 30 分钟内响应」。
- 加一份 `llms.txt`。 面向大模型的站点索引,把主要页面、主体信息和「我们不做什么」写清楚。这是新兴约定,成本极低。
怎么用这份清单
按顺序做。第一模块没过,后面两块的收益都是零 —— 爬虫进不来,结构化数据写得再全也没人读。
做完一轮之后,用固定的一组客户问题在各 AI 平台复测一次,对比基线。官网侧的修复通常是所有 GEO 动作里见效最快、成本最低的一块,值得先做完再谈投放。