定义
AI 爬虫是模型厂商用来抓取网页内容的机器人 —— 用于训练、用于实时检索,或两者都有。每一个都用自己的 user agent 标识身份。
为什么重要
被抓到是被引用的前提。一个挡掉这些 UA 的站点 —— 无论是有意还是 CDN 默认 —— 在任何内容工作开始之前就已经出局了。
实际应用
用各家爬虫的 UA 实际发一次请求、看返回码。读一遍 robots.txt 不算测试。
相关词条
需结合理解的相关概念
先确认品牌当前在 AI 答案中的位置
按客户真实会问的问题,在各家 AI 平台完成一轮可见度诊断。首次现状评估不收费。