这个文件要解决什么
爬虫到达一个站点后,必须判断哪些页面承载着值得一读的主张。在大站上这种推断成本很高而且经常判错 —— 它会把预算花在分类列表和标签归档上。这个文件的作用是直说:这些页面能回答问题,每一个回答的是什么。
为什么照抄 sitemap 等于白做
sitemap 列出一切,而那恰恰是这个文件要解决的问题。四百条没有任何说明的 URL,提供的信息并不比直接爬一遍更多。二十到五十条、每条附一句说明该页确立了什么,才是有用的形态。
好条目长什么样
一个链接,加一句描述该页提出的主张 —— 不是它的标题。「价格」是标题。「五个档位的公开价格,以及每档配额实际允许做什么」是主张。后者能让爬虫判断,针对手头这个问题,这个页面值不值得取回。
条目按提问方式分组:这项服务是什么、多少钱、怎么交付、适合谁、有什么限制。限制那一组是大多数站点会省略、却最可能被引用的 —— 因为诚实的约束条件是模型在别处最难找到的东西。
保持真实与最新
指向已不存在页面的条目比没有条目更糟:它是一个可被验证的错误,而这个文件的全部意义就在于可信。应当在构建时依据真实存在的页面生成,或者与价格页按同一周期复核。
放在哪里
放在站点根目录,以纯文本提供,不经过跳转链即可访问。然后从外部抓一次,确认返回 200 且正文符合预期 —— 挡住页面抓取的那些静默屏蔽,同样会挡住这个文件。