案例库 · 软件与 IT · 战略决策 · 2005–2006
网站地图让网站把自家URL列表交给搜索引擎,确保抓取
谷歌2005年推出的XML网站地图让站长向爬虫列出URL;雅虎和微软2006年加入,成为通用标准。
解法
大型网站将页面隐藏在表单、JavaScript和薄弱链接之后,仅靠跟随链接的爬虫会漏掉这些页面。2005年6月,谷歌推出了网站地图0.84版本,让网站开发者发布整个网站的链接列表——一个简单的XML文件,描述哪些URL存在。
该协议的设计刻意保持极简:文件必须以<urlset>开头,每个页面包含一个<url>条目,每个条目必须包含<loc> URL,并可选<lastmod>、<changefreq>和<priority>标签。这种XML对内容管理系统来说生成起来轻而易举,通过robots.txt自动发现,无需额外配置。
采用推广是联合行动:2006年11月,谷歌、雅虎和微软宣布共同支持该协议,Ask.com和IBM也在2007年跟进。一种文件格式就能满足所有主要爬虫,网站地图因此成为整个网络的标准做法。
生效的原因
- 网站主比爬虫更清楚自己的URL
- 内容管理系统生成XML轻而易举
- 谷歌、雅虎和微软在2006年就统一协议
- 通过robots.txt自动发现,无需额外设置
取得的成效一份简单的XML列表就能告诉爬虫所有URL利落
可借鉴之处
与其让爬虫自行发现一切,不如让网站把自家索引交给搜索引擎——发布者最清楚自己的内容地图。
后续进展
sitemaps.org承载着所有主要搜索引擎读取的协议;网站地图索引文件、图片和视频网站地图以及gzip压缩扩展了它,至今仍是网站告知爬虫抓取内容的标准方式。
资料来源
发现哪里写错了?告诉我们。