Robots.txt是放在网站根目录下的一个纯文本文件,它的作用是告诉搜索引擎的爬虫程序,站点的哪些部分允许被抓取、哪些部分应当避开。它是管理站点抓取预算、防止后台或私密页面被收录的基础工具。如果你刚开始接触网站优化,掌握这个文件的正确写法是非常重要的一步,下面就从最基础的规则说起。
这个文件本质上是给爬虫看的说明,语法并不复杂,主要由几个固定指令组成。它们必须严格遵守英文格式,每行只写一条指令,且行与行之间不能有错乱。
需要注意,文件名必须严格按“robots.txt”的小写形式命名,且文件编码只能是UTF-8无BOM格式。如果使用其他编码或添加了多余的空格,可能会导致规则判定出错。
对于大多数网站来说,最先要做的是允许所有爬虫访问公开内容,同时把后台和临时目录屏蔽掉。这是一个比较稳妥的起始模板:
常见的网站初始配置
User-agent: *
Disallow: /admin/
Disallow: /tmp/
Sitemap: https://www.example.com/sitemap.xml
如果站点需要针对不同搜索引擎设置不同的权限,比如只允许百度收录而拦截谷歌和必应,可以采用分组写法:
按爬虫区分规则的写法
User-agent: Googlebot
Disallow: /
User-agent: Bingbot
Disallow: /
User-agent: Baiduspider
Allow: /
需要注意的是,如果某个爬虫被Disallow: /完全屏蔽,那么同组中的Allow指令就不会再生效,因为这个组内已经不允许它访问任何路径了。写完文件后,建议在浏览器中直接访问你的域名加robots.txt,检查页面是否能正常显示规则内容。
很多站点因为几个不起眼的小失误,导致整站内容延迟收录甚至被完全屏蔽。以下是反复出现的几类问题,值得特别留意。
要特别提醒的是,不要试图用Robots.txt来隐藏敏感信息。这个文件是公开的,任何人都能看到里面的路径。需要保护的隐私数据应该通过登录验证或服务器权限来限制,而不能只依赖爬虫规则。
文件写完后,验证步骤至关重要。虽然文件本身是纯文本,但它的影响范围涉及全站收录情况,因此需要仔细测试不同场景。
首先,可以在各大搜索引擎的站长平台中寻找“Robots测试工具”或“抓取检查”功能。只需要输入要测试的页面URL,系统就会反馈该地址被允许还是被禁止访问,并指出是受哪一条规则影响。
其次,检查时要注意细节:比如测试根域名和带www的域名是否都指向同一个文件;确认某一具体URL与规则中的路径是否完全匹配;查看文件内容是否被CDN缓存了旧版本。
在逻辑梳理上,建议先屏蔽整个目录,再单独放开一个子路径,这样规则更清晰。比如先写Disallow: /products/,再写Allow: /products/best/,这样只有best这个子目录不会被拦截。在动手修改之前,最好先备份现有的内容,做完改动后通过站长工具重新提交一次,以便快速触发抓取。
正常情况下不会直接受到惩罚,但会造成收录层面的问题。比如意外屏蔽了整站,搜索引擎会暂时停止抓取,直到你修正文件并且重新提交。多数情况下只要及时改正,收录会逐渐恢复正常。
不能作为唯一的保护手段。这份文件随意可以被查看,里面的路径也会公开,因此不适合存放或屏蔽含有私密内容的页面。保护敏感页面应当依靠密码验证、服务器访问控制等方式来保证真正不可见。
这个指令本身并非强制标准,部分搜索引擎会忽略它,甚至不鼓励使用。如果需要降低服务器的抓取压力,建议通过站长平台中的抓取速率设置或服务器日志分析来调整,而不是完全依赖该指令。
编写Robots.txt看似简单,其实需要注意细节。建议先从允许所有爬虫并屏蔽后台目录的简单方案入手,再根据站点情况进行模块化调整。每次修改后都要用站长工具验证一遍,并注意大小写、空格等细节错误。尤其是不要把后台路径等敏感信息写在公开文件里,如需隐藏必须使用访问权限控制。保持配置简洁清晰,才不容易因为失误而影响整个站点的抓取与收录。