IT袋

当前位置:主页 > 经验教程 > 软件教程 >

网站robots.txt文件协议写法

网页robots.txt文件作用 网站robots.txt文件协议写法

更新:2023-08-09 05:48:08 来源:IT袋 作者:马勇
导读:网站robots.txt文件协议写法,对于网站长来说: robots.txt文件协议写法 是必须要掌握的知识,因为它可以告诉搜索引擎机器人你不希望或者希望它抓取哪些内容,那么下面 IT袋 IT袋小编就给大家分享

网站robots.txt文件协议写法

网站robots.txt文件协议写法(包含允许和禁止搜索引擎抓取、网站地图写法)

对于网站长来说:robots.txt文件协议写法是必须要掌握的知识,因为它可以告诉搜索引擎机器人你不希望或者希望它抓取哪些内容,那么下面IT袋IT袋小编就给大家分享robots协议写法,不懂的网站长赶紧来学习吧!

一、robots.txt是什么文件?robot文件有什么作用?

从网站优化和网站安全的方面来说,我们的站点并不是每一个页面都需要用户访问,这就好比即使再好的朋友来到了您的家里,您也不会将家里所有的东西都展示给朋友看。那么怎么控制搜索引擎蜘蛛抓取网站的范围呢?这就需要写到robots.txt文件里来告诉搜素引擎蜘蛛。
robots.txt文件是搜索引擎来到网站之后访问的第一文件,robots.txt文件中设置了搜索引擎的抓取范围。

网站robots.txt文件协议写法(包含允许和禁止搜索引擎抓取、网站地图写法)

二、robots.txt文件设置要求
1、robots.txt文件必须放置在网站根目录;
2、robots.txt文件名必须小写。
根据上面两点提示我们查看到绝大部分网站的robots.txt文件,如果出现无法访问的现象,最大可能就是网站根目录中没有此文件。

三、robots.txt文件规则解读
robots.txt的书写格式为:<域>:<可选空格><域值><可选空格>
常见的robots.txt指令为:

User-agent: * 
Disallow: / 

此指令代表禁止所有的搜索引擎抓取网站的任何部分。此指令常用于站点不想被搜索引擎收录或者建站初期,当网站结构没有建设完成的时候,我们是不希望搜索引擎抓取网站任何内容的。
1、User-agent:
用于指定某个搜索引擎蜘蛛,如果使用通配符*代表所有的搜索引擎蜘蛛,如:

User-agent: Baiduspider 指的是指定百度蜘蛛;
User-agent: Googlebot 指的是指定谷歌蜘蛛。

2、Disallow: /
代表着禁止抓取网站的某些内容,如“/”后面没有任何参数代表禁止抓取网站所有内容。我们来学习一下参数后面分别代表的含义:

Disallow: /admin/ 禁止抓取admin目录下的所有内容;
Disallow: /cgi-bin/*.htm 禁止抓取/cgi-bin目录下的所有以.htm结尾的文件;
Disallow: /*?* 禁止抓取网站中所有包含问号 (?) 的网址;
Disallow:/ab/adc.html 禁止抓取ab文件夹下面的adc.html文件;

相关阅读