IT袋

当前位置:主页 > 经验教程 > 软件教程 >

网站robots.txt文件协议写法

网页robots.txt文件作用 网站robots.txt文件协议写法(2)

更新:2023-08-09 05:48:08 来源:IT袋 作者:马勇
导读:网站robots.txt文件协议写法,在这里重点强调一点,Disallow指令有一个比较特殊的地方,Disallow: /代表着禁止抓取,但是Disallow: 代表着允许抓取,如: User-agent: * Disallow: 此指令代表允许

网站robots.txt文件协议写法

在这里重点强调一点,Disallow指令有一个比较特殊的地方,Disallow: /代表着禁止抓取,但是Disallow: 代表着允许抓取,如:

User-agent: * 
Disallow: 

此指令代表允许所有的搜索引擎抓取网站的任何内容。
3、Allow:/
该指令用于允许蜘蛛抓取某些文件。Allow:/指令后面的参数与Disallow指令相同,如:

User-agent: * 
Disallow: /a/Allow: /a/b/

该指令的含义是不允许蜘蛛抓取a目录下的其他目录和文件,但是可以抓取a目录下的b目录中的内容。
4、$通配符,代表着以某个字符结尾的URL。

User-agent: * 
Disallow: /.jpg$

此指令的含义是禁止所有搜索引擎抓取所有.jpg文件。
$指令在效果上有些地方和*是相同的,$指令常见于动态网址,互联网中应用不是特别广泛。

Disallow: /.jpg$ 等同于 Disallow: /*.jpg

5、Sitemap:告诉蜘蛛XML网站地图的位置,格式为:

Sitemap: http://你的域名/sitemap.xml

主流的搜索引擎都会遵守robots文件指令,但是被robots文件禁止抓取的网址还会出现在搜索引擎结果中,这就好比你虽然不告诉我发生了什么事,但是我从别人那里知道了你的事情一样。只要禁止被抓取的网址在互联网中存在导入链接,搜索引擎就会知道这个网址的存在,有可能被搜索引擎收录,但是搜索结果标题下方会出现对应的提示:由于该网站的tobots.txt文件存在限制指令(限制搜索引擎抓取),系统无法提供该页面的内容。
经过IT袋小编多年建站经验,发现国外的某些垃圾搜索引擎,既不能给我们的网站带来流量,一天到晚还疯狂的抓取我们的网站内容,这无疑是增加了网站的负担,这时候我们就需要禁止这些搜索引擎抓取我们的网站内容,就需要在robots文件里面禁止。

以上IT袋网介绍的网站robots.txt文件协议写法(包含允许和禁止搜索引擎抓取、网站地图写法)的全部内容,网友们不妨在这方面予以借鉴

相关阅读