robots协议

一笑奈何 提交于 2020-01-22 10:23:24
robots协议也叫robots.txt(统一小写)是一种存放于网站根目录下的ASCII编码的文本文件,它通常告诉网络搜索引擎的漫游器(又称网络蜘蛛),此网站中的哪些内容是不应被搜索引擎的漫游器获取的,哪些是可以被漫游器获取的。因为一些系统中的URL是大小写敏感的,所以robots.txt的文件名应统一为小写。robots.txt应放置于网站的根目录下。如果想单独定义搜索引擎的漫游器访问子目录时的行为,那么可以将自定的设置合并到根目录下的robots.txt,或者使用robots元数据(Metadata,又称元数据)。
robots协议并不是一个规范,而只是约定俗成的,所以并不能保证网站的隐私。
例:CSDN网站:

User-agent: *
Disallow: /images/
Disallow: /content/
Disallow: /ui/
Disallow: /js/
Disallow: /*?*

Sitemap: https://blog.csdn.net/s/sitemap_index/index_site_map.xml
Sitemap: https://blog.csdn.net/s/sitemap_index/sitemap_list_index_category.xml
Sitemap: https://blog.csdn.net/s/sitemap_index/sitemap_list_index_list.xml
Sitemap: https://blog.csdn.net/s/sitemap_index/sitemap_list_index_time.xml

易学教程内所有资源均来自网络或用户发布的内容,如有违反法律规定的内容欢迎反馈
该文章没有解决你所遇到的问题?点击提问,说说你的问题,让更多的人一起探讨吧!