目前我手上最老的域名已经11年多了,但是我的建站经历还要再+7年,因为最早我是从初中开始搭建网站的,那时候用的蚂蚁分类信息系统、记事狗微博系统等,大学了我才注册自己的域名,如今首晒已有40多个一级域名。
事情的起因
早期我做网站知道robots.txt这个玩意,但是没有管它,毕竟那时候搜索引擎的爬虫都很老实,每天就爬十几个页面这样,完全不会给服务器造成太大压力。
也是去年的时候,我的服务器经常宕机,一看网站日志,好家伙,Facebook和Amazon的爬虫爬疯了都,我就想,又不是搜索引擎,又不能给我网站带来流量,肯定是拿去训练自己的AI大模型了。
我和爬虫的初期战争
就在Facebook和Amazon的爬虫疯狂爬我的网站的时候,我想起了robots.txt这个文件,除了搜索引擎外的就把常见爬虫全部用robotsx.txt禁止了。
我知道robotsx.txt是君子协议,但是我不知道Facebook和Amazon的爬虫不遵守啊,几天后还是疯狂在爬,每秒钟几十次访问,堪比DDOS攻击了。
后来我想着把高频访问IP直接封了,就又研究iptables了,结果就是,不仅麻烦,还不怎么有用。
当前在用效果很好的方法
服务器上的Fail2ban,这个插件宝塔上直接安装的,设置好高频访问IP直接封禁几个小时,这样这些爬虫应该就不会再来了吧。
结果是我想得太简单了,这些爬虫的IP可太多了,一个IP就只来爬一次,压根封不到它,几百个几千个IP来,我的服务器一样还是时不时宕机。
然后我就研究.htaccess这个伪静态文件了,结合AI帮我写的,现在的版本非常好用,直接那几家爬虫就在黑名单里,然后访问/xmlrpc.php文件、访问压根不存在的文件的直接返回403。
返回403是直接不加载php文件了,然后我的服务器CPU就很低,最低的时候都2%左右了
新网站再也不加robots.txt
前几天自己用Codex开发了一套网站程序,域名都4天了还没收录,就问了问豆包,它让我建robots.txt和sitemap.xml,我压根不想建,真的防不住,还是自己上手段服务器硬核防御比较有用!
原文地址:https://zz.bloggl.com/post/congnatianqiwodexinzhanzaiyebujiarobots-txt
本文来自投稿,不代表首晒立场,如若转载,请注明出处:https://www.shoushai.com/p/1983
网友热评(1)
robotsx.txt早就没用了,直接让他们抓不到是最好的办法