如何通过封锁蜘蛛抓取来有效守护网站隐私安全?
- 内容介绍
- 文章标签
- 相关推荐
#爬虫#操作程序#运维 这篇文章带你说说怎么把搜索引擎的蜘蛛给挡住咱们的隐私安全才能稳稳的。别看技术听起来严肃,其实跟平时玩手机差不多,随便一句话就能搞定。
1、先别慌,找个好方法拦住它们
说起封锁蜘蛛。最常用的就是那句老话:让它走路先停下来。怎么停,说到就靠三招,robots.txt、meta标签、服务器设置。这三样工具,像是给网站装了三层门。
1‑1 先从门口开始——robots.txt
在你的网站根目录敲一个.txt文件,名字叫robots.txt。里面写个规则,让蜘蛛知道哪儿可以走,哪儿要闭门。
比如想全站屏蔽:
User-agent: *
Disallow: /
说到只屏蔽百度,
User-agent: Baiduspider
Disallow: /
或者只关掉后台目录:
User-agent: *
Disallow: /admin/
记住改完后通常需要几天到两个月才会完全生效。想快点,可以去各大搜索引擎的站长工具里删索引。
1‑2 页面级别的“小秘密”——Meta标签
在单页里加一句代码,让蜘蛛直接认命:
"noindex" 就是不让它收录;"nofollow" 则是不要追踪内部链接。如果你只想让它停止抓取但还能跟链子,那就去掉 "nofollow"。
1‑3 服务器里做一把锁——.htaccess 或 Nginx 配置
.htaccess 是 Apache 的小配件。
#爬虫#操作程序#运维 这篇文章带你说说怎么把搜索引擎的蜘蛛给挡住咱们的隐私安全才能稳稳的。别看技术听起来严肃,其实跟平时玩手机差不多,随便一句话就能搞定。
1、先别慌,找个好方法拦住它们
说起封锁蜘蛛。最常用的就是那句老话:让它走路先停下来。怎么停,说到就靠三招,robots.txt、meta标签、服务器设置。这三样工具,像是给网站装了三层门。
1‑1 先从门口开始——robots.txt
在你的网站根目录敲一个.txt文件,名字叫robots.txt。里面写个规则,让蜘蛛知道哪儿可以走,哪儿要闭门。
比如想全站屏蔽:
User-agent: *
Disallow: /
说到只屏蔽百度,
User-agent: Baiduspider
Disallow: /
或者只关掉后台目录:
User-agent: *
Disallow: /admin/
记住改完后通常需要几天到两个月才会完全生效。想快点,可以去各大搜索引擎的站长工具里删索引。
1‑2 页面级别的“小秘密”——Meta标签
在单页里加一句代码,让蜘蛛直接认命:
"noindex" 就是不让它收录;"nofollow" 则是不要追踪内部链接。如果你只想让它停止抓取但还能跟链子,那就去掉 "nofollow"。
1‑3 服务器里做一把锁——.htaccess 或 Nginx 配置
.htaccess 是 Apache 的小配件。

