结论:合规的关键是「区分对待」——对搜索引擎放行,对恶意爬虫限速或拦截,别一刀切。
① 先用 User-Agent 和 IP 做初步识别。百度、谷歌等主流爬虫有官方 IP 段,可以白名单放行,其他 UA 可疑的走限速策略。
② 用 robots.txt 明确规则。声明哪些目录允许抓、哪些禁止,同时设置 Crawl-delay 控制频率,这是最基础的合规做法。
③ 对高频请求做限流。同一 IP 短时间内请求过多就返回 429 或加验证码,但要注意别把搜索引擎的抓取也限了,白名单要配好。
④ 保留日志和证据。记录异常爬虫的请求日志,如果涉及数据被恶意抓取,这些日志是维权的基础。合规不是一味封堵,而是有依据地管理。