结论:没有能100%防住采集的方案,但用「频率限制+内容指纹+动态渲染」三层叠加,能把采集成本抬到大多数爬虫放弃。

① 先做访问频率限制,在 Nginx 或 CDN 层对单 IP、单 UA 的请求做阈值控制,比如每分钟超过 60 次就返回 429 或验证码。注意别一刀切封 IP,移动网络和公司出口很容易误伤,建议按「IP+UA」组合计数。

② 再上内容指纹,给正文里的关键词做随机同义替换或插入不可见字符,再配合定时快照比对。如果对方整站照搬,你能第一时间通过指纹定位到被采集的页面,后续取证和投诉都有依据。

③ 对高价值页面用动态渲染,正文由 JS 异步加载,接口加时间戳签名和一次性 token。静态爬虫拿到的只是空壳,要破解就得逆向 JS,成本直接翻几倍。

④ 最后别忘了 robots.txt 和版权声明,虽然挡不住恶意采集,但在投诉和走法律流程时是必要的前置证据。防采集本质是成本博弈,不是技术封死。