结论:PetalBot 是华为花瓣搜索(Petal Search)的官方网页抓取爬虫,正常抓取下对服务器性能影响很小,但如果站点资源紧张或它抓取频率异常,确实需要主动管理。
① 先确认身份。PetalBot 的 User-Agent 里带有 PetalBot 字样,官方说明其 IP 段归属华为云。你可以在服务器日志里用 grep 过滤 PetalBot,看它是否真的来自官方 IP,避免有人伪装成它来扫站。
② 评估抓取强度。正常配置下它的并发和频率都比较克制,不会像某些采集器那样打满带宽。如果日志里发现同一 IP 短时间高频请求,先看是不是站点地图或分页链接暴露太多,导致它陷入深爬。
③ 用 robots.txt 管理。不想被它抓的目录直接写 Disallow,PetalBot 声明遵守 robots 协议。对动态参数多、容易生成无限 URL 的页面,尤其要屏蔽,否则它可能反复爬取浪费资源。
④ 真影响性能就限速。可以在 Nginx 层面对 PetalBot 的 UA 做限流或返回 429,但建议保留首页和内容页的抓取权限,毕竟它带来的搜索流量对站点是有价值的。