海洋 CMS 如何设置网站 robots.txt 文件

juming
juming 初级会员超兽战士
发布于 2026-10-08 13:09 ·1 浏览 ·0 回复

结论:海洋 CMS 没有「robots.txt 开关」这种东西,robots.txt 是放在网站根目录(和 index.php 同级)的一个纯文本文件,你自己创建、自己写规则就行,写完用 域名/robots.txt 能访问到即生效。

海洋 CMS 的 robots.txt 放在哪个目录?

结论:必须放在网站根目录,文件名必须是小写 robots.txt,放错目录等于没设。

访问 https://你的域名/robots.txt,这个 URL 对应服务器上的文件路径就是根目录下的 robots.txt。如果你用宝塔面板,路径通常是 /www/wwwroot/你的域名/robots.txt;如果是虚拟主机,就用 FTP 传到根目录。注意三点:

  1. 文件名不能写成 Robots.txt 或 robot.txt,协议规定的文件名是全小写单数。
  2. 必须是根目录,放在 /html/、/template/ 这些子目录里,搜索引擎不会去读。
  3. 文件编码用 UTF-8 但不要带 BOM 头,带 BOM 会导致部分爬虫把第一行 User-agent 解析成乱码。

如果你在后台翻遍了设置项都找不到入口,这是正常的——它不在数据库里,就是个静态文件。

海洋 CMS 的 robots.txt 具体怎么写?

结论:影视站最值得屏蔽的是后台目录、数据缓存目录和搜索页,最不能屏蔽的是图片和播放页。

直接给一份可复制的模板(把域名替换成你自己的):

User-agent: *
Disallow: /admin/
Disallow: /data/
Disallow: /search.php
Disallow: /*?keyword=
Allow: /
Sitemap: https://www.example.com/sitemap.xml

逐条说明:

  • User-agent: * 表示对除指定爬虫外的所有爬虫生效。
  • Disallow: /admin/ 屏蔽后台目录。海洋 CMS 后台默认目录名通常是 admin,如果你改过名,就写改名后的目录,这条很重要,后台被收录会带来安全隐患。
  • Disallow: /data/ 屏蔽数据缓存目录(海洋 CMS 的缓存与配置文件多放在这里),避免蜘蛛抓到缓存碎片页。
  • Disallow: /search.php 和 Disallow: /*?keyword= 屏蔽站内搜索结果页。影视站搜索页是典型的蜘蛛陷阱,参数组合能生成成千上万个相似页面,不屏蔽会严重稀释收录质量。
  • Sitemap: 指向站点地图,前提是你确实生成了 sitemap.xml,没有就别写这行,写了反而报错。
  • Allow: / 放在最后表示其余目录全部放行。

关键提醒:如果站内海报图放在 upload/ 之类的上传目录,千万不要 Disallow 它,图片被屏蔽后搜索结果里只剩纯文字,点击率会掉。同样,内容页、播放页的伪静态路径必须放行。

语法上还有两条容易踩的规则:# 开头是注释;路径大小写敏感,/Admin/ 和 /admin/ 是两个不同的路径;* 是通配符,$ 表示结尾,例如 Disallow: /*.php$ 会屏蔽所有以 .php 结尾的 URL。

设置完怎么验证 robots.txt 真的生效了?

结论:用 curl -I 看状态码和 Content-Type,再用搜索资源平台的测试工具跑一遍,两步都通过才算配置正确。

第一步,命令行验证:

curl -I https://你的域名/robots.txt

期望看到 HTTP/1.1 200 OK 和 Content-Type: text/plain。如果返回 404,说明文件名或目录放错了;如果返回 200 但 Content-Type 是 text/html,通常是被伪静态规则或 CMS 的路由重写了,需要给 Nginx 加一条 location = /robots.txt { } 之类的优先匹配规则。

第二步,用工具验证。百度搜索资源平台和 Google Search Console 都提供 robots.txt 测试工具,把规则粘进去,能直接看到某条 URL 是「允许抓取」还是「被拦截」,这是确认规则没写反的最快方式。

写 robots.txt 时必须注意的两个认知误区

结论:robots.txt 是「建议」不是「墙」,而且它管不了已经收录的页面。

第一,它只对遵守协议的爬虫生效。恶意的采集爬虫根本不读这个文件,指望靠它防采集是不现实的。同理,它也不能用来「保密」——后台地址写进 Disallow 只是不让收录,不代表别人访问不到。

第二,屏蔽不等于删除。如果一个页面已经被收录,你再写 Disallow,爬虫只是不再抓取,之前收录的条目可能长期保留在搜索结果里。要真删,得去搜索资源平台提交删除申请,并配合页面级的 noindex 标签。

最后收个尾:海洋 CMS 的 robots.txt 就是根目录一个文本文件,写清楚「屏蔽后台、缓存、搜索页,放行内容页和图片,附上 sitemap」,用 curl 和平台工具各验一次,十分钟就能搞定。改完别指望立刻生效,搜索引擎重新抓取这个文件通常需要几天时间。

版权声明:本文来自 GJ站长论坛《海洋 CMS 如何设置网站 robots.txt 文件》
原文链接:https://www.gj0.com/thread-969.html
转载请注明出处并保留本声明;内容仅代表作者观点,与本站立场无关。若本文涉嫌侵权,请联系本站处理。

全部回复 0

还没有回复,来抢沙发~