苹果CMS采集规则编写?

juming
juming 正式会员超兽战士
发布于 2026-10-07 04:24 ·3 浏览 ·0 回复

学完这篇,你能在苹果CMS V10 后台亲手写完一条能跑通的采集规则,把目标站的视频或文章批量抓进自己的分类里,而不是只会用别人现成的资源库。

第一步:先分清该用哪种采集

苹果CMS V10 的采集分两条路,选错了就是白折腾。

后台左侧菜单点 采集,展开后有两个入口:

  • 资源库:采集别人已经做好的接口(比如各种「默认资源库」),你只要填一个接口 URL,点「绑定分类」就能用,不用写规则。
  • 自定义采集:进 采集 → 自定义采集 → 添加,这里才是需要你写规则的。

结果:你确认自己走的是「自定义采集 → 添加」这条路。

第二步:在目标站上把页面结构抄下来

这一步要拿到写规则要用的选择器。用 Chrome 打开目标站的列表页,按 F12 打开开发者工具,切到 元素(Elements) 面板。

找到重复出现的那一块(每条影片/文章的那个卡片),在它外层容器上右键 → 复制 → 复制选择器(Copy selector),得到类似 .list li 这样的东西,记下来。

接着记四个值:

  • 标题在哪个标签上:通常是 <a title="xxx"> 或 <h3>
  • 详情页链接:<a href="xxx">
  • 缩略图:<img src="xxx"> 或 data-original
  • 列表页第二页的网址长什么样,找出页码在哪

再随便点进一个详情页,同样记下标题、正文、播放地址所在的位置。

第三步:填列表页规则

回到后台 采集 → 自定义采集 → 添加,逐项填:

  • 采集名称:自己看得懂就行,如「某站电影」
  • 采集地址:列表页第一页的完整 URL
  • 页码规则:把地址里的页码换成占位符,V10 用 {page},例如 https://xxx.com/list/1-{page}.html
  • 编码:看目标站源码里的 charset,UTF-8 就填 UTF-8,老站常是 GBK
  • 列表区域选择器:填第二步抄到的 .list li
  • 标题规则:a@title(取 a 标签的 title 属性)
  • 链接规则:a@href
  • 图片规则:img@data-original

填完点「测试」,能看到一列抓到的详情页 URL 就对了。

注意:现在大量站点的缩略图是懒加载,真实地址放在 data-original 或 data-src 里,src 位置往往是一张占位图。写错这一项,采回来的封面全是空白图。

第四步:填内容页规则

同一个页面往下拉,是内容页部分:

  • 标题规则:如 h1
  • 内容规则:填正文容器选择器,如 .article-content
  • 播放地址规则:苹果CMS 需要的是 m3u8 播放地址,用正则从源码里提,例如 "url":"(.*?\.m3u8.*?)"

注意:内容规则千万别填 body,否则广告、友情链接、版权声明会一起入库,后期清理比重采还费时间。

第五步:绑定分类并试采一条

在自定义采集列表里点你刚建的规则,进入「采集分类绑定」:左边是目标站分类,右边下拉选你自己的分类,一一对应后保存。

然后点「采集1页」做测试,等它跑完,去 视频 → 视频管理(文章则是 文章 → 文章管理)看有没有新数据,图片、播放地址是否正常。

第六步:配入库参数

同一规则页面里还有几个开关值得调:

  • 入库状态:建议先选「未审核」,人工看一遍再批量通过
  • 保存远程图片:目标站有防盗链时勾上,图片会下载到本地
  • 去重:按「标题」或「播放地址」去重,避免重复采集灌库
  • 想自动跑就配服务器定时任务,用 crontab 定时访问采集地址

小结

  • 资源库采集不写规则,自定义采集才写;
  • 规则的选择器必须先在浏览器 F12 里抄下来,别凭感觉写;
  • 懒加载图用 data-original,正文用具体容器别用 body;
  • 先「测试」再「采1页」,最后才批量;
  • 新站上线前把入库状态设为未审核。
版权声明:本文来自 GJ论坛《苹果CMS采集规则编写?》
原文链接:https://www.gj0.com/thread-66.html
转载请注明出处并保留本声明;内容仅代表作者观点,与本站立场无关。若本文涉嫌侵权,请联系本站处理。

全部回复 0

还没有回复,来抢沙发~