苹果CMS采集规则编写?
学完这篇,你能在苹果CMS V10 后台亲手写完一条能跑通的采集规则,把目标站的视频或文章批量抓进自己的分类里,而不是只会用别人现成的资源库。
第一步:先分清该用哪种采集
苹果CMS V10 的采集分两条路,选错了就是白折腾。
后台左侧菜单点 采集,展开后有两个入口:
- 资源库:采集别人已经做好的接口(比如各种「默认资源库」),你只要填一个接口 URL,点「绑定分类」就能用,不用写规则。
- 自定义采集:进
采集 → 自定义采集 → 添加,这里才是需要你写规则的。
结果:你确认自己走的是「自定义采集 → 添加」这条路。
第二步:在目标站上把页面结构抄下来
这一步要拿到写规则要用的选择器。用 Chrome 打开目标站的列表页,按 F12 打开开发者工具,切到 元素(Elements) 面板。
找到重复出现的那一块(每条影片/文章的那个卡片),在它外层容器上右键 → 复制 → 复制选择器(Copy selector),得到类似 .list li 这样的东西,记下来。
接着记四个值:
- 标题在哪个标签上:通常是
<a title="xxx">或<h3> - 详情页链接:
<a href="xxx"> - 缩略图:
<img src="xxx">或data-original - 列表页第二页的网址长什么样,找出页码在哪
再随便点进一个详情页,同样记下标题、正文、播放地址所在的位置。
第三步:填列表页规则
回到后台 采集 → 自定义采集 → 添加,逐项填:
- 采集名称:自己看得懂就行,如「某站电影」
- 采集地址:列表页第一页的完整 URL
- 页码规则:把地址里的页码换成占位符,V10 用
{page},例如https://xxx.com/list/1-{page}.html - 编码:看目标站源码里的
charset,UTF-8 就填 UTF-8,老站常是 GBK - 列表区域选择器:填第二步抄到的
.list li - 标题规则:
a@title(取 a 标签的 title 属性) - 链接规则:
a@href - 图片规则:
img@data-original
填完点「测试」,能看到一列抓到的详情页 URL 就对了。
注意:现在大量站点的缩略图是懒加载,真实地址放在
data-original或data-src里,src位置往往是一张占位图。写错这一项,采回来的封面全是空白图。
第四步:填内容页规则
同一个页面往下拉,是内容页部分:
- 标题规则:如
h1 - 内容规则:填正文容器选择器,如
.article-content - 播放地址规则:苹果CMS 需要的是 m3u8 播放地址,用正则从源码里提,例如
"url":"(.*?\.m3u8.*?)"
注意:内容规则千万别填
body,否则广告、友情链接、版权声明会一起入库,后期清理比重采还费时间。
第五步:绑定分类并试采一条
在自定义采集列表里点你刚建的规则,进入「采集分类绑定」:左边是目标站分类,右边下拉选你自己的分类,一一对应后保存。
然后点「采集1页」做测试,等它跑完,去 视频 → 视频管理(文章则是 文章 → 文章管理)看有没有新数据,图片、播放地址是否正常。
第六步:配入库参数
同一规则页面里还有几个开关值得调:
- 入库状态:建议先选「未审核」,人工看一遍再批量通过
- 保存远程图片:目标站有防盗链时勾上,图片会下载到本地
- 去重:按「标题」或「播放地址」去重,避免重复采集灌库
- 想自动跑就配服务器定时任务,用 crontab 定时访问采集地址
小结
- 资源库采集不写规则,自定义采集才写;
- 规则的选择器必须先在浏览器 F12 里抄下来,别凭感觉写;
- 懒加载图用
data-original,正文用具体容器别用body; - 先「测试」再「采1页」,最后才批量;
- 新站上线前把入库状态设为未审核。
原文链接:https://www.gj0.com/thread-66.html
转载请注明出处并保留本声明;内容仅代表作者观点,与本站立场无关。若本文涉嫌侵权,请联系本站处理。