dhcaiji 导航采集插件

一键采集第三方导航站的导航标签(名称 / 网址 / 简介 / 分类),导入本站审核队列,审核通过后进入云端内容中心。支持任意小众导航站,采够即停,全程人工把关。

填网址即采到量自动停止先审后录防 SSRF / 强制 HTTPS 校验
① 填写网址支持多个地址
② 确认声明勾选同意
③ 分步采集实时进度
④ 核对结果可编辑/忽略
⑤ 导入审核宿主审核队列
⑥ 内容中心宿主既有流程

核心功能

🌐

任意导航站即填即采

直接粘贴目标站网址即可开始,支持多行批量、每行可带「分类|网址」前缀;只填域名(如 wndh.net)自动补全 https。

🎯

按数量采集,到量即停

开始前设定本次需要的条数,采够自动停止;按「新入库」计数,重复网址不计入,多余结果直接丢弃并写进日志。

🧠

智能解析两种页面结构

现代导航站(网址藏在 data-url 属性)与传统 a 链接站通吃;自动识别名称、简介、图标、分类,过滤登录页、版权页、搜索热词等噪声。

🔧

规则提取兜底

结构特殊的站点可写 CSS 选择器(自研转换引擎,支持后代 / 子元素 / 属性)或直接写 XPath,字段还能用 @attr 取属性值。

人工把关,先审后录

采集结果先入插件暂存表,可筛选、编辑、忽略;确认无误后手动导入,绝不自动入库。

🛡️

安全采集

内网地址与云元数据全程拦截(含 302 重定向后复检)、DNS 解析失败即拒、HTTPS 证书默认严格校验,采前声明弹窗明示合规要求。

使用演示

1 · 填写网址,设定数量

采集任务 · dhcaiji
wndh.net
50
(留空自动推断)
开始采集试采集 10 条先试采看效果,再正式跑
填好网址与数量后点击「开始采集」,会先弹出采集须知与免责声明。

2 · 采集前声明弹窗

采集须知与免责声明

  1. 云端公共内容库可能已存在相同数据,采集结果可能与内容中心产生重复,导入前请自行核对去重;
  2. 本次请求为模拟人工访问公开网页(类似人工查看并抄录),不登录、不绕过访问限制、不高频爬取;
  3. 请勿采集涉及著作权、个人信息、商业秘密的内容,涉及第三方权利请自行取得授权;
  4. 风险自担,法律后果由操作者承担。
取消确认开始采集

3 · 实时进度,采够即停

采集进度
正在采集:https://wndh.net/
已入库 34 / 50
wndh.net:解析 112 条,新增 34 条,重复 78 条 (采够 50 条即自动停止,不会自动导入)

导入后进入宿主审核

导入时插件自动识别宿主类型,把数据写入对应的审核队列,并直接给出跳转链接:

宿主站点写入位置审核入口
LifeSOSO收录管理 · 待审核(status=0)后台 → 收录管理
Life System公共标签管理 · 未公开草稿导航 → 公共标签管理 → 未公开

审核通过后,由宿主既有逻辑自动投递云端内容中心,插件不重复实现、不越权操作。

采集结果管理

实测效果

目标站点采集条数抽样结果
wndh.net(data-url 结构)200 条钉钉 / 飞书 / 企业微信… 分类「办公」,简介完整
xxnav.com200 条学习类站点,名称与网址对应正确
sbrdh.com200 条上班人导航,分类推断正常
www.hao123.com(传统结构)200 条老式 a 链接站同样支持
www.2345.com / 123.sogou.com113 / 200 条多结构自适应

单页最多条数、同域名上限、超时、UA 均可在设置中调整;纯 JS 渲染、静态抓不到内容的站点建议改用其静态栏目页或规则提取。

采集设置

基础

  • 抓取超时(3~60 秒)、单页最大字节
  • 单页最多采集条数、同域名条数上限
  • 自定义 UA、自动推断分类、补抓目标站简介

安全(默认最严格)

  • 校验 SSL 证书:默认开启,自签名 / 过期证书一律拒绝
  • 允许抓取内网地址:默认关闭,127.x / 192.168.x / 云元数据全程拦截
  • 重定向逐跳复检、DNS 解析失败即拒、最多跟随 5 跳

常见问题

采集到 0 条?目标站可能是纯 JS 渲染,换它的静态栏目页,或用「规则提取」填选择器;可先点「试采集 10 条」验证。

提示「禁止抓取内网」?这是安全保护:内网、云元数据、解析不出 IP 的域名都会被拒,目标站 302 跳内网同样会中止。

提示 SSL 校验失败?目标站证书过期或自签名。确认可信后可在设置里临时关闭「校验 SSL 证书」。

简介为空?可打开「补抓目标站简介」(稍慢),或导入前手工补全。

数据存哪?暂存在插件自有 dhcaiji_* 表,卸载插件一并清除;已导入宿主的数据不受影响。