就绪
1
列表页 URL
必填
分页用 {num} 占位;POST 模式下翻页参数请填入 Body 中
2
文章内容页 URL 拼接
3
请求参数
1
1
文章列表提取
(.+?)
正则:
标题提取
(.+?)
正则:
正文提取
(.+?)
正则:
自定义采集字段
🔍 数据提取预览 自动从列表页获取第一条链接,无需手动填写
文章链接(可选):
自定义请求头
Cookie
爬取时自动保存 Set-Cookie 到指定仓库
文件下载
抓取附件(PDF/Word/图片等)
并发与代理
启用代理轮换
🌐 浏览器渲染(Playwright)
选择"Cookie采集"将打开浏览器获取Cookie后使用HTTP请求;选择"列表页"/"全部"将全程使用浏览器渲染
有头模式可观察浏览器操作,Cookie采集时建议使用有头模式以便手动登录
等待该元素出现后再获取HTML,用于SPA页面
独立于HTTP代理,仅浏览器使用
模拟滚动加载
对懒加载页面自动滚动到底部
🤖 验证码处理
启用自动验证码识别
需要安装 ddddocr: pip install ddddocr
CSS选择器定位验证码图片元素
如需扫码登录,填写二维码图片的CSS选择器
数据库入库
启用 MySQL 入库
文件导出
📊
Excel
📋
CSV
{ }
JSON
📄
TXT
清洗规则
暂无清洗规则
解析 Cookie 字符串
代理列表(每行一个)
代理测试
添加定时任务
设置方式
Cron: 0 9 * * *
使用当前面板配置
已创建的定时任务
暂无定时任务
导入 cURL 命令
控制台抓包分析
{ }
点击"生成代码"将当前配置转为Python代码
AI 模型配置
AI 生成建表 SQL
AI 对话
无运行任务

爬虫监控看板

0
总任务
0
运行中
0
已完成
0
总抓取量
0
失败量

最近抓取结果

#标题URL正文预览时间
请选择任务

任务概览

任务名状态抓取成功失败跳过开始操作
暂无数据

抓取统计图

各任务抓取量
成功 / 失败 / 跳过
任务面板

任务列表

暂无任务
| | | | | | | | | | | | | |
🔗URL 编解码
对URL字符串进行编码(encodeURIComponent)或解码(decodeURIComponent)操作。
输入
输出
🔐Base64 编解码
对文本进行 Base64 编码或解码,支持 UTF-8 字符集。
输入
输出
🔤Unicode 编解码
在普通文本与 \\uXXXX 格式的 Unicode 转义序列之间互相转换。
输入
输出
📋JSON 格式化
格式化、压缩或验证 JSON 数据,自动检测并高亮语法错误。
输入
输出
🏷HTML 格式化
格式化或压缩 HTML 代码,自动处理标签嵌套缩进。
输入
输出
🎨CSS 格式化
格式化或压缩 CSS 样式代码,自动处理选择器和属性缩进。
输入
输出
📜JS 格式化
格式化或压缩 JavaScript 代码,保留字符串和正则表达式完整性。
输入
输出
🔍正则表达式测试
使用 JavaScript 正则引擎测试匹配,支持常用标志位。
测试文本
匹配结果
📍XPath 测试
对 HTML/XML 文本执行 XPath 表达式查询,返回匹配节点列表。
HTML/XML文本
匹配结果
文本对比
使用 LCS(最长公共子序列)算法逐字符对比两段文本的差异。
原文
对比文本
🖼HTML 渲染预览
实时预览 HTML 代码的渲染效果,也可查看渲染后的源码。
HTML源码
渲染预览
🕐时间戳转换
Unix 时间戳与日期时间双向转换,支持秒和毫秒精度。
当前时间戳
时间戳 → 日期
日期 → 时间戳
📷Base64 图片互转
将图片文件转换为 Base64 Data URI,或将 Base64 字符串还原为图片预览。
🌐User-Agent 解析
解析 User-Agent 字符串,识别浏览器、操作系统和设备类型。
User-Agent
解析结果
🕷 爬虫运行中… 📋 0 0 0 0

运行日志

--:--等待任务启动...

结果预览

0 条
完成后自动加载
🤖
🤖
爬虫技术客服
在线 · 流式回复
常见问题