v1.0.2: 自动爬取试爬取功能 + 每个页面/图片生成操作信息元数据(模式/时间/网址/来源链接/深度等)
This commit is contained in:
@@ -45,12 +45,19 @@
|
||||
|
||||
### 4. 自动爬取模式
|
||||
给定一个起始网址,系统自动从页面里发现链接、按规则筛选后 BFS 爬取:
|
||||
- **🧪 试爬取**:先用起始网址试跑一次,展示规则筛选后的链接清单(将爬取哪些、排除哪些及原因),确认规则符合预期后再正式开爬
|
||||
- **包含规则**:只爬包含指定子串(或正则)的链接
|
||||
- **排除规则**:跳过匹配的链接(如 login、/tag/)
|
||||
- **仅同域名**:限制在起始网站内
|
||||
- **最大页数 / 最大深度**:控制爬取规模
|
||||
- 其余参数(间隔、重试、图片、通知)同批量模式
|
||||
|
||||
### 5. 资源操作信息(元数据)
|
||||
每个爬取的网页和图片都自动生成 `.meta.json` 操作信息文件:
|
||||
- **网页**(`<文件名>.meta.json`):爬取模式(批量/定时/自动)、爬取时间、爬取网址、**来源链接**(自动模式下从哪个页面发现)、爬取深度、任务/运行 ID、页面标题、状态、尝试次数、文件列表、图片明细
|
||||
- **图片集**(`<文件名>_img/meta.json`):所属页面、来源链接、每张图片的原始 URL / 大小 / 下载时间
|
||||
- 详情页结果表中点「📋 元数据」即可在线查看
|
||||
|
||||
## 输出文件
|
||||
|
||||
每个任务输出到独立目录(默认 `out/<任务ID>/`):
|
||||
@@ -69,6 +76,8 @@
|
||||
| POST | `/api/tasks/<id>/pause` | 暂停 |
|
||||
| POST | `/api/tasks/<id>/resume` | 恢复 |
|
||||
| POST | `/api/tasks/<id>/stop` | 终止 |
|
||||
| POST | `/api/probe` | 试爬取(表单规则预览链接清单) |
|
||||
| POST | `/api/tasks/<id>/probe` | 对已保存的自动任务试爬取 |
|
||||
| GET | `/api/runs/<rid>` | 运行详情(结果+日志) |
|
||||
| GET | `/api/runs/<rid>/logs?offset=N` | 增量日志 |
|
||||
| GET | `/api/file?task_id=&path=` | 读取输出文件(HTML/TXT/图片) |
|
||||
|
||||
Reference in New Issue
Block a user