Agent Skills 工具箱fetch-everything 一套面向 **Claude Code**/openclaw 的高质量 Skills 合集,涵盖网页抓取、文档提取、电商数据处理、云端部署等场景,特别强化了对中文平台的支持。
概要
一套面向 的高质量 Skills 合集,涵盖网页抓取、文档提取、电商数据处理、云端部署等场景,特别强化了对中文平台的支持。 将任意 URL 转换为干净的 Markdown 文本。核心亮点是能抓取 的页面。 - 社交媒体:X/Twitter、微博、知乎、B站、小红书、Facebook、Instagram - 即时通讯:微信公众号文章 - 协作文档:飞书/Lark 文档(通过 API) - 其他:YouTube、TikTok、GitHub、Medium 等 1. — 利用真实浏览器登录态,适合登录墙页面 2. — 微信公众号专用 3. — 飞书/Lark 文档专用 4. :r.jina.ai → Firecrawl → defuddle.md → agent-fetch 基于 MinerU API 的文档提取工具,支持 PDF、图片、Word、PPT 等格式。 1. — 快速,200次/天免费额度 2. — 无限制,自带反爬绕过 3. — 静态页面兜底 - 能读取微信公众号文章(Jina 无法处理的场景) - 保留标题、链接、图片 URL、列表结构 - 自动识别中文平台并选择最优路径 1. 分析目标站点的商品列表模式 2. 提取商品信息(名称、价格、描述、规格、图片) 3. 图片上传至 CDN,生成远程 URL 4. 输出标准 Shopify CSV
README
Claude Code Skills 工具箱
一套面向 Claude Code 的高质量 Skills 合集,涵盖网页抓取、文档提取、电商数据处理、云端部署等场景,特别强化了对中文平台的支持。
Skills 一览
| Skill | 用途 | 免登录 |
|---|---|---|
| markdown-proxy | URL → Markdown,支持 35+ 登录态平台 | 部分 |
| mineru-ai | PDF/图片/网页 → Markdown/HTML/DOCX | 部分 |
| web-content-fetcher-main | 网页正文提取,三级降级策略 | 是 |
| shopify-product-scraper | 品牌站商品抓取 → Shopify CSV | 是 |
| apify-ultimate-scraper | 55+ 平台通用 AI 爬虫 | 需 Apify 账号 |
| apify-actor-development | 开发/调试/部署 Apify Actor | 需 Apify 账号 |
| apify-actorization | 将现有项目转为 Apify Actor | 需 Apify 账号 |
| apify-generate-output-schema | 自动生成 Actor 输出 Schema | 需 Apify 账号 |
| skill-creator | 创建和更新 Skill 的元指南 | 是 |
详细说明
markdown-proxy
将任意 URL 转换为干净的 Markdown 文本。核心亮点是能抓取 需要登录 的页面。
支持平台(35+):
- 社交媒体:X/Twitter、微博、知乎、B站、小红书、Facebook、Instagram
- 即时通讯:微信公众号文章
- 协作文档:飞书/Lark 文档(通过 API)
- 其他:YouTube、TikTok、GitHub、Medium 等
抓取策略(按优先级自动降级):
- bb-browser site — 利用真实浏览器登录态,适合登录墙页面
- Playwright MCP — 微信公众号专用
- 飞书 API 脚本 — 飞书/Lark 文档专用
- 代理服务级联:
r.jina.ai→ Firecrawl →defuddle.md→agent-fetch
安装:
npm install -g bb-browser
bb-browser site update # 下载社区 site 适配器
使用示例:
抓取 https://mp.weixin.qq.com/s/xxx 的内容
获取 https://twitter.com/user/status/123 的正文
mineru-ai
基于 MinerU API 的文档提取工具,支持 PDF、图片、Word、PPT 等格式。
两种模式:
flash-extract |
extract |
|
|---|---|---|
| Token | 不需要 | 需要 |
| 速度 | 快 | 标准 |
| 表格识别 | 不支持 | 支持 |
| 公式识别 | 不支持 | 支持 |
| OCR | 支持 | 支持 |
| 输出格式 | Markdown | md/html/latex/docx/json |
| 文件限制 | 10MB / 20页 | 更高 |
| 批量处理 | 不支持 | 支持 |
安装:
npm install -g mineru-open-api
使用示例:
解析 report.pdf
提取 image.png 的文字内容
将 presentation.pptx 转为 markdown
web-content-fetcher-main
网页正文内容提取,自动返回干净的 Markdown 格式。
三级降级策略:
- Jina Reader — 快速,200次/天免费额度
- Scrapling + html2text — 无限制,自带反爬绕过
- web_fetch — 静态页面兜底
特殊能力:
- 能读取微信公众号文章(Jina 无法处理的场景)
- 保留标题、链接、图片 URL、列表结构
- 自动识别中文平台并选择最优路径
使用示例:
抓取 https://example.com/article 的正文内容
读取这篇文章:https://mp.weixin.qq.com/s/xxx
shopify-product-scraper
从品牌电商网站抓取商品数据,生成 Shopify CSV 导入文件,图片自动上传至远程 CDN。
工作流程:
- 分析目标站点的商品列表模式
- 提取商品信息(名称、价格、描述、规格、图片)
- 图片上传至 CDN,生成远程 URL
- 输出标准 Shopify CSV
支持的商品页模式:
data-*属性模式- 语义化卡片模式
- JSON-LD 结构化数据
- Next.js
__NEXT_DATA__
使用示例:
抓取 https://www.brand.com/products 的商品数据,生成 Shopify CSV
apify-ultimate-scraper
通用 AI 爬虫,覆盖 55+ 平台,基于 Apify Actor 生态。
支持平台:
- 社交媒体:Instagram(12个Actor)、Facebook(14个)、TikTok(14个)
- 视频:YouTube(5个)
- 搜索:Google Maps、Google Search、Google Trends
- 旅游:Booking.com、TripAdvisor
输出格式: 快速回答、CSV、JSON
适用场景: 线索获取、品牌监控、竞品分析、影响力调研
使用示例:
搜索 Dubai 地区的 CNC 加工企业
抓取 @username 的 Instagram 帖子
apify-actor-development
开发、调试和部署 Apify Actor — 面向 Web 抓取、自动化和数据处理的无服务器云程序。
支持语言: JavaScript / TypeScript / Python
核心功能:
- 完整的 Actor 创建流程
- 本地测试 (
apify run) - 安全规范(凭据脱敏、输入校验)
- Standby 模式支持
- 日志标准
apify-actorization
将现有项目转换为 Apify Actor,实现一键上云。
支持方式:
- JavaScript/TypeScript:SDK 包装(Actor.init/exit)
- Python:async context manager 包装
- 任意语言:CLI wrapper 模式
apify-generate-output-schema
通过分析 Actor 源码,自动生成输出 Schema 文件:
dataset_schema.jsonoutput_schema.jsonkey_value_store_schema.json
包含 7 个阶段:发现 → 分析 → 生成示例 → 创建 Schema → 验证
skill-creator
创建和更新 Skill 的元指南,提供 Skill 编写的最佳实践、目录结构规范和模板。
环境要求
必装工具
# Node.js (v18+)
npm install -g bb-browser # markdown-proxy 核心
npm install -g mineru-open-api # 文档提取
# Apify(可选)
npm install -g apify-cli
apify login
可选配置
| 工具 | 配置方式 | 用途 |
|---|---|---|
| MinerU Token | mineru-open-api auth |
解锁精确提取(表格/公式/批量) |
| Firecrawl API Key | .env 文件 |
markdown-proxy 代理降级 |
| 飞书 Open API | .env 文件 |
飞书文档抓取 |
| Apify Token | apify login |
云端爬虫平台 |
MCP 服务器
项目已配置 .mcp.json,启用 bb-browser MCP 集成:
{
"mcpServers": {
"bb-browser": {
"command": "npx",
"args": ["-y", "bb-browser", "--mcp"]
}
}
}
目录结构
.claude/
├── skills/
│ ├── apify-actor-development/
│ │ └── skill.md
│ ├── apify-actorization/
│ │ └── skill.md
│ ├── apify-generate-output-schema/
│ │ └── skill.md
│ ├── apify-ultimate-scraper/
│ │ └── skill.md
│ ├── markdown-proxy/
│ │ ├── skill.md
│ │ ├── README.md
│ │ └── .env
│ ├── mineru-ai/
│ │ └── skill.md
│ ├── shopify-product-scraper/
│ │ └── skill.md
│ ├── skill-creator/
│ │ └── skill.md
│ └── web-content-fetcher-main/
│ └── skill.md
├── settings.local.json
└── .env
output/ # 抓取输出数据
.mcp.json # MCP 服务器配置
快速开始
- 克隆仓库到本地
- 将
.claude/目录放入你的项目,或确保 Claude Code 能访问到 skills - 根据需要安装对应 CLI 工具
- 在 Claude Code 中直接使用自然语言触发 Skill:
- “抓取这个 URL 的内容” →
markdown-proxy或web-content-fetcher-main - “解析这个 PDF” →
mineru-ai - “抓取这个网站的商品” →
shopify-product-scraper - “搜索 Instagram 上的…” →
apify-ultimate-scraper
- “抓取这个 URL 的内容” →
License
Private — 仅供授权使用。
推奨ツール
別のキーワードを試すか、フィルタを外してください。
インストール
npx skillfish add liangdabiao/fetch-everything