LF

liangdabiao/fetch-everything

Developer tools
48 stars Quality 70 Trend 70

Agent Skills 工具箱fetch-everything 一套面向 **Claude Code**/openclaw 的高质量 Skills 合集,涵盖网页抓取、文档提取、电商数据处理、云端部署等场景,特别强化了对中文平台的支持。

Overview

一套面向 的高质量 Skills 合集,涵盖网页抓取、文档提取、电商数据处理、云端部署等场景,特别强化了对中文平台的支持。 将任意 URL 转换为干净的 Markdown 文本。核心亮点是能抓取 的页面。 - 社交媒体:X/Twitter、微博、知乎、B站、小红书、Facebook、Instagram - 即时通讯:微信公众号文章 - 协作文档:飞书/Lark 文档(通过 API) - 其他:YouTube、TikTok、GitHub、Medium 等 1. — 利用真实浏览器登录态,适合登录墙页面 2. — 微信公众号专用 3. — 飞书/Lark 文档专用 4. :r.jina.ai → Firecrawl → defuddle.md → agent-fetch 基于 MinerU API 的文档提取工具,支持 PDF、图片、Word、PPT 等格式。 1. — 快速,200次/天免费额度 2. — 无限制,自带反爬绕过 3. — 静态页面兜底 - 能读取微信公众号文章(Jina 无法处理的场景) - 保留标题、链接、图片 URL、列表结构 - 自动识别中文平台并选择最优路径 1. 分析目标站点的商品列表模式 2. 提取商品信息(名称、价格、描述、规格、图片) 3. 图片上传至 CDN,生成远程 URL 4. 输出标准 Shopify CSV

README

Claude Code Skills 工具箱

一套面向 Claude Code 的高质量 Skills 合集,涵盖网页抓取、文档提取、电商数据处理、云端部署等场景,特别强化了对中文平台的支持。

Skills 一览

Skill 用途 免登录
markdown-proxy URL → Markdown,支持 35+ 登录态平台 部分
mineru-ai PDF/图片/网页 → Markdown/HTML/DOCX 部分
web-content-fetcher-main 网页正文提取,三级降级策略 是
shopify-product-scraper 品牌站商品抓取 → Shopify CSV 是
apify-ultimate-scraper 55+ 平台通用 AI 爬虫 需 Apify 账号
apify-actor-development 开发/调试/部署 Apify Actor 需 Apify 账号
apify-actorization 将现有项目转为 Apify Actor 需 Apify 账号
apify-generate-output-schema 自动生成 Actor 输出 Schema 需 Apify 账号
skill-creator 创建和更新 Skill 的元指南 是

详细说明

markdown-proxy

将任意 URL 转换为干净的 Markdown 文本。核心亮点是能抓取 需要登录 的页面。

支持平台(35+):

  • 社交媒体:X/Twitter、微博、知乎、B站、小红书、Facebook、Instagram
  • 即时通讯:微信公众号文章
  • 协作文档:飞书/Lark 文档(通过 API)
  • 其他:YouTube、TikTok、GitHub、Medium 等

抓取策略(按优先级自动降级):

  1. bb-browser site — 利用真实浏览器登录态,适合登录墙页面
  2. Playwright MCP — 微信公众号专用
  3. 飞书 API 脚本 — 飞书/Lark 文档专用
  4. 代理服务级联:r.jina.ai → Firecrawl → defuddle.md → agent-fetch

安装:

npm install -g bb-browser
bb-browser site update   # 下载社区 site 适配器

使用示例:

抓取 https://mp.weixin.qq.com/s/xxx 的内容
获取 https://twitter.com/user/status/123 的正文

mineru-ai

基于 MinerU API 的文档提取工具,支持 PDF、图片、Word、PPT 等格式。

两种模式:

flash-extract extract
Token 不需要 需要
速度 快 标准
表格识别 不支持 支持
公式识别 不支持 支持
OCR 支持 支持
输出格式 Markdown md/html/latex/docx/json
文件限制 10MB / 20页 更高
批量处理 不支持 支持

安装:

npm install -g mineru-open-api

使用示例:

解析 report.pdf
提取 image.png 的文字内容
将 presentation.pptx 转为 markdown

web-content-fetcher-main

网页正文内容提取,自动返回干净的 Markdown 格式。

三级降级策略:

  1. Jina Reader — 快速,200次/天免费额度
  2. Scrapling + html2text — 无限制,自带反爬绕过
  3. web_fetch — 静态页面兜底

特殊能力:

  • 能读取微信公众号文章(Jina 无法处理的场景)
  • 保留标题、链接、图片 URL、列表结构
  • 自动识别中文平台并选择最优路径

使用示例:

抓取 https://example.com/article 的正文内容
读取这篇文章:https://mp.weixin.qq.com/s/xxx

shopify-product-scraper

从品牌电商网站抓取商品数据,生成 Shopify CSV 导入文件,图片自动上传至远程 CDN。

工作流程:

  1. 分析目标站点的商品列表模式
  2. 提取商品信息(名称、价格、描述、规格、图片)
  3. 图片上传至 CDN,生成远程 URL
  4. 输出标准 Shopify CSV

支持的商品页模式:

  • data-* 属性模式
  • 语义化卡片模式
  • JSON-LD 结构化数据
  • Next.js __NEXT_DATA__

使用示例:

抓取 https://www.brand.com/products 的商品数据,生成 Shopify CSV

apify-ultimate-scraper

通用 AI 爬虫,覆盖 55+ 平台,基于 Apify Actor 生态。

支持平台:

  • 社交媒体:Instagram(12个Actor)、Facebook(14个)、TikTok(14个)
  • 视频:YouTube(5个)
  • 搜索:Google Maps、Google Search、Google Trends
  • 旅游:Booking.com、TripAdvisor

输出格式: 快速回答、CSV、JSON

适用场景: 线索获取、品牌监控、竞品分析、影响力调研

使用示例:

搜索 Dubai 地区的 CNC 加工企业
抓取 @username 的 Instagram 帖子

apify-actor-development

开发、调试和部署 Apify Actor — 面向 Web 抓取、自动化和数据处理的无服务器云程序。

支持语言: JavaScript / TypeScript / Python

核心功能:

  • 完整的 Actor 创建流程
  • 本地测试 (apify run)
  • 安全规范(凭据脱敏、输入校验)
  • Standby 模式支持
  • 日志标准

apify-actorization

将现有项目转换为 Apify Actor,实现一键上云。

支持方式:

  • JavaScript/TypeScript:SDK 包装(Actor.init/exit)
  • Python:async context manager 包装
  • 任意语言:CLI wrapper 模式

apify-generate-output-schema

通过分析 Actor 源码,自动生成输出 Schema 文件:

  • dataset_schema.json
  • output_schema.json
  • key_value_store_schema.json

包含 7 个阶段:发现 → 分析 → 生成示例 → 创建 Schema → 验证


skill-creator

创建和更新 Skill 的元指南,提供 Skill 编写的最佳实践、目录结构规范和模板。


环境要求

必装工具

# Node.js (v18+)
npm install -g bb-browser          # markdown-proxy 核心
npm install -g mineru-open-api     # 文档提取

# Apify(可选)
npm install -g apify-cli
apify login

可选配置

工具 配置方式 用途
MinerU Token mineru-open-api auth 解锁精确提取(表格/公式/批量)
Firecrawl API Key .env 文件 markdown-proxy 代理降级
飞书 Open API .env 文件 飞书文档抓取
Apify Token apify login 云端爬虫平台

MCP 服务器

项目已配置 .mcp.json,启用 bb-browser MCP 集成:

{
  "mcpServers": {
    "bb-browser": {
      "command": "npx",
      "args": ["-y", "bb-browser", "--mcp"]
    }
  }
}

目录结构

.claude/
├── skills/
│   ├── apify-actor-development/
│   │   └── skill.md
│   ├── apify-actorization/
│   │   └── skill.md
│   ├── apify-generate-output-schema/
│   │   └── skill.md
│   ├── apify-ultimate-scraper/
│   │   └── skill.md
│   ├── markdown-proxy/
│   │   ├── skill.md
│   │   ├── README.md
│   │   └── .env
│   ├── mineru-ai/
│   │   └── skill.md
│   ├── shopify-product-scraper/
│   │   └── skill.md
│   ├── skill-creator/
│   │   └── skill.md
│   └── web-content-fetcher-main/
│       └── skill.md
├── settings.local.json
└── .env
output/              # 抓取输出数据
.mcp.json            # MCP 服务器配置

快速开始

  1. 克隆仓库到本地
  2. 将 .claude/ 目录放入你的项目,或确保 Claude Code 能访问到 skills
  3. 根据需要安装对应 CLI 工具
  4. 在 Claude Code 中直接使用自然语言触发 Skill:
    • “抓取这个 URL 的内容” → markdown-proxy 或 web-content-fetcher-main
    • “解析这个 PDF” → mineru-ai
    • “抓取这个网站的商品” → shopify-product-scraper
    • “搜索 Instagram 上的…” → apify-ultimate-scraper

License

Private — 仅供授权使用。

View this README on GitHub

Recommended Tools

Try a different keyword or remove a filter.

Install

npx skillfish add liangdabiao/fetch-everything