10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 标签云 排行榜

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI开源项目

webclaw:1.5K Star 的 AI 网页提取工具,Token 优化 90%,速度快 20 倍

3月前 AI开源项目 711 0

最近在构建 RAG 系统时,需要将大量技术文档喂给大模型。一开始使用常规的网页抓取方案,结果抓回来的内容惨不忍睹——导航栏、页脚、广告、脚本代码混在一起,50000 token 的 HTML 里真正有用的内容不到 800 token。

更麻烦的是,有些网站加了 Cloudflare 防护,直接返回 403 或验证码页面。用 Playwright 跑无头浏览器又慢又重,一个请求要等好几秒。尝试了 trafilatura、newspaper3k、readability 等开源项目,效果都不理想。

直到发现了 webclaw,一款专为 AI 工作流设计的高性能网页提取工具。

图片 1

项目介绍

webclaw 的核心目标很明确:把网页转成干净、结构化、适合大模型使用的内容。

图片 2

不同于传统抓取工具,webclaw 从底层重新设计了整个提取流程。它用 Rust 编写,通过 TLS 指纹模拟浏览器行为,无需启动真正的浏览器就能绕过大多数反爬机制。提取引擎会自动识别并剔除导航栏、广告、脚本等无用信息,只保留核心正文。

核心亮点

Token 优化:减少 90% 无效信息

原始 HTML 页面通常包含大量导航链接、CSS 样式、脚本代码和重复的页脚内容。这些信息对人类阅读是必要的,但对 AI 模型纯粹是浪费 token。

webclaw 采用九步优化流水线,通过文本密度、语义标签、链接比例、位置信息和上下文相关性等指标对 DOM 节点综合评分。导航栏、广告、页脚、评论区等低分值节点会被自动剔除,而文章正文、标题、图片说明等高分值节点会被保留并整理。

极速响应:比 Chrome 方案快 20 倍

传统的 Playwright、Selenium 方案需要启动完整的浏览器实例,加载渲染引擎、JavaScript 引擎、CSS 解析器等,每个请求耗时 2-3 秒。对于需要频繁访问网页的 AI Agent 来说,这种延迟无法接受。

webclaw 不启动浏览器,而是在 TLS 层面模拟浏览器行为——TCP 握手、加密套件、扩展信息、指纹特征全部模拟 Chrome 的行为,让反爬系统误以为是真实用户访问。性能表现:

  • 静态页面平均响应时间仅 118ms
  • 本地提取 10KB 页面只需 0.8ms
  • 本地提取 100KB 页面只需 3.2ms
  • 本地提取 500KB 页面只需 12.1ms
  • 整体性能比基于 Chrome 的方案快 20 倍

原生 MCP 支持:无缝接入 AI Agent

webclaw 内置了 MCP(Model Context Protocol)服务器,可以直接接入 Claude Code、Cursor、Windsurf、OpenCode、Codex 等主流 AI 工具,无需编写适配代码。

只需一行命令即可完成配置:

npx create-webclaw

该命令会自动检测已安装的 AI 工具,并为每个工具生成相应配置文件。配置完成后重启 AI 工具,webclaw 的所有功能就会自动可用,Agent 可以直接执行网页抓取、站点爬取、内容对比、品牌信息提取等操作。

智能反爬绕过:自动应对 Cloudflare

现代网站普遍使用 Cloudflare、Akamai、DataDome 等反爬系统。这些系统会检查 TLS 指纹、浏览器特征等,普通的 HTTP 请求很容易被拦截。

webclaw 通过 primp 库在底层模拟 Chrome 的 TLS 指纹,使请求看起来完全像来自真实浏览器。对于需要 JavaScript 渲染的页面,webclaw 会自动检测并切换到渲染路径,无需手动配置。

丰富的输出格式

webclaw 支持多种输出格式:

格式 适用场景
markdown 保留结构的干净内容
llm 专为大模型优化的紧凑格式
text 纯文本,最小化格式
json 结构化元数据和提取字段
html 清理后的 HTML

其中 llm 格式会进一步去除重复链接、空段落等,是喂给 RAG 系统的最佳选择。

快速上手

方法一:MCP 一键安装(推荐)

npx create-webclaw

方法二:Homebrew(macOS)

brew tap 0xMassi/webclaw
brew install webclaw

方法三:预编译二进制

从 GitHub Releases 页面下载 macOS 或 Linux 二进制文件:github.com/0xMassi/webclaw/releases

方法四:Docker

docker run --rm ghcr.io/0xmassi/webclaw https://example.com

使用示例

基础提取:

# 提取单页内容(默认 markdown 格式)
webclaw https://example.com

# 指定输出格式
webclaw https://example.com --format markdown
webclaw https://example.com --format llm
webclaw https://example.com --format json

只保留主内容:

webclaw https://example.com/blog/post --only-main-content

自定义选择器:

webclaw https://example.com \
  --include "article, main, .content" \
  --exclude "nav, footer, .sidebar, .ad"

爬取文档站:

webclaw https://docs.rust-lang.org --crawl --depth 2 --max-pages 50

提取品牌信息:

webclaw https://github.com --brand

页面变化对比:

# 保存快照
webclaw https://example.com/pricing --format json > pricing-old.json

# 对比变化
webclaw https://example.com/pricing --diff-with pricing-old.json

SDK 使用

TypeScript:

import { Webclaw } from "@webclaw/sdk";
const client = new Webclaw({
  apiKey: process.env.WEBCLAW_API_KEY!
});
const page = await client.scrape({
  url: "https://example.com",
  formats: ["markdown"],
  only_main_content: true,
});
console.log(page.markdown);

Python:

from webclaw import Webclaw
client = Webclaw(api_key="wc_your_key")
page = client.scrape(
    "https://example.com",
    formats=["markdown"],
    only_main_content=True,
)
print(page.markdown)

总结

webclaw 是一款真正理解 AI 工作流需求的网页提取工具。它从底层重新设计了网页提取流程,通过 TLS 指纹模拟、智能内容评分、多格式输出等特性,解决了传统抓取工具的三大痛点:

  • 抓不到——反爬防护
  • 抓不干净——大量噪声
  • 抓了没用——格式不适合 AI

如果你正在构建 RAG 系统、AI Agent,或者需要定期抓取网页内容,webclaw 值得一试。

GitHub:github.com/0xMassi/webclaw

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:webclaw:1.5K Star 的 AI 网页提取工具,Token 优化 90%,速度快 20 倍
#webclaw #网页提取 #AI工具 #MCP #网页抓取 
收藏 1
字节 Seed-Audio 1.0 实测:从语音合成到语音创作的突破
Ponytail:让 AI 写代码前先思考的开源项目,减少 54% 代码量
推荐阅读
  • PageAgent:阿里开源AI智能体,无需后端部署即可轻松集成
  • FluentRead:开源浏览器翻译插件,轻松实现沉浸式阅读体验
  • JSON Render:用结构化JSON重新定义AI生成前端代码的边界
  • ai-website-cloner-template:21.7k 星的开源网站逆向工程工具,截图生成 Next.js 项目
  • AirLLM:4GB 显存跑 70B 大模型的逐层加载推理方案
评论 (0)
请登录后发表评论
分类精选
WeKnora:终于等到了腾讯ima的开源知识库框架,用 API 轻松打造本地智能文档检索
12451 1年前
OpenSpec:比 Cursor Plan 更聪明?试试这款让 AI 编码更靠谱的规范驱动工具
10730 11月前
CapCut API:一个剪映API开源项目,让AI自动剪辑视频
10330 9月前
AIRI:你的开源AI女友,让你随时拥有属于自己的 AI VTuber
9221 1年前
Antigravity-Manager:这个开源神器让你白嫖ClaudeOpus 4.5,Gemini 3!还能接Claude Code等任意平台
9137 8月前
CompressO:开源免费的视频压缩神器,让你的硬盘瞬间轻松 10 倍
8708 1年前
就要创作:从提示词到创作团队,开源 AI 网文写作平台
8553 11月前
awesome-openclaw-skills:700+ Skills 一条命令装配完成,如何让本地 AI Agent 真正落地可用
8086 7月前
Claude Code 生成专业图表的 15 个 Skills:覆盖 7 种渲染引擎的完整指南
7959 5月前
baoyu-skills:又一个宝藏Skill,面向内容创作者的技能集,支持图文生成、发布与处理
7893 8月前

文章目录

关于苏米客
分类排行
1 MiniMax Code 开源 CLI 并上线 ZCode 会话迁移插件,剑指 AI 编程工具市场
2 Jev 开源替代 Nimble 与 Kev:对比数据训练与极致轻量的 System One 模型复刻
3 DSH Desktop 开源项目:DeepSeek Harness 桌面客户端,新增企业级管控功能
4 Compositor 开源项目:仅 7MB 的轻量级 Photoshop 平替,支持图层与 PSD 兼容
5 remiqora 开源项目:本地 AI 音乐工作站,集成 ACE-Step 与 YuE2 双模型
6 browser-use 开源 jev-ultrafast:Jev 模型驱动浏览器 Agent,协议调用降 91%
7 jit-motion 开源 Skill:一份 PRD 生成产品宣传动画,单文件 HTML 支持四画幅自适应
8 Marketing Skills 开源项目:把营销方法论转化为 AI Agent 可调用技能库
9 开源 Skill 实战:用代码渲染生成产品宣传片,零素材成本还原产品视觉风格
10 Jev Visual:前 OpenAI 员工开源决策模型的视觉版,Mac 本地运行多模态判断
苏米客
登录 注册
显示
没有账号? · 立即注册
显示
已有账号? · 直接登录
登录代表你已同意 用户协议 和 隐私政策
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6 网站地图 百度地图
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联