在日常使用 Claude Code、Codex 等 AI 编程助手时,我们常常需要让 AI 处理各种格式的文档——Word、PPT、Excel、PDF 等。传统做法是为每种文件格式找不同的转换工具,效率低且质量参差不齐,表格丢失、公式错乱是家常便饭。对于构建知识库或训练大模型来说,这种不稳定的文档解析会带来严重影响。
针对这一痛点,Firecrawl 团队开源了 anydoc 工具,上线仅 10 天就收获 15000+ GitHub Star。

Firecrawl 此前以网页抓取转 Markdown 闻名,这次开源 anydoc 补上了本地文档处理这块拼图。它支持将 Word、PPT、Excel、PDF、EPUB 等文件一键转换为干净的 Markdown 格式,覆盖 8 大类格式、14 种扩展名,甚至兼容 2003 年的老旧 .doc 和 .ppt 格式。

anydoc 的实现思路很清晰:先读取文件并理解其内容结构,生成一份统一格式的中间稿——标题、表格、列表等元素全部标记清楚,再将中间稿转换为 Markdown。这种两段式处理让文档维护变得更容易,比如发现表格转换 Bug 时可以直接修正。
格式识别不依赖文件扩展名,而是通过读取文件字节中的特征标记来判断,即使文件名被改错也能正确识别。
转换速度是 anydoc 的核心优势。它采用纯 Rust 实现,不依赖 ML 模型和外部服务,最快仅需 4.4 毫秒。官方用 100 份真实文档与 LibreOffice、Markitdown、Pandoc、Docling 等同类工具横向对比,anydoc 是唯一全面支持 14 种格式且在质量和速度上均排名第一的工具。

细节处理同样到位:合并单元格表格、脚注、代码块、PPT 备注都能保留。文档中的图片会以引用文本形式呈现,原始文件缓存在本地目录中。
anydoc 提供多种使用方式:
- 开发语言集成:提供 Node、Python、Rust 等语言的 SDK,方便集成到项目中
- Skill 安装:通过
npx skills add firecrawl/anydoc安装到 Claude Code、Codex 等 Agent 工具中使用 - 在线 Web 版:浏览器打开即用,所有转换在本地完成,数据不会上传服务器,适合处理敏感文档

当然,anydoc 目前也有局限性:本地模式只能处理常规 PDF,扫描件/纯图片 PDF 无法读取(可通过托管 API 接 OCR 模型解决);加密或带密码保护的文档也会报错。
经过实测,anydoc 对 docx、pptx、xlsx 等常见格式转换效果出色,连 rtf、odt、epub 等小众格式也能干净地转为 Markdown。

近年来,RAG 知识库和 Agent 应用开发持续火热,文档解析却往往是最容易出问题且难以察觉的环节——表格转换丢失一半、检索结果不准,这些问题可能潜伏很久才被发现。
Firecrawl 先解决了网页转 Markdown,现在又补上本地文档处理。两个给 AI 喂数据的核心入口,anydoc 都占住了。未来它能否像 ffmpeg 在音视频领域的地位一样,成为 AI 数据管道的默认底座,值得观察。
GitHub 项目地址:https://github.com/firecrawl/anydoc