10+年产品经理专注分享AI 工具、AI 资讯、AI Coding、Vibe Coding与下一代产品创新,按 Ctrl+D 收藏我们
关于我 留言板 小程序 标签云

苏米客

  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
  • 登录
  • 首页
  • AIGC
    • AI最新动态
    • AI学习教程
    • AI工具集合
    • AI产品百科
    • AI编程开发
    • AI提示词
    • AI开源项目
    • AI智能体
  • Axure
    • Axure动态
    • Axure教程
  • 产品
    • 用户体验
    • 产品设计
    • 苏米杂谈
  • 资源
    • 产品UI组件库
    • 开源图标库
    • 中后台框架
  • 书单
    • AI书籍
    • 用户体验
    • UI视觉
    • 产品研究
    • 其他类型
  • 下载
    • Axure组件
    • Axure原型
    • 文档报告
    • 素材资源
当前位置: 首页 » AI开源项目

doc7:1.1K Star 的开源工具,让 AI 像人一样看懂文档而非识别

3小时前 AI开源项目 18 0

今天推荐一个文档转 Markdown 的开源工具 doc7,GitHub 上已收获 1.1K Star。它可以把 PDF、Office、扫描件、截图、图表、公式、流程图等任意文档,通过你自己的多模态模型,转换成 AI 可直接检索、引用和推理的 Markdown 格式。

图片 1

项目简介

doc7 由 magicrew 团队开发,使用 Go 语言编写。核心理念一句话:Any document in. AI-ready Markdown out.

图片 2

核心亮点

不靠 OCR 栈,靠视觉理解

传统文档处理工具采用"分而治之"的流水线架构:OCR 识别文字、布局分析识别版面、表格模型识别表格……每个环节都会丢失信息,误差层层累积。

doc7 的做法完全不同:把整页文档渲染成图像,交给多模态模型去"看"。模型一次性理解页面上所有元素——文字、表格、公式、图表、图示关系——然后直接重建为结构化 Markdown。不是"看清"每个字,而是"看懂"整页内容。

实测数据说话

项目团队在两份纯图片 PDF 上做了公开 Benchmark,15 项可机器校验的视觉事实,doc7 恢复了全部 15 项。对比数据:

  • MarkItDown 0.1.6 + OCR 插件:9/15
  • Docling 2.113.0 标准模式:3/15
  • MarkItDown 默认模式:0/15(直接输出空文件)

更关键的是,doc7 生成的 Markdown 仅 5,293 字节,而 Docling 输出了 2,571,445 字节——体积大了近 500 倍(因嵌入了 Base64 页面图像)。

不收费、不绑定、不锁死

  • 不卖文档额度:不按页、不按图片、不按转换次数收费
  • 不绑定模型:可用任何兼容 OpenAI 接口的多模态模型,包括本地部署
  • 不锁定服务:无必需的 OCR 技术栈或文档处理服务
  • 文档留在本地:配合本地模型部署,内容完全不出你的基础设施

用项目的话来说:"当硬件已经存在时,新增一份文档的边际成本主要只剩电力和运行时间。"

一套流程,所有格式

PDF、Word、PPT、Excel、图片、扫描件——不同格式进入同一个页面理解管线,产出统一的 Markdown。不需要为不同格式维护不同的处理工具。

功能特性

  • 多格式支持:支持几乎所有常见文档格式
  • 内置 Agent:自带轻量 Agent,运行在配置的本地模型上
  • 断点续跑和选择性重跑
  • 远程文档处理 + HTTP 服务
  • 批量目录处理
  • MCP 与 Go SDK

图片 3

快速上手

第一步:安装 doc7

macOS / Linux:

curl -fsSL https://raw.githubusercontent.com/magicrew/doc7/main/scripts/install.sh | bash

Windows PowerShell:

irm https://raw.githubusercontent.com/magicrew/doc7/main/scripts/install.ps1 | iex

也可以直接从 GitHub Releases 页面下载对应平台的压缩包。

第二步:准备视觉模型

需要兼容 OpenAI 接口的多模态模型:

  • 本地模型(推荐):安装 LM Studio 或 Ollama,加载支持视觉的模型(如 qwen3.5-9b、llama3.2-vision 等),启动本地服务。默认地址:http://127.0.0.1:1234/v1
  • 远程 API:使用任何兼容 OpenAI 接口的视觉模型服务,配置 API Key

第三步:首次配置

# 查看可用模型
doc7 models --base-url http://localhost:8000/v1

# 保存配置
doc7 setup config \
  --base-url http://localhost:8000/v1 \
  --model

# 如果需要 API Key
doc7 setup config --api-key-stdin

第四步:检查环境

# 检查本地依赖和模型连通性
doc7 doctor --check-model

# 检查特定文件格式的依赖
doc7 doctor report.docx --check-model

第五步:开始转换

# 最简单的用法
doc7 report.pdf

# 指定输出目录
doc7 read report.pdf -o output-dir

# 处理截图
doc7 screenshot.png

# 批量处理目录
doc7 read ./documents -o ./knowledge

# 从 stdin 管道输入
cat report.pdf | doc7 read - --stdin-name report.pdf --stdout > report.md

总结

使用 doc7 处理后,表格结构完整,条款分段清晰,连页脚的法律声明都能准确识别。如果你手里有一堆格式混乱的文档想喂给 AI,不想花大把时间搭环境、调参数,也不想被按页计费的服务收割,doc7 值得试试。

它代表的方向是:让 AI 像人一样"看懂"文档,而不是像机器一样"识别"文档。

GitHub 项目地址:https://github.com/magicrew/doc7

声明:本站原创文章文字版权归本站所有,转载务必注明作者和出处;本站转载文章仅仅代表原作者观点,不代表本站立场,图文版权归原作者所有。如有侵权,请联系我们删除。
未经允许不得转载:doc7:1.1K Star 的开源工具,让 AI 像人一样看懂文档而非识别
#doc7 #文档转换 #Markdown #多模态模型 #开源工具 
收藏 1
DeepSeek Harness 首发体验:它不想做下一个 Codex
Claude Code 和 Codex 能当 DeepSeek Harness 的子 Agent?几分钟上手教程
推荐阅读
  • Wan2.2-Animate:一键生成角色动画与视频替换的开源神器
  • baoyu-skills:又一个宝藏Skill,面向内容创作者的技能集,支持图文生成、发布与处理
  • RTK 开源工具实测:Claude Code 会话 Token 节省 80%,16.8K Star 验证有效性
  • AnythingLLM:一个全栈式的本地化私有知识库与企业级文档聊天平台
  • PPTAgent:一个把文档自动转成结构化幻灯片的开源 AI 系统
评论 (0)
请登录后发表评论
分类精选
WeKnora:终于等到了腾讯ima的开源知识库框架,用 API 轻松打造本地智能文档检索
11610 11月前
OpenSpec:比 Cursor Plan 更聪明?试试这款让 AI 编码更靠谱的规范驱动工具
10425 10月前
CapCut API:一个剪映API开源项目,让AI自动剪辑视频
9511 8月前
Antigravity-Manager:这个开源神器让你白嫖ClaudeOpus 4.5,Gemini 3!还能接Claude Code等任意平台
8598 7月前
AIRI:你的开源AI女友,让你随时拥有属于自己的 AI VTuber
8539 11月前
CompressO:开源免费的视频压缩神器,让你的硬盘瞬间轻松 10 倍
8162 11月前
就要创作:从提示词到创作团队,开源 AI 网文写作平台
8076 10月前
awesome-openclaw-skills:700+ Skills 一条命令装配完成,如何让本地 AI Agent 真正落地可用
7721 6月前
baoyu-skills:又一个宝藏Skill,面向内容创作者的技能集,支持图文生成、发布与处理
7243 6月前
Claude Code 生成专业图表的 15 个 Skills:覆盖 7 种渲染引擎的完整指南
7106 4月前

文章目录

关注「苏米客」公众号

订阅推送更及时,手机查看更方便
分类排行
1 doc7:1.1K Star 的开源工具,让 AI 像人一样看懂文档而非识别
2 Agent Reach:给 AI Agent 装上上网能力的开源工具,支持 15+ 平台
3 Firecrawl 开源 anydoc:10 天 1.5 万 Star,14 种格式文档转 Markdown
4 Codex Security 开源:OpenAI 安全扫描插件,支持多 Agent 工具链接入
5 story-to-handdrawn-video:把中文故事转化为手绘动画的开源 Skill,20种风格可选
6 i-have-adhd:一份 SKILL.md 让 AI 回答先说重点,GitHub 1.8 万星
7 photo-abstract-editorial:Codex 技能,把照片变成抽象艺术编辑作品
8 anydoc:14 种办公格式统一转 Markdown,5ms 极速转换
9 Prime Agent:会自我沉淀经验的开源 AI 代理架构,9.2k Stars
10 AirLLM:4GB 显存跑 70B 大模型的逐层加载推理方案
©2015-2024 苏米客XMSUMI 版权所有 · WWW.XMSUMI.COM 闽ICP备14005900号-6
微信文章助手 程序库 免费影视APP 免费字体下载 产品经理导航 爱克硕儿 产品经理AI资讯 Axure元件库下载 申请友联