2026 年 PDF 转 Markdown 工具对比:哪款适合你的文档
一句话版。干净的电子 PDF,几乎什么提取器都够用——别想复杂了。工具的分水岭在难文档上:多栏、合并单元格表格、扫描件、公式。下面:每一类的真实工具名单、三个你可以亲手复现的翻车案例、以及转换出来的 Markdown 到底长什么样。我们就是 Markovo——声明完毕——实测数字在 benchmarks 页。
2026 年市面上的工具格局
"PDF 转 Markdown"不是一种技术,而是四代完全不同的路线——今天卖给你的大多数产品还停在第三代:
| 代际 | 这一类的真实工具 | 怎么读页面 | 在哪翻车 |
|---|---|---|---|
| 第一代 · 文本层 | pdfminer.six、PyPDF2/pypdf、pdf.js、pdftotext | 按文件顺序倒出内嵌文本流 | 任何没有干净文本层的页面;版面语义全丢 |
| 第二代 · 规则启发式 | PyMuPDF 文本字典管线、字号→标题猜测、手写表格查找器 | 文本 + 几何线索(字号、线条位置) | 规则作者没预见到的版面——也就是大多数真实文档 |
| 第三代 · 提取 + 小模型 OCR | OCRmyPDF/Tesseract 管线、pdfplumber 表格提取、模板驱动转换器、绝大多数免费"PDF→MD"网站 | 先吃文本层;没办法时才看像素;剩下的交给小模型 | 多栏阅读顺序、合并/嵌套表格、公式、低分辨率扫描、手写体 |
| 第四代 · 文档模型 | olmOCR 类管线、MinerU、Docling 版面模型、端到端文档视觉模型——以及 Markovo 的生产管线 | 渲染页面;文档级模型直接读版面、单元格、公式区、图注 | 真算力成本;手写体和密集记号仍需人工复核 |
看"怎么读页面"那一列就行:文档里写"提取文本层、必要时走 OCR"的,无论叫什么名字都是第三代。
主流工具逐个看
点名说,不谈抽象——每个"PDF 转 Markdown"帖子里都会出现的那几个,连同人们用过之后才发现的短板:
| 工具 | 运行方式 / 成本 | 擅长 | 要注意 |
|---|---|---|---|
| pdftotext / pdfminer.six | 本地命令行或库 · 免费 | 电子生成的单栏页面,秒出 | 完全没有结构——出来就是一堆文本 |
| PyMuPDF4LLM(Artifex) | 本地 Python · AGPL | 文本层转 Markdown,非常快 | 阅读顺序在图表和多栏处会断;AGPL 协议对商用管线有影响 |
| MarkItDown(Microsoft, MIT) | 本地 Python · 免费 | 一个 API 吃很多种格式 | PDF 出来没有标题结构——章节标题全变普通文本;不带 OCR |
| pdfplumber | 本地 Python · 免费 | 可控的表格区域提取 | 是提取工具箱不是转换器——管线要自己拼 |
| Docling(IBM Research, MIT) | 本地 Python · 免费 | 结构化文档模型;解不出的内容会标记而不是瞎编 | 公式和图片直接丢而不是还原;要下模型 |
| Marker(Datalab) | 本地模型 · 商用条款要先看 | 公式和图;各类型文档表现稳定 | 多栏签名区和参考文献会串行;基本要 GPU |
| MinerU(OpenDataLab) | 本地 VLM · 开源 | 公开 benchmark 上顶级的表格和公式 | 已知会丢脚注文本、把目录行提成标题;GPU 基本必需 |
| Mathpix | 托管 API · 按页计费 | 公式和科学文献 PDF | 只有托管;一次独立测试抓到它在密集表格里静默改数——合计数要自己核 |
| Markovo | 托管 · 按页 Credits,网页 + API + CLI + MCP | 15 种输入出一个可验证的 Markdown bundle;按页路由;OpenDataLoader-Bench 官方榜单第 4/13 | 要花 Credits;手写体和密集记号照样标出来给你复核 |
各家独立 benchmark 的共同结论:上面每个工具都有翻车点——诚实的那些翻得明显。不管选哪个,看它的失败模式,别看演示页。
三个你可以亲手复现的翻车案例
这不是假设场景——公开 benchmark 打分的正是这些类别。
季度业绩表现强劲 另据消息,委员会 各地区营收普遍增长 宣布季度业绩表现 同比增长 12%。 强劲,各地区营收…
季度业绩表现强劲,各地区营收普遍 增长,同比增长 12%。 另据消息,委员会宣布季度业绩表现…
Quarter Success P95 seconds Status Q1 96.2% 4.8 Ready Q2 97.4% 4.4 Ready Q3 98.1% 4.1 Ready
| Quarter | Success | P95 seconds | Status | |---------|---------|-------------|--------| | Q1 | 96.2% | 4.8 | Ready | | Q2 | 97.4% | 4.4 | Ready | | Q3 | 98.1% | 4.1 | Ready |
Tfie clalnt frmn tho Sh3ll Deed of 1844 dEaAwitn d* E = mc2 appearz hereln tha Purchasor c0venants…
The clause from the Shell Deed of 1844 drawing on E = mc² appears herein; the Purchaser covenants…
这三类正是公开 benchmark 打分的地方——我们在全量 200 篇 OpenDataLoader-Bench 和 DP-Bench 上的实测都在 benchmarks 页。
转换出来的 Markdown 长什么样
这是一份真实的 output.md——从转换 bundle 里原样拿出来的,没有为了截图修饰过:
**Quarterly quality dashboard** | Quarter | Success | P95 seconds | Status | |---------|---------|-------------|--------| | Q1 | 96.2% | 4.8 | Ready | | Q2 | 97.4% | 4.4 | Ready | | Q3 | 98.1% | 4.1 | Ready |  Success rate. Success rises from 96.2% at Q1 to 98.1% at Q3; highest 98.1% at Q3; lowest 96.2% at Q1. 
标题是标题、表格是真管道表格、图表转成文字描述、图片是指向 assets/ 里真实文件的引用。Obsidian、VS Code、GitHub 打开即用。bundle 里还带 source_map.json(每行来自哪一页)和 quality_report.json(逐页置信度和复核标记)——验证不需要靠盲信转换器。
为什么要走模型路线——以及代价
文档模型管线把页面先当图片处理:文档级模型能看出十二个碎片组成一个 3×4 表格、这一块是公式、右栏接着左栏往下读——和你自己看页面用的是同一批线索。输出是"这页在展示什么结构",不是"文件里有什么字节"。
代价:视觉模型读一页要 GPU 时间,单页更慢、按页计费——所以我们在转换之前先给你看 Credit 预估。实际答案是两个都用、按页路由:干净文本层走快速提取,需要"看"的页面走文档模型。一份合并的 output.md,每页走了哪条路由记在 source_map.json 里。
你到底需要哪一代
- 电子 PDF、单栏、纯文字 → 一到三代都够用。文本层本身就是答案,没必要花钱让模型再读一遍。
- 表格、多栏论文、扫描件、任何要喂 RAG 的东西 → 要页面感知的路线:通用场景用 PDF 转 Markdown,图片密集用 Image 转 Markdown。
- 无论选哪个,按结构验证:跑公开 benchmark(OpenDataLoader-Bench、DP-Bench),或者先拿一页最难的手动对一遍再上量。
只测 PDF 的对比漏掉了什么
大多数横评测完 PDF 就停了。但真正进管线的文档不全是 PDF——还有 Word 导出、PPT、EPUB 书、截图、会议录音、网页。每种类型换一个转换器,就意味着每种类型一种输出形状。
Markovo 走同一条管线:Word、Excel、PPT、EPUB、图片、音频、视频、Notion、GitHub、YouTube、Hacker News、公开 URL——出来都是同一个带验证资产的 Markdown bundle。而且可以全程脚本化:API、CLI 和 MCP server 返回同一个 bundle,处理 PDF 的那条管线顺便就把整个语料库处理了。
常见问题
2026 年到底哪款 PDF 转 Markdown 工具最好?
看文档。干净的电子 PDF,任何文本层提取器都够用,别花钱让模型重读。表格、多栏、扫描件、要喂 RAG 的内容 → 要文档模型管线,实测差距都在这些类别里。OpenDataLoader-Bench 官方榜单上我们总分第 4(13 个引擎),阅读顺序和表格都是已发布第二——方法和数字在 benchmarks 页。
Markovo 是文档模型转换器吗?
按页路由:干净文本层走快速提取,需要"看"的页面走文档模型——每个 bundle 都带质量证据(逐页置信度、源映射、提取出的资产)。需要人看的页面会被标出来,不是静默近似。
文本层提取什么时候是对的?
电子生成的单栏 PDF:快、便宜、准。错误在于把它当唯一路线,然后对它根本"看不见"的文档也叫"转换"。
怎么客观比较转换器?
跑公开 benchmark 而不是看截图:OpenDataLoader-Bench 和 DP-Bench 用固定规则给真实输出打分、公开基线。我们的跑分——方法、数据集、分数——都在 benchmarks 页。