2026 年 PDF 转 Markdown 工具对比:哪款适合你的文档

一句话版。干净的电子 PDF,几乎什么提取器都够用——别想复杂了。工具的分水岭在难文档上:多栏、合并单元格表格、扫描件、公式。下面:每一类的真实工具名单、三个你可以亲手复现的翻车案例、以及转换出来的 Markdown 到底长什么样。我们就是 Markovo——声明完毕——实测数字在 benchmarks 页

2026 年市面上的工具格局

"PDF 转 Markdown"不是一种技术,而是四代完全不同的路线——今天卖给你的大多数产品还停在第三代:

代际这一类的真实工具怎么读页面在哪翻车
第一代 · 文本层pdfminer.six、PyPDF2/pypdf、pdf.js、pdftotext按文件顺序倒出内嵌文本流任何没有干净文本层的页面;版面语义全丢
第二代 · 规则启发式PyMuPDF 文本字典管线、字号→标题猜测、手写表格查找器文本 + 几何线索(字号、线条位置)规则作者没预见到的版面——也就是大多数真实文档
第三代 · 提取 + 小模型 OCROCRmyPDF/Tesseract 管线、pdfplumber 表格提取、模板驱动转换器、绝大多数免费"PDF→MD"网站先吃文本层;没办法时才看像素;剩下的交给小模型多栏阅读顺序、合并/嵌套表格、公式、低分辨率扫描、手写体
第四代 · 文档模型olmOCR 类管线、MinerU、Docling 版面模型、端到端文档视觉模型——以及 Markovo 的生产管线渲染页面;文档级模型直接读版面、单元格、公式区、图注真算力成本;手写体和密集记号仍需人工复核

看"怎么读页面"那一列就行:文档里写"提取文本层、必要时走 OCR"的,无论叫什么名字都是第三代。

主流工具逐个看

点名说,不谈抽象——每个"PDF 转 Markdown"帖子里都会出现的那几个,连同人们用过之后才发现的短板:

工具运行方式 / 成本擅长要注意
pdftotext / pdfminer.six本地命令行或库 · 免费电子生成的单栏页面,秒出完全没有结构——出来就是一堆文本
PyMuPDF4LLM(Artifex)本地 Python · AGPL文本层转 Markdown,非常快阅读顺序在图表和多栏处会断;AGPL 协议对商用管线有影响
MarkItDown(Microsoft, MIT)本地 Python · 免费一个 API 吃很多种格式PDF 出来没有标题结构——章节标题全变普通文本;不带 OCR
pdfplumber本地 Python · 免费可控的表格区域提取是提取工具箱不是转换器——管线要自己拼
Docling(IBM Research, MIT)本地 Python · 免费结构化文档模型;解不出的内容会标记而不是瞎编公式和图片直接丢而不是还原;要下模型
Marker(Datalab)本地模型 · 商用条款要先看公式和图;各类型文档表现稳定多栏签名区和参考文献会串行;基本要 GPU
MinerU(OpenDataLab)本地 VLM · 开源公开 benchmark 上顶级的表格和公式已知会丢脚注文本、把目录行提成标题;GPU 基本必需
Mathpix托管 API · 按页计费公式和科学文献 PDF只有托管;一次独立测试抓到它在密集表格里静默改数——合计数要自己核
Markovo托管 · 按页 Credits,网页 + API + CLI + MCP15 种输入出一个可验证的 Markdown bundle;按页路由;OpenDataLoader-Bench 官方榜单第 4/13要花 Credits;手写体和密集记号照样标出来给你复核

各家独立 benchmark 的共同结论:上面每个工具都有翻车点——诚实的那些翻得明显。不管选哪个,看它的失败模式,别看演示页。

三个你可以亲手复现的翻车案例

这不是假设场景——公开 benchmark 打分的正是这些类别。

案例 1 · 多栏阅读顺序任何双栏论文或杂志
第三代输出
季度业绩表现强劲   另据消息,委员会
各地区营收普遍增长   宣布季度业绩表现
同比增长 12%。     强劲,各地区营收…
文档实际内容
季度业绩表现强劲,各地区营收普遍
增长,同比增长 12%。

另据消息,委员会宣布季度业绩表现…
原因:提取器按文件顺序读文本碎片——左栏第 1 行、右栏第 1 行——根本没有"栏"的概念。
案例 2 · 表格结构任何财报或规格表
第三代输出
Quarter Success P95 seconds Status
Q1 96.2% 4.8 Ready Q2 97.4% 4.4
Ready Q3 98.1% 4.1 Ready
你真正需要的
| Quarter | Success | P95 seconds | Status |
|---------|---------|-------------|--------|
| Q1      |   96.2% |         4.8 | Ready  |
| Q2      |   97.4% |         4.4 | Ready  |
| Q3      |   98.1% |         4.1 | Ready  |
原因:PDF 里没有"表格"对象——只有摆好位置的文本碎片和几条线。还原单元格需要理解网格,不是按行读。
案例 3 · 扫描件与公式老扫描件、合同、学术 PDF
小模型 OCR 输出
Tfie clalnt frmn tho Sh3ll Deed of
1844  dEaAwitn d* E = mc2 appearz
hereln  tha Purchasor c0venants…
文档模型读出的
The clause from the Shell Deed of
1844 drawing on E = mc² appears
herein; the Purchaser covenants…
原因:Tesseract 级模型在词级读字形,没有文档级上下文——它没法用版面信息把 "Tfie" 纠正回 "The"。

这三类正是公开 benchmark 打分的地方——我们在全量 200 篇 OpenDataLoader-Bench 和 DP-Bench 上的实测都在 benchmarks 页

转换出来的 Markdown 长什么样

这是一份真实的 output.md——从转换 bundle 里原样拿出来的,没有为了截图修饰过:

output.mdproofs/table bundle
**Quarterly quality dashboard**

| Quarter | Success | P95 seconds | Status |
|---------|---------|-------------|--------|
| Q1      |   96.2% |         4.8 | Ready  |
| Q2      |   97.4% |         4.4 | Ready  |
| Q3      |   98.1% |         4.1 | Ready  |

![Quality dashboard embedded image 1](assets/sheet-1-image-1-d09aca096ccd3886.png)

Success rate. Success rises from 96.2% at Q1 to 98.1% at Q3; highest 98.1% at Q3; lowest 96.2% at Q1.

![Success rate](assets/sheet-1-chart-1-336c797e94ae8a26.svg)

标题是标题、表格是真管道表格、图表转成文字描述、图片是指向 assets/ 里真实文件的引用。Obsidian、VS Code、GitHub 打开即用。bundle 里还带 source_map.json(每行来自哪一页)和 quality_report.json(逐页置信度和复核标记)——验证不需要靠盲信转换器。

为什么要走模型路线——以及代价

文档模型管线把页面先当图片处理:文档级模型能看出十二个碎片组成一个 3×4 表格、这一块是公式、右栏接着左栏往下读——和你自己看页面用的是同一批线索。输出是"这页在展示什么结构",不是"文件里有什么字节"。

代价:视觉模型读一页要 GPU 时间,单页更慢、按页计费——所以我们在转换之前先给你看 Credit 预估。实际答案是两个都用、按页路由:干净文本层走快速提取,需要"看"的页面走文档模型。一份合并的 output.md,每页走了哪条路由记在 source_map.json 里。

你到底需要哪一代

只测 PDF 的对比漏掉了什么

大多数横评测完 PDF 就停了。但真正进管线的文档不全是 PDF——还有 Word 导出、PPT、EPUB 书、截图、会议录音、网页。每种类型换一个转换器,就意味着每种类型一种输出形状。

Markovo 走同一条管线:WordExcelPPTEPUB图片音频视频NotionGitHubYouTubeHacker News公开 URL——出来都是同一个带验证资产的 Markdown bundle。而且可以全程脚本化:API、CLI 和 MCP server 返回同一个 bundle,处理 PDF 的那条管线顺便就把整个语料库处理了。

常见问题

2026 年到底哪款 PDF 转 Markdown 工具最好?

看文档。干净的电子 PDF,任何文本层提取器都够用,别花钱让模型重读。表格、多栏、扫描件、要喂 RAG 的内容 → 要文档模型管线,实测差距都在这些类别里。OpenDataLoader-Bench 官方榜单上我们总分第 4(13 个引擎),阅读顺序和表格都是已发布第二——方法和数字在 benchmarks 页

Markovo 是文档模型转换器吗?

按页路由:干净文本层走快速提取,需要"看"的页面走文档模型——每个 bundle 都带质量证据(逐页置信度、源映射、提取出的资产)。需要人看的页面会被标出来,不是静默近似。

文本层提取什么时候是对的?

电子生成的单栏 PDF:快、便宜、准。错误在于把它当唯一路线,然后对它根本"看不见"的文档也叫"转换"。

怎么客观比较转换器?

跑公开 benchmark 而不是看截图:OpenDataLoader-Bench 和 DP-Bench 用固定规则给真实输出打分、公开基线。我们的跑分——方法、数据集、分数——都在 benchmarks 页