最后更新:2026 年 9 月 · 阅读时长:约 6 分钟 · 适用:写博客、技术文档、研究者
需要把 PDF 内容搬到 Markdown:
为什么要转 Markdown?
| 格式 | 编辑 | 版本控制 | 搜索 | 平台兼容 |
|---|---|---|---|---|
| Markdown | ✅ 任何编辑器 | ✅ Git | ✅ 全局 | ✅ 全平台 |
| Word | ⚠️ 复杂 | ❌ | ⚠️ | ⚠️ |
| PDF | ❌ | ❌ | ❌ | ✅ |
Markdown 是写作者的瑞士军刀。
✅ 保留结构 · ✅ 公式转换 · ✅ 本地处理
Markdown = 纯文本 + 简单标记语法:
# 标题
粗体 *斜体*
链接
!图片
> 引用
- 列表
1. 编号
\代码\
\\\
代码块
\\\
| PDF 元素 | Markdown 等价 | 难度 |
|---|---|---|
| 标题 | # H1 | ⭐ 简单 |
| 段落 | 普通文本 | ⭐ 简单 |
| 列表 | - item | ⭐⭐ 中等 |
| 表格 | \| \| \| | ⭐⭐⭐ 难 |
| 图片 | !alt | ⭐⭐ 中等 |
| 数学公式 | $LaTeX$ | ⭐⭐⭐⭐ 难 |
| 代码块 | ` | ⭐⭐ 中等 |
| 引用 | > quote | ⭐ 简单 |
关键:AI 识别准确率 85-95%,公式和表格最难。
| 项目 | 评分 |
|---|---|
| 价格 | ⭐⭐⭐⭐⭐ 完全免费 |
| 结构保留 | ⭐⭐⭐⭐ 90%+ |
| 公式 | ⭐⭐⭐⭐ LaTeX 输出 |
| 表格 | ⭐⭐⭐⭐ Markdown 表格 |
| 图片 | ⭐⭐⭐⭐ 自动提取 |
| OCR | ⭐⭐⭐⭐ 支持 |
| 隐私 | ⭐⭐⭐⭐⭐ 本地 |
优点:专门为 Markdown 设计、公式转换好
缺点:浏览器版本要新
网址:github.com/datalab-to/marker
| 项目 | 评分 |
|---|---|
| 价格 | ⭐⭐⭐⭐⭐ 开源免费 |
| 结构保留 | ⭐⭐⭐⭐⭐ 95%+ |
| 公式 | ⭐⭐⭐⭐⭐ LaTeX(最强)|
| 表格 | ⭐⭐⭐⭐ |
| 图片 | ⭐⭐⭐⭐ |
| OCR | ⭐⭐⭐⭐⭐ |
| 隐私 | ⭐⭐⭐⭐⭐ 本地(需 Python) |
优点:开源、转换质量业界最强
缺点:需要 Python + GPU 环境
网址:github.com/facebookresearch/nougat
| 项目 | 评分 |
|---|---|
| 价格 | ⭐⭐⭐⭐⭐ 开源免费 |
| 结构保留 | ⭐⭐⭐⭐ |
| 公式 | ⭐⭐⭐⭐⭐ |
| 学术论文 | ⭐⭐⭐⭐⭐ 专为论文设计 |
| OCR | ⭐⭐⭐⭐⭐ |
| 隐私 | ⭐⭐⭐⭐⭐ 本地 |
优点:学术论文转换最强
缺点:需要 Python + GPU
| 工具 | 公式 | 学术 | 普通 PDF | 上手难度 |
|---|---|---|---|---|
| 简盒 | ⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐ 简单 |
| Marker | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐ | ⭐⭐⭐ 难 |
| Nougat | ⭐⭐⭐⭐⭐ | ⭐⭐⭐⭐⭐ | ⭐⭐⭐ | ⭐⭐⭐⭐ 难 |
推荐:
典型问题:下载一篇英文论文,做笔记。
方案:
效果:
典型问题:公司 PDF 文档,需要搬到 GitHub。
方案:
注意:图片会单独保存,需要手动上传到仓库。
典型问题:买了电子书 PDF,想摘抄到笔记。
方案:
注意:受 DRM 保护的电子书不能转换。
典型问题:想把 PDF 报告的内容搬到博客。
方案:
注意:引用要标注来源,尊重版权。
PDF 转 Markdown,公式转换的 3 个层次:
| 层次 | 准确率 | 输出 |
|---|---|---|
| 简单公式(a²+b²=c²) | 95%+ | LaTeX |
| 中等公式(积分、矩阵) | 80-90% | LaTeX(部分需修正)|
| 复杂公式(多行、嵌套) | 50-70% | 可能丢失 |
修正方法:用 Mathpix(学术专业)或手动修正。
PDF 表格转 Markdown 的难点:
PDF 表格 → 智能识别行列 → 生成 Markdown 表格
简盒用 AI 模型识别表格边界,准确率 80-85%。复杂合并单元格可能丢失。
转换后图片处理:
原 PDF 图片 → 提取 → 嵌入 Markdown
简盒默认自动提取图片并嵌入 Markdown(用 base64 编码)。
注意:如果 PDF 图片很多,生成的 .md 文件会很大(> 10MB)。
转换时勾选「保留页码注释」:
[第 12 页]
# 标题
正文...
用途:方便对照原 PDF 引用。
原因:PDF 字体未嵌入
解决:
原因:PDF 公式是图片,不是文本
解决:
原因:原 PDF 表格不规范
解决:
原因:扫描版是图片,没有文字层
解决:
原因:默认未保留图片
解决:
如果你有很多 PDF 要处理(100+ 篇论文):
PDF 批量下载 → Marker/Nougat 批量转换 → Obsidian/Logseq 索引
| 工具 | 用途 |
|---|---|
| Zotero | 文献管理 |
| ZotFile | PDF 自动重命名 |
| Marker | PDF → Markdown 批量转换 |
| Obsidian | Markdown 笔记 |
| Obsidian Citations | 论文引用插件 |
完整教程:简盒博客 - 学术工作流
特点:
本文由 简盒 JianHeBox 编辑整理。