起因是自己整理论文和年报的时候,PDF 转 Markdown 老是转出一堆垃圾:表格塌成一坨纯文本、标题层级全乱、参考文献里的链接指向不存在的锚点。市面上的在线工具要么要登录,要么每天限次数,要么得先把文件传到别人服务器上。
所以自己做了一个: https://pdf2md.me/
四个点:
1. 免费。没有付费墙,没有每日次数限制。
2. 免登录。打开就能用,不用注册,也不用留邮箱。
3. 快。本地直接跑,不排队、不等服务端队列。
4. 隐私。整个转换在你自己的浏览器里完成,PDF 一个字节都不会上传到服务器,所以合同、内部文档也能放心转。
单个文件支持到 1000 页。
做的时候拿了几份真实文档跟同类工具对了一下:
- 293 页年报的表格:这边输出 2469 行表格,pdf2md.net 输出 0 行。
- 15 页论文的标题层级:PDF.ai 转出 310 个 H2 、一个 H1 都没有,这边保留原始层级。
- 参考文献链接:iLovePDF 的 43 个链接里 38 个是死锚点,这边 68 个链接零死锚。
页面上有个 sample 可以直接点开试,不用自己翻 PDF 。扫描件(纯图片 PDF )目前不做 OCR ,会直接告诉你这是扫描件,而不是硬转出一堆乱码。
欢迎试试,遇到转崩的 PDF 欢迎丢过来。
所以自己做了一个: https://pdf2md.me/
四个点:
1. 免费。没有付费墙,没有每日次数限制。
2. 免登录。打开就能用,不用注册,也不用留邮箱。
3. 快。本地直接跑,不排队、不等服务端队列。
4. 隐私。整个转换在你自己的浏览器里完成,PDF 一个字节都不会上传到服务器,所以合同、内部文档也能放心转。
单个文件支持到 1000 页。
做的时候拿了几份真实文档跟同类工具对了一下:
- 293 页年报的表格:这边输出 2469 行表格,pdf2md.net 输出 0 行。
- 15 页论文的标题层级:PDF.ai 转出 310 个 H2 、一个 H1 都没有,这边保留原始层级。
- 参考文献链接:iLovePDF 的 43 个链接里 38 个是死锚点,这边 68 个链接零死锚。
页面上有个 sample 可以直接点开试,不用自己翻 PDF 。扫描件(纯图片 PDF )目前不做 OCR ,会直接告诉你这是扫描件,而不是硬转出一堆乱码。
欢迎试试,遇到转崩的 PDF 欢迎丢过来。