Wink Pings

500个DOCX 1.7秒:这个转Markdown的工具,快得有点不讲理

处理文档的人都知道,把DOCX、PDF这些格式转成干净的Markdown有多烦。表格错位、标题丢失、脚注乱跑——每换一个格式,就要重新调试一次。AnyDoc的做法很直接:500个DOCX文件,1.7秒处理完,单个文件不到5毫秒。它不靠文件后缀判断格式,而是直接看内容。

处理文档的人都知道,把 DOCX、PDF 这些格式转成干净的 Markdown 有多烦。表格错位、标题丢失、脚注乱跑——每换一个格式,就要重新调试一次。

AnyDoc 的做法很直接:**500 个 DOCX 文件,1.7 秒处理完,单个文件不到 5 毫秒。**

上面这个视频里,一份英文保密协议的扫描件,被快速识别并转成了结构清晰的 Markdown 文本,标题、条款、签署人信息一目了然。

它怎么做到的?

核心就两点:

**第一,统一文档模型。** 所有格式——Word、PPT、Excel、PDF、RTF、EPUB、CSV,一共 14 种——先解析成同一个中间模型,再用同一个 Markdown 序列器输出。所以不管输入是什么格式,表格转义、标题锚点、脚注这些行为完全一致。你不需要针对不同格式写不同的处理逻辑。

**第二,基于内容识别格式,不依赖后缀。** 文件后缀错了也能正确转换。这意味着什么?你从客户那里收到的那些命名混乱、后缀乱标的文件,扔进去照样能处理。

有人问复杂表格能不能稳住。项目在 GitHub 上开源了,地址在 [github.com/firecrawl/anydoc](https://github.com/firecrawl/anydoc),有兴趣的可以直接拉下来跑跑看。

这类工具的价值不在“能转”——能转的工具有很多。它的价值在于**快**和**一致**。当你需要批量处理几百个文档时,每个文件省下几十秒,累积起来就是几小时。而统一输出格式这件事,省掉的是你在下游处理时一遍遍修补的功夫。

工具类项目做到这个份上,算是想明白了。

发布时间: 2026-08-13 04:33