Everything to Markdown by 星球小捕手
原理博客

把资料变成 AI 可读的 Markdown

我们写这组文章,拆解 Everything to Markdown 背后那些"看起来理所当然、其实各有讲究"的事: 为什么是 Markdown、14 种格式如何归一、格式怎么被识别、为什么要在你浏览器里跑、以及 PDF 到底卡在哪里。

为什么 AI 需要 Markdown:资料形态与"可读"的含义

一段 Word 复制到聊天框里往往只剩一堆乱码和换行。AI 真正能吃进去的,是结构化、低噪声、语义明确的文本——这恰恰是 Markdown 的强项。

统一文档模型:14 种格式如何归一为一套 Markdown

Word、PPT、Excel 的内部结构天差地别。本文讲清楚"先解析进同一个中间模型,再统一序列化"这条管线,为什么比逐格式硬编码更稳。

不看扩展名:格式到底是怎么被识别出来的

.pdf 不一定是 PDF,.docx 也可能只是改了名的 ZIP。Everything to Markdown 看的是文件内容本身——这是一个比你想的更可靠的做法。

为什么转换应该发生在你的浏览器里

上传到服务器转,等于把资料交了出去。本地 WebAssembly 转换既保护隐私,又把延迟压到毫秒级。这两者并非不能兼得。

PDF 的边界:文本型与扫描型,以及 OCR 之外的事

同样是 PDF,有的能完美转成 Markdown,有的连一个字都提不出来。差别不在工具,而在文件本身有没有"文字层"。

关于 Everything to Markdown

Everything to Markdown星球小捕手 打造,借鉴并参考了开源文档转换模型 Firecrawl anydoc (Rust → WebAssembly,MIT 许可证),把"各种资料转成 AI 能读懂的 Markdown"做成一个简单、本地、轻量的网页工具。