Everything to Markdown by 星球小捕手

为什么 AI 需要 Markdown:资料形态与"可读"的含义

你大概有过这样的经历:从一份 Word 里选中一段,复制,粘进聊天框或某个 AI 对话框,结果排版全乱、表格变成乱码、图片失踪,只剩一堆奇怪的换行和空格。这并不是你操作错了,而是——大多数"资料"天生不是给机器读的

资料的两副面孔

一份 .docx 文件,对人类和对于程序,是完全不同的两样东西。

对人来说,它是"带格式的文档":标题加粗、段落缩进、表格对齐、配图居中。你一眼就能读懂它的意图。但对一个大模型来说,它首先是一堆 ZIP 压缩包里的 XML 节点,里面混着样式定义、修订记录、嵌入字体、缩略图……真正"内容"被埋在噪声里。

AI 不关心你的标题用了几号字体,它关心的是:这句话是标题还是正文?这条数据属于哪一行哪一列?这段引用是谁说的?

Markdown 为什么是"机器友好"的格式

Markdown 之所以成为 AI 工作流里的通用语,不是因为它时髦,而是因为它同时满足三件事:

  • 结构化#-| 这些符号明确表达了层级、列表、表格,而不是靠视觉位置暗示。
  • 低噪声:没有字体、颜色、页眉页脚这些与"意思"无关的信息,token 花在刀刃上。
  • 纯文本:任何系统都能读、能存、能检索、能 diff,不依赖特定软件。

把一份资料转成 Markdown,本质上是一次翻译:从"给人看的排版"翻译成"给机器读的结构"。这正是 Everything to Markdown 在做的事。

一个具体的对比

假设有一张销售表,原文件是 Excel。如果直接把单元格文本平铺丢给模型:

一月 二月 三月
北方 120 135 150
南方 98 110 130

模型得"猜"哪行是表头、哪列对应哪月。而 Markdown 表格:

| 区域 | 一月 | 二月 | 三月 |
| --- | --- | --- | --- |
| 北方 | 120 | 135 | 150 |
| 南方 | 98 | 110 | 130 |

结构一目了然。对 AI 而言,后者不是"更好看",而是更少误解、更少幻觉

所以,"转成 Markdown"到底转了什么

不是把字抠出来那么简单。它转的是语义关系

  • 这行是标题还是正文?
  • 这几段是一个列表,还是各自独立的句子?
  • 这个数字是表格里的单元格,还是正文里的举例?
  • 这张图配在哪一节,说明什么?

能回答好这些问题,资料才真正"可读"。这也是为什么 we 坚持把转换做成一条确定性的解析管线,而不是交给一个黑盒去"理解"。

小结

AI 需要的不是"更多的字",而是更干净、更有结构的字。Markdown 恰好是人和机器之间那座最省力的桥。下一篇,我们拆开看:14 种天差地别的格式,是怎么被统一成这一套 Markdown 的。

← 返回博客列表 · 下一篇:统一文档模型 →