为什么 AI 需要 Markdown:资料形态与"可读"的含义
你大概有过这样的经历:从一份 Word 里选中一段,复制,粘进聊天框或某个 AI 对话框,结果排版全乱、表格变成乱码、图片失踪,只剩一堆奇怪的换行和空格。这并不是你操作错了,而是——大多数"资料"天生不是给机器读的。
资料的两副面孔
一份 .docx 文件,对人类和对于程序,是完全不同的两样东西。
对人来说,它是"带格式的文档":标题加粗、段落缩进、表格对齐、配图居中。你一眼就能读懂它的意图。但对一个大模型来说,它首先是一堆 ZIP 压缩包里的 XML 节点,里面混着样式定义、修订记录、嵌入字体、缩略图……真正"内容"被埋在噪声里。
AI 不关心你的标题用了几号字体,它关心的是:这句话是标题还是正文?这条数据属于哪一行哪一列?这段引用是谁说的?
Markdown 为什么是"机器友好"的格式
Markdown 之所以成为 AI 工作流里的通用语,不是因为它时髦,而是因为它同时满足三件事:
- 结构化:
#、-、|这些符号明确表达了层级、列表、表格,而不是靠视觉位置暗示。 - 低噪声:没有字体、颜色、页眉页脚这些与"意思"无关的信息,token 花在刀刃上。
- 纯文本:任何系统都能读、能存、能检索、能 diff,不依赖特定软件。
把一份资料转成 Markdown,本质上是一次翻译:从"给人看的排版"翻译成"给机器读的结构"。这正是 Everything to Markdown 在做的事。
一个具体的对比
假设有一张销售表,原文件是 Excel。如果直接把单元格文本平铺丢给模型:
一月 二月 三月
北方 120 135 150
南方 98 110 130
模型得"猜"哪行是表头、哪列对应哪月。而 Markdown 表格:
| 区域 | 一月 | 二月 | 三月 |
| --- | --- | --- | --- |
| 北方 | 120 | 135 | 150 |
| 南方 | 98 | 110 | 130 |
结构一目了然。对 AI 而言,后者不是"更好看",而是更少误解、更少幻觉。
所以,"转成 Markdown"到底转了什么
不是把字抠出来那么简单。它转的是语义关系:
- 这行是标题还是正文?
- 这几段是一个列表,还是各自独立的句子?
- 这个数字是表格里的单元格,还是正文里的举例?
- 这张图配在哪一节,说明什么?
能回答好这些问题,资料才真正"可读"。这也是为什么 we 坚持把转换做成一条确定性的解析管线,而不是交给一个黑盒去"理解"。
小结
AI 需要的不是"更多的字",而是更干净、更有结构的字。Markdown 恰好是人和机器之间那座最省力的桥。下一篇,我们拆开看:14 种天差地别的格式,是怎么被统一成这一套 Markdown 的。