现在 AI 经常会直接给我们生成各种文件。
让它写一篇文章,它可能会给你一个 .md;让它做个网页,又会给你一个 .html;丢进去一段视频,有时候还能导出 .srt 字幕。
这些文件用电脑自动的记事本打开,里面好像全都是文字,感觉也没啥区别呀,可能会有一些看不太懂的符号
所以这篇小科普我们来解决下面这三个问题
- 这些文件打开全是文字,为什么还非要分这么多格式?
- 平时自己写东西,到底该用 Word 还是 Markdown?
- SRT 这个字幕文件,到底是个什么东西?
其实这些问题可以放在一起理解:很多文本格式的区别,不在于里面有没有文字,而在于它除了文字,还保存了什么规则。
TXT = 文字
Markdown = 文字 + 轻量的结构标记
HTML = 文字 + 网页结构
SRT = 文字 + 字幕时间轴
Word = 文字 + 复杂排版、图片和文档关系
比如同样一句"这是标题",放进 TXT 里,它就是一行普通文字
放进 Markdown 里,可以在前面加一个 #,告诉软件这是一条标题
放进 HTML 里,则会写成 <h1>这是标题</h1>,让浏览器按照网页标题来显示。
所以这一章,先抓住两个重点就够了:
- 文件后缀是在告诉电脑"这份内容应该按什么规则来读"
- 真正决定格式的,则是文件里面的数据和结构。
Markdown,AI 时代最值得学的文本格式
这几个格式里,我最想单独讲的其实是 Markdown。
说句暴论:如果你不知道 Markdown 是什么,那你大概率是个“电子文盲”
倒不是说这个 Markdown 格式有多重重要,而是现在 Markdown 已经慢慢变成了人和 AI 之间最主流的交互格式之一,而且它也是最最最实用的一个格式。
你让 AI 写文章、整理笔记、写 Skill、改项目说明,最后落地的十有八九就是一个 .md 文件。
Markdown 的文件后缀是 .md, 它本身还是纯文本,用记事本也能打开,只是在普通文字里加些符号,例如:# 号表示标题,短横线表示列表,两个星号表示加粗。
# 一级标题
## 二级标题
这是普通正文,**这里是一句加粗的话**。
- 第一项
- 第二项
[这是一个链接] (https://www.30know.com)
> 这是一段引用
先会标题、加粗、列表、链接和图片,日常写作基本就够用了,就很快就可以学会的
像表格、脚注和其他复杂语法,以后需要用到在网站问 AI,下面这张图是 markdown 语法大总结

Markdown还有一点很出色,就是即使没有被软件渲染,直接看源文件也能看懂,# 标题 一眼就知道是标题,,- 内容 一眼就知道是列表。
这也是它特别适合人和 AI 一起工作的原因:对人来说,它比一堆程序代码更直观;对 AI 来说,标题、列表、引用和代码块又已经分出了清楚的结构。
很多 AI 编程工具会使用 AGENTS.md、CLAUDE.md、copilot-instructions.md 这类 Markdown 文件保存项目规则。大家现在经常听到的 Skill,本质上也没有多神秘,很多 Skill 就是由一份或者多份 Markdown 文件组成的。
我平时写稿子也都是用 Markdown 语法来写的,包括大家现在看到的这个网站,文章的标题、正文、列表和图片,也是先用 Markdown 组织,再转换成网页。
我也十分推荐大家日常写文字或者整理笔记的时候,使用 markdown 语法来写,会更加的轻量依旧方便,也容易让 AI 读取。
其他几种格式,会认、会选就够了
TXT:只有文字,所以最简单
在 Windows 里右键新建的文本文档,就是一个 .txt 文件。它主要保存文字和换行,不记字体、字号和排版,所以通常很小,系统日志、配置说明、临时记录都常用它,这个没啥好讲的。
但是txt有一个很经典的问题那就是:乱码,明明是中文,打开却变成一堆奇怪符号。
这不是文件坏了,而是软件用错了文字编码,就像两边拿了两本不同的密码本,翻译没对上。但是这个问题其实现在比较少见了,90后和早期00后,可能都有遇到过。

碰到这种情况,最省事的办法其实是直接把文件丢给 AI ,让 AI “翻译”出来
如果 AI 也还原不出来,再退一步,用 VS Code 或 Notepad++ 尝试"以 UTF-8 重新打开"或者"以 GBK 重新打开",哪种能正常显示,就说明原来用的是那种编码,再转换保存成 UTF-8,以后基本就不会再乱码。
关于这个乱码问题,是一个历史遗留问题,相对比较复杂,这里就不展开讲了
对这方面感兴趣的可以看看下面柴知道老师的科普视频,讲的十分清晰也有趣,视频做的也牛逼
现在这种乱码情况在现在的近年的系统上很少看到了,但是如果你身边的设备还是比较老的,就电脑系统还是win7、win10的,那么就强烈推荐看看上面的科普视频,因为你大概率会遇到。
Word:把内容和最终排版一起交付
Word 现在常见的后缀是 .docx,老一点的文件还会看到 .doc。
它和前面几种纯文本文件不太一样。Word 要保存的不只是文字,还有字体、字号、颜色、段落、图片、表格、页眉页脚、批注和修订这些等等复杂的信息
说白了,它更像一份需要"渲染"出来的排版文件
不是随便一个软件打开就能看到正常效果。这也是为什么 Word 比较依赖 Office、WPS 这类专门的办公软件,用记事本这种简单工具打开,大概率只会看到一堆乱码。
讲一个冷知识: .docx 文件本质上就是一个改了名字的压缩包,你可以把你电脑上的一个 docx 文件复制一份,然后把后缀直接改成 .zip,在用解压软件解压,就会里面会看到一堆 XML 文件和文件夹,分别存着文字、图片、样式这些东西。
这也是为什么 Word 文件不能靠改后缀直接变成 txt 或 md,因为它压根不是"一篇文字",而是"一整个打包好的文档包"。
HTML:给浏览器看的网页结构
HTML 的后缀是 .html,主要是给浏览器看的。
用记事本打开,是一堆标签:
<h1>这是一个标题</h1>
<p>这是正文,里面还有一个<a href="https://www.30know.com">链接</a>。</p>
用浏览器打开,浏览器就知道该怎么显示了。
现在让 AI 帮你做点东西,拿到的经常就是一个 HTML 文件,生成一张数据表格,生成一个小工具,生成一份互动报告,十有八九都是它。
甚至现在不少人开始拿 HTML 来做 GPT 用,直接让 AI 生成一整套网页版演示文稿,翻页、动画都能做,然后比传统PPT还要灵活,我一朋友公司基本一周要开三次会,老是要做汇报,汇报就要做ppt,然后它每次都是直接把数据丢给AI,然后直接出一个html页面直接做汇报。
不过,真正的网站可能还依赖图片、字体、其他代码文件,甚至服务器里的数据,网页另存为以后不一定能完整带走。来源不明的 HTML 也别当成普通 TXT 随便打开,尤其是诱导你登录或下载文件的页面。
SRT:文字后面多了一条时间轴
SRT 是一种常见的视频字幕文件,后缀是 .srt。你可以直接理解成,一份专门装字幕的文件。
用记事本打开,长这样:

像剪映这类剪辑软件读到这个时间码,就知道每句话该什么时候出现、什么时候消失。
大家下载电影时,有时会看到视频旁边单独放着一个 SRT,这就是常说的外挂字幕,主文件名改成和视频一样,很多播放器就能自动识别到。
如果你不做剪辑,也不折腾本地电影资源,SRT 还有一个很实用的用途:快速拿到一个网上视频的逐句文字稿,直接丢给 AI 总结、分章节、提取观点。因为里面保留了时间码,AI 整理完之后,还能标出某个观点大概出现在视频的什么位置,不用自己再回头一句句翻找
但是绝大数AI都不支持上传srt格式文件,你就需要把文件后缀改为txt再上传给AI。

具体怎么拿到这份 SRT?主要看 B 站和 YouTube 这类长视频平台。这两个平台基本都支持字幕功能,视频作者上传视频时,通常会一起上传一份 SRT 字幕文件——用户可以自己选择打开还是关掉字幕,平台也能借这份文件做多语言翻译,让别的国家的人也能看懂视频内容。


只要一个视频带了 SRT 字幕,浏览器插件基本都能识别并提取出来。具体用哪个插件我就不点名推荐了,有需要的话,直接去浏览器的扩展商店,搜“字幕提取”,基本就能找到能用的插件。

这对于经常看知识类型的视频有福了!这个技巧真的知道的人不多
还有一个小技巧,可以进行快速调研,例如我最近想要个笔记本电脑,我懒得看b站各个博主的测试,直接打开大量的测评视频,直接提取他们的srt文件,如何全部丢给AI,然AI进行综合判,直接出一个表格展示产品的优缺点和价格,还有各个博主的评价。
总结
| 格式 | 适用场景 | 注意事项 |
|---|---|---|
| TXT | 临时记录、系统日志 | 不记排版,乱码优先丢给 AI 还原 |
| Markdown | 写文章、做知识库、保存 AI 提示词/Skill | 渲染前也能读懂,最适合当"源稿" |
| Word(.docx) | 交作业、做合同、需要复杂排版和打印 | 本质是压缩包,依赖 Office/WPS 打开 |
| HTML | AI 生成的网页、小工具、演示文稿 | 只负责结构,来源不明别随便登录信息 |
| SRT | 视频字幕,提取后交给 AI 总结 | 别删时间码和空行,否则识别不全 |