30know
AI、大模型、LLM、多模态和 Transformer,到底是什么关系?

AI、大模型、LLM、多模态和 Transformer,到底是什么关系?

你可能已经用过 ChatGPT、 DeepSeek、Kimi、千问、Gemini、豆包 .....

平时打开他们,输入一个问题,等它回答就行,好像也没有多复杂。
但是只要你开始看一些 AI 相关的文章和视频,就会有一些看起来很专业的名词出现:大模型、LLM、多模态、Transformer……

而且感觉它们好像都在说同一个东西,但好像又不是那么一回事

所以这一篇不讲复杂原理,不讲啥参数或者模型训练,先带你认识下这些最基础的名词

以后再看到这些名词,就能大概判断是在说的是哪一类模型、一种技术架构,还是我们日常使用的产品,就已经够够了。

先看一张关系图

这里我直接先把整体关系放出来:

AI
└── 大模型
    └── LLM:主要围绕语言的一类大模型
        ├── 可以主要处理文字
        └── 也可以拥有图片、语音等多模态能力

Transformer:许多现代大模型采用的一种技术架构

AI 产品:把一个或多个模型、工具和功能组合起来,最终交给普通人使用

这张图只是帮助第一次接触的人找到位置,不是什么严谨的学术分类,就是大概的关系逻辑

其中,AI 是最大的范围,我们现在看到的聊天、识图、语音识别、生成图片,这些技术和应用都可以放在 AI 这个大范围里。

“大模型”是中文互联网里比较宽泛的叫法,大家聊天时,经常会直接把能对话、能写作的 AI 叫作大模型,但严格来说,大模型并不只有处理语言这一种。

LLM 是 Large Language Model 的缩写,中文就是“大语言模型”,它是大模型里主要和语言打交道的一类。

而多模态和 Transformer,不能继续硬塞进这关系图中

多模态说的是模型能处理哪些信息,Transformer 说的是模型采用什么技术架构,一个在说能力范围,一个在说底层怎么搭,它们回答的不是同一个问题。

我们用的是产品

ChatGPT、豆包、DeepSeek,这三个名字可以先并列放在一起理解:它们都是普通人能够直接打开和使用的 AI 产品。

我们真正接触到的是产品的聊天框、语音按钮、图片生成功能、文件上传和联网搜索

模型更像是产品背后的能力核心,产品会把模型接进来,再搭配界面、搜索、文件、记忆和其他工具,最后变成一套可以使用的东西。

所以,产品能力和模型能力不能完全画等号。

例如你在一个产品里既能聊天,又能生成图片和视频,不一定代表这些事情全部由同一个模型完成。它可能同时接入语言模型、图片模型、视频模型和其他服务,再由产品把它们放进同一个界面。

豆包里,就分别列出了大语言模型、文生图模型、视频生成模型和音乐模型。

对普通人来说,这个区别其实挺重要。

因为我们选择一个 AI 产品时,不只是比较底层模型谁更强,它能不能直接语音聊天、能不能方便地处理图片、界面顺不顺手、常用功能全不全,这些都会决定最终体验。

所以我一直觉得,对于绝大多数普通人来说,模型能力的上限不一定要追到最高

就例如很多时候豆包就已经够用,它能被这么多人使用,除了宣传原因,产品覆盖的功能比较多,也是一个很重要的原因。

模型决定了很多能力的基础,产品则决定这些能力最后怎样来到你手里,两者有关,但不是一回事。

LLM 与多模态

现在再回头看 LLM。

LLM 就是大语言模型,重点在“语言”。聊天、写作、总结、翻译,这些事情主要都在处理和生成语言,它是一类从大量材料中学习语言规律,再根据你的输入生成内容的模型,对于普通人来说,LLM 知道这些就可以了

但是现在的 AI 产品已经不只会处理文字了。

你可以发一张照片,让它告诉你图里有什么;也可以直接和它语音聊天;有些产品还能生成图片、声音和视频。这时候经常出现的另一个词,就是“多模态”。

这里的“模态”,可以先理解成信息的形式。

  • 文字是一种模态。
  • 图片是一种模态。
  • 语音和视频也是不同的模态。

所谓多模态,就是 AI 不再只能“读文字”,还可以同时看图片、听声音、看视频。只要一个模型能够处理两种及以上的信息形式,就可以叫多模态模型

如果一个模型会写作、翻译、总结和改标题,看起来什么都能干,但这些任务处理的仍然都是文字,它依然可能只是围绕单一模态工作。

如果它不只能接收文字,还能看懂图片、听懂语音,或者生成其他形式的内容,这才发生了模态上的变化。

多模态和 LLM 也不是二选一。

有些 LLM 主要处理文字,也有一些模型仍然以语言能力为核心,同时又能接收图片、声音等信息,这时“LLM”和“多模态”可以同时用来描述它。

一个产品拥有文字、图片和语音功能,我们可以说它提供了多模态体验,所以咱们普通人选择产品时,先看自己到底需要什么:只是聊天写作,还是经常要发图片、传文件、语音交流和生成其他内容。

像国内的豆包、千问就是属于经典的多模态,除了文字还可以处理、图片、音频、视频,而咱们熟知的 DeepSeek 在 2026 年 4 月 29 日才终于上线了识图能力,在这之前都是只能对文字进行处理。

Transformer

当你继续往 LLM 的底层看,又会遇到 Transformer,这个词直译成中文叫“变换器”。

但这个翻译对第一次接触的人基本没有帮助,你只需要先把它理解成一种模型技术架构。

2017 年,Google 的研究团队发表了一篇论文,标题叫 《Attention Is All You Need》,Transformer 就是在这篇论文中被提出的。

后来我们熟悉的许多主流 LLM,以及一部分多模态模型,都采用了 Transformer 或者在它的基础上继续发展,所以网上讲大语言模型时,经常会顺着 LLM 继续讲 Transformer、自注意力和各种计算过程,这些知识当然有用,但不是每个人都必须从这里开始。

如果你准备往算法、AI 工程或者计算机专业继续深入,Transformer 确实是一个绕不开的基础知识。

但是你只是想把 AI 当成工具,就只需知道:LLM 说的是以语言为核心的模型,Transformer 则是LLM模型采用的核心技术架构。

因为“底层知识”不等于“所有人都必须掌握的基础知识”。

如果你对 LLM 和 Transformer 的具体原理感兴趣,可以继续看这个科普视频,,如果暂时不感兴趣,也完全不影响你学习和使用 AI。

最后再来总结下这几个名词:

  • 大模型是一个比较宽泛的模型类别。
  • LLM 是主要处理和生成语言的一类大模型。
  • 多模态描述模型或产品能处理哪些信息形式。
  • Transformer 是许多现代大模型采用的技术架构。
  • ChatGPT、豆包、DeepSeek,是我们日常真正打开的 AI 产品。

大概,知道它们分别在说什么就够了。

下一章,我们再继续认识一个日常出现次数更多、也会直接影响 AI 使用的词:Token。

本章小测

7道题

本章配有随堂小测,登录后即可作答并记录成绩。