做 AI 产品的人,多半有过这种时刻:工程师说「这个用 diffusion 做不了流式输出」,你点点头,心里想「所以呢」。
这篇不讲公式。只讲四种主流架构各自在解决什么问题、它们的性格是什么,以及这些性格会怎么反过来约束你的产品设计。
📚 这是「模型内部」篇。 看完想知道「外部怎么用」——参数量为什么会骗人、MoE 的路由器怎么坏掉、harness 层为什么才是真正拉开差距的地方,接着读:底座、MoE 与 Harness:一个用模型的人该懂的四件事。
🧱 Transformer:会划重点的阅读者
它解决什么问题?
在 Transformer 之前,模型读一句话像排队传纸条——一个词一个词往后传,传到句尾,句首的信息已经模糊了。长句子就是接力赛丢棒。
Transformer 的做法很粗暴也很聪明:让每个词直接看见所有词。读到「它」的时候,模型同时扫一遍全文,自己判断这个「它」指的是前面哪个名词。这个机制叫注意力(attention)。
类比一下:老式做法是听录音带,只能顺着放;Transformer 是把整页纸摊在桌上,随时用手指戳任意一处做对照。
代价是什么?
摊开的纸越大,两两对照的次数就爆炸增长。这就是「上下文窗口」成为一个被反复营销的指标的原因——它不是免费的,是真金白银的算力。
代表模型:GPT 系列、Claude、Gemini、Llama——今天你叫得出名字的大语言模型,骨架基本都是它。
💡 对你意味着什么:长上下文是有价格的。当你设计一个「把用户全部历史都喂进去」的功能时,成本和延迟都会跟着上下文长度非线性上涨。更划算的产品设计往往是「检索出相关的那 5 段」,而不是「全塞进去」。
🎨 Diffusion:从噪点里雕出图像
它解决什么问题?
生成图像不能像写句子那样一个像素一个像素往后接——图像没有「顺序」。
Diffusion 的思路是反向去噪:先给一张真图不断加噪点,直到变成纯雪花;然后训练模型学会把这个过程倒放。用的时候,从一团随机雪花开始,一步步擦掉噪点,最后浮现出一张图。
类比:像米开朗基罗那句被引用滥了的话——石头里本来就有雕像,我只是把多余的部分去掉。Diffusion 就是从噪声里一刀刀削出画面。
性格是什么?
- 慢,但可控。它要迭代几十步才出结果,所以天然不适合「打字机式」的流式输出。
- 中途可干预。因为是分步的,你可以在中间插入约束(ControlNet、inpainting、局部重绘)。这是它比一次性生成模型强大的地方。
代表模型:Stable Diffusion、Midjourney、DALL·E 3、Sora(视频方向的扩展)。
💡 对你意味着什么:图像/视频生成的等待是结构性的,不是「优化一下就能秒出」。与其藏起进度条,不如把「逐步成形」做成可见的体验。另外,“局部重绘""参考图控制”这类功能之所以能做,正是因为 diffusion 分步的性格——这是设计上可以主动利用的杠杆。
🧩 MoE 混合专家:不是更聪明,是更省
它解决什么问题?
模型参数越多越强,但每次推理都把全部参数跑一遍,太贵。
MoE(Mixture of Experts)的做法:把模型内部切成很多个「专家」子网络,前面加一个调度员(router)。每个 token 进来,调度员只挑其中两三个专家干活,其余的睡觉。
类比:一家 200 人的咨询公司。你来问税务问题,不需要全公司 200 人开会,前台把你领到税务组那 3 个人就够了。公司规模是 200 人的水准,成本是 3 人的水准。
性格是什么?
- 总参数量巨大,实际激活的很小。所以你会看到「总参数 6710 亿,激活 370 亿」这种听起来矛盾的描述。
- 省的是算力,不是显存。所有专家都得待命,内存占用没省下来。
- 调度不稳定。router 挑错专家的时候,输出质量会有波动。
代表模型:Mixtral、DeepSeek-V3、以及多数没公开细节但被广泛推测采用 MoE 的顶级闭源模型。
💡 对你意味着什么:MoE 是「同等价格买到更强模型」的主要来源之一,这是过去两年 API 价格能持续跳水的底层原因。做定价和成本模型时,别假设「参数量 = 成本」,那个换算关系已经断了。
🔗 想深入一层:上面说的「router 挑错专家会波动」其实有个正式名字叫路由坠缩,它是 MoE 最难缠的病,行业为它迭代了四代解法。另外 MoE 真正的隐藏成本不是算力而是 All-to-All 通信。这两点展开在:底座、MoE 与 Harness · 第 1 章。
🌊 SSM / Mamba:把长文读成一条河
它解决什么问题?
Transformer 的「每个词看见所有词」,代价是长度一涨成本就平方级爆炸。那能不能既保留长距离记忆,又让成本只线性增长?
状态空间模型(SSM,代表实现是 Mamba)的思路是:不摊开全文,而是维护一个持续更新的「状态摘要」。信息像水一样流过,模型不断更新手里那份摘要,该记的记下,该忘的冲走。
类比:Transformer 是把整本书摊在桌上随时翻;Mamba 是一边读一边做笔记,读完只留一页笔记。笔记本页数固定,所以读一万页和读一百页,每页的成本一样。
性格是什么?
- 长序列上便宜得多,成本随长度线性增长而非平方。
- 精确回忆偏弱。摘要式记忆天然容易丢细节——问它「第 3 章第 2 段的原句是什么」,它不如 Transformer 靠谱。
- 目前更多以混合架构出现(一部分层用 SSM,一部分层保留 attention),纯 SSM 大模型尚未成为主流。
代表模型:Mamba、Jamba,以及一些长上下文/端侧方向的混合架构尝试。
💡 对你意味着什么:如果你的产品要处理超长输入(整本手册、几小时音频、连续传感器流),这条技术路线值得盯着——它是「长上下文变便宜」最有希望的方向。但涉及精确引用、逐字核对的场景,短期内还是别赌它。
🗺️ 一张对照表
| 架构 | 一句话 | 擅长 | 短板 |
|---|---|---|---|
| Transformer | 摊开全文互相对照 | 理解、推理、精确引用 | 长度一涨成本爆炸 |
| Diffusion | 从噪声里逐步雕出结果 | 图像/视频、中途可控 | 慢,不适合流式 |
| MoE | 只叫醒需要的专家 | 同等成本换更强模型 | 吃显存,调度有波动 |
| SSM / Mamba | 边读边做笔记 | 超长序列、成本线性 | 精确回忆弱 |
🎯 最后一句
这四种架构不是竞争关系,更像四种材料。
真正影响你产品的,往往不是「用了哪个架构」,而是架构性格外溢出来的那些约束:为什么这个功能一定要等、为什么长文档这么贵、为什么价格突然降了一半、为什么它记不住第 3 章那句话。
➡️ 下一篇
架构决定了模型的天花板,但你实际能拿到多少,取决于模型外面那层工程。
底座、MoE 与 Harness:一个用模型的人该懂的四件事 —— 参数量为什么会骗人、MoE 路由器怎么坏掉、蒸馏丢掉的是哪部分能力,以及为什么产出差距 90% 来自 harness 层。
知道原因,你就能在需求评审上说出比「能不能快点」更有用的话。
—— 马启航Marvis