主流模型架构理论速览

写给设计师和 PM 的 AI 架构笔记:Transformer / Diffusion / MoE / SSM 各解决什么问题,以及它们对产品设计意味着什么。

做 AI 产品的人,多半有过这种时刻:工程师说「这个用 diffusion 做不了流式输出」,你点点头,心里想「所以呢」。

这篇不讲公式。只讲四种主流架构各自在解决什么问题它们的性格是什么,以及这些性格会怎么反过来约束你的产品设计

📚 这是「模型内部」篇。 看完想知道「外部怎么用」——参数量为什么会骗人、MoE 的路由器怎么坏掉、harness 层为什么才是真正拉开差距的地方,接着读:底座、MoE 与 Harness:一个用模型的人该懂的四件事


🧱 Transformer:会划重点的阅读者

它解决什么问题?

在 Transformer 之前,模型读一句话像排队传纸条——一个词一个词往后传,传到句尾,句首的信息已经模糊了。长句子就是接力赛丢棒。

Transformer 的做法很粗暴也很聪明:让每个词直接看见所有词。读到「它」的时候,模型同时扫一遍全文,自己判断这个「它」指的是前面哪个名词。这个机制叫注意力(attention)。

类比一下:老式做法是听录音带,只能顺着放;Transformer 是把整页纸摊在桌上,随时用手指戳任意一处做对照。

代价是什么?

摊开的纸越大,两两对照的次数就爆炸增长。这就是「上下文窗口」成为一个被反复营销的指标的原因——它不是免费的,是真金白银的算力。

代表模型:GPT 系列、Claude、Gemini、Llama——今天你叫得出名字的大语言模型,骨架基本都是它。

💡 对你意味着什么:长上下文是有价格的。当你设计一个「把用户全部历史都喂进去」的功能时,成本和延迟都会跟着上下文长度非线性上涨。更划算的产品设计往往是「检索出相关的那 5 段」,而不是「全塞进去」。


🎨 Diffusion:从噪点里雕出图像

它解决什么问题?

生成图像不能像写句子那样一个像素一个像素往后接——图像没有「顺序」。

Diffusion 的思路是反向去噪:先给一张真图不断加噪点,直到变成纯雪花;然后训练模型学会把这个过程倒放。用的时候,从一团随机雪花开始,一步步擦掉噪点,最后浮现出一张图。

类比:像米开朗基罗那句被引用滥了的话——石头里本来就有雕像,我只是把多余的部分去掉。Diffusion 就是从噪声里一刀刀削出画面。

性格是什么?

  • 慢,但可控。它要迭代几十步才出结果,所以天然不适合「打字机式」的流式输出。
  • 中途可干预。因为是分步的,你可以在中间插入约束(ControlNet、inpainting、局部重绘)。这是它比一次性生成模型强大的地方。

代表模型:Stable Diffusion、Midjourney、DALL·E 3、Sora(视频方向的扩展)。

💡 对你意味着什么:图像/视频生成的等待是结构性的,不是「优化一下就能秒出」。与其藏起进度条,不如把「逐步成形」做成可见的体验。另外,“局部重绘""参考图控制”这类功能之所以能做,正是因为 diffusion 分步的性格——这是设计上可以主动利用的杠杆。


🧩 MoE 混合专家:不是更聪明,是更省

它解决什么问题?

模型参数越多越强,但每次推理都把全部参数跑一遍,太贵。

MoE(Mixture of Experts)的做法:把模型内部切成很多个「专家」子网络,前面加一个调度员(router)。每个 token 进来,调度员只挑其中两三个专家干活,其余的睡觉。

类比:一家 200 人的咨询公司。你来问税务问题,不需要全公司 200 人开会,前台把你领到税务组那 3 个人就够了。公司规模是 200 人的水准,成本是 3 人的水准。

性格是什么?

  • 总参数量巨大,实际激活的很小。所以你会看到「总参数 6710 亿,激活 370 亿」这种听起来矛盾的描述。
  • 省的是算力,不是显存。所有专家都得待命,内存占用没省下来。
  • 调度不稳定。router 挑错专家的时候,输出质量会有波动。

代表模型:Mixtral、DeepSeek-V3、以及多数没公开细节但被广泛推测采用 MoE 的顶级闭源模型。

💡 对你意味着什么:MoE 是「同等价格买到更强模型」的主要来源之一,这是过去两年 API 价格能持续跳水的底层原因。做定价和成本模型时,别假设「参数量 = 成本」,那个换算关系已经断了。

🔗 想深入一层:上面说的「router 挑错专家会波动」其实有个正式名字叫路由坠缩,它是 MoE 最难缠的病,行业为它迭代了四代解法。另外 MoE 真正的隐藏成本不是算力而是 All-to-All 通信。这两点展开在:底座、MoE 与 Harness · 第 1 章


🌊 SSM / Mamba:把长文读成一条河

它解决什么问题?

Transformer 的「每个词看见所有词」,代价是长度一涨成本就平方级爆炸。那能不能既保留长距离记忆,又让成本只线性增长?

状态空间模型(SSM,代表实现是 Mamba)的思路是:不摊开全文,而是维护一个持续更新的「状态摘要」。信息像水一样流过,模型不断更新手里那份摘要,该记的记下,该忘的冲走。

类比:Transformer 是把整本书摊在桌上随时翻;Mamba 是一边读一边做笔记,读完只留一页笔记。笔记本页数固定,所以读一万页和读一百页,每页的成本一样。

性格是什么?

  • 长序列上便宜得多,成本随长度线性增长而非平方。
  • 精确回忆偏弱。摘要式记忆天然容易丢细节——问它「第 3 章第 2 段的原句是什么」,它不如 Transformer 靠谱。
  • 目前更多以混合架构出现(一部分层用 SSM,一部分层保留 attention),纯 SSM 大模型尚未成为主流。

代表模型:Mamba、Jamba,以及一些长上下文/端侧方向的混合架构尝试。

💡 对你意味着什么:如果你的产品要处理超长输入(整本手册、几小时音频、连续传感器流),这条技术路线值得盯着——它是「长上下文变便宜」最有希望的方向。但涉及精确引用、逐字核对的场景,短期内还是别赌它。


🗺️ 一张对照表

架构一句话擅长短板
Transformer摊开全文互相对照理解、推理、精确引用长度一涨成本爆炸
Diffusion从噪声里逐步雕出结果图像/视频、中途可控慢,不适合流式
MoE只叫醒需要的专家同等成本换更强模型吃显存,调度有波动
SSM / Mamba边读边做笔记超长序列、成本线性精确回忆弱

🎯 最后一句

这四种架构不是竞争关系,更像四种材料。

真正影响你产品的,往往不是「用了哪个架构」,而是架构性格外溢出来的那些约束:为什么这个功能一定要等、为什么长文档这么贵、为什么价格突然降了一半、为什么它记不住第 3 章那句话


➡️ 下一篇

架构决定了模型的天花板,但你实际能拿到多少,取决于模型外面那层工程。

底座、MoE 与 Harness:一个用模型的人该懂的四件事 —— 参数量为什么会骗人、MoE 路由器怎么坏掉、蒸馏丢掉的是哪部分能力,以及为什么产出差距 90% 来自 harness 层。

知道原因,你就能在需求评审上说出比「能不能快点」更有用的话。

—— 马启航Marvis