MoE:总参很大,每次只叫醒几位

602 字
3 分钟
MoE:总参很大,每次只叫醒几位

卡型号时老撞上 122B-A10B671B 旁边又冒个 37B——不是印错了,是 MoE(Mixture of Experts)在说话:库里养一堆专家,推理只点几名上场。

什么是 MoE:全能一人 vs 专家团
什么是 MoE:全能一人 vs 专家团

稠密一人队 vs 专家轮班

稠密模型(图例 Llama-70B)像全能一个人:参数全在,推理也几乎全上。

MoE(图例 DeepSeek-V3)像专家团:总参可以很大,路由只激活最贴题的几位。图称 DeepSeek-V3 总参约 671B、单次激活约 37B——数字以原图为准,未对官方卡。

图里还甩了「更高效 / 更专业 / 更强大 / 更灵活」四连。带走判断就够:按需激活省的是算力路径,不是「变小所以到处都能塞」的魔法。

A = Active:总参大、激活小

总参数 vs 激活参数
总参数 vs 激活参数

读名习惯(图例 Qwen3.5-122B-A10B):

片段意思
122B总参数(要装进显存的那坨)
A10BActive ≈ 10B(每次真正算的)
AActive

图中还按「约 2 bytes/参」估了 122B × 2 ≈ 244GB 量级——口径是示意图,真机还看精度、开销、并行切分。

坑在这句:省算力 ≠ 省显存。

  • 省的是延迟 / FLOPs 一侧:每次只算激活子集,体感像「小模型在算」。
  • 不省的是权重占坑:专家们多半仍要常驻(或可加载到)显存,房还是大房。

口头版:省钱(算力)不省房(显存)。

跟 Base / Instruct / 蒸馏 / 量化不是互斥菜单

大模型版本一图
大模型版本一图

同一张「版本图」里其实叠了几条正交轴:

切面改什么
Base地基:会续写,未必会当助手
Instruct对话 / 听指令
蒸馏老师教学生 → 体型仍小、相对更聪明
量化降精度 → 体积与显存压力下来,「智商」可能略掉
MoE架构:总参大、激活少

它们能叠。图里举例:蒸馏 + 量化 + MoE,常见于本地部署故事线。看到后缀别当成五选一货架。

「最先进」先降温

原文标题和页脚爱喊「目前最先进的架构」。更稳的边界:

  • MoE 是主流稠密之外的一条架构路,旗舰与小模型都有人用;不等于永远碾压稠密,也不等于部署一定更省心。
  • 选型先问:你卡在算力/延迟,还是卡在显存装得下装不下?只听「总参巨大所以更强」容易买错房。

评论区

像发消息一样写就好:点工具栏插入表情 / 图片,表情会直接显示。插图 ≤5MB。