不期而至🎁 惊喜礼盒
🎁 Surprise · 不定期 · 随缘更新


🎁 Surprise · 不定期 · 随缘更新
🎁 SURPRISE
谢谢你停在这里。愿你被温柔以待,也愿你带着一点勇气继续往前——这是我留给访客的小小礼物 🎀✨。
— threetwoa
(=;ェ;=) 客来不妨坐下,落叶声里续一壶茶;猫会自己找你。
走进数字花园
卡型号时老撞上 122B-A10B、671B 旁边又冒个 37B——不是印错了,是 MoE(Mixture of Experts)在说话:库里养一堆专家,推理只点几名上场。

稠密模型(图例 Llama-70B)像全能一个人:参数全在,推理也几乎全上。
MoE(图例 DeepSeek-V3)像专家团:总参可以很大,路由只激活最贴题的几位。图称 DeepSeek-V3 总参约 671B、单次激活约 37B——数字以原图为准,未对官方卡。
图里还甩了「更高效 / 更专业 / 更强大 / 更灵活」四连。带走判断就够:按需激活省的是算力路径,不是「变小所以到处都能塞」的魔法。
A = Active:总参大、激活小
读名习惯(图例 Qwen3.5-122B-A10B):
| 片段 | 意思 |
|---|---|
122B | 总参数(要装进显存的那坨) |
A10B | Active ≈ 10B(每次真正算的) |
A | Active |
图中还按「约 2 bytes/参」估了 122B × 2 ≈ 244GB 量级——口径是示意图,真机还看精度、开销、并行切分。
坑在这句:省算力 ≠ 省显存。
口头版:省钱(算力)不省房(显存)。

同一张「版本图」里其实叠了几条正交轴:
| 切面 | 改什么 |
|---|---|
| Base | 地基:会续写,未必会当助手 |
| Instruct | 对话 / 听指令 |
| 蒸馏 | 老师教学生 → 体型仍小、相对更聪明 |
| 量化 | 降精度 → 体积与显存压力下来,「智商」可能略掉 |
| MoE | 架构:总参大、激活少 |
它们能叠。图里举例:蒸馏 + 量化 + MoE,常见于本地部署故事线。看到后缀别当成五选一货架。
原文标题和页脚爱喊「目前最先进的架构」。更稳的边界:
复制链接或生成海报,发给感兴趣的人。

OpenCode 里把 Luna 留给路由与验收,DeepSeek Flash 干可拆的纯文本执行,MiniMax 专管媒体;省钱的关键是委派契约,不是堆模型。
2026-08-05部分内容可能已过时
分享你的想法,与大家交流讨论
像发消息一样写就好:点工具栏插入表情 / 图片,表情会直接显示。插图 ≤5MB。
🎁 Surprise · 不定期 · 随缘更新
🎁 SURPRISE
谢谢你停在这里。愿你被温柔以待,也愿你带着一点勇气继续往前——这是我留给访客的小小礼物 🎀✨。
— threetwoa
有什么想了解的?
我基于博客内容回答