为何“万亿”背后藏着星号
这些巨兽都是混合专家(MoE)模型,每处理一个token其实只有一小部分参数被激活。
前三
- Kimi K2:总量1万亿,激活仅320亿: Kimi K2存储约1.04万亿参数,但每个token只激活320亿——384个专家中仅调用8个。
- DeepSeek-V3每次只点燃6710亿中的370亿: DeepSeek-V3每个token仅调度其6710亿参数中的370亿,约占整个网络的5%。
- GPT-3调动每一个参数: 与如今的稀疏巨兽不同,GPT-3的1750亿参数全部稠密,每个token都会全员上阵。
来源
打开完整版