为何“万亿”背后藏着星号

这些巨兽都是混合专家(MoE)模型,每处理一个token其实只有一小部分参数被激活。

前三

  1. Kimi K2:总量1万亿,激活仅320亿: Kimi K2存储约1.04万亿参数,但每个token只激活320亿——384个专家中仅调用8个。
  2. DeepSeek-V3每次只点燃6710亿中的370亿: DeepSeek-V3每个token仅调度其6710亿参数中的370亿,约占整个网络的5%。
  3. GPT-3调动每一个参数: 与如今的稀疏巨兽不同,GPT-3的1750亿参数全部稠密,每个token都会全员上阵。

来源

打开完整版