276B总参、每个token只激活12B,看到这个配置我第一反应是显存还是会被总参数量卡死——MoE省下来的是算力不是存储,全量权重照样得驻留。真正值得琢磨的是它用12B激活,在Terminal-Bench 2.
1、HLE和SWE-Bench Verified上都压过了激活41B的那版Inkling,说明路由策略和专家切分带来的收益,比单纯堆激活量更划算。原生音频、视觉再叠1M上下文一起给到,等于把多模态和长程能力塞进同一套权重里了。
开源这点最实在,能自己拆开看专家分布和路由是不是均衡。部署侧的账得另算,稀疏模型吞吐很吃batch,小并发场景反倒讨不到便宜。