Thinking Machines放出Inkling,975B的MoE,权重是开的

Thinking Machines Lab把Inkling放出来了,这是他们第一个从零训的模型,权重开放。规格上是MoE,总参数975B、激活41B,上下文最长到1M,输入吃文本、图像和音频,但输出只有文本。另外预告了一个更小的Inkling-Small,276B总参、12B激活,权重要等测试完才给。

架构里有两处我觉得值得单独拎出来:一是位置编码没用RoPE,而是用了相对位置嵌入,官方说法是外推得更好;二是多模态走的是无编码器路线,音频进来是dMel谱,图像切成40×40的patch过一个四层hMLP,然后直接跟文本token一起送进decoder。MoE那部分基本是照着DeepSeek-V3的路子走的,256个路由专家加2个共享专家,每token激活6个。

最有意思的是那个thinking effort,训练阶段就通过改系统提示加调每token代价让模型学会了按需分配token预算,推理时能直接拨。等于把成本和延迟从模型级别的固定值变成了每次调用可调的旋钮,这个对工程侧比多几分跑分实在。

部署门槛不低,BF16要2TB显存起步,NVFP4能压到600GB左右。

开源就是好文明 :fire: