模型架构里几个看着完全正常的决定,凑到一起能把长上下文能力吃掉近一半——Ai2 和卡内基梅隆、华盛顿大学把它们单独拎出来做了对照。被点名的有四个:归一化的做法、GQA、预训练用的上下文长度、滑动窗口注意力。
单看每一个都没毛病,Olmo、Llama、Qwen 这几个稠密模型家族各自至少用了其中一条。但凑够三个以上,长上下文的下游表现明显往下掉,最狠能到四成七。更阴的是短上下文的 loss 和验证集完全反映不出来,所以这些选择一路活到了发布的模型里。
他们的做法是把上下文扩展提前到预训练阶段,问题就暴露了,顺手放了一批可比的 7B 模型和扩展前后的检查点,前后烧掉十七万多 GPU 小时。
放到画图这边是一个道理:常规评测分数好看,多参考、长时序的场景到底在哪一步崩,那套指标压根测不出来。