边说边推理这件事,比模型本身更值得看

Grok 那边的语音模型 Think Fast 2.0 上线了,主打的是边说边推理、把交互等待压下去。

做交互的应该都懂这个点。语音最劝退的不是答得对不对,是你问完之后那几秒静默——人不知道它在想还是已经挂了,忍不住又说一遍,两边一起乱套。文字聊天有光标闪、有逐字流出来兜着,语音这边什么都没有,只能干等。

把推理和发声重叠起来,本质是拿输出的前半段去盖住计算延迟,这思路在前端也不新鲜,骨架屏、乐观更新都是一个道理。区别在于语音说出口就收不回来,前面几个字押错了方向、后面怎么圆回去,才是真正难的地方。

笑死 :joy: