阶跃新出的 Step 3 主打推理,口号大概就是什么才算真正好用的推理模型。我盯推理这块久了,觉得国内厂商终于开始不光比刷分,而是往好用这个软指标上靠了。
推理模型最烦的就是又慢又贵,真正好用得在延迟、成本和答对率之间找平衡,光榜单漂亮没意义。
它具体做到哪一步,官方跑分我还没细看就不复述了,等自己拿实际任务喂一喂再下判断。
阶跃新出的 Step 3 主打推理,口号大概就是什么才算真正好用的推理模型。我盯推理这块久了,觉得国内厂商终于开始不光比刷分,而是往好用这个软指标上靠了。
推理模型最烦的就是又慢又贵,真正好用得在延迟、成本和答对率之间找平衡,光榜单漂亮没意义。
它具体做到哪一步,官方跑分我还没细看就不复述了,等自己拿实际任务喂一喂再下判断。
好用比刷分重要,同意
推理模型就是慢和贵两座大山
蹲实测
国内终于不只盯着榜单了
延迟成本答对率这个三角,说得对
好用这软指标绕不开延迟和成本,推理慢和贵两座山不搬开,道理都对用起来还是劝退