30B 这个尺寸卡的位置很讨巧。24GB 显存这条线更讨巧——3090、4090 单卡刚好就是这个数,家里那台打游戏的机器直接就能用上。
本地跑智能体这件事,以前一直卡在中间地带:小模型指令跟随一塌糊涂,让它调个工具能给你调出花来;大模型效果够用但塞不进消费级卡,只能上云,数据就得往外走。现在 Meta 把 30B 的 Muse Glimmer 开源出来,正好补的是这一段。
对公司内部那些不方便出网的活儿,这个意义比跑分大。日志、工单、内部文档,能在自己机器上跑完不落到别人手里。
量化到什么精度才刚好压进 24G、长上下文之后显存会不会顶穿,这些我还没细看,等有人在自己机器上跑通了再说。