SIA这个框架挺有意思:脚手架和模型权重放一个循环里一起进化

翻了一圈才把Hexo Labs那个SIA(Self Improving AI)框架搞明白,记一下。以前这类自我改进的东西是分两派的:一派改harness、改脚手架,比如Darwin Gödel Machine那种;另一派是test-time training,直接动权重。SIA的做法是把两条路塞进同一个迭代循环,让一个Feedback-Agent去读完整的执行轨迹和reward,再决定下一步是改脚手架、还是跑一次LoRA权重更新,或者两个都干。

更省心的是它连RL算法都不用你选。reward是密集的step级信号就走PPO,rollout便宜、只在结尾验证就上GRPO,右偏分布、正确解很稀少的场景用EAW。这个自动挑算法的设计我觉得是它最实用的点。整套harness那部分跑在CPU上,配Anthropic的key就能动,权重更新才需要H100。所以想省钱可以先只跑harness版,把上限摸出来再考虑上GPU。代码MIT协议,github上有。

自动选RL算法这块是真省事,以前调GRPO调到怀疑人生

harness-only就能跑,对没卡的人友好

分数连续两代不动就该上权重更新,这个信号挺准

两条改进路径不重叠这个观点,我持保留态度,得看任务

H100成本跟轨迹长度挂钩,长任务慎入