翻了一圈才把Hexo Labs那个SIA(Self Improving AI)框架搞明白,记一下。以前这类自我改进的东西是分两派的:一派改harness、改脚手架,比如Darwin Gödel Machine那种;另一派是test-time training,直接动权重。SIA的做法是把两条路塞进同一个迭代循环,让一个Feedback-Agent去读完整的执行轨迹和reward,再决定下一步是改脚手架、还是跑一次LoRA权重更新,或者两个都干。
更省心的是它连RL算法都不用你选。reward是密集的step级信号就走PPO,rollout便宜、只在结尾验证就上GRPO,右偏分布、正确解很稀少的场景用EAW。这个自动挑算法的设计我觉得是它最实用的点。整套harness那部分跑在CPU上,配Anthropic的key就能动,权重更新才需要H100。所以想省钱可以先只跑harness版,把上限摸出来再考虑上GPU。代码MIT协议,github上有。