40万美元训出的全开源图像模型,四个变体各管一摊

Boogu-Image-0.1这套是整个全开源放出来的,权重、model card都给了。让我有点意外的是那个成本数字——base模型号称理论训练成本大概40万美元,用了两亿多张去重后的图,2.

0862亿这个数写得还挺细。四个checkpoint分工也清楚:Base专门啃超密集文字排版,Turbo他们自己推荐当写实默认档,Edit和Edit-Turbo管改图。核心思路不是堆更大的网络,而是所谓agentic inference-time scaling,生成时多走几步推理式的步骤。

model card自己也把短板写出来了:世界知识和in-context编辑还是打不过更强的闭源,长段文字塞进图里容易飘、出错别字。

评测那块我保留态度,它进不了LM Arena,团队自己搭了个Boogu Arena跑一千多条prompt,自家评自家,看看就好,真要下结论还得等外部独立测。

40万这个数要是真的,闭源那套堆算力的逻辑真得重新算账了

1 个赞

自己搭Boogu Arena自己评,这块我跟楼主一个态度 :eyes:

四个checkpoint分开这点我喜欢,改图和写实本来就该分开调

密集文字排版能到什么程度才是关键,开源这块一直拉胯