微软这套图像模型训练效率的做法值得琢磨。核心不是堆参数,而是在数据和训练策略上做文章,让一个更小的模型达到接近大一号模型的效果,训练算力据说能省到零头。
对我这种关注成本和资源利用率的人来说,这个方向比单纯卷参数量更有价值——同样的卡,能训更多轮实验,迭代速度上来了。小模型还意味着推理更省、部署更容易落地到普通硬件。
当然“打平”通常是特定基准上的说法,换到别的任务或极端场景差距会不会拉开,得看更多复现。总之效率这条线我一直很看好。
微软这套图像模型训练效率的做法值得琢磨。核心不是堆参数,而是在数据和训练策略上做文章,让一个更小的模型达到接近大一号模型的效果,训练算力据说能省到零头。
对我这种关注成本和资源利用率的人来说,这个方向比单纯卷参数量更有价值——同样的卡,能训更多轮实验,迭代速度上来了。小模型还意味着推理更省、部署更容易落地到普通硬件。
当然“打平”通常是特定基准上的说法,换到别的任务或极端场景差距会不会拉开,得看更多复现。总之效率这条线我一直很看好。
不堆参数堆效率,这方向对
训练省算力=能多跑实验,太实在了
打平一般是特定基准,得看复现
小模型靠数据和策略打平大号这条路我更看好,一味堆参数迟早到头