级联式的 LoRA 多模态融合这个思路我挺认。传统做法一上来就把所有模态塞进一个固定的融合结构,想加个新模态基本得整体重训。这个框架换了玩法:先给每个模态单独做 LoRA 适配,再分阶段融合——先把关系近的模态并起来,之后再逐步接那些异构、差异大的模态,前面学好的部分不动。
好处是省参数,换数据集、模态集合不一样时也不至于推倒重来。它在 NurViD 和护士培训那两个医疗动作识别数据集上验证,比单模态强,跟之前各自数据集上的专用 baseline 也能打个平手。
医疗培训这种场景模态本来就杂,参数高效地慢慢拼,确实比一把硬融合现实得多。