看到HealthGPT这类医疗VLM放出对复杂MRI模态理解99.7%这种数字,我第一反应是想问一句:什么数据集、什么任务、怎么定义的准确率?医疗影像这块,脱离测试集和任务定义谈准确率基本没意义。
99.7%听着吓人,但如果是在一个干净、分布均匀的benchmark上刷的,跟真实临床里那些模糊的、罕见的、多病共存的片子完全是两回事。单一模型能处理多类生成任务这个方向我认可,通用性是好事。
但一涉及医疗,越高的数字越该谨慎,因为剩下那0.3%在临床上可能就是要命的漏诊。技术进步值得关注,营销式报数字得警惕。