UniMedSeg:统一上下文的2D/3D医学图像分割基础模型
【前沿科学转载】
医学图像分割是计算机辅助诊断的基础任务,但现有通用分割方法通常局限于特定范式:视觉上下文学习(ICL)需要图像-标签对,交互式分割依赖几何提示,语言引导分割需要文本指令——而且2D切片和3D体积往往由不同架构分别处理。这种范式隔离和维度隔离限制了异构标注数据的联合学习,也阻碍了跨任务、跨格式的知识迁移。
发表于arXiv的最新论文提出了UniMedSeg——一个基于Transformer架构的统一医学图像分割基础模型。UniMedSeg摒弃了提示和维度特定的局部分支,将视觉图像、密集掩码、几何引导和语言标记统一映射到标准化的序列接口中,由共享的Transformer骨干网络处理。这种设计使得来自27个公共数据集的异构2D/3D数据和多样化监督格式能够实现联合表征学习。
为了克服长序列带来的二次计算复杂度和内存瓶颈,研究团队提出了解耦分割注意力(Decoupled Split Attention)机制,将长上下文注意力复杂度降低到线性级别,同时保持硬件友好的密集计算。配合专门设计的类型和位置嵌入,这一机制能够促进上下文-目标的有效交互,实现无需微调的跨任务泛化。
在涵盖多种分割范式的大规模评估中,UniMedSeg在视觉上下文学习、交互式分割和语言引导分割三个范式上均达到最优(SOTA)性能。特别值得注意的是,无需任务特定微调,模型就能展示出跨中心域偏移、未见过解剖结构和跨物种目标的强大泛化能力。代码和模型权重已在GitHub上开源发布。
这一成果标志着医学图像分割正走向真正的”大一统”时代——一个模型即可处理多样化的临床分割任务,无需为每个场景单独训练专用模型。
来源:
📄 arXiv:2607.12896 — “UniMedSeg: Unified In-Context Learning for Multi-Paradigm 2D/3D Medical Image Segmentation”
👥 作者:Yunzhou Li, Jiesi Hu, Yanwu Yang, Hanyang Peng, Chenfei Ye, Jianfeng Cao, Yixuan Yuan, Ting Ma
🏷️ 分类:cs.CV
📅 提交日期:2026-07-14
