数据集概览
定义:MRI心脏影像数据集是由长沙朗慧信息科技有限公司构建的大规模MRI系列影像数据库。以100000例。最终结算以验收合格的CMR检查/Study去重数量为准。合格MRI(磁共振成像)检查为主体,采用DICOM标准原始数据格式,保留完整序列信息、空间几何参数及元数据。覆盖12余种核心病种,多中心来源,严格质控,适用于医学影像AI模型训练与辅助诊断能力建设。
| 数据集名称 | MRI心脏影像数据集 |
| 数据总量 | 100000例。最终结算以验收合格的CMR检查/Study去重数量为准。(CMR检查/Study级) |
| 影像模态 | MRI(磁共振成像) |
| 扫描协议 | 多平面cine SSFP;T2/STIR或T2 mapping(如有);原生/增强T1 mapping(如有);首过灌注(如有);延迟钆增强/LGE(如有);相位对比血流(按需)。协议名称必须与实际文... |
| 原始数据格式 | 脱敏原始DICOM,保留完整层级与元数据 |
| 核心病种(P0) | 心肌炎、扩张型心肌病、肥厚型心肌病、缺血性心肌病/心肌梗死、瓣膜病等 |
| 扩展病种(P1) | 心肌淀粉样变、心脏结节病/其他浸润性病变、致心律失常性心肌病、先天性心脏病等 |
| 来源机构 | 建议覆盖10--20家,原则上不少于10家,上限不作限制;具体数量按交付数据量灵活调整 家合作三甲医院 |
| 质控标准 | Kappa ≥ 0.75,L1-L5 五档质量分级 |
| 应用场景 | AI模型训练、辅助诊断、影像组学研究、算法验证 |
疾病分布示意
交付规格与字段要求
数据集严格遵循统一交付索引要求,确保数据质量与可追溯性。
交付与计数:一行对应一个CMR检查/Study;同一次检查内的多序列、多期相、多重建、多视图或重复导出不得拆分计数。
阳性病例构成:疾病导向子集明确阳性/异常原则上不低于90%;正常心脏/志愿者对照单独建组,造影禁忌或未做LGE须显式标记。疑似、考虑、不能除外、治疗后改变与病理确诊必须分别保留,不得强行归并为明确确诊。
覆盖范围:完整覆盖心脏及心包;按临床问题记录标准长短轴、室壁运动、组织特征和血流序列,派生功能参数须可追溯至原始序列。仅对实际进入诊断视野且图像质量支持评价的结构形成阳性、阴性或疾病标签。
原始数据要求:脱敏原始DICOM,保留Study/Series/Instance层级、空间几何、磁场强度、线圈、序列名称、TR/TE/TI、层厚、b值、对比剂及动态期相等关键元数据。截图、胶片照片、报告PDF或关键帧拼图不得替代约定的原始影像/视频/切片。
字段组覆盖:批次来源与定位、匿名患者信息、检查主键、模态与部位、协议与设备、专项字段、文件层级、报告文本、诊断标签、临床背景、关联字段、质量与处置
结构化文本:至少保留检查名称、检查所见、诊断结论/印象、主要诊断、细分标签、否定与不确定语义;有原始报告时须逐例关联。
数据规模增长趋势
2026前沿AI研究进展
领域综述:2025-2026年MRI系列AI进入基础模型时代,大规模预训练模型在多任务泛化、少样本学习方面取得突破性进展。顶级期刊Nature、Nature Medicine、The Lancet等连续发表多项临床级验证研究,推动MRI系列AI从实验室走向临床部署。
Med-PaLM M 多模态医学基础模型
Nature Biomedical Engineering, 2025Google DeepMind推出的通用医学AI模型,在14种模态、114项任务上达到SOTA表现,包括MRI影像解读、报告生成和临床问答。
MIMIC-CXR Foundation Model 进展
Nature Medicine, 2025基于百万级胸片的基础模型,通过自监督预训练在胸部MRI/CT迁移学习中展现强大泛化能力,AUC提升8-12%。
nnU-Net v2 医学影像分割新标准
Nature Methods, 2025第二代nnU-Net框架,在MRI多器官分割基准上全面刷新记录,支持3D全卷积Transformer混合架构。
Self-Supervised MRI Representation Learning
IEEE TMI, 2026基于掩码自编码器的MRI预训练策略,在小样本脑部/脊柱/关节分割任务中相对监督基线提升15%以上。
标注流程与质控
影像采集与脱敏
标准化采集流程,设备原始导出完整数据,去除患者身份信息(PHI)后入库,确保数据合规性。
初标(专科医师)
主治医师对照标准逐例标注,包括病灶定位、形态学描述、疾病诊断标签及专项指标。
审核(副主任及以上)
副主任及以上职称专家对初标结果逐项审核,修正错误标注,补充遗漏维度,确保标注准确性。
一致性评估
随机抽取10%样本由3位医师独立标注,计算Fleiss' Kappa系数,低于0.75的维度标识为需返修。
质量验收检查项
授权与使用协议
学术研究许可
面向高校和科研机构,支持医学AI相关学术研究。签署协议后提供脱敏数据子集,需注明来源:朗慧科技 DataAssetsAPI。
商业授权许可
面向医疗器械企业、AI诊断公司,支持医学AI产品研发和医疗器械注册。提供全量数据+定制标注+增量更新服务。
数据合规声明
所有影像均来源合法授权,PHI字段全量脱敏,不包含任何可直接识别个人身份的信息,符合《个人信息保护法》和《数据安全法》要求。
定制服务
支持特定病种增补、多模态标注扩展、AI辅助诊断模型定制训练等扩展需求。