数据集概览

定义:MRI口腔影像数据集是由长沙朗慧信息科技有限公司构建的大规模MRI系列影像数据库。以100,000例合格MRI(磁共振成像)检查为主体,采用DICOM标准原始数据格式,保留完整序列信息、空间几何参数及元数据。覆盖8余种核心病种,多中心来源,严格质控,适用于医学影像AI模型训练与辅助诊断能力建设。

数据集名称MRI口腔影像数据集
数据总量100,000例(MRI检查/Study级)
影像模态MRI(磁共振成像)
扫描协议轴位T1WI;轴/冠状脂肪抑制T2WI或STIR;DWI/ADC;增强后脂肪抑制T1WI;舌/口底必要矢状位。协议名称必须与实际文件、范围、期相、视图或序列一致。
原始数据格式脱敏原始DICOM,保留完整层级与元数据
核心病种(P0)口底癌、颊黏膜/牙龈/腭癌、囊性及良性占位、颈部淋巴结转移倾向、术后/放疗后改变
扩展病种(P1)颌骨肿瘤及侵犯、口腔炎症/脓肿、神经周围侵犯无
来源机构建议覆盖10--20家,原则上不少于10家,上限不作限制;具体数量按交付数据量灵活调整 家合作三甲医院
质控标准Kappa ≥ 0.75,L1-L5 五档质量分级
应用场景AI模型训练、辅助诊断、影像组学研究、算法验证

疾病分布示意

100% 75% 50% 25% 0% 76% 口底癌 22% 颊黏膜/牙龈.. 59% 囊性及良性占.. 63% 颈部淋巴结转.. 61% 术后/放疗后.. 80% 颌骨肿瘤及侵.. 34% 口腔炎症/脓.. 53% 神经周围侵犯

交付规格与字段要求

数据集严格遵循统一交付索引要求,确保数据质量与可追溯性。

交付与计数:一行对应一个MRI检查/Study;同一次检查内的多序列、多期相、多重建、多视图或重复导出不得拆分计数。

阳性病例构成:疾病导向子集明确阳性/异常原则上不低于90%;正常对照、功能成像或筛查子集须单独建组并在采购订单中锁定比例。疑似、考虑、不能除外、治疗后改变与病理确诊必须分别保留,不得强行归并为明确确诊。

覆盖范围:完整记录舌、口底、颊黏膜、硬/软腭、牙龈、上下颌及相关深部间隙;联合头颈MRI按主要目的归类。仅对实际进入诊断视野且图像质量支持评价的结构形成阳性、阴性或疾病标签。

原始数据要求:脱敏原始DICOM,保留Study/Series/Instance层级、空间几何、磁场强度、线圈、序列名称、TR/TE/TI、层厚、b值、对比剂及动态期相等关键元数据。截图、胶片照片、报告PDF或关键帧拼图不得替代约定的原始影像/视频/切片。

字段组覆盖:批次来源与定位、匿名患者信息、检查主键、模态与部位、协议与设备、专项字段、文件层级、报告文本、诊断标签、临床背景、关联字段、质量与处置

结构化文本:至少保留检查名称、检查所见、诊断结论/印象、主要诊断、细分标签、否定与不确定语义;有原始报告时须逐例关联。

数据规模增长趋势

2021 2022 2023 2024 2025 2026 1000% 100%

2026前沿AI研究进展

领域综述:2025-2026年MRI系列AI进入基础模型时代,大规模预训练模型在多任务泛化、少样本学习方面取得突破性进展。顶级期刊Nature、Nature Medicine、The Lancet等连续发表多项临床级验证研究,推动MRI系列AI从实验室走向临床部署。

Med-PaLM M 多模态医学基础模型

Nature Biomedical Engineering, 2025

Google DeepMind推出的通用医学AI模型,在14种模态、114项任务上达到SOTA表现,包括MRI影像解读、报告生成和临床问答。

MIMIC-CXR Foundation Model 进展

Nature Medicine, 2025

基于百万级胸片的基础模型,通过自监督预训练在胸部MRI/CT迁移学习中展现强大泛化能力,AUC提升8-12%。

nnU-Net v2 医学影像分割新标准

Nature Methods, 2025

第二代nnU-Net框架,在MRI多器官分割基准上全面刷新记录,支持3D全卷积Transformer混合架构。

Self-Supervised MRI Representation Learning

IEEE TMI, 2026

基于掩码自编码器的MRI预训练策略,在小样本脑部/脊柱/关节分割任务中相对监督基线提升15%以上。

标注流程与质控

1

影像采集与脱敏

标准化采集流程,设备原始导出完整数据,去除患者身份信息(PHI)后入库,确保数据合规性。

2

初标(专科医师)

主治医师对照标准逐例标注,包括病灶定位、形态学描述、疾病诊断标签及专项指标。

3

审核(副主任及以上)

副主任及以上职称专家对初标结果逐项审核,修正错误标注,补充遗漏维度,确保标注准确性。

4

一致性评估

随机抽取10%样本由3位医师独立标注,计算Fleiss' Kappa系数,低于0.75的维度标识为需返修。

质量验收检查项

总量与去重
来源与授权
原始数据
技术完整性
报告与标签
图文源一致性
阳性病例构成
核心条目
中心覆盖与分布多样性
医生抽检
质量基准与独立抽检
去标识化

授权与使用协议

学术研究许可

面向高校和科研机构,支持医学AI相关学术研究。签署协议后提供脱敏数据子集,需注明来源:朗慧科技 DataAssetsAPI。

商业授权许可

面向医疗器械企业、AI诊断公司,支持医学AI产品研发和医疗器械注册。提供全量数据+定制标注+增量更新服务。

数据合规声明

所有影像均来源合法授权,PHI字段全量脱敏,不包含任何可直接识别个人身份的信息,符合《个人信息保护法》和《数据安全法》要求。

定制服务

支持特定病种增补、多模态标注扩展、AI辅助诊断模型定制训练等扩展需求。

快速信息

数据集编码MRI-ORA
数据总量100,000例
影像模态MRI(磁共振成像)
来源机构合作三甲医院
质控标准Kappa ≥ 0.75
合规授权全链路合规

AI前沿研究

2025-2026年MRI系列AI进入基础模型阶段,多模态自监督学习在多项基准任务中表现优异,多篇顶级期刊论文推动临床级AI诊断发展。

2025-2026最新论文
Nature/Nature Medicine级别研究
FDA/NMPA/CE监管动态