数据集概览
定义:乳腺钼靶X光影像数据集是由长沙朗慧信息科技有限公司构建的大规模X光系列影像数据库。以300000例(计入X光总量200,000例)。最终结算以验收合格的双侧检查/Study(诊断性单侧补充视图仍归入同次检查)去重数量为准。合格X光(乳腺钼靶)检查为主体,采用DICOM标准原始数据格式,保留完整序列信息、空间几何参数及元数据。覆盖10余种核心病种,多中心来源,严格质控,适用于医学影像AI模型训练与辅助诊断能力建设。
| 数据集名称 | 乳腺钼靶X光影像数据集 |
| 数据总量 | 300000例(计入X光总量200,000例)。最终结算以验收合格的双侧检查/Study(诊断性单侧补充视图仍归入同次检查)去重数量为准。(双侧检查/Study(诊断性单侧补充视图仍归入同次检查)级) |
| 影像模态 | X光(乳腺钼靶) |
| 扫描协议 | 双侧CC;双侧MLO;诊断性补充视图;数字乳腺断层合成/DBT(如有);合成2D图与原始投照分开。协议名称必须与实际文件、范围、期相、视图或序列一致。 |
| 原始数据格式 | 脱敏原始DICOM,保留完整层级与元数据 |
| 核心病种(P0) | 乳腺肿块、可疑钙化、局灶/整体不对称、结构扭曲、乳腺癌等 |
| 扩展病种(P1) | 筛查阴性无 |
| 来源机构 | 建议覆盖10--20家,原则上不少于10家,上限不作限制;具体数量按交付数据量灵活调整 家合作三甲医院 |
| 质控标准 | Kappa ≥ 0.75,L1-L5 五档质量分级 |
| 应用场景 | AI模型训练、辅助诊断、影像组学研究、算法验证 |
疾病分布示意
交付规格与字段要求
数据集严格遵循统一交付索引要求,确保数据质量与可追溯性。
交付与计数:一行对应一个双侧检查/Study(诊断性单侧补充视图仍归入同次检查);同一次检查内的多序列、多期相、多重建、多视图或重复导出不得拆分计数。
阳性病例构成:异常/阳性检查为主体;筛查阴性必须作为独立对照并按BI-RADS与随访状态分层,比例在采购订单中锁定。疑似、考虑、不能除外、治疗后改变与病理确诊必须分别保留,不得强行归并为明确确诊。
覆盖范围:标准双侧CC和MLO视图为主体;补充压迫/放大视图、植入物视图和断层合成必须分层标记。仅对实际进入诊断视野且图像质量支持评价的结构形成阳性、阴性或疾病标签。
原始数据要求:脱敏原始DICOM或设备原生无损数字影像,保留曝光参数、像素间距、体位/视图、设备厂商型号及原始/处理状态;胶片翻拍、报告截图和社交软件压缩图不得替代。截图、胶片照片、报告PDF或关键帧拼图不得替代约定的原始影像/视频/切片。
字段组覆盖:批次来源与定位、匿名患者信息、检查主键、模态与部位、协议与设备、专项字段、文件层级、报告文本、诊断标签、临床背景、关联字段、质量与处置
结构化文本:至少保留检查名称、检查所见、诊断结论/印象、主要诊断、细分标签、否定与不确定语义;有原始报告时须逐例关联。
数据规模增长趋势
2026前沿AI研究进展
领域综述:2025-2026年X光系列AI进入基础模型时代,大规模预训练模型在多任务泛化、少样本学习方面取得突破性进展。顶级期刊Nature、Nature Medicine、The Lancet等连续发表多项临床级验证研究,推动X光系列AI从实验室走向临床部署。
DeepMind Mammography AI 临床验证
Nature, 2025DeepMind乳腺AI在逾百万例筛查中实现假阳性降低19%、假阴性降低20%,在欧洲多国多中心验证中表现一致。
Mammography Screening AI 大规模临床部署
The Lancet Oncology, 2026瑞典全国性乳腺AI筛查研究显示,AI辅助筛查使癌症检出率提升13%,间期癌比例显著下降。
Multi-View Mammography Transformer
IEEE TMI, 2025基于CC/MLO双视图融合的Transformer架构,在BI-RADS分类和乳腺癌风险预测上达到放射科医师水平。
Digital Breast Tomosynthesis AI
Radiology, 2026DBT 3D乳腺断层合成AI检测系统,在致密型乳腺人群中比传统2D钼靶检出率提升25%。
标注流程与质控
影像采集与脱敏
标准化采集流程,设备原始导出完整数据,去除患者身份信息(PHI)后入库,确保数据合规性。
初标(专科医师)
主治医师对照标准逐例标注,包括病灶定位、形态学描述、疾病诊断标签及专项指标。
审核(副主任及以上)
副主任及以上职称专家对初标结果逐项审核,修正错误标注,补充遗漏维度,确保标注准确性。
一致性评估
随机抽取10%样本由3位医师独立标注,计算Fleiss' Kappa系数,低于0.75的维度标识为需返修。
质量验收检查项
授权与使用协议
学术研究许可
面向高校和科研机构,支持医学AI相关学术研究。签署协议后提供脱敏数据子集,需注明来源:朗慧科技 DataAssetsAPI。
商业授权许可
面向医疗器械企业、AI诊断公司,支持医学AI产品研发和医疗器械注册。提供全量数据+定制标注+增量更新服务。
数据合规声明
所有影像均来源合法授权,PHI字段全量脱敏,不包含任何可直接识别个人身份的信息,符合《个人信息保护法》和《数据安全法》要求。
定制服务
支持特定病种增补、多模态标注扩展、AI辅助诊断模型定制训练等扩展需求。