数据集概览
定义:胎儿超声影像数据集是由长沙朗慧信息科技有限公司构建的大规模超声系列影像数据库。以纳入超声总量100,000例;子部位数量在采购订单中锁定。最终结算以验收合格的一次产前超声检查/Study(多胎按胎儿另建关联编号但检查仅计1例)去重数量为准。合格超声检查为主体,采用DICOM标准原始数据格式,保留完整序列信息、空间几何参数及元数据。覆盖12余种核心病种,多中心来源,严格质控,适用于医学影像AI模型训练与辅助诊断能力建设。
| 数据集名称 | 胎儿超声影像数据集 |
| 数据总量 | 纳入超声总量100,000例;子部位数量在采购订单中锁定。最终结算以验收合格的一次产前超声检查/Study(多胎按胎儿另建关联编号但检查仅计1例)去重数量为准。(一次产前超声检查/Study(多胎按胎儿另建关联编号但检查仅计1例)级) |
| 影像模态 | 超声 |
| 扫描协议 | 早孕/中孕系统筛查/晚孕生长评估分层;二维灰阶;彩色/频谱多普勒按临床已有;三维/四维派生数据单独标记;标准切面与测量。协议名称必须与实际文件、范围、期相、视图或序列一致。 |
| 原始数据格式 | 脱敏原始DICOM,保留完整层级与元数据 |
| 核心病种(P0) | 正常系统筛查、胎儿生长受限/小于孕龄、巨大儿/生长过快、羊水异常 |
| 扩展病种(P1) | 中枢神经系统异常、先天性心脏异常、颜面/颈部异常、胸腹壁及消化系统异常等 |
| 来源机构 | 建议覆盖10--20家,原则上不少于10家,上限不作限制;具体数量按交付数据量灵活调整 家合作三甲医院 |
| 质控标准 | Kappa ≥ 0.75,L1-L5 五档质量分级 |
| 应用场景 | AI模型训练、辅助诊断、影像组学研究、算法验证 |
疾病分布示意
交付规格与字段要求
数据集严格遵循统一交付索引要求,确保数据质量与可追溯性。
交付与计数:一行对应一个一次产前超声检查/Study(多胎按胎儿另建关联编号但检查仅计1例);同一次检查内的多序列、多期相、多重建、多视图或重复导出不得拆分计数。
阳性病例构成:不适用90%阳性要求;正常发育与异常病例均为必要数据,异常类型、孕周和严重程度的目标比例在采购订单中锁定。疑似、考虑、不能除外、治疗后改变与病理确诊必须分别保留,不得强行归并为明确确诊。
覆盖范围:按孕期和检查类型记录胎儿数、胎位、胎盘、羊水、生物测量和可评价解剖系统;未评价结构不得形成阴性结论。仅对实际进入诊断视野且图像质量支持评价的结构形成阳性、阴性或疾病标签。
原始数据要求:优先DICOM原始静态图和设备原始动态图;保留标准切面、测量、胎儿编号、孕周、探头和设备参数,报告截图不得替代。截图、胶片照片、报告PDF或关键帧拼图不得替代约定的原始影像/视频/切片。
字段组覆盖:批次来源与定位、匿名患者信息、检查主键、模态与部位、协议与设备、专项字段、文件层级、报告文本、诊断标签、临床背景、关联字段、质量与处置
结构化文本:至少保留检查名称、检查所见、诊断结论/印象、主要诊断、细分标签、否定与不确定语义;有原始报告时须逐例关联。
数据规模增长趋势
2026前沿AI研究进展
领域综述:2025-2026年超声系列AI进入基础模型时代,大规模预训练模型在多任务泛化、少样本学习方面取得突破性进展。顶级期刊Nature、Nature Medicine、The Lancet等连续发表多项临床级验证研究,推动超声系列AI从实验室走向临床部署。
Ultrasound Foundation Model (SonoFoundation)
Nature Machine Intelligence, 2025首个大规模超声基础模型,预训练于50万例超声视频,在18项下游任务中全面超越专用模型。
SonoNet系列 实时超声AI诊断
The Lancet Digital Health, 2025SonoNet v3实现胎儿超声实时智能质控与生物测量,在多中心验证中达到专家级一致性(ICC > 0.92)。
Real-Time Ultrasound AI Guidance System
Nature Biomedical Engineering, 2026结合视觉Transformer与运动追踪的实时超声导航系统,在介入超声引导穿刺中显著提升首次成功率。
Multi-Organ Ultrasound Foundation Model
Radiology, 2025覆盖腹部、甲状腺、乳腺、心脏的多器官超声统一模型,零样本迁移能力强,支持快速病种适配。
标注流程与质控
影像采集与脱敏
标准化采集流程,设备原始导出完整数据,去除患者身份信息(PHI)后入库,确保数据合规性。
初标(专科医师)
主治医师对照标准逐例标注,包括病灶定位、形态学描述、疾病诊断标签及专项指标。
审核(副主任及以上)
副主任及以上职称专家对初标结果逐项审核,修正错误标注,补充遗漏维度,确保标注准确性。
一致性评估
随机抽取10%样本由3位医师独立标注,计算Fleiss' Kappa系数,低于0.75的维度标识为需返修。
质量验收检查项
授权与使用协议
学术研究许可
面向高校和科研机构,支持医学AI相关学术研究。签署协议后提供脱敏数据子集,需注明来源:朗慧科技 DataAssetsAPI。
商业授权许可
面向医疗器械企业、AI诊断公司,支持医学AI产品研发和医疗器械注册。提供全量数据+定制标注+增量更新服务。
数据合规声明
所有影像均来源合法授权,PHI字段全量脱敏,不包含任何可直接识别个人身份的信息,符合《个人信息保护法》和《数据安全法》要求。
定制服务
支持特定病种增补、多模态标注扩展、AI辅助诊断模型定制训练等扩展需求。