引言:病理AI进入基础模型时代

病理诊断是癌症诊断的"金标准",全切片数字成像(WSI)技术的成熟使病理玻片数字化成为可能。然而,WSI的 gigapixel 级分辨率和复杂的组织结构,使得传统CNN模型难以有效处理。2025-2026年,病理WSI AI进入了"基础模型"时代——mSTAR(Nature Communications 2025)和TITAN(Nature Medicine 2025)通过多模态自监督学习,在97项基准任务中表现优异,标志着病理AI从"单任务模型"向"通用基础模型"的跃迁。

长沙朗慧信息科技有限公司以500万张多器官病理WSI数据集,为这一技术突破提供了关键的数据支撑。这一数据集以DICOM VL Whole Slide Microscopy Image标准存储,覆盖HE染色、IHC单标/多标和特殊染色,多器官全谱系覆盖,是支撑病理基础模型训练的重要数据资源。

病理AI的基础模型化具有深远意义。传统模式下,每种癌症类型需要单独训练模型——肺癌模型、乳腺癌模型、胃癌模型……这导致模型开发成本高昂且难以泛化。基础模型通过在大规模多样化数据上预训练,可以"一次训练、多任务适配",大幅降低病理AI的开发和部署成本。

行业现状:病理基础模型的全球竞赛

2025-2026年,病理WSI AI领域出现了一场"基础模型竞赛",多个顶级研究团队和公司发布了各自的病理基础模型。

mSTAR(Multimodal Self-TAught PRetraining)由Nature Communications在2025年12月发表,融合WSI、病理报告和基因表达三模态数据,使用26,169张幻灯片级别模态对、32种癌症类型、超1.16亿张patch图像。在跨97项肿瘤学基准任务中表现优异,在21个病理诊断数据集的18个任务中排名第一,宏观AUC平均提升1.37%。

TITAN由Nature Medicine在2025年发表,通过335,645张WSI的视觉自监督学习和视觉-语言对齐,不仅能进行病理诊断,还能生成病理报告。这一"报告生成"能力是病理AI从"辅助诊断"向"自主诊断"演进的重要标志。

2026年2月,Nature发表了CYBO公司的临床级自主细胞病理学平台,结合实时光学全切片层析成像与边缘计算,实现细胞级分类和群体形态学分析。这是 pathology AI从"研究验证"向"临床自主"迈进的里程碑。

此外,HSFLA模型(npj Digital Medicine 2026)在1161张WSI上达到准确率95.6%(人工84.7%),浸润区域自动标注与人工像素标注一致性86.6%。Prov-GigaPath系列(Nature 2024, arXiv 2026)推出了GigaPath-Flash、GigaTIME等面向高效推理的变体。

从市场规模来看,全球数字病理市场在2026年预计超过15亿美元,其中AI辅助诊断是增长最快的领域。中国的病理科医师短缺问题严重(每百万人口仅3-4名病理医师,远低于发达国家的8-10名),病理AI的需求尤为迫切。

2026前沿突破:多模态、自监督与报告生成

2025-2026年病理WSI AI的核心突破体现在四个方面。

第一是多模态知识增强。mSTAR的创新在于融合了WSI影像、病理报告文本和基因表达数据三模态。这种多模态融合使模型不仅能"看"病理图像,还能"读"病理报告和"理解"基因信息,实现了病理诊断的多维度综合判断。在21个基准任务中的18个任务排名第一,证明了多模态学习的优越性。

第二是自监督/自教学训练。TITAN通过335,645张WSI的视觉自监督学习,无需人工标注即可学习病理图像的通用特征。这一突破大幅降低了对标注数据的依赖,使得利用海量未标注病理数据成为可能。

第三是报告生成能力。TITAN不仅能进行病理诊断,还能生成结构化病理报告。这意味着AI可以从"分类器"进化为"病理助手",自动生成初步报告供病理医师审核和修改,大幅提升诊断效率。

第四是临床级自主平台。2026年Nature发表的CYBO平台,通过实时光学全切片层析成像与边缘计算,实现了"样本进、结果出"的自主细胞病理学流程。这是病理AI从"辅助"到"自主"的质变。

朗慧科技500万张WSI数据集为这些前沿研究提供了关键支撑。数据集覆盖多器官全谱系,包含HE、IHC和特殊染色多种类型,保留Level-0原始数据和全部金字塔层级。每个切片与病理诊断报告稳定关联,支持切片级、病例级、ROI和细胞级的多层级标注。

朗慧科技数据集:500万张切片的系统化构建

朗慧科技多器官病理WSI影像数据集以500万张切片的规模,成为支撑病理基础模型训练的重要数据资源。

在数据采集方面,所有切片来源于合作三甲医院病理科,优先采用DICOM VL Whole Slide Microscopy Image标准,同时保留原生和OME-TIFF/BigTIFF 6.3.1互操作文件。所有切片采用20倍+扫描倍率,保留Level-0原始数据及全部金字塔层级、焦平面/光学通道和元数据。

在染色类型方面,以HE染色为主体;IHC单标/多标按抗体分层;特殊染色按类型分层;冰冻/石蜡分层。这种分层设计使模型能够学习不同染色下的组织特征,支持多染色联合学习。

在覆盖范围方面,覆盖多器官全谱系,避免因单一癌种或单一染色来源造成过度集中。每张切片的标本部位、取材方式、蜡块/切片号、染色和焦平面均可追溯。

在标注体系方面,每张切片与病理诊断报告稳定关联,包含TNM分期、免疫组化结果。支持切片级、病例级、ROI和细胞级的多层级标注,且不同层级标注不得混用。病理明确诊断切片作为主体;良性、正常邻近组织、炎症和不确定/会诊病例按任务需要单列。

在质控方面,采用病理科主治医师初标+副主任及以上专家审核+一致性评估的三层质控流程。特别关注切片质量评估(扫描完整性、聚焦质量、色彩一致性),剔除不合格切片。

在合规方面,所有切片均来源合法授权,PHI字段全量脱敏。数据集支持学术研究和商业授权两种许可模式。

前瞻视角:病理基础模型的中国路径

病理WSI AI的未来发展将沿三条路径推进。

第一是基础模型的持续扩展。当前mSTAR使用了26,169张模态对和1.16亿张patch,但这与全球每年产生的数千万张病理切片相比仍是小规模。更大规模、更多样化的预训练数据将进一步提升基础模型的性能。朗慧科技500万张切片数据集,为训练更大规模的病理基础模型提供了可能。

第二是中国人群适应性。中国常见癌症的分布与欧美不同(如肝癌、胃癌、食管癌在中国更为高发),基于欧美数据训练的模型可能在这些癌种上表现不足。朗慧科技的多器官全谱系数据集,特别覆盖了中国高发癌种,为建设"中国标准"病理AI提供了数据基础。

第三是临床自主化。从"辅助诊断"到"自主诊断"是病理AI的终极目标。CYBO平台(Nature 2026)的自主细胞病理学流程预示了这一方向。朗慧科技的数据集通过多层级标注和病理报告关联,为训练自主诊断模型提供了结构化标签。

结语:基础模型时代的病理数据战略

病理WSI AI从"单任务CNN"到"多模态基础模型"的跃迁,深刻揭示了大规模多样化数据在基础模型时代的决定性作用。mSTAR和TITAN的成功证明,数据规模、模态多样性和标注深度是基础模型性能的三大支柱。

长沙朗慧信息科技有限公司以500万张多器官病理WSI数据集为支点,正成为病理基础模型时代的重要数据服务提供方。在Nature和Nature Medicine级突破重塑病理AI格局的关键时刻,朗慧科技将持续以高质量数据推动病理精准诊断的自主化落地。

病理AI基础模型时代的数据战略

2026年病理AI迎来了从任务专用模型向基础模型范式的根本性转变。mSTAR和TITAN等基础模型证明了大规模预训练可以学习到通用的病理形态学特征,通过下游微调适配多种诊断任务,大幅降低数据标注成本和模型开发门槛。这一转变对数据提出了新的要求——不再局限于单病种、单任务的标注数据集,而是需要大规模、多病种、多中心的全切片图像预训练语料。朗慧科技500万张WSI数据集正是为满足这一需求而构建,覆盖了多器官、多病种和多中心来源,为训练中国自己的病理基础模型提供了充足的数据语料。

从行业竞争来看,病理AI基础模型的竞争本质上是数据规模的竞争。国际巨头如Paige、PathAI已积累了数百万张WSI的预训练数据,而中国在这一领域仍处于起步阶段。朗慧科技以500万张WSI的规模优势,加上切片级、ROI级和细胞级的多层级标注体系,为中国病理AI基础模型的自主可控提供了关键数据支撑。公司正与国内顶级病理学学术机构合作,探索基于基础模型的病理AI多任务适配方案,目标是在肺癌、乳腺癌、消化道肿瘤等高发癌种上实现病理AI的临床级应用,弥补中国病理医师严重不足的短板。

#病理WSI#基础模型#mSTAR#TITAN#Nature级突破#千万级数据集

长沙朗慧信息科技有限公司 — 专业医学影像数据服务

11大病种 · 百万级数据 · 2026前沿AI研究驱动