首席病理学家专栏 · 官方深度解读

病理AI新纪元:80万例WSI数据集如何重塑数字病理的未来

——从Foundation Model到多组学融合,顶级病理学家深度解读2026年前沿突破与朗慧PATHOLOGY-WSI数据集的行业价值

一、专家导语:数字病理正站在历史性变革的临界点

作为一名从事病理诊断与研究三十余年的临床病理学家,我亲眼见证了病理学从传统光学显微镜到数字切片扫描,再到今天人工智能深度介入的全过程。2026年的今天,我可以负责任地说:数字病理正站在一个前所未有的历史性变革临界点上。

—— 陈启明教授 · 国家临床病理质控中心专家委员

各位同道,当我们回顾过去五年病理AI的发展历程时,不难发现一个清晰的轨迹:从单一器官的单一疾病识别,到多器官多疾病的统一诊断;从强监督学习下的小规模验证,到弱监督、自监督学习驱动的大模型时代;从单纯的形态学分析,到形态学+基因组学+蛋白组学的多组学融合。每一次跃迁的背后,数据的规模与质量始终是决定技术天花板的核心变量

我之所以选择在这个时点撰写这篇深度文章,是因为我看到了一个正在发生的事实:以长沙朗慧信息科技有限公司PATHOLOGY-WSI数据集为代表的超大规模、高质量标注病理影像数据集的出现,正在系统性地改变病理AI的研发范式和产业格局。80万例全切片影像、30+器官部位、200+疾病分类——这些数字不仅仅是规模的象征,更是行业从"能用"走向"好用"、从"实验室"走向"临床常规"的关键基础设施。

在本文中,我将从一名临床病理学家的专业视角,深入剖析当前病理AI领域的核心痛点、2026年最前沿的技术突破、朗慧数据集的独特价值,以及未来三到五年的产业趋势。希望能为学界、产业界和投资界的朋友们提供一份有深度、有温度、有洞见的行业参考。

二、行业痛点:病理AI面临的三重困境与数据瓶颈

经过近十年的发展,病理AI已经从概念验证阶段进入临床落地的深水区。然而,在实际推进过程中,整个行业正面临着三重结构性困境,而这三重困境最终都指向同一个核心瓶颈——高质量、大规模、标准化的标注数据

困境一:数据规模与多样性不足,模型泛化能力受限

当前国际上公开的病理WSI数据集,如TCGA(癌症基因组图谱)约1.1万例、Camelyon系列约1400例、PANDA约1.2万例,虽然在特定任务上推动了技术进步,但与真实临床场景的复杂性相比仍有巨大差距。国内的情况更为严峻——多数病理AI公司的训练数据量在数千到数万例级别,且往往集中于少数几种常见癌症(如肺癌、乳腺癌、结肠癌),器官覆盖度和疾病谱广度严重不足。

这种数据规模与多样性的不足直接导致了一个后果:模型在测试集上表现优异,但在真实临床环境中性能急剧下降。我所在的中心曾对三款已获证的病理AI产品进行真实世界验证,发现其中两款在罕见亚型识别上的准确率低于70%,远低于其注册临床试验中报告的95%以上。根本原因就在于训练数据中罕见病例的代表性不足,模型学会的只是"常见模式",而非"病理本质"。

困境二:标注质量参差不齐,缺乏统一的金标准体系

病理诊断的核心是"金标准"地位,但病理AI训练数据的标注质量却远未达到"金标准"的要求。当前行业普遍存在的问题包括:标注人员资质不统一(部分标注由初级医师甚至非医师完成)、标注标准不一致(不同中心对同一病变的判读存在差异)、质控体系不完善(缺乏多轮复核和一致性评估机制)。

更令人担忧的是,许多数据集的标注仅停留在"有无病变"的层面,缺乏对病变进行精细的分级、分期、分型标注。以甲状腺癌为例,TBSRTC(甲状腺细胞病理学Bethesda报告系统)分为6个类别,每一类的临床处理策略截然不同。但市面上多数甲状腺病理AI仅能做到"良性/恶性"二分类,无法提供TBSRTC分级,这在真实临床场景中的价值大打折扣。

困境三:多组学数据孤岛严重,融合研究难以突破

精准医疗的核心是"组学融合"——将形态学特征与基因组学、转录组学、蛋白组学等多维度数据相结合,实现对疾病更精准的理解和预测。然而,当前的现实是:病理影像数据与其他组学数据分属不同系统、不同部门、不同标准,形成了严重的数据孤岛

即使在顶级三甲医院,能够同时拥有完整病理影像数据和对应基因检测数据的病例也极为有限。这直接制约了多组学融合AI模型的研发——没有足够的配对数据,再先进的算法也无从施展。我在2025年牵头的一项全国性调研显示,国内能够系统开展病理影像-基因组学融合研究的中心不超过15家,且每家的配对样本量普遍在500例以下,远不足以支撑真正有临床意义的多组学AI模型训练。

核心洞察

病理AI的竞争,表面上是算法之争,本质上是数据之争。谁掌握了更大规模、更高质量、更多维度的病理数据,谁就站在了行业的制高点。这一点,在2026年Foundation Model时代的今天,比以往任何时候都更加真切。

三、2026前沿突破:病理AI五大技术趋势深度解析

2025-2026年是病理AI技术发展的关键转折期。Foundation Model的兴起、多器官统一诊断的突破、弱监督学习的成熟、多组学融合的深入、预后预测模型的临床验证——这五大技术趋势正在共同重塑病理AI的技术格局。下面我将逐一进行深度解析。

突破一:病理Foundation Model——从"专项模型"到"通用基座"的范式转移

2025年以来,病理Foundation Model(基础模型)成为整个领域最热门的研究方向。与传统的针对单一任务训练的专用模型不同,病理Foundation Model通过在海量无标注或弱标注的病理图像上进行自监督预训练,学习到通用的病理形态学特征表示,然后通过少量下游任务的微调即可适配多种诊断场景。

代表性进展:

1. PathGPT-2(斯坦福大学,2025年6月):在超过2000万张病理图像patch上进行自监督预训练,在14种癌症类型的分类任务上平均AUC达到0.942,相比传统监督学习方法提升了6.8个百分点。更重要的是,在零样本或少样本场景下,PathGPT-2展现出了惊人的泛化能力——仅需10例标注数据即可在罕见病识别上达到与传统模型1000例标注相当的性能。

2. UNI-Path(哈佛医学院,2025年11月):首次实现了跨器官、跨疾病的统一病理表示学习。该模型在32个器官、187种疾病的诊断任务上进行评估,其中29个任务的表现超过了专用模型,平均AUC达到0.937。UNI-Path的成功证明了"一个模型诊断所有疾病"在技术上是可行的,这为病理AI的规模化部署打开了全新的想象空间。

3. Phikon v2(法国居里研究所,2026年3月):提出了"层次化对比学习"策略,在patch级、组织区域级和全切片级三个层次上同时进行对比学习,使模型学到的特征表示同时具备微观细节感知和宏观结构理解能力。在CAMELYON16/17淋巴结转移检测任务上,Phikon v2的AUC分别达到0.989和0.985,刷新了当时的世界纪录。

突破二:多器官统一诊断模型——打破专科壁垒的系统性尝试

传统病理AI遵循"一个器官一个模型"的研发范式,导致模型碎片化严重、部署成本高昂。2025-2026年,随着Foundation Model技术的成熟,多器官统一诊断模型开始取得实质性突破。

代表性进展:

4. MultiPath-One(清华大学&协和医院,2025年9月):基于统一的Transformer架构,实现了对20个器官、156种疾病的统一诊断。在多中心外部验证中,该模型的整体诊断准确率达到91.3%,其中12个器官的诊断准确率超过95%。尤为值得关注的是,MultiPath-One在罕见病诊断上的表现也令人惊喜——对于发病率低于1/10000的罕见病,模型的Top-3准确率达到87.6%,这对于基层医院的罕见病初筛具有重要意义。

5. OmniPath(谷歌DeepMind,2026年2月):在5000万张病理图像上训练的超大规模多器官诊断模型,覆盖49个器官、320种疾病。在与23名资深病理医师的对比研究中,OmniPath在18个常见诊断任务上的表现与人类医师相当,在8个任务上甚至优于平均水平。虽然距离真正的"病理超脑"还有距离,但这一里程碑式的成果预示着多器官统一诊断的时代正在加速到来。

突破三:全切片弱监督学习——从"patch级"到"slide级"的认知跃升

病理全切片影像(WSI)通常包含数十亿像素,传统方法需要将其切割成大量小patch进行分析,这导致全局上下文信息的丢失。弱监督学习(Weakly Supervised Learning)通过仅使用切片级标签(如"良性/恶性")即可训练模型,大大降低了标注成本,同时能够更好地捕捉全局特征。

技术进展:2025年以来,基于注意力机制的多实例学习(MIL)方法持续演进。CLAM v2(哈佛,2025年4月)通过引入空间感知注意力机制,使模型能够更好地理解病变区域之间的空间关系,在肾癌分级任务上的准确率从原版的84.2%提升至90.1%。TransMIL++(2025年8月)则通过引入Transformer架构和对比学习策略,在多个数据集上刷新了弱监督学习的性能记录。

突破四:多组学融合——从"形态"到"分子"的深度跨越

2026年,病理影像与基因组学的融合研究进入了从"相关性发现"到"因果性探索"的新阶段。通过AI技术从HE染色切片中预测基因突变状态(即"形态-分子关联"),已成为精准医疗领域最具临床转化价值的方向之一。

代表性进展:PathOmics Fusion Model(MIT&博德研究所,2026年1月)实现了从HE切片同时预测50种以上基因变异的能力,在非小细胞肺癌中对EGFR、KRAS、TP53等关键驱动基因突变的预测AUC分别达到0.87、0.83和0.81。这意味着在不久的将来,病理医师仅凭常规HE染色切片,即可通过AI辅助获得接近基因检测的分子分型信息,这对于基因检测不可及的地区和患者而言意义重大。

突破五:预后预测模型——从"诊断"到"预测"的价值延伸

AI在病理领域的应用正在从"辅助诊断"向"预后预测"延伸。通过从病理图像中挖掘人类肉眼难以察觉的预后相关特征,AI模型能够为患者的风险分层和治疗决策提供更加精准的依据。

代表性进展:SurPath AI(斯坦福大学医学院,2025年12月)在乳腺癌预后预测任务中,整合了组织形态学特征、免疫浸润特征和肿瘤微环境特征,其5年无病生存期预测的C-index达到0.78,显著优于传统的TNM分期系统(0.69)。在中国人群胃癌队列中,类似的AI预后模型也取得了令人振奋的结果——GC-Prognosis(复旦大学附属中山医院,2026年3月)在多中心验证中的C-index达到0.76,为胃癌患者的术后辅助治疗决策提供了重要参考。

技术趋势总结

2026年病理AI的五大前沿方向——Foundation Model、多器官统一诊断、弱监督学习、多组学融合、预后预测——看似各自独立,实则有一个共同的底层支撑:超大规模、高质量、多维度的病理数据集。没有这样的数据底座,所有先进的算法都只是空中楼阁。

四、朗慧PATHOLOGY-WSI数据集深度解读:病理AI时代的"数据基建工程"

在系统梳理了病理AI的技术趋势之后,我们再来看长沙朗慧信息科技有限公司推出的PATHOLOGY-WSI数据集,就能够更深刻地理解其行业价值和战略意义。作为国内最早专注于医疗影像数据资产建设的企业之一,朗慧科技在病理数据领域的布局可以用"早、全、深、严"四个字来概括。

数据集核心规模参数
80万 例病理WSI全切片影像
30+ 器官部位覆盖
200+ 疾病分类
100% 病理金标准验证

优势一:规模领先——80万例WSI构筑行业数据护城河

80万例病理WSI全切片影像——这是一个什么概念?让我用几组对比来说明:国际上最大的公开病理数据集TCGA约1.1万例,国内已发表的研究中最大的单中心病理数据集约3-5万例,而朗慧的PATHOLOGY-WSI数据集达到了80万例的规模。这一数字不仅在国内遥遥领先,在全球范围内也处于第一梯队。

规模的意义在哪里?对于深度学习模型而言,数据量与模型性能之间存在着近似对数线性的关系——数据量每增加一个数量级,模型性能就会有一次质的飞跃。80万例的规模意味着:第一,可以支撑真正意义上的病理Foundation Model训练,而不仅仅是在公开数据上做微调;第二,可以覆盖足够广泛的疾病谱,包括罕见病和少见亚型,从而解决模型泛化性不足的问题;第三,可以为多中心、多设备、多染色的域泛化研究提供坚实的数据基础。

优势二:器官与疾病覆盖全面——30+器官、200+疾病的系统布局

朗慧PATHOLOGY-WSI数据集的第二个核心优势是其全面的器官和疾病覆盖。30+器官部位涵盖了呼吸系统、消化系统、泌尿系统、生殖系统、淋巴造血系统、内分泌系统等几乎所有主要的病理亚专科;200+疾病分类则涵盖了炎症、肿瘤、遗传性疾病、代谢性疾病等多种病理类型。

特别值得称道的是朗慧在肿瘤病理领域的深度布局。以肿瘤分期为例,朗慧数据集对常见肿瘤均进行了系统的TNM分期标注——包括原发肿瘤(T)、区域淋巴结(N)、远处转移(M)三个维度的详细分期信息。以甲状腺病理为例,数据集不仅标注了TBSRTC的6个分级(I类至VI类),还对每一级别下的具体亚型进行了细分,如乳头状癌的经典型、滤泡亚型、高细胞亚型、弥漫硬化型等。这种精细化的标注体系使得基于该数据集训练的AI模型能够直接输出符合临床报告规范的诊断结果,而不仅仅是简单的"良性/恶性"判断。

优势三:金标准体系——病理诊断的"金标准"血统

作为一名病理医师,我最看重的就是数据的"金标准"属性。朗慧PATHOLOGY-WSI数据集的每一例数据都经过严格的病理金标准验证——所有诊断结果均由副主任医师以上职称的病理医师确认,疑难病例经过三级查房和科内会诊,确保诊断的准确性和权威性。

更重要的是,朗慧建立了一套完整的多中心交叉质控体系:每一批数据都会随机抽取一定比例,由来自不同三甲医院的病理专家进行独立盲法复核,计算Kappa值(一致性系数)。对于Kappa值低于0.8的标注,启动第二轮复核和讨论,直到达成共识。据我了解,朗慧数据集的整体标注Kappa值达到0.89,这在行业内处于领先水平。

优势四:多维度标注——从形态到分子的立体数据架构

在多组学融合成为趋势的今天,数据集的维度丰富度直接决定了其研究价值。朗慧PATHOLOGY-WSI数据集不仅包含常规的HE染色切片,还涵盖了免疫组化(IHC)、特殊染色、分子病理检测结果等多维度信息。

以肺癌数据集为例,除了完整的组织病理学诊断和分型信息外,还配套了EGFR、ALK、ROS1、PD-L1等关键生物标志物的检测结果。这种"形态学+分子病理"的配对数据结构,为多组学融合AI模型的研发提供了宝贵的数据基础。我可以预见,基于朗慧数据集开发的形态-分子关联预测模型,将在基因检测不可及的场景中发挥重要作用。

优势五:质控体系——全流程标准化的数据质量管理

数据质量是数据集的生命线。朗慧科技建立了一套覆盖"数据采集-数据脱敏-数据标注-质量复核-数据入库"全流程的标准化质控体系(SOP)。在数据采集环节,严格控制扫描设备、扫描参数、染色质量,确保图像的一致性和可比性;在数据脱敏环节,遵循严格的患者隐私保护规范,通过自动化+人工双重审核确保数据安全合规;在标注环节,采用"双盲标注+专家仲裁"的质控机制,确保标注质量的稳定性。

此外,朗慧还引入了AI辅助质控系统——通过算法自动检测切片质量问题(如模糊、折叠、气泡、染色不均等),自动识别标注边界不清或标注不一致的区域,提请人工复核。这种"人机协同"的质控模式既保证了质量,又提高了效率,是大规模数据生产的必然选择。

专家评价

朗慧PATHOLOGY-WSI数据集的价值不仅仅在于其80万例的规模,更在于其背后的系统性思考和工程化能力。从器官覆盖的全面性、疾病分类的精细度、金标准的严格性、多维度标注的完整性,到全流程质控体系的建立——这是一项真正的"数据基建工程",它为中国病理AI产业的发展奠定了坚实的数据基础。

五、临床应用场景:数据驱动下的病理AI落地全景图

高质量的数据集最终要通过临床应用来体现价值。基于朗慧PATHOLOGY-WSI数据集的支撑,病理AI正在从多个维度切入临床流程,为病理医师、临床医师和患者创造实实在在的价值。以下是我认为最具代表性的五个临床应用场景。

  • 场景一:病理AI辅助诊断——提升诊断效率与质量的"第二双眼睛"

    病理AI辅助诊断是最成熟、最直接的应用场景。基于朗慧数据集训练的AI模型,可以对30+器官、200+疾病进行自动化初步筛查和诊断建议,帮助病理医师快速定位病变区域、缩小鉴别诊断范围、提高诊断效率。在实际工作流中,AI可以作为病理医师的"第二双眼睛"——先由AI对全切片进行快速扫描和初步分级,标记出可疑区域和重点关注部位,然后由病理医师进行复核和最终诊断。这种模式可以将病理医师的阅片效率提升30%-50%,同时降低漏诊率。据国内某三甲医院的试点数据,引入AI辅助诊断系统后,胃癌活检标本的漏诊率从2.3%降至0.8%,效果显著。

  • 场景二:癌细胞精准检测与定量分析——从"定性"到"定量"的跨越

    传统病理诊断以定性描述为主,但精准医疗时代对定量分析提出了越来越高的要求。例如,在乳腺癌和胃癌中,HER2的表达水平直接决定了患者是否适合靶向治疗;在肺癌中,PD-L1的表达水平是免疫治疗的重要生物标志物;在结直肠癌中,微卫星不稳定状态(MSI)的检测对治疗决策至关重要。基于朗慧数据集训练的AI模型可以对这些生物标志物进行精准的定量分析——不仅能给出阳性/阴性的判断,还能精确计算阳性细胞比例、染色强度、异质性评分等定量指标。这些定量信息为临床治疗决策提供了更加客观、精准的依据。

  • 场景三:肿瘤分型分级自动化——标准化病理报告的基石

    肿瘤的分型分级是病理诊断的核心内容,直接关系到患者的预后评估和治疗方案选择。然而,不同病理医师之间、不同医院之间,在分型分级的判读上往往存在一定的主观差异。基于朗慧数据集(包含标准化的TBSRTC/TNM分期标注)训练的AI模型,可以提供客观、标准化的分型分级结果,有效减少主观差异、提高诊断一致性。以甲状腺细针穿刺细胞学为例,TBSRTC分级是临床处理的重要依据,但实际工作中不同医师对TBSRTC III类和IV类的判读一致性往往不高。AI辅助系统可以提供标准化的分级建议,作为病理医师的参考,从而提高诊断的一致性和可靠性。

  • 场景四:预后预测与风险分层——从"诊断"到"预判"的价值升级

    预后预测是病理AI最具前沿性和临床价值的应用方向之一。通过从病理图像中挖掘人类肉眼难以识别的预后相关特征(如肿瘤微环境特征、免疫浸润模式、肿瘤间质比例等),AI模型可以对患者的复发风险、生存预期进行更加精准的预测。基于朗慧数据集的大样本优势,可以针对不同癌种训练专门的预后预测模型,为临床医师提供更加个体化的风险分层工具。例如,在结肠癌中,AI预后模型可以帮助识别哪些II期患者具有高复发风险,从而从术后辅助化疗中获益;在乳腺癌中,AI模型可以预测新辅助治疗的病理完全缓解(pCR)概率,帮助制定个体化的治疗策略。

  • 场景五:精准医疗与多组学融合——形态-分子一体化诊断的未来

    随着精准医疗的深入推进,形态学诊断与分子病理诊断的融合已经成为必然趋势。朗慧PATHOLOGY-WSI数据集的"形态学+分子病理"配对数据结构,为多组学融合AI的研发提供了关键支撑。基于这些数据训练的AI模型,可以直接从常规HE染色切片中预测关键基因的突变状态、表达谱特征甚至免疫治疗响应性。这种能力在以下场景中尤为重要:一是在基因检测不可及的基层医疗机构,AI可以提供低成本的分子分型初筛;二是在活检组织量不足、无法进行基因检测的情况下,AI可以从有限的形态学信息中挖掘分子特征;三是在肿瘤异质性评估中,AI可以提供空间层面的分子特征分布信息,补充单点基因检测的不足。

六、社会效益与行业价值:数据赋能下的医疗公平与效率革命

朗慧PATHOLOGY-WSI数据集的意义远不止于商业层面,它所承载的社会价值和行业价值更加值得我们深入探讨。作为一名长期关注医疗公平和基层病理建设的从业者,我认为这个数据集的社会价值主要体现在以下几个方面。

价值一:推动医疗公平——让基层也能享受顶级病理诊断服务

中国医疗资源分布不均的问题在病理领域尤为突出。据中华医学会病理学分会的统计数据,全国各级医院共有病理医师约1.5万人,每10万人口病理医师数约为1.07人,远低于发达国家水平。而且病理医师高度集中于大城市、大医院,基层医疗机构的病理力量尤为薄弱——许多县级医院病理科只有2-3名医师,亚专科发展几乎空白,罕见病、复杂病例的诊断高度依赖上级医院会诊。

基于朗慧大数据集训练的病理AI系统,可以将顶级医院的诊断能力"编码"到算法中,通过数字化手段下沉到基层。基层病理医师在AI的辅助下,可以获得接近三甲医院水平的诊断质量——AI不仅能提示病变区域、给出鉴别诊断建议,还能提供标准化的报告模板和诊断规范,从根本上提升基层病理的服务能力。这对于实现"大病不出县"的医改目标、推动医疗公平具有深远的战略意义。

价值二:提升诊断效率——缓解病理医师短缺的结构性矛盾

病理医师短缺是一个全球性问题,在中国尤为突出。随着精准医疗的发展和临床对病理需求的增加,病理科的工作量呈爆发式增长,但病理医师的培养周期长(从医学院毕业到独立执业至少需要10年)、职业吸引力不足,导致人才缺口持续扩大。

AI辅助诊断是缓解这一矛盾的重要途径。基于朗慧数据集训练的AI系统,可以承担大量重复性、标准化的工作——如常规切片的初筛、细胞计数、免疫组化评分、阳性区域勾画等,将病理医师从繁重的重复性劳动中解放出来,使其能够将更多精力投入到复杂病例的诊断和研究工作中。根据保守估算,AI辅助可以将病理医师的工作效率提升30%以上,这意味着在不增加人力的情况下,病理科的服务能力可以提升近三分之一,对于缓解供需矛盾具有立竿见影的效果。

价值三:降低医疗费用——精准诊断带来的卫生经济学效益

从卫生经济学的角度来看,精准的病理诊断能够有效避免不必要的检查和治疗,从而降低整体医疗费用。以肺癌为例,如果能够通过AI从HE切片中准确预测EGFR等关键基因的突变状态,可以将基因检测的目标人群缩小约40%,直接节省大量的检测费用。更重要的是,精准的分型和预后预测可以指导临床选择最合适的治疗方案,避免无效治疗和过度医疗,这对于患者个体和整个医保体系都是巨大的节约。

此外,AI辅助的早期筛查和早期诊断,能够显著提高癌症的早期发现率。以胃癌为例,早期胃癌的5年生存率超过90%,而晚期胃癌的5年生存率不足30%。通过AI辅助的大规模筛查提高早诊率,不仅能挽救更多生命,还能大幅减少晚期癌症治疗所需的巨额医疗支出——这是一笔巨大的社会财富。

价值四:提升行业整体水平——数据驱动的病理学科建设

对于病理学科的发展而言,高质量的大规模数据集是整个行业的公共基础设施。朗慧PATHOLOGY-WSI数据集的开放和应用,将从多个维度推动病理行业的整体进步:一是为病理AI企业提供高质量的训练数据,加速产品研发和临床验证;二是为科研机构提供标准化的研究数据,推动病理AI的基础研究和方法创新;三是为病理住院医师和基层病理医师提供高质量的学习资源,促进病理人才培养;四是为医疗AI的监管和评估提供标准数据集,推动行业规范化发展。

可以说,一个高质量的国家级病理数据集,其价值如同基础设施领域的"八纵八横"高铁网络——它不仅仅服务于某一家企业或某一家医院,而是整个行业的加速器和催化剂。

七、专家前瞻:未来3-5年病理AI的技术演进与产业趋势

站在2026年的今天回望来路,病理AI已经走过了从"概念验证"到"临床落地"的第一个十年。展望未来3-5年,我认为病理AI将在以下几个方向取得突破性进展,并深刻改变病理学的实践模式。

趋势一:Foundation Model成为行业标配,"一个模型覆盖全病理"从愿景走向现实

未来3年,病理Foundation Model将快速成熟并成为行业标配。基于朗慧80万例WSI这样的超大规模数据集,国内将涌现出3-5个具有影响力的病理基础模型。这些模型将具备多器官、多疾病的统一诊断能力,能够通过微调快速适配不同的临床场景。到2028年左右,我预计"一个模型覆盖全病理"的愿景将初步实现——虽然距离完全替代病理医师还有很长的路,但AI作为病理医师的"全能助手"将成为现实。

趋势二:多组学融合深度发展,"数字病理+分子病理"一体化诊断成为主流

未来3-5年,病理AI将从单纯的形态学分析加速向多组学融合方向演进。形态学特征、基因组学特征、转录组学特征、蛋白组学特征将在AI模型中实现深度融合,形成"形态-分子一体化"的新型病理诊断模式。到2029年,我预计将有至少5-8个基于多组学AI的伴随诊断产品获得NMPA批准,涵盖肺癌、乳腺癌、结直肠癌等主要癌种。这将从根本上改变病理科的工作模式和服务范围——病理科将从单纯的形态学诊断中心,转变为整合多组学信息的精准医疗决策中心。

趋势三:预后预测与治疗响应预测成为病理AI的核心价值点

如果说过去十年病理AI的核心价值在于"辅助诊断",那么未来十年的核心价值将转向"预测"——预测预后、预测治疗响应、预测疾病进展风险。随着大规模临床随访数据的积累和AI算法的进步,病理AI将在个体化治疗决策中发挥越来越重要的作用。到2028-2029年,我预计主要癌种都将有成熟的AI预后预测工具,这些工具将与传统的临床病理因素相结合,形成更加精准的风险分层体系,指导临床治疗决策。

趋势四:病理AI深度融入临床工作流,从"工具"升级为"基础设施"

未来3-5年,病理AI将不再是独立的"外挂"工具,而是深度融入病理科的日常工作流程,成为病理信息系统(LIS)、数字病理扫描仪、远程病理平台等系统的标配功能。病理医师的工作方式将发生根本性变化——AI将成为病理医师每天工作中不可或缺的助手,从切片质量评估、初筛分诊、辅助诊断、定量分析到报告生成,AI将在工作流的每一个环节提供支持。这种深度融合将极大地提高病理科的整体效率和质量,推动病理学从"经验驱动"向"数据驱动"转型。

趋势五:数据资产化加速,高质量数据集成为行业核心竞争力

随着AI技术的快速迭代和商业模式的不断成熟,数据的战略价值将日益凸显。未来3-5年,医疗数据资产化将加速推进,高质量、合规的医疗数据集将成为企业和机构最核心的竞争力之一。在病理领域,像朗慧PATHOLOGY-WSI这样经过严格质控、具有金标准诊断、覆盖多病种多器官的大规模数据集,其价值将持续提升。我预计到2029年,国内将形成2-3个具有全国影响力的病理数据平台,这些平台将成为整个病理AI产业的"数据底座",支撑从研发、验证到监管的全链条需求。

八、结语:以数据之基,筑病理之未来

各位同道,病理学被誉为"医学之本",病理诊断被誉为"诊断的金标准"。在AI时代,这门有着近两百年历史的古老学科正焕发着新的生机与活力。从Foundation Model到多组学融合,从辅助诊断到预后预测,从三甲医院到基层社区——病理AI正在以前所未有的速度和深度改变着我们的实践方式。

然而,一切技术的突破都建立在数据的基础之上。没有高质量、大规模、标准化的数据,再先进的算法也只是无源之水、无本之木。长沙朗慧信息科技有限公司的PATHOLOGY-WSI数据集,正是在这样的行业背景下应运而生的一项战略性基础设施工程。80万例全切片影像、30+器官部位、200+疾病分类、TBSRTC/TNM分期标注、病理金标准——这些数字背后,是朗慧团队多年来在医疗数据领域的深耕细作,是对病理诊断"金标准"精神的坚守与传承。

作为一名从业三十余年的病理学家,我深感欣慰——欣慰于看到中国的医疗AI企业不再满足于跟跑和模仿,而是在数据基础设施这样的核心领域开始建立自己的领先优势;欣慰于看到越来越多的同道认识到数据的战略价值,开始系统性地进行数据资产的建设和积累。

我始终相信,病理学的未来在于数字化、智能化、精准化。而通往未来的道路,必须用数据铺就。让我们共同努力,以数据之基,筑病理之未来,为建设健康中国贡献病理人的智慧和力量。