Introduction: L'IA pathologique dans l'âge modèle de base

Le diagnostic pathologique est la « norme de genre » pour le diagnostic du cancer, et la maturité de la technologie d'imagerie numérique à coupe entière (WSI) a permis de numériser les pathologies. Cependant, la résolution gigapixel de WSI et la structure organisationnelle complexe rendent le modèle CNN traditionnel difficile à gérer efficacement. En 2025-2026, l'IA pathologique WSI est entrée dans l'ère « modèle de base » - mSTAR (Nature Communications 2025) et TITAN (Nature Medicine 2025) par le biais d'un apprentissage multimodulaire auto-suivi et a effectué d'excellentes performances dans 97 missions de référence, marquant le saut de l'IA pathologique, de « modèle de mission » à « modèle de base général ».

Long Salang Langhui Information Technology Ltd. soutient cette percée technologique avec un ensemble de données WSI multi-organes de pathologie de 5 millions. Cet ensemble de données est stocké dans la norme de microscopie de trous de la CTCI VL, couvrant la teinture HeE, le mono-label/multiplateforme IHC et la coloration spéciale, la couverture spectrale multi-organes, et est une ressource de données importante pour la formation aux modèles de pathologie de base.

Dans les modèles traditionnels, chaque type de cancer nécessite des modèles de formation distincts - modèles de cancer du poumon, modèles de cancer du sein, modèles de cancer de l'estomac - qui conduisent à l'élaboration de modèles coûteux et difficiles à généraliser. Les modèles de base peuvent réduire de façon significative les coûts de développement et de déploiement de l'IA pathologique par la pré-formation dans une grande variété de données.

Situation actuelle de l'industrie : une concurrence mondiale sur les modèles pathologiques sous-jacents

En 2025-2026, un « concours de base » a été lancé dans le domaine de la pathologie WSI AI, avec plusieurs équipes de recherche et entreprises publiant leurs propres modèles de fondation de pathologie.

mSTAR (Multimodal Self-Taught Pretraining) publié par Nature Commissions en décembre 2025, intègre des données à trois modules sur l'ISM, les rapports pathologiques et l'expression génétique, en utilisant 26 169 paires de modèles à diapos, 32 types de cancer et plus de 116 millions de patins. La performance dans les missions de base en oncologie de 1997 est excellente, se classant en premier dans les 18 missions des 21 ensembles de données diagnostiques pathologiques, et macroAUC a en moyenne augmenté de 1,37 %.

TITAN, publié par Nature Medicine en 2025, est un indicateur important de l'évolution de l'IA pathologique, de « diagnostic assisté » à « diagnostic autonome » par la supervision visuelle de l'autoapprentissage et de l'alignement visual-linguistique de 335 645 ISM, non seulement pour le diagnostic pathologique, mais aussi pour la production de rapports pathologiques.

En février 2026, Nature a publié la Plateforme de pathologie autocellulaire clinique CYBO, qui combine la dialyse optique en temps réel à des calculs marginaux pour obtenir une classification au niveau cellulaire et une analyse morphologique de groupe.

En outre, le modèle HSFLA (npj Digital Medicine 2026) a obtenu un taux de précision de 95,6 % (à la main) sur 1161 WSI, et le marquage automatique de la zone d'immersion était conforme à 86,6 % aux pixels artificiels. La série Prov-GigaPath (Nature 2024, arXiv 2026) a introduit des variantes à haute incidence orientées raisonnement comme GigaPath-Flash et Gigatime.

En 2026, le marché mondial de la pathologie numérique devrait dépasser 1,5 milliard de dollars, le diagnostic assisté par l'IA étant la zone qui connaît la croissance la plus rapide. La Chine est particulièrement touchée par la pénurie de pathologistes (3-4 pathologistes par million de personnes, soit bien moins de 8-10 dans les pays développés).

2026 percée de première ligne : modèle multiple, autosurveillance et production de rapports

La percée fondamentale de la pathologie WSI AI 2025-2026 se fait de quatre façons.

La première est l'amélioration de la connaissance de multiples mosaïques. L'innovation de mSTAR est l'intégration de trois mosaïques d'images WSI, de textes de rapports pathologiques et de données d'expression génétique. Cette convergence multimodulaire permet aux modèles de lire non seulement des images pathologiques, mais aussi des rapports pathologiques et de comprendre l'information génétique, et d'obtenir une synthèse multidimensionnelle du diagnostic pathologique.

Le second est auto-supervisé/auto-apprentissage. TITAN est auto-supervisé par 335 645 WSI, et peut apprendre le caractère universel des images pathologiques sans étiquetage manuel. Cette percée a réduit considérablement la dépendance à l'égard des données marquées, ce qui permet d'utiliser de grandes quantités de données pathologiques non marquées.

Troisièmement, la capacité de produire des rapports. TITAN non seulement fournit un diagnostic pathologique, mais produit aussi des rapports pathologiques structurels. Cela signifie que l'IA peut automatiquement générer des rapports préliminaires du «Classer» à «Assistant Physicien» pour l'examen et la révision par les pathologistes, ce qui améliore significativement l'efficacité du diagnostic.

La quatrième est la plateforme d'autonomie clinique. La plateforme CYBO, publiée par Nature en 2026, a réalisé le processus de "échantillonnage dans et hors de" pathologie cellulaire autonome en calculant tout le spectre de l'ensemble du spectre optique en temps réel, de l'ensemble du spectre de l'optique à la périphérie.

Les ensembles de données couvrent les systèmes spectraux multi-organes, y compris divers types de colorants HeE, IHC et spéciaux, et conservent les données de niveau 0 d'origine et tous les niveaux pyramidales. Chaque tranche est liée à un rapport de diagnostic pathologique et supporte des étiquettes multi-niveaux de tranches, de cas, de ROI et de niveaux cellulaires.

Ensemble de données Longhui Tech : systématisation de 5 millions de tranches

L'ensemble de données d'image WSI de Longhui Tech Multiorgan Pathology, d'une taille de 5 millions de tranches, est une ressource importante pour la formation aux modèles de pathologie de base.

En ce qui concerne la collecte des données, toutes les tranches sont dérivées de la Section de pathologie unitaire de l'hôpital Sanchae, donnant la priorité à la norme DITC VL de microscopie à glissière, tout en préservant l'interopérabilité originale et OME-TIFF/BigTIFF 6.3.1. Toutes les tranches sont soumises à un multiplicateur de 20 fois + de balayage, en conservant les données brutes de niveau 0 et tous les niveaux pyramidales, les canaux focal/optiques et les métadonnées.

Pour les types de colorants, la substance principale est la teinture HE; couche d'anticorps mono/multi-étiquette IHC; colorant spécial par type; couche congelée/paraffine. Cette conception de couche permet aux modèles d'apprendre les caractéristiques organisationnelles de différentes teintures et soutient l'apprentissage des articulations multichromosomiques.

En termes de couverture, le système spectral multi-organes est couvert, évitant la surconcentration par des cancers ou des sources de colorants uniques.

En ce qui concerne le système de signes, chaque tranche est liée au rapport de diagnostic pathologique, et comprend les stades TNM, les résultats de vaccination. L'appui est donné aux étiquettes multi-niveaux de la tranche, cas, ROI et niveaux cellulaires, qui ne doivent pas être utilisés à différents niveaux.

En matière de contrôle de la qualité, on utilise le processus de contrôle à trois niveaux en utilisant la première norme de pathologiste + directeur adjoint et des experts supérieurs pour examiner l'évaluation de la conformité +.

En ce qui concerne la conformité, toutes les tranches sont autorisées par la loi à partir d'une source et les champs PHI sont entièrement disséminés.

Perspectives d ' avenir: la voie suivie par la Chine pour atteindre le modèle de base en matière de pathologie

L'évolution future de la pathologie L'IA de l'ISB suivra trois voies.

La première est l'expansion continue du modèle de base. Le mSTAR utilise actuellement 26 169 paires de modèles et 116 millions de patchs, mais ce n'est pas grand chose par rapport aux dizaines de millions de tranches pathologiques produites à l'échelle mondiale chaque année.

La deuxième est l'adaptation de la population chinoise. Contrairement à l'Europe et aux États-Unis, où les cancers courants sont répandus (p. ex., le foie, l'estomac et le cancer de l'œsophage sont plus fréquents), les modèles basés sur la formation des données en Europe et aux États-Unis peuvent être sous-performants de ces cancers.

Le troisième est l'autonomie clinique. Du diagnostic assisté au diagnostic automatisé est l'objectif ultime de la pathologie AI. Le processus de cytologie autonome de la plateforme CYBO (Nature 2026) prédit cette direction. L'ensemble de données de la technologie Longhui est lié par l'étiquetage multiniveaux et le rapport pathologique, qui fournit des étiquettes structurées pour la formation à des modèles de diagnostic autonomes.

Remarques finales: Stratégies de données pathologiques pour l'âge du modèle de base

Le passage de la pathologie WSI AI d'un « CNN à simple tâche » à un « modèle de base multimodulaire » a révélé le rôle décisif des données sur la diversité à grande échelle dans l'ère du modèle de base. Le succès de mSTAR et TITAN a démontré que la taille des données, la diversité des modèles et la profondeur de marquage sont les trois piliers de la performance sous-jacente du modèle.

Long Shara'i Information Technology Ltd, qui est basé sur plus de 5 millions de ensembles de données de l'ISB sur les organes, devient un important fournisseur de services de données pour l'âge du modèle de base de pathologie. À un moment critique où les niveaux de la Nature et de la Nature Médecine ont brisé par la restructuration de l'IA pathologique, la technologie de Long Slu continuera à conduire la libération autonome de diagnostics pathologiques avec des données de haute qualité.

Stratégie de données pour le modèle pathologique de base de l'IA âge

La pathologie AI de 2026 a marqué un tournant fondamental, passant de modèles spécifiques à la mission à des modèles de base. Des modèles de base comme mSTAR et TITAN ont démontré que la préformation à grande échelle peut être apprise de pathologies génériques, réduisant de façon significative les coûts d'étiquetage des données et les seuils de développement de la modélisation en adaptant les missions de diagnostic à de multiples niveaux.

En termes de concurrence industrielle, la concurrence pour le modèle pathologique de base de l'IA est essentiellement une concurrence pour la taille des données. Des géants internationaux tels que Paiga et PathAI ont accumulé des millions de données de pré-formation sur WSI, tandis que la Chine en est encore aux premières étapes de ce domaine.

# Pathologie ISM#基础模型#mSTAR#TITAN# Une percée au niveau de la nature# Ensembles de données à 10 millions de degrés

Changsha Langhui Information Technology Co., Ltd. — Services de données d'imagerie médicale professionnelle

11大病种 · 百万级数据 · 2026前沿AI研究驱动