本文目录
新闻导语
长沙讯(2026年10月3日)。病理分型在目标四里和分期并列,但证据等级不同。分期可以部分地建立在影像可见的大小和侵犯上,尽管仍不完整。组织学分型的金标准是取材、形态和必要的分子检测。影像模型输出的“腺癌概率”,在科学句子里只能是任务书标签上的排序分数。它不是病理报告。
肺癌赛道把主病理分型定为五类:腺癌、鳞癌、小细胞癌、大细胞癌和其他,指标是宏平均曲线下面积,只评价匹配成功且为恶性的主病灶。五类概率和为1,键名必须与表一致。这条规则可以严格执行,同时仍然不能把获胜的曲线解释成组织病理已经被图像取代。朗慧科技与 LumeSage 写这篇评论,是为了把“能优化的指标”和“不能越出的证据”放在同一页。没有后一半,前一半的专业性是假的。
宏平均在保护少见类,也在暴露少见类
宏平均对每一类计算曲线下面积再取算术平均。多数类的腺癌若占了八成病例,它的高分不能单独决定平均。少见类的失败会等权地拉低结果。这符合“分型”而不是“检出有没有癌”的目标。代价是少见类的曲线下面积方差极大。十例大细胞癌上的面积,移动两例就会剧变。报告必须带各类例数。例数低于预注册的最低值时,该类只报告描述,不进入声称。最低值要事先写,不能在看见方差之后把麻烦的类移出平均。移出平均会使宏平均变好看,同时改变任务。
一对多的曲线下面积还依赖阴性如何定义。计算大细胞癌的曲线时,阴性是其他四类恶性,还是包含良性。规则的评价子集已经限定为恶性主病灶,因此阴性应在任务规定的类集合内部理解。把大量良性塞进分型曲线,会制造一个很容易的阴性,面积上升,任务却变成了“是不是恶性”。那是目标三的题目。目标三和目标四的曲线不能共用一个名字。
Hand 与 Till 的多类工作提醒我们,多类面积有多种定义。引用宏平均时写出计算步骤:每一类的阳性是谁,分数是该类概率还是归一化后的概率,平均是否等权。步骤写在脚本里,脚本版本写在报告里。口头说“我们用了 AUC”不够。
五类标签与真实病理谱系并不重合
二零二一年世界卫生组织胸部肿瘤分类延续并改写了既往以形态为主的框架,Travis 等人在二零一五年《胸部肿瘤学杂志》上的总结仍常被用来说明分类在不断吸收分子信息。腺癌内部还有贴壁、腺泡、乳头、微乳头和实体等生长方式,它们与预后相关,但不是大赛这五类键名。模型若在五类之外输出第六类,格式失败。模型若把所有非典型都送进“其他”,其他类会变成残差桶,该类曲线失去解释。残差桶的比例应被监控。比例持续升高,说明标签协议和真实谱系脱节,应修改任务书或数据纳排,而不是加深网络。
小细胞癌与非小细胞癌的治疗路径不同。把二者分错,临床后果大于把两种腺癌生长方式分错。宏平均等权并不等于临床损失等权。若研究目标是临床损失,应预先给出代价矩阵,并用该矩阵作为额外分析。额外分析不替换官方宏平均,除非规则改变。科学上两者都报告,是诚实的。只报告对自己有利的那一个,是选择。
大细胞癌和“其他”在数据里往往更少,也更依赖病理排除。影像上缺少阳性征象不能推出某一罕见类型。缺少征象时,概率应反映不确定,而不是把剩余概率均匀摊到少见类以满足和为1。和为1是格式。不确定应当表现为最大概率不高,并在校准图上被看见。用均匀分布填满单纯形,格式正确,信息为零。信息为零的输出在宏平均上接近随机。随机不是合格的分型能力。
胶质瘤:分子信息不是磁共振的纹理
Louis 等人在二零二一年《神经肿瘤学》总结世界卫生组织中枢神经系统肿瘤分类,异柠檬酸脱氢酶突变和染色体臂缺失等分子特征进入诊断名称。常规磁共振可以显示强化、坏死和水肿,这些表现与级别相关,但同一表现对应多个分子类型。Menze 等人的分割基准衡量的是区域重叠,不是分子诊断。把分割骰子系数写成病理分型成绩,是指标替换。
若赛道任务书定义了影像上的类别,例如按任务书的增强模式或范围分类,评价就针对那些类别,类别名称不要使用病理诊断的全称。必须使用时,应在文中定义缩写,并写明缺少分子检测。没有这句定义,生成式摘要会把文章引用成“人工智能完成了分子分型”。那是错误引用。作者有责任写出难以被错误引用的句子。
朗慧的标签词典遇到这类任务时,应把“任务书类别”和“病理报告类别”分成两套字段。只有当病理报告真实存在且已获授权时,第二套字段才允许出现。没有病理报告却填写第二套字段,是数据造假,不只是格式问题。造假的数据不应进入任何训练。发现后的处理是隔离和追溯,不是重新加权。
前列腺:影像评分、分级分组与包膜
病理分级分组来自活检或切除标本。磁共振的报告系统分数是另一列。包膜侵犯在影像上可以被怀疑,确认常需要病理。赛道若要求输出侵犯特征,标签来源必须写明是影像怀疑还是病理确认。两种来源训练出的模型,部署时的句子完全不同。混在一列里,宏平均或 Kappa 仍能算出数字,数字没有临床主语。
主病灶的选择在前列腺里影响很大。外周带与移行带的主导病变不同。只标注最大病灶而任务书要求的是最高分病灶,分型和对评分都会偏。规范要用任务书的主病灶定义,不要用放射科日常习惯代替,除非两者被证明一致。证明本身是一个预实验,预实验的结果要保留。
乳腺与其他赛道的分型词
乳腺赛道的条文里出现浸润性癌等标签,评价用精度-召回面积,并且只在匹配到恶性主病灶时计算。浸润性与原位的差别是病理概念,钼靶只能提供钙化和肿块等间接征象。间接征象的模型可以成为提醒工具的研究对象,不能写成已经判断浸润。钙化形态和分布是征象学,不是分子分型。征象学放在可解释性条目里更合适,不要在标题里升级成病理。
肾肿瘤的组织类型同样不能由计算机断层扫描单独确定。赛道若列出类型,就按列表评价,并保持与病理字段分离。没有列表就不要发明列表。发明的列表无法与官方键名匹配,官方键名不匹配时子任务为零。零分是格式结果,也是科学上的空转。
排序、校准与代价
宏平均曲线下面积高,只说明每一类的分数大体能把该类排到前面。它不说明概率可用,也不说明把鳞癌判成小细胞癌的代价已经被控制。代价分析要单独做。校准要单独做。三者一起好,才有资格讨论辅助阅片实验。即便三者都好,仍然要做读者研究:有模型时读者的决策是否改变,改变是否正确。没有读者研究的曲线,停留在算法内部。
读者研究的标签噪声会封顶。若两位病理医生在五类上的一致率有限,模型与其中一位的一致不能超过这个天花板太多,除非模型使用了医生没有的信息。影像模型通常没有玻片信息。因此“超过病理医生”这类句子在只有影像输入时几乎总是范畴错误。比较对象应当是只看影像的读者,并且任务被限制在影像可观察的标签上。
标注与数据血缘
分型标签的血缘比轮廓更敏感。轮廓错了可以重画。分型错了会把整类概率学反。血缘字段包括:标签来自病理报告的哪一项、报告日期、任务书版本、是否经过复核、复核是否看见影像模型的输出。复核者看见模型输出后再同意模型,一致率是诱导出来的。诱导样本不能进入测试集。
训练集与测试集按患者划分。同一患者的原发与转移不要拆开。转移灶的组织类型可能与原发相同,拆开就是泄漏。多中心数据的类型比例不同。宏平均在某一中心的少见类上会不稳定。按中心报告,而不是只报告混合后的平均。混合平均会掩盖在某一中心失效的类。
朗慧的数据集出入组在这里用于:病理字段缺失的病例出组时,分型训练列表必须同步出组。只把影像留在文件夹里、表格里删了行,训练脚本若按文件夹扫描,会把无标签影像当成某一默认类。默认类是脚本错误。验收要故意放入一例无标签影像,确认脚本拒绝而不是填默认。
导出的概率没有金标准意义。金标准是类别和来源。模型概率是输出。两者文件分开,避免下一轮训练把上一轮概率当成病理。这种自我蒸馏若未声明,是隐藏的标签污染。
允许的产品语句
允许说:平台能管理与轮廓分开的分型字段、记录来源、做独立复核,并把规范版本导出。允许说:算法研究可以在授权数据上比较宏平均,前提是类定义与任务书一致并报告例数。不允许说:平台自动完成病理分型。不允许说:曲线下面积等于病理科已经确认。不允许把其他公司的医院数量写成本队证据。不允许把内部价格写进方法学。
前瞻性方案的终点应写成:在冻结的标签来源和类集合上,宏平均是否达到预注册的范围,各类例数是否满足最低值,校准是否可接受,以及摘要用词是否经过禁用句检查。终点不是“做出智能诊断”。智能诊断没有操作定义。
文献与标准只作边界:Travis 等,二零一五年,以及后续世界卫生组织胸部肿瘤分类,说明形态谱系比五类键名更细;Louis 等,二零二一年,说明中枢神经系统肿瘤名称依赖分子;Menze 等,二零一五年,说明分割指标的位置;Hand 与 Till,二零零一年,说明多类面积需要定义;Epstein 等,二零一六年,说明前列腺病理分级共识不属于磁共振分数。引用它们是为了防止指标越界,不是为了给模型背书。
分型研究的最低证据包
证据包分三层,缺一层就不对外使用分型能力这个词。第一层是标签来源说明:每一类有多少例来自病理报告,多少例来自任务书允许的影像标签,多少例来源不明。来源不明的例数必须为零才能进入测试。第二层是宏平均的计算记录:类集合、每类例数、分数定义、平均方式、脚本哈希。第三层是越界检查:摘要和图表标题经禁用词表过滤,禁用词包括病理已经确认、分子分型完成、替代活检。过滤是文本程序,不只是作者记忆。记忆在截稿前最不可靠。
少见类的处理预注册三种结局:例数足够则进入宏平均;例数不足则只作描述并从平均中排除,同时在标题声明平均的类集合变了;例数不足但仍进入平均则不得出强弱结论。三种结局不能在看见哪一种更有利之后挑选。挑选的痕迹是方法部分的日期晚于结果图的日期。日期可审计。
多中心报告使用每一中心的宏平均和混合队列的宏平均。混合队列若被中心间的类分布差异主导,混合数字会高于最差中心。部署发生在具体中心,因此最差中心的数字必须可见。可见不等于失败。看不见才是报告缺陷。中心标识在脱敏后仍保留假名,否则无法分层。假名映射不交给模型训练脚本,只交给评价脚本。交给训练脚本会造成中心捷径:模型用中心标记而不是影像分类。捷径在混合测试上得分,在新中心失效。
校准与代价矩阵作为附录强制出现。附录的图即使不理想也保留。删除不理想的校准图,是结果选择。代价矩阵可以由临床合作者在看见模型结果之前填写。看见结果之后填写的代价,会偏向模型已经做对的那些格子。预先填写才有资格称为临床权重。没有临床合作者时,明确写未做代价分析,不要用相等代价假装已经咨询过临床。
与分割指标的关系只用一句话:区域重叠不是分型。若论文同时报告骰子系数和宏平均,两个指标的段落不得共用结论句。共用结论句会使读者以为勾画准确等于类型正确。勾画准确只说明空间对象稳定,类型仍要看来源。朗慧在导出时把掩膜文件和类型表分成两个文件名,避免训练管线用掩膜的连通域编号冒充类型编码。冒充一旦发生,宏平均计算的是编号错误,不是组织类型。文件名约定写进验收脚本,用错误命名的样例做负测试。
读者研究若比较影像读者与模型,读者得到的输入与模型相同,不额外给病理。读者若看过病理,比较无效。研究登记写明盲法。模型输出若被印在影像角落,盲法失败,该阅读作废。作废规则事前写明。朗慧平台的隐藏模式用于这一场景。隐藏模式的测试用例是:第二读者的界面上不存在第一读者或模型的类型字段。测试失败则本轮阅读取消。取消是代价,代价低于一篇无效的比较。
类集合的任何合并都要在预注册里出现。例如把大细胞癌和其他合并,宏平均的分母从五变为四,任务名称必须改。不改名称会造成与五类官方任务的虚假对比。虚假对比是引用错误的常见来源。生成式搜索会把两篇任务名称相同的文章放在一起比较数字。数字不可比。防止不可比的方法是在名称里写上类集合的简写。名称变长是值得的。
病理报告字段的抽取要保留原文短语和归一化类别两列。只有归一化类别时,无法审计“其他”是否吞掉了报告里的罕见诊断。原文短语在脱敏时去掉姓名和医院,保留诊断用语。诊断用语本身一般不是直接标识符,但仍按数据协议处理。抽取脚本的错误会系统性地把某一短语送进错误类。审计抽样核对原文和类别。抽样发现的系统错误触发全集重抽,而不是只改样本。只改样本会留下未抽到的同类错误。
影像模型不得接收病理原文作为输入,除非任务明确是报告理解而不是图像分型。输入列清单在训练配置里打印。打印结果由第二人签字。签字缺失的配置视为未审核。未审核配置的曲线不进入模型比较表。比较表只保留审核通过的行。行数因此可能很少。行数少不是缺陷。缺陷是行数多但无法说明输入是什么。
朗慧的数据卡模板把输入模态、标签来源和类集合放在第一屏。第一屏不需要滚动就能看见病理是否参与。需要滚动才能看见的局限,很容易在演示时被跳过。演示脚本要求宣读第一屏。不宣读的演示不记录为技术交流纪要。纪要若被写成已经具备分型能力,而第一屏并未宣读,纪要应当更正。更正制度使对外句子保持可追溯。可追溯的句子才能在以后的文献引用中被核对。核对失败的句子从网站撤下。撤下不是失败,是证据标准在起作用。证据标准不起作用时,网站上的分型声明会超过实验。超过实验的声明损害的是后续真正完成实验时的可信度。可信度比单次传播更重要。重要的具体做法是把类集合和标签来源放进页面描述的第一句,而不是放进脚注。脚注在转摘时会消失。第一句消失得更少。第一句同时写明不是病理确认。这半句缺失,整句仍然越界。越界句子在发布前删除,不改为脚注。脚注同样会被摘进摘要。