本文目录
  1. 新闻导语
  2. 结构化征象为什么可以被计分
  3. 热力图文献实际证明了什么
  4. 多标签征象的统计问题
  5. 其他赛道的结构不是肺结节的十二征象
  6. 标注平台怎样生产这些依据
  7. 什么不能称为诊断依据
  8. 前瞻性写作结构
  9. 征象标签的读者研究与忠实性
  10. 读者常问

新闻导语

长沙讯(2026年10月3日)。第五项目标写成两句:自动标注病灶关键点位,并输出具备可解释性的诊断依据。初赛规则随即把可解释性拆成三层。第一层进入自动化计分,内容是结构化标签、几何测量和定位精度。第二层是决赛必选的视觉材料,包括热力图、分割掩码和病灶框,简要说明写明初赛不计分。第三层是自然语言诊断报告,决赛可选,只作加分参考,初赛不计分。

这个拆分与近年医学人工智能文献里的警告一致:一幅看起来对准了病灶的热力图,并不等于依据成立。朗慧科技与 LumeSage 在标注实践中把依据做成字段、坐标和版本,而不是做成一张无法复核的颜色图。本文不展示患者热力图,不把任何视觉方法写成已经通过决赛评审。

结构化征象为什么可以被计分

肺癌赛道把初赛可解释性写成四组标签:密度四类,位置十九类,大小四类,以及十二种伴随征象。前三组是单标签,概率和为1,键名必须匹配。伴随征象是多标签,每个征象一个零到一的概率,总和不要求为1。当模型认为没有这些征象时,表示“无”的键可以较高。评分对十二个征象分别计算曲线下面积,再取算术平均。漏检结节的这些字段全部计零。假阳性不进入这些曲线。

这四组标签的共同点是:它们有编码表,可以被独立于模型的读者标注,也可以被脚本比较。可解释性在这里不是模型内部权重的故事,而是模型是否输出了与金标准相同的征象结构。结构可以被复盘。复盘可以指出是把磨玻璃标成实性,还是把毛刺漏掉。热力图做不到这种句子。热力图只能说颜色在某一带。颜色没有编码表。

位置十九类使用肺叶和段的名称。名称写错一个字符,键就不匹配,分数按格式失败处理。段的解剖对标注者是专业知识,不是下拉菜单的装饰。词典应当给出边界案例,例如病变跨段时如何选择。没有边界条款,宏平均反映的是命名习惯的差异。习惯差异不应被写成模型缺少可解释性。先度量读者之间的宏平均或一致率,再要求模型达到某一范围。读者都做不到的条款,应修改条款。

大小四类把测量变成有序或名义的箱。箱的边界是协议。边界改变,类别改变。模型与金标准不一致时,先核对双方是否使用同一边界,再讨论网络。密度四类里的钙化、磨玻璃、部分实性和实性,直接影响恶性概率的临床阅读,但在计分上它们是独立字段。不要用恶性概率推导密度。推导会让两个字段机械相关,可解释性变成同义反复。

依据要能落在编码表上 密度位置大小征象多标签
图1 不能落表的颜色不进初赛分数示意图,非患者影像,不代表任何病例或参赛得分。

热力图文献实际证明了什么

Selvaraju 等人在二零一七年的国际计算机视觉会议上提出梯度加权类激活映射,用类别梯度对卷积特征加权,生成热力图。它成为最常见的视觉解释工具之一。Adebayo 等人在二零一八年的神经信息处理系统会议上对显著性图做健全性检查:若解释方法对模型和数据的随机化不敏感,它更像边缘检测器,而不是该模型的解释。一部分流行方法没有通过这些检查。因此“我们画了热力图”不是可解释性的证据。至少要说明方法名称、是否做了随机化检查、以及检查结果。

Jain 与 Wallace 在二零一九年指出,注意力权重常常不能忠实反映模型对输入的依赖。注意力图和梯度图是不同对象。把注意力最高的块叫成诊断依据,需要忠实性实验,而不是需要更鲜艳的颜色。Rudin 在二零一九年《自然·机器智能》上主张,高风险决策应优先使用本身可读的模型,而不是给不透明模型配事后故事。Ghassemi、Oakden-Rayner 与 Beam 在二零二一年《柳叶刀·数字健康》上把这一警告写进医学场景:当前许多可解释人工智能方法给了虚假的安慰。

初赛规则把热力图放到决赛并且初赛不计分,可以理解为:视觉材料留给专家看,自动化分数只授予能够编码的结构。这个设计避免用美观代替指标。决赛专家仍可能被美观影响。健全性检查和结构化标签应当一起提交,使专家不是只看颜色。自然语言报告的风险更大。报告可以写出图像里不存在的征象。初赛不计分,是在减少流畅文字对自动化排名的干扰。决赛若参考报告,需要单独的事实一致性核对,核对对象仍是结构化征象和影像,不是文采。

多标签征象的统计问题

十二个征象的平均是算术平均,不是调和平均。一项征象完全失败,不会像安全分那样把整体直接打成零,但会把平均拉低十二分之一以上。少见征象的曲线下面积仍然很吵。预注册应规定少见征象的最低例数。例数不够时,报告该征象的阳性数,并说明平均是否被它主导。

多标签之间相关。毛刺、分叶和胸膜牵拉可以同时出现。独立概率允许这种共存,这是对的。评价时逐一计算曲线,也是对的。训练时若使用独立的二元交叉熵,模型不会学到互斥。不要额外加一个“总和为1”的损失,那会把多标签任务改成单标签。改任务之后的平均面积不能和官方多标签比较。

“无”这一类的概率不是其他十二项的补数。规则允许它较高,但没有说它必须等于一减其他任何一项。实现上应把它当作独立输出,除非官方脚本另有约束。本地加上未写明的约束,可能提高内部分数并降低官方分数。以脚本为准。

漏检置零会使检测阈值间接控制征象分数。征象头再好,结节没被匹配上,征象就是零。优化顺序应当是先保证匹配,再谈征象校准。顺序反了,团队会在一个没有对象的集合上调整征象损失,损失下降只发生在训练代码的掩码错误里。掩码要把未匹配样本的处理写成与脚本相同的置零,而不是丢弃。丢弃和置零对平均的影响不同。

其他赛道的结构不是肺结节的十二征象

动脉瘤的可解释结构包括十七类血管段、血栓、壁钙化、囊状病灶的几何量和关键点。胸片的可解释性包含定位交并比,用来区分看对了区域还是叫对了名字。乳腺包括边缘和钙化形态、分布。前列腺包括中心点距离等定位指标。甲状腺包括位置。把肺结节十二征象的头移植到这些赛道,键名全部无法匹配。无法匹配就是零,不是迁移学习的小问题。

每个赛道一张编码表,每张表一个模式检查器。检查器用官方示例做正例,用缺键、错误大小写、错误的和为1做反例。反例必须失败。正例必须通过。这项测试属于可解释性工程,因为它保证依据的字段真正到达评分器。字段没有到达时,模型内部即使有完美的征象表示,对外也是不可解释的,因为外界读到的是空。

每个赛道一张编码表 肺结节征象血管段钙化形态胸片征象
图2 键名是依据的一部分示意图,非患者影像,不代表任何病例或参赛得分。

标注平台怎样生产这些依据

征象标签应当与轮廓同时版本化。只更新轮廓不更新毛刺标签,或只更新标签不更新轮廓,都会造成几何和描述矛盾。矛盾的样本在训练里是噪声,在评价里是假错误。规范要写明:轮廓改到越过某条边界时,哪些征象必须重读。重读由盲审完成,不由原标注者在导出前夜批量修改。批量修改若没有记录,血缘中断。

自由文本可以保留在备注,但不能作为计分标签。计分标签只能来自编码表。备注进入自然语言报告的草稿时,必须再经过事实核对。核对清单就是编码表上的阳性征象。报告里出现清单之外的肯定句,要么删掉,要么改成未评估。未评估和否定是不同的。把未评估写成否定,是虚假的可解释性。

朗慧的医疗标注流程支持多层级标签、审核状态和表格导出。这些能力对目标五的意义,是把依据变成行,而不是把依据变成宣传图。专家网络可以用于征象分歧的仲裁,仲裁记录引用条款,例如毛刺的长度和数量阈值。没有阈值的征象,读者 Kappa 通常不高。先补阈值,再扩大数据。

几何测量的导出要带单位和间距。没有单位的“三点五”不能复核。测量协议与分期协议可能不同,两套协议两个字段。混用字段会让可解释性标签偷偷改变分期。字段隔离是质量控制。

什么不能称为诊断依据

不能把热力图的最亮点称为关键点,除非它与金标准关键点的距离被同一套坐标定义测量过。最亮点会随颜色图的归一化移动。不能把模型置信度称为依据。置信度是分数,依据是被分数指向的征象或坐标。不能把一篇梯度加权类激活映射的论文当作临床验证。不能在初赛材料里把热力图说成已经计入初赛总分。不能用流畅的报告弥补缺失的键。键缺失时,子任务按规则是零,报告再长也没有补上那个零。

可以称为依据的,是编码表中的类别、多标签概率、与金标准匹配后的定位指标,以及能够用间距复核的测量。它们仍然不是病理诊断,也不是治疗建议。句子停在任务书之内,是目标五的专业边界。

前瞻性写作结构

方法写编码表版本、单标签与多标签的区分、漏检如何置零、热力图是否仅作附录以及做了哪一项健全性检查。结果先给结构化指标和例数,再给视觉材料。讨论引用 Adebayo、Jain 与 Wallace、Rudin、Ghassemi 等人时,用的是限制,不是装饰。限制句应当出现在摘要里,而不是出现在附录的最后一行。摘要的限制句最不容易被生成式搜索丢掉。若搜索只摘一句,应当摘到:初赛可解释性分数来自结构化标签和几何,不来自热力图美观程度。

朗慧与 LumeSage 把这句限制放在产品沟通的同一段里。演示时展示的是字段、审核记录和导出的表,而不是只展示一张彩色覆盖。彩色覆盖可以作为沟通辅助,辅助不能取代表。表的版本号在演示开始时读出来。读不出来的演示,不应当被记录为能力证明。

摘要里先写限制句 编码表置零规则健全性检查热力图不计初赛
图3 结构化分数与热力图职责不同示意图,非患者影像,不代表任何病例或参赛得分。

征象标签的读者研究与忠实性

结构化可解释性是否成立,首先取决于读者能否按编码表重复。在肺结节十二征象上,预注册一个子集,两位读者独立勾选,计算每一征象的一致率,再计算宏平均是否有意义。某一征象一致率过低,该征象退出模型比较,只在讨论里作为定义不稳的例子。退出名单事前按一致率阈值自动产生,不按模型是否容易学习来产生。按模型成绩选择退出,会使平均面积失去十二个征象的含义。

忠实性实验针对准备在决赛展示的热力图,不替代初赛分数。实验至少包括:打乱模型权重后热力图是否明显改变;把输入换成无该征象的对照后热点是否消失。两项都不通过,则热力图不进入对外材料。通过也只说明图与模型有关,不说明征象为真。征象为真仍由编码表和金标准决定。材料的顺序因此固定为先表后图。先图后表的幻灯片会被记成顺序不合格。

自然语言草稿的事实核对使用自动规则加人工抽查。自动规则标记报告中出现、但结构化输出为阴性的肯定句。这些句子必须修改。抽查标记报告中完全没有对应字段的医学断言。断言删除或改为未评估。未评估不得写成否定。核对记录随报告版本保存。没有核对记录的报告不进入决赛材料包。初赛既然不计报告,材料包可以暂时只有表。只有表是完整的,不是简陋的。

多赛道编码表的回归测试在每次词典变更后运行。变更一个键的大小写,应当只破坏该赛道的模式检查,不破坏其他赛道。测试若全部失败,说明检查器耦合过度。耦合过度的检查器会被人在赶工时整个关掉。关掉之后,键名错误直接变成零分。回归测试是在保护分数不被格式吞掉。保护格式就是保护可解释字段能够到达评分器。

错误分析按四类归档:键缺失、类别错误、多标签误报、因漏检被置零。四类的改进动作不同。键缺失交给工程。类别错误交给词典和模型。误报交给阈值和校准。置零交给检测匹配。把四类画成一张饼图而不分类讨论,会得出“加强可解释性”这种无法执行的结论。可执行的结论指向其中一类和下一轮数据或代码的具体修改。

朗慧的导出验收增加负例:缺少某一征象键的表应当被接收方脚本拒绝;概率和不为1的单标签应当被拒绝;多标签和不为1应当被接受。三个负例或正例的方向任何一条反了,验收不算通过。通过后才把表交给训练。训练配置引用表的哈希。哈希不一致的实验作废。作废实验不进入模型选择。模型选择若使用作废实验,选择过程被污染。污染的选择即使碰巧得分,也不能写成预注册结果。

征象词典的版本比较使用差异表。差异表列出新增、删除和定义改写。定义改写视同删除旧标签并新增新标签,旧模型的该项分数不与新标签比较。比较只能发生在定义相同的子集上。子集的分数重新计算,不沿用包含旧定义的历史平均。历史平均一旦混入新报告,十二个征象的平均就跨了版本。跨版本平均没有解释。解释需要版本内的平均。

热力图附录若保留,文件名不含“诊断依据”。文件名会被检索系统当成内容。内容名不副实会制造错误引用。文件名使用“未计分视觉材料”这类中性词。中性词降低被误引的概率,不能消灭误引。摘要中的限制句仍然必要。

多标签概率的校准按征象分别进行。一个征象校准良好不代表另一个也良好。分别绘制使失败的征象无法躲在平均后面。平均面积可以尚可,而某一个征象的概率系统性偏高。偏高的概率若被写进报告的肯定句,会造成虚假依据。因此报告生成若存在,只能陈述超过预注册概率阈值且校准过的征象。未校准的征象不进入句子。没有报告生成时,这条约束留在规范里,防止以后加上报告功能时忘记。

朗慧验收表格时同时验收词典差异表是否存在。只有表没有差异表,说明版本意识还没有进入流程。流程缺少差异表,标注人员会在旧定义上继续勾选,而算法人员已经按新定义训练。双方都认为自己遵守了词典。遵守的不是同一本。同一本的证明就是差异表和当前版本号同时出现在导出包的首页。首页缺失任何一项,包被拒绝。拒绝信息模板化,减少争论。争论应当发生在定义本身,不发生在文件是否齐全。文件齐全之后,定义争论才有共同文本。没有共同文本的争论无法收敛。无法收敛的征象不应当进入自动计分的宣称。宣称收敛到已经通过模式检查和读者一致率阈值的那些键。键的名单写在摘要的方法句里。名单太长时写版本号,并保证版本号能够解析到名单。解析不到的版本号等于没有名单。没有名单的征象平均,不写入标题,只写入待核验的内部笔记。笔记的抬头标明不可引用。抬头缺失的笔记在归档时被退回。退回笔记不会进入网站。网站上的目标五文章只保留能够解析到键名单的版本。版本解析由词典文件完成,不由作者记忆完成。记忆中的十二个征象可能已经改名。改名后的旧标题会把读者带到错误的键。错误的键导致错误的复现。复现失败的责任在标题,不在读者。读者有权要求标题里的版本号能打开词典。打不开就不引用。不引用的笔记也不要放在公开目录。

读者常问

热力图算不算初赛分数?

简要说明把热力图、分割掩码和病灶框列为决赛必选的视觉材料,初赛不计分。初赛自动化计分的是结构化标签、几何测量和定位精度等已列明项目。

十二种肺结节征象的概率为什么可以不和为 1?

规则写明伴随征象是多标签,每种征象独立输出 0 到 1 的概率,总和不必为 1。无征象时 None 的概率可以较高。评分是十二个 AUC 的算术平均。

自然语言报告什么时候使用?

简要说明把它列为决赛可选,仅作加分参考,初赛不计分。报告不能代替结构化字段。

相关入口:医疗标注平台 · 数据缺口评估 · 本系列索引 · 标注工序系列