本文目录
  1. 新闻导语
  2. 占位、肿瘤与非肿瘤不是三个可以随意互换的词
  3. 公开数据能教会什么,不能代替什么
  4. 匹配成功是分类的前提
  5. 良恶性概率的排序与校准
  6. 非肿瘤样本与阴性层
  7. 多模态与赛道七、赛道八的提醒
  8. 朗慧工序与算法分工
  9. 写作时的禁止事项
  10. 占位鉴别的最小可发表要素
  11. 读者常问

新闻导语

长沙讯(2026年10月3日)。初赛的第三项目标写成:识别肿瘤占位与非肿瘤占位。这句话是框架,不是统一的标签集。八个赛道把框架落到不同的病变上:肺结节的检出与良恶性,肾肿瘤,颅内动脉瘤,脑胶质瘤,前列腺病变,乳腺病变,甲状腺结节,以及胸片上的多种征象。动脉瘤不是肿瘤。胸片上的气胸和肺水肿也不是肿瘤占位。若用一个“癌与非癌”的二分类头去覆盖全部赛道,模型在定义上就已经跑题。

朗慧科技与 LumeSage 把目标三理解成两段式科学问题。第一段是空间上有没有把金标准病变匹配上。第二段才是匹配上的对象属于哪一类临床含义。检测分数高而分类没有定义,或者分类分数高而病变根本没有被匹配,都不能称为完成了占位鉴别。本文引用公开数据库和指南作为方法学背景,不把那些论文的敏感度换算成大赛得分,也不报告朗慧自己的检测成绩。

占位、肿瘤与非肿瘤不是三个可以随意互换的词

占位在影像报告里常指占据空间的病变,它不自动等于肿瘤。囊肿、血肿、脓肿、肉芽肿和血管瘤都可以占位。肿瘤内部又有良性和恶性。规则在肺癌赛道把问题写成结节检测加良恶性二分类,恶性风险的曲线下面积基于全部金标准结节计算,漏检的恶性结节被强制赋予恶性分数零再参与排序。这是一种非常具体的惩罚:没找到的恶性结节,在分类排序里被放到最不可能恶性的位置。它防止模型用“只对有把握的结节输出恶性概率”来美化曲线。

非肿瘤占位若在某一赛道的金标准里存在,必须有自己的标签,不能塞进“其他”而不计数。“其他”会变成垃圾桶。垃圾桶类别的曲线下面积无法解释。肾癌赛道写明匹配不要求类别一致,匹配只代表空间检出,类别错误在分类指标里扣分。这句话把检测和分类正式拆开。空间对了、诊断错了,仍然是错误,但错误的名字不同。复盘时应当能说出是哪一种。

颅内动脉瘤赛道的基础识别是筛查和检测,形态可以是囊状、梭形或不规则。把动脉瘤叫成肿瘤占位,会把后续的瘤颈关键点和血管段定位引到错误的解剖课程。目标三的总标题不能覆盖赛道名词。论文式的写法是:在总目标的框架下,本赛道的阳性是什么,阴性是什么,匹配成功的定义是什么。三个句子缺一,图表就没有标题。

两段式而不是一个准确率 金标准病变空间匹配类别概率未匹配另计
图1 先匹配空间,再评价类别示意图,非患者影像,不代表任何病例或参赛得分。

公开数据能教会什么,不能代替什么

Armato 等人在二零一一年《医学物理学》上报告肺部图像数据库联盟与图像数据库资源计划的完成,这就是后来被广泛使用的肺结节计算机断层扫描数据。多位放射科医师的勾画不一致是该数据的核心事实,不是瑕疵。不一致意味着结节边界和是否算结节都有观察者差异。用单一勾画训练、再用同一勾画测试,会低估真实的不确定。Setio 等人在二零一七年《医学图像分析》上总结肺结节检测挑战的验证方式,使用自由响应受试者工作特征曲线,在若干假阳性率上平均敏感度。大赛肺癌赛道同样使用自由响应曲线的平均敏感度,并单列直径小于十毫米的微小结节。挑战赛的匹配半径和假阳性计数单位与大赛条文并不相同。相同的只是“用自由响应而不是用病例级准确率”这一决策。

MacMahon 等人在二零一七年《放射学》发表弗莱施纳学会对偶然肺结节管理的指南。指南是临床处置建议,依赖结节大小、密度和危险因素,不是一个检测器的损失函数。模型输出的良恶性概率不能直接写成指南里的随访间隔。间隔涉及个体危险因素和共享决策。影像模型没有这些信息时,应当拒绝生成间隔。拒绝是能力的一部分。

前列腺影像报告和数据系统的更新见于 Turkbey 等人二零一九年的文献,它把磁共振发现写成有序评分。这和肺结节的良恶性二分类不是同一标尺。胶质瘤分割挑战由 Menze 等人在二零一五年《电气与电子工程师协会医学成像汇刊》上建立基准,后来的工作把生存预测等任务分开。分割基准的骰子系数不是分期,也不是病理分型。胸片方面,Irvin 等人的 CheXpert 与 Johnson 等人的 MIMIC-CXR 提供了大规模标签,同时说明报告挖掘标签带有不确定。不确定标签若被强行二值化,目标三的非肿瘤与肿瘤界线会被文本规则而不是影像决定。这些数据都可以作为方法学训练,不能作为医保测试集的替代品,也不能在未授权时混入。

匹配成功是分类的前提

肺癌赛道的匹配是预测中心与真实中心的欧氏距离不超过一个由真实结节平均直径决定的上限,上限被夹在二毫米和十五毫米之间。一个金标准结节对上多个预测时,只保留置信度最高者为真阳性,其余忽略。忽略不等于假阳性不计。假阳性仍进入自由响应曲线的误报。假阳性不进入后续的分期和征象评分。这个设计让“多报几个点碰运气”在检测曲线上付出代价,而不能在分期上碰运气得分。

漏检则相反。假阴性结节的密度、大小、位置和伴随征象全部计零,恶性风险被置零后仍参与排序。检测头的漏检因此不是局部损失,而是下游字段的连坐。连坐有科学理由:没有空间对象,就没有可以解释的诊断对象。它也带来优化上的不对称。模型会倾向于多报,以便减少连坐,再靠非极大抑制或官方的“只留最高置信度”规则清理重复命中。多报的上限由自由响应曲线约束。两条曲线必须一起看。只看分类曲线下面积的队伍,可能用极低的检出率换分类上的干净,然后在恶性置零规则下意外崩溃。置零规则就是为了封住这条路。

其他赛道的匹配稍后在下一篇按条文对照。本篇强调的原则只有一条:在写损失函数之前先写匹配伪代码,并把手算的三例样本放进单元测试。三例分别是真阳性、假阳性和假阴性。单元测试的期望分若与规则句子不一致,以规则句子为准修改代码,而不是修改对句子的记忆。

良恶性概率的排序与校准

曲线下面积使用的是排序。Guo 等人在二零一七年指出,深度网络的概率数值常常没有频率含义。一个排序很好的恶性分数,可以全体偏高。若业务把零点五当成恶性阈值,而零点五在本模型里对应的经验频率是零点二,阈值就没有临床解释。大赛若只看曲线下面积,队伍可以暂不校准;若界面要显示概率,必须校准或明确标注未校准。肺癌赛道还要求漏检恶性的分数为0。0是一个人为插入的排序点,不是模型的概率输出。评价脚本插入的0与模型自己输出的0应能区分,否则无法复盘是漏检还是模型极度确信为良性。日志里保留匹配状态,才能区分这两件事。

主病灶概念贯穿后续目标。单病灶时它就是该病灶。多病灶时,规则写的是最具临床意义的病灶。最具临床意义需要操作定义:最大、最可疑,还是位于关键解剖。不同定义会选出不同的主病灶,分期分数会跟着变。定义应在标注开始前冻结,并允许在盲审中被质疑。质疑成立则升版,不成立则保留记录。没有记录的“临床意义”是口头传统。口头传统无法在多中心保持。

朗慧的标注规范把主病灶写成层级里的一个角色,而不是颜色偏好。颜色可以帮助阅片,但导出的是角色编码。角色编码进入表格后,算法才知道哪一行可以进入分期损失。其余恶性病灶按肺癌赛道的写法不进入分期计分。它们仍然可以进入检测和征象。训练代码若把所有恶性结节的分期损失打开,优化的就不是官方指标。对齐官方指标不是唯一的科学目标,但若声称对齐,损失掩码必须和规则一致,并在文档里写明故意不对齐的部分。

主病灶是角色不是颜色 全部检出主病灶角色分期损失掩码征象另表
图2 只有被规则点名的对象进入分期示意图,非患者影像,不代表任何病例或参赛得分。

非肿瘤样本与阴性层

只在有肿瘤的层上训练,模型会把“有物体”当成“有肿瘤”。非肿瘤占位和完全没有占位的层都要有计划。没有占位的层如何编码,应在规范里写明,而不是留成空文件。空文件在有的脚本里是阴性,在有的脚本里是缺失。缺失会被错误地丢弃,阴性会参与损失。两种行为差一个如果语句。这个语句要有测试。

钙化、肉芽肿和炎性团块在肺里是常见的非恶性占位。它们的密度和边缘征象与肿瘤重叠。重叠是任务难度,不是标注错误。标注错误是同一团块在不同版本里改变良恶性而不留版本号。版本号一变,曲线就不能和旧模型比较。朗慧要求规范版本进入导出包,对目标三是硬条件。没有版本的良恶性表,不能作为前瞻性实验的标签。

观察者差异要用独立复核测量,而不是用模型一致性代替。模型与一位医师一致,可能只是在重复那位医师的偏见。至少两位独立读者在预注册子集上的一致率,应在论文方法中出现。一致率低的类别,不适合作为细粒度结论,只适合作为不确定。不确定类若被删除,测试分布会被改写。删除必须报告例数和原因。

多模态与赛道七、赛道八的提醒

甲状腺赛道包含静态图和动态视频,匹配用交并比,动态只在标注帧上计算。它不考核目标一和目标二。把肺结节检测器的分数写进甲状腺能力,是模态错误。超声视频也不在朗慧当前公开的计算机断层扫描、磁共振和正电子发射断层扫描默认路径里。默认路径未包含,就不应在产品句里暗示逐帧跟踪已经验收。

胸片赛道按征象类别分别匹配,局灶征象和弥漫征象的交并比阈值不同,非极大抑制只在同一征象类别内进行。不同征象的框可以空间重叠。这对“一个框一个病”的直觉是反例。气胸和肺水肿可以共存。目标三若被理解成互斥的肿瘤对非肿瘤,会和胸片的多标签现实冲突。多标签要用多标签指标,例如各类平均精度,而不是一个互斥的准确率。

正电子发射与计算机断层的融合若序列不匹配,不能用来给占位定性。融合看见图并不等于配准研究已经完成。代谢信息可以帮助某些临床问题,但在规则没有把标准摄取值写进标签之前,它不是该项的金标准。额外模态是额外的方案,不是免费的加分项。

朗慧工序与算法分工

标注平台提供矩形、椭圆、套索、自由勾画、插值和掩膜笔刷,用于把占位的空间范围变成可导出的轮廓或体素。插值生成的中间层是草稿,必须抽层复核,否则体积和中心都会偏。中心一偏,肺癌赛道的距离匹配会从真阳性变成假阴性,下游连坐开始。所以插值不是检测指标的中性操作。它改变几何。

半自动草稿和模型库分割可以加速,但在审核之前不是金标准。用未审核草稿训练良恶性分类,再在同一草稿上测试,是标签泄漏。泄漏的曲线不能用来讨论目标三。盲审把审核者与标注者分开。分歧仲裁要有条款,例如边界画在实性成分还是磨玻璃边缘。条款不统一时,先统一条款,再扩大例数。

导出的体素标签必须带方向和间距。接收方在训练代码里打开一例,核对中心坐标与标注工具中的中心是否在同一患者坐标系。这一步是目标三的验收,比文件计数重要。临床表格里的良恶性要能用检查号对上同一对象。对不上的行删除并计数,不猜测。

朗慧不把自由响应平均敏感度写成平台功能。那个数属于特定测试集上的特定匹配规则。平台保证的是规则可以被执行和复盘:谁标的、哪一版规范、中心是否可重算、主病灶角色是否导出。算法组在此之上选择网络。网络的名字不改变匹配伪代码。

写作时的禁止事项

不要把弗莱施纳指南的随访建议写成模型已经遵守指南。不要把肺结节挑战的平均敏感度写成医保成绩。不要把动脉瘤检测写成肿瘤分型。不要把报告挖掘得到的胸片标签写成活检。不要在缺少阴性层的数据上声称能够区分非肿瘤占位。不要用热力图代替中心点匹配。热力图在简要说明里属于决赛视觉材料,初赛自动化不计分。

可以写的句子是:本队列的阳性定义、匹配规则、主病灶规则、漏检如何进入分类排序、观察者一致率以及规范版本。这些句子具备前瞻性,因为它们在看结果之前就可以被证伪。不能被证伪的形容词不属于科研文章。

可证伪的五句话 阳性定义匹配伪代码主病灶漏检惩罚
图3 定义写在结果之前示意图,非患者影像,不代表任何病例或参赛得分。

占位鉴别的最小可发表要素

一篇能够被复核的占位研究,方法部分至少回答八个问题。病变的影像定义是什么,哪一类看起来相似但必须标成非目标。匹配使用距离、交并比还是两者的或。多预测对一金标准时保留谁。假阳性进入哪条曲线,不进入哪条曲线。假阴性如何影响后续排序,是置零、记零点五还是离开该指标的分母。主病灶由最大径、最高分还是独立角色决定。观察者差异在哪个子集上测量。规范版本如何出现在结果表的表注里。八个问题有一个用形容词代替,文章就还停在介绍,没有进入实验。

报告检测成绩时同时给出尺度分层。肺结节按小于十毫米与其余分层,是因为规则单列了微小结节的自由响应敏感度。其他任务按自己的分档,不借用十毫米。分层表的列是同一匹配规则下的不同子集,不是不同规则的混合。混合表会产生一个无法实施的“平均难度”。平均难度不能指导该补哪类样本。

良恶性或占位类别的曲线下面积旁边写样本量和平移后的工作点。工作点的选择数据与最终测试数据不相交。若使用交叉验证,每一折的工作点只看该折的验证部分。把所有折的预测拼起来再选一个全局阈值,会使用到每一折的测试信息。这种泄漏很隐蔽,因为代码看起来仍然没有读取“测试集”这个文件夹。泄漏的是信息,不是文件夹名字。

非肿瘤占位的错误分析按类型列表:囊肿、炎症、血管性病变、术后改变、技术伪影。每一类计数。计数为零的类型不出现在结论的“能够区分”里。结论的主语收窄到有计数的类型。收窄使句子变长,也使句子变真。变真比变短重要。

朗慧交付给算法组的清单使用同样的八问。答完才导出训练包。导出包的清单文件本身进入版本控制。训练包若被重新抽样,清单文件的哈希必须改变。哈希不变而文件内容改变,说明版本控制没有包住标签。没有包住的标签不能支持前瞻性声明。声明的日期应当早于测试集第一次被推理的日期。日期顺序写在实验登记的第一页。日期无法证明时,该次实验降级为探索,探索结果不进入对外标题。标题使用探索一词是允许的,使用完成鉴别是不允许的。词语的纪律需要编辑核对,核对人不是第一作者本人。本人对用词已经习惯,习惯会放过越界句子。核对表列出禁用词:达到临床诊断、超过专家、可以替代随访指南。出现任一禁用词,稿件退回修改。修改记录保留。保留修改记录是为了看见越界句子曾经出现过,从而改进模板,而不是为了追究措辞。模板改进后,新的方案直接使用收窄的主语。主语收窄到病变类型、模态和匹配规则。收窄后的句子更长,引用时更不容易被概括成万能检测器。万能检测器不是目标三的科学形态。目标三的科学形态是若干个定义清楚、可以失败的检测与分类任务。失败被报告出来,任务才可信。只报告成功子集的任务,子集的选择过程本身需要被审查。审查不通过,成功子集不成立。

读者常问

目标三是一个全赛道通用的良恶性分类吗?

不是。总目标写成识别肿瘤占位与非肿瘤占位,但赛道任务不同:肺结节、肾肿瘤、颅内动脉瘤、胶质瘤、前列腺、乳腺、甲状腺和胸片征象各有匹配规则。动脉瘤不是肿瘤,不能套用肺癌的病理分型表。

假阳性是否进入分期评分?

以肺癌赛道为例,规则写明假阳性不参与后续评估,只作为 FROC 的误报。其他赛道也多规定未匹配预测不进入 AUC。具体以该赛道条文为准。

公开挑战赛的敏感度能否写成医保得分?

不能。LUNA16 等挑战的匹配半径、假阳性定义和人群都与本次规则不同,数字不可换算。

相关入口:医疗标注平台 · 数据缺口评估 · 本系列索引 · 标注工序系列