本文目录
  1. 新闻导语
  2. 肺癌:距离夹逼与忽略多余命中
  3. 肾癌:匹配与类别分离
  4. 动脉瘤:分档阈值与禁止拆分
  5. 前列腺与乳腺:分母固定在全部阳性病例
  6. 甲状腺:视频只在标注帧上存在
  7. 胸片:类别内抑制与类别间共存
  8. 连坐对标注质量的含义
  9. 自由响应曲线与平均精度的阅读顺序
  10. 不能跨赛道借用的清单
  11. 前瞻性实验应预注册的内容
  12. 连坐路径的逐赛道核对表
  13. 读者常问

新闻导语

长沙讯(2026年10月3日)。目标三的检测分数一旦离开匹配规则,就无法解释。初赛各赛道的匹配并不共用一个公式。肺癌用与直径有关的中心点距离。肾癌用交并比或与半径有关的中心距离,并用匈牙利算法做一对一。颅内动脉瘤按病灶大小分档规定交并比和距离,并禁止把一个病灶拆成多块去匹配。前列腺把多项诊断放在匹配成功之后。乳腺按面积使用自适应交并比。甲状腺用交并比零点五,动态序列只在标注帧上平均。胸片按征象类别分别匹配,局灶与弥漫的阈值不同。

这些差异不是文字风格。它们决定假阴性会以什么形式惩罚分期、分型和关键点。朗慧科技与 LumeSage 的评论目的,是把连坐关系写清楚,便于算法、标注和验收使用同一份伪代码。本文不估计各赛道的难度系数,不把某一赛道的阈值推荐给另一赛道。

肺癌:距离夹逼与忽略多余命中

预测中心与真实中心的距离需要不超过真实结节平均直径的零点六倍,同时不小于二毫米、不大于十五毫米。小病灶不会因为直径乘零点六变成亚毫米的不可能阈值,大病灶也不会把阈值放到十五毫米以外。一个金标准对上多个预测时,只留置信度最高者。其余命中被忽略,不作为额外真阳性。假阳性仍进入自由响应曲线。假阴性使该结节后续恶性风险、病理、分期和征象记零或按恶性置零规则进入排序。

连坐的范围很宽。因此肺结节检测的工作点不能只按分类曲线来选。选一个很干净的高阈值,漏检上升,下游大面积为零。选一个很低的阈值,自由响应曲线上的假阳性上升。两条曲线之间没有普遍最优,只有在验证集上按预注册规则选出的操作点。操作点一旦参考了测试集,选择本身就泄漏。

中心点的计算依赖掩膜或轮廓的几何定义。轮廓含洞、插值层未复核、间距用错,中心都会漂。漂过阈值,连坐启动。标注质量控制在这里是检测指标的一部分。把它当成艺术问题,是管理错误。

肾癌:匹配与类别分离

肾癌赛道的匹配条件是交并比达到零点五,或中心距离不超过五毫米与零点五倍等效半径中的较大者。匈牙利算法求一对一全局最优。匹配不要求类别一致。类别错误另计。未匹配的预测是假阳性,不进任何曲线下面积。未检出的金标准是假阴性,分类记零。

病理分型、T 分期和关键特征还有额外条件:主病灶空间匹配成功,并且模型把它判为恶性。漏检或误判为良性,该病例目标四全部为零。多病灶时只有金标准指定的主病灶进入目标四。这条规则把“检出了一个次要恶性病灶”与“完成了主病灶诊断”分开。临床报告同样区分主病灶和次要病灶。算法若用最大响应代替主病灶,可能稳定地选错对象。主病灶编码必须来自标注,不能来自模型的自信。

动脉瘤:分档阈值与禁止拆分

动脉瘤按最大径分档。小于三毫米、三到五毫米、大于五毫米,交并比和距离阈值不同。小病灶用更宽松的交并比和更小的绝对距离。最大径来自金标准掩膜,不用预测直径来决定自己适用哪一档。用预测直径定档,会让模型通过改直径来挑阈值。

一对一由匈牙利匹配保证。禁止把一个病灶拆成多块连通域去匹配多个预测。赛后复核掩码,批量拆分可判提交无效。掩膜里的像素值还必须等于连通域排序编号,否则整例无效。这是格式约束,不是医学约束。格式约束失败时,医学指标没有机会被计算。工程测试要用一例故意写错编号,确认本地检查能发现。

主病灶漏检时,该赛道对部分曲线下面积使用随机猜测水平的零点五,而不是零。零和零点五对平均的影响不同。抄肺癌的置零规则到动脉瘤脚本,会算错。形态、血栓、钙化和十七类血管段定位只在匹配成功的病灶上计算。囊状主病灶才评价几何测量和瘤颈、瘤顶关键点。梭形和不规则输出空值,不计分也不惩罚。空值必须是规则允许的空,而不是缺失键。缺失键可能整例无效。空与缺失在测试里要分成两个用例。

空值不是缺失键 匹配成功允许空值缺失键整例无效
图1 规则允许的空与格式错误分开测示意图,非患者影像,不代表任何病例或参赛得分。

前列腺与乳腺:分母固定在全部阳性病例

前列腺赛道写明,目标四的分母是全部具有主病灶的阳性病例,不是模型匹配成功的病例数。漏检主病灶仍然留在分母里,并用该赛道规定的方式惩罚。全腺体和外周带的骰子系数不依赖病灶匹配。骨转移的框检测使用二维交并比零点五,与前列腺病灶匹配互相独立。把所有任务串成一个匹配,会让骨转移的失败被前列腺病灶的成功掩盖,或相反。独立任务要独立计数。

乳腺赛道按面积自适应交并比,在金标准掩膜与预测掩膜之间做匈牙利一对一,并有双向最优保留。多边形病灶看骰子系数,矩形病灶看交并比,对象类型不同,指标不同。主病灶的良恶性使用精度-召回曲线下面积。未检出主病灶会触发该赛道的惩罚条款。钙化的形态和分布附着在钙化病灶上,不要求该病灶是主病灶,但漏检钙化病灶会触发另一套惩罚。条件必填也要注意:边缘只对肿块输出,钙化描述只对钙化输出。对所有框都输出钙化形态,会制造格式上的假阳性字段。脚本若严格,这些字段可能被判为错误;脚本若忽略,则模型在学习无用输出。以条文为准做条件输出,并加测试。

甲状腺:视频只在标注帧上存在

静态超声用掩膜交并比,阈值零点五,匈牙利一对一。动态数据把各标注帧的交并比做算术平均,不设单帧下限。某一帧没有预测,该帧交并比为零,再进入平均。未标注帧上的预测不评分。这意味着视频模型在未标注帧上的闪烁既不加分也不直接扣分,但标注帧之间的不稳定会拉低平均交并比。

主病灶匹配失败时,良恶性、甲状腺影像报告分级、侵犯、位置和临床显著性不进入那些分类指标的样本,检测平均精度和骰子系数仍然受到漏检惩罚。这与肺癌“分类排序里置零”不同。实现时必须分赛道,不能共用一个惩罚函数再传一个布尔值敷衍。布尔值会被人忘记。更好的做法是每个赛道一个评分模块,模块顶部用注释引用条文原句。

甲状腺赛道不参加目标一和目标二。不要把超声模型的临床分与其他赛道的总分放在一张无注释的柱状图里。柱状图的纵轴必须是同一定义。

胸片:类别内抑制与类别间共存

非极大抑制的交并比零点五只作用于同一征象类别。不同征象即使完全重叠也不互相删除。局灶十类使用面积自适应阈值,面积来自金标准框,不是预测框。弥漫七类使用更宽的固定交并比。十七类平均精度是检测分类的综合指标之一。分类错误和未匹配是不同失败。定位精度对匹配成功的框计算平均交并比,即使类别错了也可以单独看定位。这样写是为了区分“看错区域”和“区域对了但名字错了”。两种错误的标注改进方向不同。前者回到框的几何,后者回到词典。

弥漫征象的边界本来就不稳定。较宽的匹配阈值承认这一事实。把弥漫征象的阈值收成和小结节一样,会制造大量假阴性,连坐到并不存在的精细分期上。胸片赛道的目标不是肺癌 T 分期。不要从目标四的总标题推导出每张胸片都要有 T 分期输出。没有定义的输出在格式检查时是负担,在科学上是空话。

失败要能说出类型 未匹配类别错误定位尚可格式无效
图2 未匹配、类别错、格式错分开示意图,非患者影像,不代表任何病例或参赛得分。

连坐对标注质量的含义

只要下游指标挂在匹配上,轮廓的一毫米就可能从真阳性变成假阴性,然后分期变零。标注规范要把影响中心和交并比的选择写明:边界画到哪里,是否包含毛刺,视频取哪一帧为清晰帧,多边形和矩形分别用于哪类对象。这些选择是科学设计,不是画图偏好。

双人标注的分歧若只取平均轮廓,平均轮廓可能谁也不承认,中心却被拿去匹配。应规定分歧时的仲裁几何,并保存仲裁前的两版。保存是为了以后计算观察者差异,不是为了在成绩不好时改用更有利的一版。改用更有利的一版是结果泄漏。

朗慧的状态机把待标注、已标注、已审核分开,用于阻止未审核轮廓进入金标准。批量下载之后,算法侧要用脚本重算中心并与标注工具对照三例:最小病灶、贴边病灶、多病灶中的主病灶。三例通过,才把匹配模块接到评分。不通过时继续修导出方向和间距,不开始讨论网络深度。

自由响应曲线与平均精度的阅读顺序

自由响应曲线回答在每个假阳性负担下的敏感度。平均精度把精度在召回上积分。两者都依赖匹配。匹配一变,曲线整条作废。阅读顺序应当是:先核对匹配测试用例,再看曲线,再看曲线上的工作点是否在验证集上选定。工作点的选择规则预注册。测试集只跑一次冻结模型。多次偷看测试集并调整,会使置信区间失效。失效的区间不能用于声称超过另一方法。

小病灶分档、微小结节单列、面积自适应阈值,都是在承认尺度改变难度。报告时分列,不要只给一个总数。总数会把微小结节的失败平均进大肿块的成功。医保场景若关心早期病变,被平均掉的正是关心的对象。

不能跨赛道借用的清单

不能把肺癌的十五毫米上限用到三毫米的动脉瘤上。不能把动脉瘤漏检记零点五的规则用到要求记零的字段上。不能把甲状腺未标注帧上的预测算进交并比。不能把胸片不同征象的重叠框删掉。不能把前列腺骨转移和腺体病灶绑成同一次匹配。不能把乳腺钙化指标限制到主病灶,如果条文说钙化独立于主病灶。

清单的用途是代码审查。审查人按赛道勾选。没有赛道名称的评分脚本不予合并。朗慧在项目管理上要求任务名称进入数据集版本,原因与此相同。版本名叫“最终最终”的数据包,无法判断里面的匹配规则是哪一条。

前瞻性实验应预注册的内容

预注册应包括:赛道或自建任务的匹配伪代码、主病灶定义、漏检惩罚的数值、空值与缺失的区别、验证集上选择工作点的规则、测试集冻结日期、以及标注规范版本。结果部分只填写这些空。若实际做法与预注册不同,差异本身是结果,要单独成段,而不是悄悄改写方法。

公开文献里的自由响应评价提供了报告格式的范例,不提供本次测试集的真值。Armato、Setio、Menze、Turkbey、Irvin 与 Johnson 等人的工作帮助说明为什么检测和标签不确定要分开写。它们不是参赛证明。

朗慧能够支持的是轮廓和框的版本化、主病灶角色、审核状态,以及把坐标按间距导出。惩罚函数和匈牙利匹配属于评价代码,应当开放给内部复核,不应当藏在标注按钮后面。按钮不显示分数,是为了保护金标准的独立。分数在冻结之后出现在评价报告里,报告引用规范版本和脚本版本。两个版本对不上的报告,不进入对外交流。

预注册空格在出结果前锁死 匹配伪代码惩罚数值工作点规则规范版本
图3 方法部分不允许事后改匹配示意图,非患者影像,不代表任何病例或参赛得分。

连坐路径的逐赛道核对表

核对表的每一行是一个赛道,列是:匹配规则原文的位置、一对一算法、假阳性是否进入下游、假阴性的数值惩罚、主病灶定义、空值是否允许、格式错误是否整例无效。填表的人引用句子,不写“类似肺癌”。类似是实现错误的主要来源。肾癌的类别不参与匹配成功与否,肺癌的多余命中被忽略,动脉瘤的小病灶阈值更松并禁止拆分,前列腺的目标四分母固定,乳腺的钙化独立于主病灶,甲状腺的未标注帧不进分母,胸片的非极大抑制不跨征象。这些差别全部体现在表里,代码审查按表抽查三例。

抽查的三例由不写代码的人准备:一例应当真阳性,一例应当假阳性,一例应当因格式无效。准备人把期望写进测试,开发人不能改期望,只能改代码。期望若与条文冲突,由第三个人修改期望并留下条文引用。三个人的分离防止“代码即规则”。代码即规则时,条文更新不会传播到分数。

连坐路径还要画一张图,节点是检测、主病灶、形态或良恶性、分期、关键点。边标上“失败则下游为零”或“失败则该项记零点五”或“失败则样本离开分母”。图上没有文字的边不允许存在。没有文字意味着惩罚未定义,实现者会自行选择对自己有利的一种。选择发生在看见结果之后时,实验的前瞻性结束。

标注负责人使用同一张图决定哪些几何必须双人审核。只有下游会连坐的几何才需要最高级别的审核资源。平均分配审核资源,会把时间花在不计分的装饰性标签上,同时放过中心点。资源分配是方法学决定。它应当写进方案的统计部分旁边,而不是只写在项目管理表。

朗慧把核对表放进数据集版本的首页。首页缺失的版本视为不可评分。算法组可以拒绝加载。拒绝记录本身是质量指标:被拒绝的版本次数下降,说明标注与规则的对齐在变好。次数下降不是模型变好。两者的图分开画,避免在周会上用同一个箭头描述两件不同的事。

连坐核对还要覆盖评分脚本的版本漂移。官方若在推理前更新示例文件,本地测试用例应替换为新示例,而不是在旧示例上保持绿色。绿色可能只说明旧格式仍被本地接受。接受旧格式的本地脚本会让队伍误以为提交包正确。提交包的模式检查应每日对照官方示例的哈希。哈希变化时冻结模型更新,先修格式。格式修完再恢复训练。恢复时记录停机时间,避免把停机期间的旧检查点拿来提交。旧检查点可能缺少新字段。缺少新字段在动脉瘤编号规则下可能整例无效,在分类规则下可能子任务为零。两种后果都足够严重,值得用哈希警报打断训练。警报由数据管理发送给算法负责人,不依赖个人记忆。记忆在多赛道并行时必然不足。并行赛道使用不同仓库目录,目录名含赛道编号。编号缺失的目录在审查时视为未分配规则,禁止提交。朗慧若同时准备多个模态的标注包,包名同样含任务名和匹配规则版本。包名不含版本,就被当作不可评分。这个规定写进交接清单的第一行,使它在压缩包被传递时仍然可见。压缩包内部的文档可能不被打开。第一行不被打开,规则就没有到达接收方。到达失败和模型失败要分开统计。分开统计之后,下一轮才能决定是修工程还是修算法。决定错了,两周的标注资源会花在不改变分数的方向上。方向错误是管理问题,也是科学问题,因为它改变了实际上被检验的假设。假设没有被检验,文章就不应当描述那次检验的结论。结论模板因此包含“本次未检验”的选项。选项被使用时,段落到此结束,不补充推测。推测句即使带有可能二字,也仍然是未检验的结论,不写入正文。正文只保留已检验的路径。未检验路径留在实验登记的待办,不留在段落里。段落结束于证据。

读者常问

所有赛道都用肺癌那条中心点距离公式吗?

不是。肺癌赛道给出了与直径有关的欧氏距离上限。肾癌、动脉瘤、前列腺、乳腺、甲状腺和胸片各自写了交并比、匈牙利匹配或面积自适应阈值。

主病灶漏检后,分期一定记零吗?

多数赛道会惩罚,但惩罚形式不同:有的字段记零,有的在 AUC 中记为零或随机猜测水平。甲状腺赛道写明主病灶匹配失败时,部分属性不进入分类指标,而在检测和 Dice 上惩罚。必须按赛道条文执行。

热力图能否代替匹配?

不能。初赛自动化计分看的是结构化字段、几何和定位等已定义指标。热力图是决赛必选的视觉材料,简要说明写明初赛不计分。

相关入口:医疗标注平台 · 数据缺口评估 · 本系列索引 · 标注工序系列