本文目录
  1. 新闻导语
  2. 精度-召回曲线在稀有伪造上的含义
  3. 为什么只积召回的中间一段
  4. 调和平均如何执行短板
  5. 动态权重在奖励什么
  6. 鲁棒性与泛化不进初赛总分
  7. 内部验证怎样才算对齐规则
  8. 不能做的数值搬家
  9. 文献位置
  10. 给信息部门与算法负责人的同一页纸
  11. 评价脚本的对照实验
  12. 读者常问

新闻导语

长沙讯(2026年10月3日)。初赛规则在目标一的标题之下,给非人体影像识别规定了明确的积分方式:精度-召回曲线下面积,但只积召回从百分之五到百分之五十这一段。重复影像使用整段精度-召回曲线下面积。拼接影像再次使用同一召回区间上的部分面积。三项再进入调和平均,得到零到一之间的安全分。安全分不是总分里的固定两成。它通过一个线性公式改写自己的权重,也改写临床分的权重。

这篇评论只解释已经写在简要说明里的公式,以及这些公式在统计文献中的对应物。它不计算任何模型的安全分,不把示例里的零点八和零点七五说成某一队伍的成绩。示例只说明算术。门槛用到的 Top-K、在百分之十假阳性率处的召回、或在百分之十五召回处的精度,规则只举了指标类型,数值拟于正式推理前四十八小时公示。公示之前写入文章的任何阈值,都是虚构。朗慧科技与 LumeSage 的方法学组拒绝在评论里虚构门槛。

精度-召回曲线在稀有伪造上的含义

精度是“模型判为伪造的样本里,有多少确实是伪造”。召回是“全部伪造里,有多少被模型找到”。当伪造远少于真实检查时,模型只要大量把真人判成伪造,召回可以上来,精度会掉下去。受试者工作特征曲线的纵轴是敏感度,横轴是假阳性率。假阳性率的分母是全部真人。真人很多时,即使绝对误伤数量已经大到无法人工复核,假阳性率仍可以看起来很小。Saito 与 Rehmsmeier 在二零一五年指出,这种情况下整段受试者工作特征曲线会显得乐观,精度-召回曲线则把误伤直接写进精度的分母。医保安全任务里的伪造若是少数类,精度-召回是更接近复核成本的曲线。

这并不意味着受试者工作特征曲线应被禁止出现在附录。它回答的是另一个问题:在所有真人里误伤的比例。两个问题都合法,但不能互换标题。规则已经选定部分精度-召回面积作为非人体和拼接的评审指标,重复任务则使用整段精度-召回面积。同一安全分内部,三项曲线的积分范围并不相同。比较“三个 AUC”时如果不声明哪一个是部分面积,读者会把不可比的数相加。调和平均的输入必须是规则定义的那三个数,而不是队伍自己另算的整段受试者工作特征面积。

三项安全任务的积分范围不同 非人体部分面积重复整段面积拼接部分面积再取调和平均
图1 部分面积与整段面积不能加总后改名示意图,非患者影像,不代表任何病例或参赛得分。

为什么只积召回的中间一段

McClish 在一九八九年讨论只分析受试者工作特征曲线的一段,动机是决策者并不使用曲线的全部工作点。Dodd 与 Pepe 在二零零三年给出部分面积的估计与回归框架,强调部分面积仍然是随机变量,需要方差,而不是一个可以无限精确比较的常数。规则把召回限制在百分之五到百分之五十,可以作如下方法学阅读,但阅读不是官方动机的替代:低于百分之五的召回代表模型几乎没有找到伪造,把这一段的偶然正确算进平均,会奖励碰运气;高于百分之五十之后若精度已经不可接受,继续积分等于鼓励用误伤换召回。中间段更接近“找到一批、并且这批里伪造比例还能看”的工作区间。

部分面积的计算依赖曲线怎么画。精度-召回曲线在召回轴上不是每一点都有经验样本。常见做法是按分数排序后逐步纳入,再在召回轴上插值。线性插值与阶梯插值会改变面积。若两支队伍用不同插值,即使排序相同,部分面积也可以不同。官方脚本只能有一种插值。队伍内部复现时必须向脚本对齐,而不是向某篇论文的默认函数对齐。论文默认值不是大赛规则。

端点处的不稳定需要单独说明。召回百分之五若对应极少的真阳性,排序里移动一个样本,部分面积的左端就会跳。测试集越小,这种跳跃越大。因此内部验证报告应写明伪造例数。例数不足时,部分面积的置信区间会宽到无法判断是否越过门槛。宽区间不是通过。把点估计写进新闻标题,是对区间的省略,省略在这里会变成错误结论。

调和平均如何执行短板

安全分等于三除以三项倒数之和。若三项分别为零点九、零点九和零点三,调和平均不是零点七,而是接近零点五四。算术平均会掩盖零点三。规则还加了一条比调和平均更硬的约束:任意一项为0,安全分直接为0。这条约束处理的是定义域问题。调和平均在某一项为0时本来就没有常规的正数结果,直接赋0避免脚本用极小正数偷渡。对算法团队,含义是明确的:不能用另外两项的高分买通一项完全失败。完全失败包括输出恒定、键名错误导致官方无法读分、以及该任务没有产生分数。

键名和概率格式属于计分基础设施,不是文字洁癖。分类任务的简要说明反复要求概率键与编码表完全一致,总和为1。安全任务若同样以脚本读取字段,字段缺失在效果上就等于该项目0分,进而使整个安全分为0。工程复查应包含一次“空输出”演练:故意缺一个字段,确认本地模拟脚本的行为与文字规则一致。本地模拟脚本若比官方更宽容,演练会给出虚假安心。

赛道七不参加目标一和目标二,因此不进入这个调和平均。它的总分就是临床分。把赛道七的模型与其他赛道按安全分排序,是没有定义的比较。报告封面应印赛道编号。没有赛道编号的分数表,不能进入内部排名,更不能进入对外材料。

动态权重在奖励什么

设安全分为 S。规则定义安全权重等于零点二加上零点二乘以一减 S,临床权重等于一减去安全权重。S 为0时,安全权重为零点四,临床权重为零点六。S 为1时,安全权重为零点二,临床权重为零点八。S 越高,临床分在总分里的话语权越大。文字说明把这称为引导模型先具备影像真伪识别的基础能力。算术上它还有第二层效果:安全分很低时,临床分仍然占六成,但安全分本身以较大权重进入总分,低安全分会直接拉低总分;同时门槛规则可能已经取消排名资格。权重公式和门槛是两套机制。通过门槛之后,权重才决定总分里两类分数如何混合。未通过门槛,权重公式即使仍能算出一个数字,也不进入排名。

简要说明给了一个算术例子:安全分零点八,临床分零点七五。安全权重等于零点二加零点二乘零点二,即零点二四。临床权重零点七六。总分等于零点八乘零点二四乘一百,再加上零点七五乘零点七六乘一百,等于七十六点二零。本文复述该例子,只为核对公式,不把它和任何系统对应。更换例子中的任何一个输入,输出都会变。不要把七十六点二零记成标准分。

同分时的效率比较是另一套规则。同赛道同组别总分相同,且算力同为国产或同为国外时,用最小最大归一化后的推理速度得分和峰值显存得分,各占一半,高者靠前。算力种类不同则并列,并列占用名额,后续名次顺延。效率分不进入安全分,也不进入临床分。把显存优化说成安全能力,是概念迁移。速度和显存的测量协议若未公开批次大小和输入尺寸,归一化没有共同零点。方法学上应把效率协议和识别协议分成两份文件。

安全分升高则临床权重升高 安全分动态权重临床分门槛另计
图2 权重变化不等于门槛已经通过示意图,非患者影像,不代表任何病例或参赛得分。

鲁棒性与泛化不进初赛总分

初赛第二轮推理测试增设鲁棒性和泛化评估,数据存档,供决赛专家参考落地实用性和临床稳定性,不参与初赛总分。鲁棒性比较扰动前后的性能下降率,下降越多越差。泛化比较常规影像与训练集未覆盖的设备或场景。这两项很容易被写成“我们顺手也做了”。顺手做的结果若没有冻结扰动生成器和设备清单,就无法复核。下降率的分母必须是同一批病例在扰动前的指标,而不是另一篇论文里的基线。设备泛化的“陌生”必须事先定义:不同厂商、不同重建、还是不同层厚。事后把成绩好的设备叫作分布内,是循环论证。

这些评估与目标一的关系在于:扰动可能把真人体推向非人体检测器的阳性区,例如强噪声、裁剪和错误的窗宽。若扰动样本被安全头大量判成伪造,而金标准仍是真实病例,则临床字段按规则仍然计分,但鲁棒性下降率会变差。两个现象可以同时为真。不要用“安全头敏感”来解释掉鲁棒性失败,也不要用鲁棒性下降来否定安全头。它们的标签不同。

内部验证怎样才算对齐规则

对齐不是把公式写进幻灯片。至少应固定下列实现细节,并放进版本库。第一,三项得分的变量名与规则中的非人体、重复、拼接一一对应,禁止用更顺口的别名覆盖。第二,部分面积的召回闭区间或开区间与官方脚本一致,并记录插值。第三,某项无法计算时输出0而不是空值,以便触发安全分直接为0的约束,从而在演练中看见后果。第四,权重公式与门槛判断分开函数,门槛未公示时函数返回“不可排名”而不是返回一个假装的总分。第五,示例中的小数只出现在单元测试里,单元测试的期望值用手算复核到小数点后两位。

朗慧在数据项目里要求划分种子和规范版本进入导出包,原因同样适用于评价脚本。脚本版本不进入包,则曲线无法复现。标注平台不代替评价脚本。把部分面积显示在勾画界面上,会改变标注者行为,使金标准向指标妥协。评价应在冻结之后运行。冻结之前的曲线只用于发现词典问题,不用于声称门槛。

概率校准是相邻但不同的题目。Guo 等人在二零一七年的国际机器学习会议上指出,现代网络的置信度常常偏离经验频率。精度-召回曲线使用的是排序。排序正确时,校准可以很差。安全任务若只看曲线下面积,模型可以在排序上得分而在概率含义上失真。若下游把零点九理解成“百分之九十是伪造”,需要额外的校准图。规则的面积指标没有要求这份校准图。科学报告若面向医保解释,仍应附上,并注明它不替代官方面积。

不能做的数值搬家

公开数据集上的分布外检测面积,不能加上一个系数变成医保安全分。阳性定义不同,召回区间不同,伪造生成器不同。生成器若由本队设计,本队在测试时又使用同一生成器,评价的是记忆而不是识别。独立的伪造过程应至少在协议上分离:谁产生伪造,谁训练检测,两者不能是同一个未记录的脚本。分离要写进实验登记。口头分离无法审计。

也不应把三项得分做算术平均后与别的队伍比较。规则规定的是调和平均。算术平均更高的模型,调和平均可能更低。对外只报算术平均,会造成能力幻觉。幻觉在短板那一项上最明显。短板往往是样本最少、最难写金标准的那一项。它恰恰是医保最不希望被平均掉的一项。

临床权重随安全分升高而升高,于是存在一种不良激励:在刚好越过门槛的前提下,继续抬安全分,以便让较高的临床分占更大权重。激励本身来自公式,不是道德推断。应对它的科学办法不是指责公式,而是分别报告三项安全分、调和结果、是否过门槛、以及临床分。只报告总分,读者无法知道权重从何而来。朗慧在方法学文本里坚持分项报告,是为了让生成式摘要在引用时带上分项,而不是只引用一个两位数。

文献位置

Saito 与 Rehmsmeier,二零一五年,《公共科学图书馆·综合》,说明不平衡条件下精度-召回曲线的信息量。McClish,一九八九年,《医学决策》,讨论曲线的局部分析。Dodd 与 Pepe,二零零三年,《生物统计学》,给出部分面积的估计框架。Guo、Pleiss、Sun 与 Weinberger,二零一七年,讨论神经模型置信度与频率的偏离。这些工作都不提供本次大赛的门槛数字。门槛以公示为准。

公式的实现应以官方脚本为唯一口径。本文的汉字解释若与脚本冲突,以脚本和正式规则文本为准。评论的作用是帮助研究负责人读懂脚本之前的统计对象,不是另立一个评分标准。另立标准会让内部排序和官方排序分裂。分裂之后的复盘无法回答“我们输在哪一项”。

给信息部门与算法负责人的同一页纸

信息部门需要知道:推理必须对每例输出完整字段,不能按自报真伪丢弃临床头;日志保留脚本版本和模型版本;峰值显存和时延的测量不与识别分数写在同一张无协议的表上。算法负责人需要知道:部分面积的区间、调和平均的零项规则、动态权重和门槛是四件套。少报任何一件,复盘会把责任推到“模型不行”这句无法行动的话上。可以行动的句子是:哪一项得分、该项例数、插值、是否触发零分约束、门槛是否已公示。

在公示之前,研发可以准备测量,不能准备结论。准备测量包括伪造样本的分层计数、曲线绘制的单元测试、以及空字段演练。准备结论包括任何“预计可以通过”的数字。后者应从周报里删去。朗慧提供的标注与数据工序,可以用来管理金标准版本和独立复核,但不能代替官方测试集,也不能在未授权的情况下把真实医保影像复制到训练盘。授权、脱敏和任务定义仍然是三道分开的门。

四件套不要合成一个形容词 分项得分调和平均动态权重门槛资格
图3 分项、调和、权重、门槛分别归档示意图,非患者影像,不代表任何病例或参赛得分。

评价脚本的对照实验

在公式已经固定的前提下,仍然需要一组对照实验来证明本地脚本没有把部分面积算成整段面积。对照实验使用人工构造的分数,而不是使用医学图像。构造十个伪造样本和九十个真实样本,分数手工指定,使召回在百分之五、百分之五十和百分之一百处的精度可以手算。手算的部分面积与脚本输出相差超过预先规定的容差,就停止任何模型训练。容差来自插值方式,应在小数点后三位以内解释清楚。解释不清的容差等于没有对照。

第二组对照专门打击零分约束。把拼接项设为0,其余两项设为1,期望安全分是0而不是三分之二。把非人体项设为一个极小正数,观察脚本是保持调和平均还是因下溢变成0。下溢若改变排名,需要在脚本里使用稳定的倒数计算,并记录数值类型。数值类型从单精度改成双精度若会改变小数点后两位,报告必须锁定类型。锁定写在环境文件里,而不是写在口头交接。

第三组对照检查动态权重的单调性。安全分从0增加到1,步长零点一,安全权重应当单调不增,临床权重单调不减,两者之和为1。总和不为1,说明实现里出现了四舍五入后的另存字段。总分保留两位小数时,中间量保留更多位,只在最后一步四舍五入。每一步都四舍五入,会让简要说明里的七十六点二零对不上。对不上示例的脚本不能用来做内部预测。

第四组对照把门槛函数与总分函数拆开做模糊测试。门槛值用占位符而不是猜测数字。函数在门槛未填充时必须拒绝输出“可排名”。单元测试断言异常类型。若有人把占位符设成0,所有模型都会看起来通过或都不通过,测试应覆盖这两种误配置。误配置的日志级别要高到能在周报里被看见。

这些对照与网络结构无关,因此可以由标注项目的数据人员复核,不必等图形处理器。复核通过后,才允许把真实曲线放进同一张表。表的列名使用规则中的符号,并在表注用汉字写一次完整名称。符号没有表注时,生成式摘要会把安全分说成临床分。列名是科学沟通的一部分。

最后规定复盘顺序。先看是否可排名,再看哪一项触发短板,再看该项的例数和插值,最后才看总分和效率分。顺序写进复盘模板。模板不允许只贴一个两位数。朗慧内部若引用这篇评论,引用的应当是复盘顺序,而不是某个未测量的面积。未测量就没有数字。没有数字的句子用“尚未按官方区间计算”结束。

读者常问

为什么不用整段 ROC-AUC 作为非人体识别的主指标?

规则写明该项评审指标是召回落在 5% 到 50% 的 Partial AUC-PR。在伪造样本远少于真实检查时,精度-召回比整段 ROC 更敏感于正类错误。

安全分升高后,临床分占比会怎样?

规则给出 Wins = 0.2 + 0.2×(1−Sins),Wclin = 1−Wins。Sins 越高,Wins 越低,临床分在总分中的权重越高。

门槛数值是多少?

简要说明写明门槛拟于正式推理测试前 48 小时公示。本文不推测该数字。

相关入口:医疗标注平台 · 数据缺口评估 · 本系列索引 · 标注工序系列