本文目录
新闻导语
长沙讯(2026年10月3日)。初赛规则对重复影像的定义很短:在原图基础上轻微调整,并且与原图没有临床差异的复制影像。这项识别使用整段精度-召回曲线下面积,然后与非人体、拼接两项进入调和平均。定义里有三个容易被滑过去的词:原图、轻微、无临床差异。任何一个词没有操作化,金标准就会变成品味。品味不能做医保安全门。
朗慧科技与 LumeSage 的方法学评论把重复检测看成近复制取证,而不是文件去重。文件去重看的是路径、校验和或实例标识。近复制看的是像素在允许的轻微变换之后是否仍与某次检查在临床上无法区分。两者都要记录,但不能互相替代。本文不给出检测器的曲线,不声称平台内置了该项分数,也不讨论如何制造能够逃过检测的复制品。制造逃避样本不属于科研评论。
无临床差异不是一个形容词
临床差异需要在具体模态上写成可观察的改变。对胸部计算机断层扫描,改变窗宽但保持体素数值,诊断信息可以不变,因为窗只是显示查找表。改变体素数值、层厚或重建核,则可能改变结节的表观直径和密度分类。规则说的轻微调整,若包括显示查找表、轻度压缩和几何上可逆的翻转,它仍可能“无临床差异”。若包括重采样到不同层厚,则体积和部分容积效应会变,这已经可能有临床差异。差异是否存在,应由预先写明的判定表决定,而不是由检测器的相似度分数反推。用检测器定义金标准,再拿同一检测器汇报成绩,是循环。
无临床差异也不等于像素一致。像素完全一致是重复的特例,校验和就能发现,不需要模型。比赛若把这种特例放进测试集,模型会显得很强,安全门却没有被检验。更符合定义的阳性,是经过轻度光度或压缩变化后,放射科医师在预先规定的任务上不能指出新的诊断信息。医师判定必须独立于算法团队。Bik、Casadevall 与 Fang 在二零一六年《mBio》上调查生物医学论文插图的不当重复,说明即使在已经发表的图里,人眼也会漏掉经过旋转、缩放或对比度调整的复制。他们的研究对象是论文图,不是医保容积数据,不能把他们的比例引用成医学影像伪造的流行率。可以借用的是方法:重复判定要有书面标准和独立复核,不能只靠“看起来眼熟”。
结构相似性与感知哈希各自回答什么
Wang、Bovik、Sheikh 与 Simoncelli 在二零零四年《电气与电子工程师协会图像处理汇刊》上提出结构相似性指数,用亮度、对比度和结构三项比较两幅图。它是图像质量指标,不是伪造检测器,更不是临床差异的定义。两幅图结构相似性很高,可以是同一次检查的相邻层,而相邻层不是复制。两幅图结构相似性下降,可以是真实的呼吸相位差异。把阈值设在某个经验数字上,会把厚层扫描的相邻层打成重复,或把真正的轻度压缩复制放过。结构相似性可以做候选检索的排序特征,不能做金标准。
感知哈希把图像压成短码,用汉明距离找近重复。它适合在大规模图库里召回候选,速度是优点。短码的碰撞是缺点。不同患者的相似摆位、尤其是侧位胸片或局部放大的超声,可能哈希接近。碰撞在安全任务里是假阳性。假阳性若很多,精度-召回曲线会在召回升高时迅速下降。规则对重复任务使用整段曲线下面积,因此高召回区的精度崩溃会被积分进去,不像非人体任务那样把积分停在召回百分之五十。这项设计上的差别意味着:重复检测器不能只优化一个很严的工作点。很严的工作点召回低,整段面积仍然会惩罚后半段的失败。队伍若只汇报阈值零点九九上的精度,汇报的不是 AUC-PR。
哈希还有一个实现细节:哈希之前的重采样和灰度量化会改变汉明距离。评价脚本若先把容积压成某张代表截图再哈希,代表层的选择就变成隐藏参数。隐藏参数不同,排名就可以不同。科学实现应声明哈希的输入是完整容积、关键层,还是每一层的最大值投影。不同声明是不同任务。
三维容积上的重复比二维图更含糊
一次胸部容积有数百层。重复可以是整个序列的轻度调整,也可以是只复制了结节所在的若干层。只复制若干层而其余层来自另一次检查,更接近拼接,应按拼接的定义审查,不要为了让重复检测器“有输出”而贴重复标签。标签词典应给出优先级:同一检查内的层间相似不是重复;跨检查且整体轻度变换且无新的诊断信息,才是重复;局部来自另一患者,是拼接。优先级写在规范里,复核时不允许临时改序。
实例唯一标识相同,强烈提示文件级复制,但仍需看像素是否被改写。标识不同,完全可能是像素级近复制,因为导出流水线会生成新标识。只监控标识的系统会漏掉“另存为”。只监控像素的系统会漏掉“标识被调包但像素未动”的目录错误。目录错误不一定符合“轻微调整”的定义,它可能是运维事故而不是伪造影像。事故仍应拦截,但应记在数据治理日志,不要混进伪造检测的阳性率,否则阳性率无法解释。
患者身份层面的重复是另一件事。同一患者的随访不是伪造。随访有临床差异,这正是它存在的理由。把随访打成重复,会破坏纵向研究,也会在安全任务里制造大量假阳性。金标准必须能读到时间与检查号。没有时间字段的图库,不能做重复任务的正式评价。朗慧的入库要求检查级标识,而不是只保留匿名文件名,原因就在这里。匿名化可以去掉姓名,不应去掉“这是另一次检查”的区分能力。区分能力用假名和盐值保持,不把原检查号写回像素。
精度-召回曲线的整段积分带来的优化压力
整段 AUC-PR 奖励的是整个排序,不是单一阈值。在重复样本较少时,曲线右端往往由大量假阳性主导。模型若把所有相似摆位都排到前面,召回可以很高,精度会在后半段塌陷,面积被拉低。这和临床阅读的直觉一致:报警太多的重复提示不会被使用。Saito 与 Rehmsmeier 关于不平衡数据的讨论在这里继续适用。不同的是积分范围:重复任务没有把积分截断在召回百分之五十。因此“只在高分段好看”不够。
校准仍然不自动解决排序。一个模型可以把真正的复制排在前面,同时把概率从零点六到零点九挤成一团。面积可以尚可,概率却不能解释成频率。若业务语言要说“重复的可能性”,需要可靠性图。规则的面积指标不强制可靠性图。面向复核人员的界面若显示概率,应注明未经校准,避免复核人员把分数当成后验概率。
数据泄漏在近复制任务里特别隐蔽。训练集里出现过的原图,测试集里出现它的轻度压缩版本,模型只要记住原图就能得分。这不是识别轻微调整的能力,这是记忆。划分必须按原图家族进行:一张原图的所有变换版本要么都在训练,要么都在测试。按文件随机划分,会把同一家族拆开。朗慧在划分上强调按患者而不是按切片,近复制任务还要再加一条:按源检查家族。患者级划分仍然可能把同一患者的同一次检查拆进两侧,如果导出时一次检查变成了多个文件。家族标识应是检查实例,而不是患者。
轻微调整的目录应当封闭
可以写进预注册的变换包括:可逆的几何翻转、显示窗的改变而不改体素、轻度有损压缩、小幅度的灰度线性拉伸。每一项都要有参数上限。上限本身是研究选择,不是大自然的常数。上限一旦在看见测试结果后放宽,评价就失效。不宜写进“无临床差异”的变换包括:改变层厚、改变重建核、裁掉含病灶的层、把结节涂掉再声称只是轻微调整。这些改变有诊断后果。把它们标成重复,等于告诉模型诊断信息的消失不重要。那会和目标三、目标五直接冲突。
变换目录还应声明哪些变换不做。不做的声明和做的声明同样重要。生成模型可以把一张检查变成另一张看起来不同但被声称同源的图。那种图是否“轻微”,不能由生成器的训练损失决定。损失小不等于临床差异小。若测试集包含生成式近复制,生成器必须独立于检测器,并且临床差异由医师按预定任务判断。没有医师判断的生成样本,只能算压力测试,不进入正式阳性。
标注工序怎样服务这项金标准
重复标签是检查级或序列级标签,不是每一个体素的笔刷。笔刷解决不了“这两次检查是不是无临床差异的复制”。平台仍有用,因为证据需要挂在对象上:源检查的标识、候选检查的标识、使用了哪一条变换假设、复核是否独立、结论是重复、非重复还是不确定。不确定不应在导出前被管理员改成重复。不确定退出正式曲线,并计数。
盲审在这里防止复核者看见采集人员已经写好的“疑似重复”提示。提示会抬高一致率。状态机应显示复核完成,而不把上一审的结论默认填进下一审。专家分歧时,仲裁记录写的是哪一条定义条款被引用,而不是只写“专家认为是”。条款引用使以后的词典修订可以定位到具体句子。
导出给算法的表格至少包含源与候选的配对键、标签、词典版本和退出数。没有配对键,检测器无法学习比较,只能学习“这张图看起来奇怪”。看起来奇怪是非人体和伪影的混合,不是重复。重复是关系标签。关系标签丢失,任务就变了。
朗慧不把关系标签的曲线下面积写成产品指标。产品能够做到的是:配对键不被匿名化过程洗掉,复核状态可查询,版本可回放。检测模型是否使用对比学习、哈希召回或配准残差,属于算法选择,应当在内部技术报告里论证,而不是在标注界面上显示成已经完成的医保能力。
与拼接、非人体的边界案例
同一患者、同一天、两次重建:若只是重建核不同,临床外观可以不同,不应标成无临床差异的重复,也不应标成跨患者拼接。它是协议差异。协议差异可以用于泛化测试,那是另一项不进初赛总分的评估。
不同患者、局部器官被贴进来:这是拼接。如果贴进来的区域几乎不可见,观察者可能把它叫成轻微重复。标签仍应按拼接条款,因为空间来源已经跨患者。来源优先于肉眼显著度。显著度是检测难度,不是定义。
没有解剖结构的图被复制两张:这首先是非人体。重复检测可以同时为真,但计分时不应让一张图无限制地充当多项阳性而不在方案里声明。若官方允许多重标签,声明来自规则;若规则未写,内部数据不要自作主张地让一项的阳性同时抬高另一项。自作主张会造成调和平均的两项相关,短板不再独立。
文献与动作
Wang 等,二零零四年,结构相似性是质量指标。Bik 等,二零一六年,说明重复判定需要标准和独立阅读,他们的统计不能外推为医保图像的伪造率。Saito 与 Rehmsmeier,二零一五年,说明整段精度-召回面积在不平衡时的含义。感知哈希的工程实现很多,阈值没有普遍常数。
可执行的下一步不是再下载一个开源去重库,而是写完判定表:哪些变换叫轻微,谁判断无临床差异,配对键如何在脱敏后保留,家族如何划分,不确定如何退出。表完成之前,不报告该项面积。朗慧可以在脱敏样例上把配对键和复核状态导出,供算法侧接到自己的评价脚本。脚本的分数留在实验室,不写进产品页。
近复制检索的实验记录
检索实验与金标准实验分开登记。检索实验允许使用哈希或嵌入向量在库内找候选,评价指标是候选列表里是否包含已知的源检查,以及列表长度。金标准实验才计算精度-召回面积。把检索的召回率写成官方面积,是指标替换。替换在幻灯片上很常见,在方法学里不成立。两个实验的数据划分都按源检查家族,防止候选列表因为泄漏而看起来完美。
嵌入向量若来自在同一批数据上训练的网络,检索成绩会偏高。应保留一个不更新权重的固定嵌入作为对照。固定嵌入很弱并不要紧,它的作用是提供下限。没有下限的提升无法判断来自任务本身还是来自在测试家族上继续训练。继续训练必须在日志里显示为另一行。
医师判定无临床差异时,任务要具体到可以做错。例如:在不知道哪一张被压缩的情况下,指出哪一张出现了新的可测量结节,或指出直径箱是否改变。若两张图都不能指出新信息,记为无临床差异。若任务本身无法完成,例如没有测量工具,则当天的判定作废,而不是记成一致。作废计数进入周报。作废过多说明实验条件不合格,不能靠增加变换种类来弥补。
压缩参数、翻转轴和灰度拉伸的上限写在一张冻结的表里。表的哈希值写进实验记录。检测器的训练配置也写哈希。两个哈希同时出现,第三个人才能复现。只保存模型权重不保存变换表,复现者会用自己的“轻微”定义,从而得到另一个任务。另一个任务的面积没有资格与原实验比较。
阴性对照至少包括:同一患者的随访、同一天的不同重建核、相邻序列的定位像,以及不同患者但摆位相似的检查。这些阴性越像阳性,测试越有价值。只使用内容差异极大的阴性,面积会虚高。虚高的面积在真正的随访库上会失效。失效不是部署后的意外,而是阴性设计的预期后果。设计阶段就应把随访放进阴性。
朗慧导出的配对键若经过脱敏,脱敏映射表的权限与影像权限分离。算法人员需要配对关系,不需要姓名。映射表只保留假名到假名的家族标识。家族标识在实验结束后按数据协议销毁或归档。归档期限写在协议里。没有期限的近复制库会无限期保存可以重新识别检查关系的信息。关系本身可能是敏感的。敏感信息的最小化是这项研究的合规部分,不是附加说明。
家族划分的审计可以在不打开像素的情况下完成。审计员只看源检查标识在训练清单和测试清单中是否相交。相交则实验无效。无效实验的模型权重删除或隔离,不作为预训练初始化,除非另有协议允许并记录污染。允许污染的初始化不能再称为未看见测试家族。命名上的严格防止后续论文把初始化写成独立训练。独立训练的定义是权重从未在测试家族上更新,也未在包含测试家族的自监督任务中更新。自监督若使用了全库,全库里的测试家族就已经进入表征。这一条容易被忽略,因为自监督没有使用重复标签。没有使用标签不等于没有使用图像。图像本身就是近复制任务的答案载体。审计因此要覆盖自监督列表,而不仅是有监督列表。列表由数据管理系统导出,不由实验者回忆。回忆漏掉一次全库预训练,面积就不可解释。朗慧的数据出入组记录应当能回答某次检查是否进入过任何训练清单,包括自监督。答不出的检查不再进入本次测试。测试清单在冻结后只读。只读权限的变更本身被记录。没有记录的解冻等于没有冻结。