本文目录
新闻导语
长沙讯(2026年10月3日)。全国医保影像人工智能识图大赛的初赛规则,把第一项评审目标写成一句话:区分真人体、假人体与非人体影像。这句话和后面的目标二一起,被归入医保安全属性。安全属性设有晋级门槛。未达标的模型不参加初赛总分排名,也没有晋级决赛的资格。组委会仍会计算各项得分供队伍参考,但参考分不能代替晋级。
朗慧科技与 LumeSage 标注平台上的算法和标注方法学组,把这一目标当作影像进入任何临床评分之前的准入问题来讨论,而不是当作一个可以事后用热力图解释的风格题。本文不报告任何队伍的名次,不报告朗慧或 LumeSage 的召回、精度或曲线下面积,也不猜测将于正式推理测试前四十八小时才公示的门槛数值。文中凡是出现公式,都来自已经发布的初赛规则简要说明;凡是出现文献,都限于可核对的公开论文与标准。影像平台上的勾画、盲审和导出,解决的是标签与工序可追溯,并不因此成为已经注册的诊断器械,也不等于已经完成大赛推理。
目标一的标题用了三个名词,计分条目则把“非人体影像识别”写成安全分的一个分量,评审指标是召回落在百分之五到百分之五十区间上的部分精度-召回曲线下面积。假人体在标题中出现,在已读到的计分定义里没有被单独写成第三套曲线。负责任的写法是把标题和操作定义分开:标题划定科学问题,操作定义划定计分对象。两者不一致时,以公示的任务书和金标准标签为准,不用口语里的“像不像人”去填补空白。
三个词分别指什么
真人体影像,指一次真实受检者检查所产生、并保留可审核几何与标识的影像。它不一定“好看”。低剂量、厚层、运动伪影、金属伪影、体外异物和摆位不良,都可以来自真人。把图像质量差当成假,会把真实的困难病例赶出临床评分,同时让模型学会讨好图像美学。医保场景里的真实检查,分布本来就比公开挑战赛的精选切片更宽。
假人体在工程文献里通常落在体模、模体和合成解剖之间,而不是落在“第二张真人照片”上。几何体模用于校准层厚、噪声和空间分辨力;拟人体模带有肺、骨或血管的形态,用来研究检出任务,但它没有个体化的病史,也没有一次真实登记的检查号。生成模型合成的容积,即使体素直方图接近某一协议,仍然缺少与之对应的真实受检者。规则标题把假人体与真人体、非人体并列,说明评审关心的是来源,不只是灰度是否落在亨氏单位的常见范围。若某一赛道的任务书把假人体进一步定义成特定体模序列或特定合成协议,该定义只在该任务书内有效,不能外推成“凡是光滑的器官都是假的”。
非人体影像,规则给出了可以直接引用的操作定义:无人体解剖结构的影像。测试卡、均匀水模的纯噪声场、扫描仪质控幻灯、把自然照片或桌面物体误传入影像目录、以及只有定位像框架而没有人体断面的对象,都更接近这一定义,而不是接近“画得不好的肺”。无解剖结构是一个阳性发现,不是一个残差。模型要输出的是“这幅图不含可辨认的人体解剖”,而不是“这幅图的诊断置信度较低”。诊断置信度低可以发生在真实的疑难病例上。把两件事合成一个分数,安全门就会误伤临床分母。
这三类不能靠单一相似度阈值区分。真人低剂量肺窗可以比拟人体模更“假”,因为噪声更大;拟人体模可以比一张桌面照片更“像”解剖,因为它本来就是按解剖模具铸造的。分类器如果只在自然图像预训练权重上微调一个“是否医学图像”的头,它学到的常常是纹理和边框,不是来源。Geirhos 等人在二零一九年的国际学习表征会议论文里表明,在图像网数据上训练的卷积网络偏向纹理而不是形状。医学影像的纹理可以被窗宽、重建核和压缩彻底改写,形状和空间标定则相对更稳。目标一若做成纹理分类器,会在重建核一变时集体失效。这不是大赛特有的缺点,而是自然图像表征迁移到计算机断层扫描时的已知偏差。
计分为什么把非人体单独拿出来
安全分被写成三项的调和平均:非人体、重复、拼接。公式是三项得分倒数之和再取倒数,并乘以三。任意一项得分为零,安全分直接为零。调和平均的直观含义是短板主导。一个模型在重复影像上接近完美,但把无解剖结构的质控图一律当成真人,安全分不会被重复任务的高分托住。对医保使用而言,这个设计是合理的:放过一类伪造,就等于允许该类伪造进入后续支付或审核逻辑。临床诊断分再高,也不能补偿“根本不是人体检查”这一错误。
非人体识别使用的不是整段受试者工作特征曲线下面积,而是部分精度-召回曲线下面积,召回区间限定在百分之五到百分之五十。Saito 与 Rehmsmeier 在二零一五年《公共科学图书馆·综合》上的论文说明,当正类稀少时,精度-召回曲线比受试者工作特征曲线更能暴露假阳性对精度的破坏。McClish 在一九八九年、Dodd 与 Pepe 在二零零三年分别讨论了只积分受试者工作特征曲线某一段的理由:临床或筛查只关心某个假阳性率或召回带,整段曲线会把无人使用的工作点算进平均。规则把召回带卡在百分之五到百分之五十,等于声明:极低召回下的偶然命中,以及为了拉满召回而接受的精度崩溃,都不进入该项积分。本文不把这一区间解释成最优门槛,只说明它改变了模型该优化的工作点。谁若在验证集上把阈值调到召回百分之九十九再汇报整段曲线,他汇报的不是这项指标。
部分面积还有一个容易被忽略的统计问题:区间端点本身有方差。测试集里非人体样本如果只有几十例,百分之五召回对应的命中个数可以是个位数。个位数的排序变化会让部分面积跳动。因此该项的科学报告至少应同时给出:阳性定义、测试例数、曲线的插值方式,以及端点是否包含。规则没有要求参赛队自行公布这些中间量,但方法学评论必须把它们写成可复现条件。没有例数的部分面积,不能拿来比较两篇论文。
分布外检测文献能用到哪一步
Hendrycks 与 Gimpel 在二零一七年的国际学习表征会议论文中,用最大 softmax 概率做分布外检测的基线,并指出高置信度不等于分布内。医学影像上的非人体样本,对一个只在肺结节数据上训练的检测器而言,就是极端的分布外输入。最大类别概率会在两种情况下同时变高:模型真的看见了结节,以及模型看见了一种训练时从未出现、但卷积特征恰好落在某一侧的纹理。所以把“恶性概率”的补数当作“非人体概率”,在定义上就是错的。目标一需要独立的来源判别,而不是诊断头的余量。
Lee 等人用类条件高斯与马氏距离做分布外分数,比最大概率更接近特征空间的密度。这条路线对非人体有一个前提:分布内特征必须来自协议相对稳定的真人体检查。若训练集本身混入体模和截图,马氏距离的中心就被污染,安全门会把假人体学成正常。朗慧在标注项目里坚持的入库顺序,因此不是可有可无的流程偏好:先按检查对象、序列几何和文件类型完成纳排,再允许勾画。纳排记录属于数据治理,不是模型结构。一个没有纳排记录的训练集,无法回答“假人体是否被当成了真人体的增强样本”。
Yi、Walia 与 Babyn 在二零一九年《医学图像分析》上综述了生成对抗网络在医学影像中的用法,包括合成数据扩充。合成扩充可以缓解少见征象,但它改变的是训练分布,不是医保安全定义。把合成容积混进“真人体”而不加来源标签,会使目标一的金标准无法书写。正确的科研用法是:合成样本带有不可遗忘的来源字段,评价真伪时要么排除,要么单列。来源字段一旦只存在于口头说明,导出的压缩包就无法复现。
体模研究有自己的计量传统。拟人胸模常被用来估计结节体积与层厚、重建核的关系,而不是用来代替人群队列。把体模论文里的检出率写成临床敏感度,是方法学错误;把体模序列混入真人测试集而不标注,则是目标一要拦截的错误。两者方向相反,却经常出现在同一份项目申报书里。申报书写“使用体模验证算法稳定性”是合理的;申报书写“体模结果代表医保人群”则超出证据。
几何与标识比纹理更难伪造得一致
计算机断层扫描的像素值锚定在亨氏单位,但仍受管电压、重建核和迭代强度影响。同一受检者在两种核下的肺纹理可以不像同一次检查。非人体图像也可能被错误地写入亨氏单位标签,例如把一张八位灰度图线性拉伸后装进医学数字成像与通信文件。因此“有亨氏单位标签”不是真人体的充分条件。充分条件更接近一组可同时成立的约束:存在可解析的序列几何,像素间距与层位置自洽,解剖结构在相邻层上连续,并且标识字段与像素内容不互相矛盾。任一条件失败,都应进入隔离,而不是进入勾画队列。
医学数字成像与通信标准把检查、序列和实例分成层次,并为实例规定全局唯一标识。标识重复或被手工改写,本身就是安全事件,但它不等于像素级的非人体。一个真实检查可以被错误地复制出第二个标识;一张没有解剖的图也可以带有看起来合法的标识。目标一的模型如果只读标识,就会放过像素伪造;如果只读像素,就会放过标识层面的张冠李戴。两项证据应分开记录,再在病例级合并。合并规则需要事先写明是逻辑与还是逻辑或。事后挑选更有利的合并方式,等于在测试集上做选择。
烧录在像素上的姓名、检查号和医院名称,是另一类与真伪相邻但并不相同的问题。它们属于隐私,也属于“图像是否还带有获取现场的痕迹”。脱敏应当删除或遮盖这些痕迹,但遮盖过程本身会制造一块无解剖的矩形。若安全模型把遮盖块当成非人体证据,脱敏后的真实检查会被系统性误判。训练和评价都必须包含“已经按方案脱敏的真人体”这一层,否则安全门与隐私合规互相拆台。朗慧在标注规范里把字段脱敏和像素烧录字分开写,就是为了避免这一混淆。像素上的遮盖需要有位置记录,而不是只在头文件里打一个已脱敏的标记。
假人体为什么比非人体更难写进金标准
无解剖结构通常可以达成较高的观察者一致:多数放射科技师能指出“这里没有人体”。假人体的一致率取决于定义是否操作化。拟人胸模的肺血管是模具,不是变异;生成模型做出的结节可以带有分叶和毛刺,形态学上故意接近恶性征象。若金标准只给“假”一个二元标签,模型会把所有形态过于典型的结节都推向假,从而伤害真实的典型恶性病例。这是目标一与目标三之间的张力。典型并不是伪造的同义词。
因此假人体的金标准至少应分层:几何体模、拟人体模、生成合成、以及真实检查经过不允许的后处理。每一层的采样单位是检查或序列,不是单张截图。只在截图上标注“看起来假”,无法复现到容积数据。三维任务的伪造可以只发生在若干层,其余层保持真实。层的混合属于拼接问题,更接近目标二,但观察者会把它叫成假人体。标签词典必须事先禁止同义词。同义词在导出表里会变成两列,调和平均的某一项就会在沉默中变空。
观察者研究需要洗脱和独立。同一位工程师上午把序列标成体模、下午又用该标签训练模型,一致性会被高估。至少应保留一版不参与训练的复核。复核不一致的序列退出该项金标准,而不是按少数服从多数悄悄合并。退出也要计数。大量退出意味着定义不可执行,此时继续报告曲线下面积没有意义。
和临床评分的接口
规则要求,除明确豁免的赛道外,模型对测试集中每一例影像都要输出五项的全部推理结果,不论模型自己认为它是真是假。评分时,组委会不采用模型自报的真伪去筛选临床对象,而是按金标准里的“真实病例”过滤。真实病例即使被模型误判为伪造,其临床字段仍然参与目标三、四、五。伪造病例即使被模型误判为真实,其临床字段也不进入这三项。
这个接口对算法设计有直接后果。不能因为安全头判了伪造,就把检测头、分期头和关键点头全部置空。置空会在“真实但被误伤”的病例上制造系统性的漏检零分。反过来,也不能为了临床分好看而把安全头永远判成真实。安全头永远为真,调和平均里的非人体项会塌掉,门槛直接失败。两项头必须同时有输出,并且在评价时按金标准而不是按模型自报来切分样本。工程上这意味着推理图是完整的,过滤发生在官方评分脚本,不发生在参赛队自行删除样本的后处理里。
赛道七按简要说明不参加目标一和目标二,总分只来自临床属性。把赛道七的超声视频结果拿去声称“已通过非人体门槛”,是跨赛道误用。超声静态图和动态帧的匹配规则使用交并比与匈牙利算法,和计算机断层扫描的非人体识别不是同一个实验。跨赛道比较单一曲线下面积,没有共同的阳性定义。
朗慧与 LumeSage 在这一目标上做什么
专业性不体现在宣称某个未公开测试集上的部分面积,而体现在能否把准入写成可演示的工序。朗慧医疗标注平台公开的主路径是计算机断层扫描、磁共振和正电子发射断层扫描的医学数字成像与通信对象。入库时拒绝非该格式,是目标一在工程侧的第一道物理约束:一张桌面照片不应与一次胸部容积拥有同一个检查目录。拒绝之后仍要抽查。格式正确的文件仍然可以内含无解剖的像素。格式门和内容门是两道门。
平台上的数据集出入组用于记录纳排改变。若一批体模被误入组,出组时不能只删除文件夹,还要让依赖该检查的勾画、特征表和划分种子一起失效。否则目标三的检测模型会在体模结节上获得虚假的真阳性。这一条对影像组学同样成立:体模的纹理特征会占住特征空间的一块,使后续选择看起来稳定,其实稳定在模具上。
盲审在目标一里的用法,是让复核者在不知道采集人员判断的前提下,重新回答“有没有人体解剖”以及“是否属于已定义的假人体层次”。盲审状态区分待标注、已标注和已审核。没有这三种状态,无法证明金标准不是采集人自评。专家网络可以用于需要资格说明的分歧,但资格说明不能替代操作定义。两位专家若对“假”的含义理解不同,一致率反映的是词典,不是眼睛。
导出侧若要把安全标签交给训练代码,至少应包含:检查级标签、标签词典版本、复核者是否独立、以及被退出的例数。导出成影像压缩包而丢掉标签版本,训练侧无法复现曲线。平台可以导出临床表格与体素标签,并不自动计算部分精度-召回面积。该面积属于评价脚本,应当在冻结的测试划分上运行,而不是在标注界面里当作实时分数展示给标注者。标注者看见实时分数,会向分数而不是向定义收敛。
不能外推的边界
本文没有给出非人体识别的推荐网络结构,也没有给出召回区间的替代方案。替代方案若要成立,需要在规则允许的范围内做预注册,而不是在看到测试分布之后改积分限。本文没有把部分面积的数值和任何商业模型绑定。公开挑战赛上的分布外检测数字,不能换算成医保门槛是否通过,因为阳性定义、召回区间和伪造生成方式都不同。
甲状腺超声、乳腺钼靶、胸片和头颈计算机断层血管成像各有设备噪声和伪影。非人体的视觉表现不会统一成“一张猫的照片”。每个赛道的阴性对照应由该模态的质控图和明确的无解剖样本构成,而不是共用一个自然图像数据集。自然图像可以是压力测试,但压力测试的分数不应混入正式的部分面积,除非任务书写明允许。
最后,目标一通过不等于图像真实到可以支付。通过只表示在已定义的非人体任务和同时考核的重复、拼接任务上,模型没有跌破公示门槛。支付、适应证和临床责任仍由相应的管理规范和医疗机构决定。算法评论停止在证据边界之内,是方法学的一部分。
文献与标准
Saito 与 Rehmsmeier,二零一五年,讨论不平衡时精度-召回曲线相对于受试者工作特征曲线的信息量。McClish,一九八九年,讨论只分析受试者工作特征曲线的一段。Dodd 与 Pepe,二零零三年,讨论部分曲线下面积的估计。Hendrycks 与 Gimpel,二零一七年,给出分布外检测的最大概率基线及其失效方式。Geirhos 等,二零一九年,报告自然图像网络的纹理偏向。Yi、Walia 与 Babyn,二零一九年,综述生成模型在医学影像中的使用边界。医学数字成像与通信标准由国家电气制造商协会维护,标识层次与私有标签的解释以标准正文为准,不以软件界面的字段名为准。
这些文献提供的是评价和表征上的约束,不是可以抄进参赛配置的超参数。重建核、层厚和体模型号必须写进自己的数据卡。没有数据卡的曲线,无法被下一次实验复现,也就不能称为前瞻性的科研结果。
可写入方案的最低字段
若一个课题组要把目标一写成内部评价,而不是写成大赛排名,字段至少包括下列各项,并且每一项都要有负责人。第一,真人体的纳入是按检查还是按序列,同一患者的多次检查是否允许同时出现在训练和测试。第二,假人体若使用,分层名称和每层例数,以及是否进入正式曲线。第三,非人体的操作定义引用哪一句话,边界案例清单由谁签字。第四,部分面积的召回区间、插值方法和随机种子。第五,安全输出与检测输出是否在同一次推理中同时产生。第六,脱敏遮盖是否单列,避免把遮盖块学成伪造证据。缺任何一项,都不建议对外使用“已具备医保安全识别能力”这种句子。
朗慧可以协助把上述字段放进标注规范和导出表,并在脱敏样例上演示入库、隔离、复核和导出。演示使用的应当是体模、质控图或已授权且已脱敏的检查,而不是临时从临床工作站拷贝的未脱敏数据。样例通过之前,规范版本号不应冻结。冻结之后的修改必须升版,否则前后两次曲线不可比。