本文目录
新闻导语
长沙讯(2026年10月3日)。第四项目标要求模型完成肿瘤分期、分级、病理分型等临床诊断。这些词在临床医学里不是同一类变量。分期描述解剖范围,常常有序。分级描述分化或报告系统里的等级,也常常有序。病理分型描述组织类型,多数时候是名义变量,类与类之间没有“T2 比 T1 更远”那样的距离。用一个准确率同时评价三者,会把“把 T1 判成 T4”和“把 T1 判成 T2”看成同样严重,也会把名义类别的错误假装成有序。
初赛简要说明在肺癌赛道把 T 分期的指标写成二次加权 Kappa,把病理分型写成宏平均曲线下面积。前列腺赛道对影像报告系统评分也使用二次加权 Kappa。这是有文献传统的选择。朗慧科技与 LumeSage 的评论说明这种选择的统计含义、主病灶分母、概率向量,以及影像分期与临床分期之间不可省略的距离。本文不给出任何模型的 Kappa,也不把影像输出称作病理诊断。
有序与名义必须先分开
T1 到 T4 的错误具有程度。相邻错误和跨级错误对临床沟通的影响不同。Cohen 在一九六八年提出加权 Kappa,用以在名义一致性之外表达有序惩罚。二次权重通常让差距的平方进入惩罚,于是相差两级比相差一级更严重,而且严重得更多。Fleiss 与 Cohen 后来讨论加权 Kappa 与组内相关系数的关系。使用二次加权时,应当在方法中写明权重是二次而不是线性。线性与二次的数值不能比较。规则写的是二次加权,内部脚本若调用库的默认值,必须核对默认是哪一种。默认值随软件版本变化。版本要锁。
名义变量没有这种距离。腺癌与鳞癌之间不存在“只错了一级所以还好”。宏平均曲线下面积对每一类分别计算再平均,避免多数类垄断。Hand 与 Till 在二零零一年讨论多类曲线下面积的概括。多类问题还有一对多、一对一等不同算法。规则若未指定宏平均以外的细节,实现应固定一种并写进脚本注释,引用编码表的类集合。类集合少一类,宏平均的分母就变了。
Frank 与 Hall 在二零零一年提出把有序分类拆成若干二分类的简单方法。那是建模技巧,不是评价的替代。可以用它训练,仍用二次加权 Kappa 评价。训练目标和评价指标不一致时,两者都要报告,避免读者以为优化 Kappa 就等于直接优化了那个拆分损失。
肺癌赛道的分母是主病灶里的恶性结节
成功匹配并且金标准为恶性的主病灶,才进入病理分型和 T 分期。其他恶性结节和良性结节不进入这项。检测到的每一个恶性结节仍必须输出分型和分期字段,缺字段则对应子任务为零,检测和恶性风险评分不受这句影响。这里有两层:评价子集是主病灶;输出完整性针对模型认为或检测到的恶性结节。实现时不要只给主病灶填字段。规则的完整性句子覆盖每一恶性结节。哪些结节被模型当成恶性,由模型的恶性判断决定,漏检恶性已经在上游被置零。字段缺失是额外的零,不是漏检的别名。
四档 T 分期的键是数字字符串,概率和为1。五类病理分型的键必须与表完全一致,大小写敏感,和为1。和不为1、键写错、缺键,在格式上就失败。格式失败应在提交前被本地模式检查拦住。拦不住的检查等于没有检查。
二次加权 Kappa 对边际分布敏感。若测试集几乎没有 T4,T4 的错误很少有机会出现,Kappa 的不确定性会很大。报告 Kappa 时同时报告各期例数和混淆矩阵。没有矩阵的单一 Kappa 无法复盘是相邻错误还是跨级错误。矩阵是科学内容,不是附录装饰。
影像看不到的东西不应当被模型编造
美国癌症联合委员会的分期手册把 T 类别与肿瘤大小、侵犯和卫星灶等联系起来。这些信息有的来自影像,有的来自支气管镜、手术和病理。只看计算机断层扫描的模型,看不到胸膜下的显微镜侵犯,也可能把肺不张和肿瘤分错。因此模型输出的 T 标签,准确的说法是“任务书定义的影像 T 类别”,不是临床病理分期。把两者写成同一个词,会在临床试验和医保材料里造成虚假精确。
大小分组本身也依赖测量。测量受层厚、重建和窗的影响。Gavrielides 等人关于肺结节体积测量的工作表明,算法和扫描参数会改变体积。体积一变,靠近阈值的病例会跨期。跨期不一定是模型“不懂医学”,可能是测量协议没有冻结。协议冻结包括:测长径还是平均径,包含不含毛刺,在哪一个窗上测。协议未冻结时,Kappa 下降不能单独归因于网络。
朗慧在标注侧要求测量协议写进规范版本。外扩工具生成的环是几何操作,不是临床靶区,更不是 T 分期。把外扩环的直径送进分期头,是字段误用。分期标签应由具备相应任务定义的读者或规则产生,而不是由外扩按钮产生。
前列腺评分与甲状腺分级同样有序,但不是 T
前列腺影像报告系统的分数从一到五,有序,二次加权 Kappa 是合理的指标族。它描述的是磁共振怀疑程度,不是病理 Gleason 分级。Epstein 等人关于 Gleason 分级共识的工作属于病理。磁共振评分与病理分级可以研究相关性,相关性不是同一性。任务书要求输出哪一个,就评价哪一个。同时输出两个同名分数,会在表格里互相覆盖。
甲状腺影像报告系统同样是有序的报告语言。甲状腺赛道还对腺外侵犯使用加权 Kappa,对临床显著性使用曲线下面积。侵犯分级和报告系统分数不要共用一个头还不换损失。有序头的评价是 Kappa 族,二分类头的评价是曲线下面积。头的名字里应包含量表名称和年份或版本。量表版本升级会改变边界病例。版本是数据卡字段。
脑胶质瘤的分级在当代分类中与分子特征绑定。只从常规磁共振输出“高级别”而不说明任务定义,会和分子时代的分类冲突。下一篇专门讨论分型与取材。本篇只固定一条:有序影像量表可以建模,但量表名称必须出现在每一个分数旁边。没有名称的“四级”没有意义。
概率向量是输出的一部分
规则要求分类和分级输出各类概率或置信度,没有概率的子任务计零。概率和为1的约束使输出落在单纯形上。单纯形上的最大分量是预测类别。评价 Kappa 时通常使用类别而不是概率。概率仍必须提交,因为规则这样写,也因为概率使错误的严重程度在复盘中可见:把 T1 判成 T4 且概率零点九九,与概率仅零点四,工程含义不同。Kappa 本身不区分这两种置信。额外报告置信不是为了加分,而是为了错误分析。
校准曲线按期或按类绘制。若高置信度的 T4 里只有一小部分真是 T4,模型不可用于任何自动提示。即使 Kappa 尚可,也不行。Guo 等人关于校准的结论在有序医学标签上同样值得检查。检查结果不替代 Kappa,也不应当被隐藏。隐藏校准失败、只公布 Kappa,是不完整的科学报告。
多标签任务不要求概率和为1。伴随征象属于目标五,各征象独立。不要把多标签的独立概率套进 T 分期的单纯形检查,否则合法的多标签会被误判为格式错误。格式检查器要按任务类型分支。
主病灶分母与漏检惩罚
前列腺赛道明确分母是全部阳性病例,漏检仍在分母中。肺癌赛道把未进入匹配的结节排除在分期评价之外,但漏检恶性通过置零影响恶性排序,并可能使主病灶根本没有预测对象。两种写法都要在代码里逐字对应。若主病灶漏检,分期没有预测类别,Kappa 的该项如何取值,必须以该赛道句子为准。有的赛道记零,有的不把该样本放入分类指标而在检测里惩罚。猜一种实现,会在跨赛道复用时制造系统性偏差。
良性病例不参与恶性分期。把良性病例的分期输出成一个假的 T 类别再送进 Kappa,会稀释或污染一致性。脚本应丢弃规则规定之外的样本,并打印丢弃计数。丢弃计数为零且数据里明明有良性,说明过滤没有生效。
标注怎样产生有序标签
有序标签不能由多边形自动生成。多边形提供大小和位置的测量,测量再由协议映射到等级。映射表是规范的一页,不是网络的最后一层。映射表改变,标签版本必须改变。读者之间的不一致要用二次加权 Kappa 先量标签,再谈模型。标签的 Kappa 很低时,模型不可能稳定地超过标签噪声。此时先做读者培训和条款澄清,而不是加深网络。
盲审对分期标签尤其重要,因为分期容易受到临床史暗示。审核者若看见标注者写下的期别,就不是独立阅读。独立阅读只给影像和测量协议。临床史若被任务允许使用,应作为单独的输入通道记录,而不是写在影像角落。角落里的字会进入像素,既泄漏答案,也破坏脱敏。
朗慧的导出表应包含:主病灶标识、量表名称、版本、类别、是否因漏检而无预测、读者标识和规范版本。没有这些列的分期文件,算法组应当拒收。拒收是专业行为。收下之后用文件名猜测量表,会造成不可复现的实验。
前瞻性方案的写法
方案在收集结果之前写明:量表版本、有序或名义、评价指标的权重类型、类集合、主病灶规则、缺失字段如何计、概率和的容差、混淆矩阵将如何公布、以及影像标签与临床病理分期的用词区别。用词区别建议直接写成禁用句:禁止在摘要里说模型完成了病理分期。允许的句子是:模型在任务书的影像标签上得到了何种一致性,例数是多少,相邻错误和跨级错误各多少。
例数不足的类别要预先规定合并或退出。合并规则事后修改,是在结果上雕刻。雕刻过的 Kappa 没有前瞻性。
文献位置:Cohen,一九六八年;Fleiss 与 Cohen关于加权 Kappa 与组内相关;Hand 与 Till,二零零一年;Frank 与 Hall,二零零一年;Turkbey 等关于前列腺影像报告系统更新;Epstein 等关于病理分级共识;癌症分期手册作为临床定义来源。这些文献划定概念,不提供本次测试的一致性数值。
一致性实验在模型之前
在训练分期模型之前,先报告标签本身的二次加权 Kappa。两位独立读者使用同一测量协议,在预注册的子集上阅读。子集包含各期的配额,避免全集中某一期过少导致读者 Kappa 也无法解释。读者 Kappa 的混淆矩阵与后来模型的混淆矩阵并列。模型在跨级错误上多于读者,说明模型比标签噪声更差,应当停止该结构的扩大实验。模型只在相邻错误上与读者相当,可以进入外部验证设计,但外部验证仍然使用影像标签的措辞。
测量协议的敏感性分析是第二步。在同一批检查上,仅改变窗或是否包含毛刺,统计有多少病例跨过分期边界。跨界比例高,说明该队列靠近阈值,Kappa 会被协议噪声主导。此时结论只能是协议敏感,不能是网络敏感。协议敏感的队列不适合用来宣传分期算法,适合用来改进测量条款。改进条款后版本号递增,旧 Kappa 作废,不作历史对比。历史对比要求协议相同。
概率输出的检查使用可靠性图,按期分层。每一期的预测概率分成若干箱,画经验频率。箱内样本太少就合并箱并声明。可靠性图不好而 Kappa 尚可,是可能的,因为 Kappa 看类别,可靠性看概率。规则要求提交概率,所以可靠性属于合规的质量,不只属于论文的加分。本地提交前若发现和不为1,直接拒绝打包。拒绝信息写明哪一例、哪一个键。信息只有“格式错误”四个字时,修复无法进行。
主病灶角色的审计抽样检查表格中的角色是否与规范定义一致。抽样比例事先写明。抽样发现的错误外推到全集的处理方式也事先写明:是全部重标,还是仅修正错误并在讨论中报告比例。事后选择重标与否,会使较差的结果有机会被重标成较好的结果。预注册的处理方式取消这个选择。
影像分期与临床分期对照若有病理或手术信息,对照作为单独终点,不替换任务书 Kappa。对照表会揭示影像看不见的侵犯。看不见的比例应当被写成局限,出现在摘要。局限比例很低时也要报告,以免读者以为没有检查过。没有检查过和比例为零,在科学记录里是两句不同的话。朗慧的字段设计把这两句分成“未获取”和“已获取且计数为零”。默认值禁止用来填充未获取。
方案的统计段落写明 Kappa 的权重、置信区间的方法以及区间不包含预注册范围时的结论模板。结论模板在出结果前写好两种:达到与未达到。未达到的模板不允许在结果出来后改成“趋势”。趋势一词没有在本方案中定义,因此不使用。定义过的词才能出现在结论里。这是前瞻性写作与回顾性宣传的分界。
二次加权 Kappa 的置信区间需要预先选择方法,并在模拟数据上验证实现。模拟一组已知一致性的有序评分,区间应当覆盖真值的频率接近名义水平。覆盖频率偏离太大,说明实现有误,真实数据上的区间不可引用。区间不可引用时,正文只报告点估计和例数,并写明区间尚未通过模拟检查。这比报告一个错误区间更诚实。错误区间会在比较两模型时产生虚假的优劣。优劣一旦写进摘要,更正很困难。模拟检查是便宜的预防。
边际分布极不平衡时,高 Kappa 可能主要来自多数期的一致。应同时报告各期的敏感度。某一期敏感度为零而总体 Kappa 尚可,结论必须指出该期没有被识别。指出之后,该期的例数决定是补充数据还是承认任务在该期不可用。不可用不是全面失败。全面失败的措辞同样不准确。准确的措辞保持期别。
线性权重的 Kappa 可以在附录作为敏感性分析,但不能替换正文的二次权重。附录图的标题含“非官方权重”。两种权重差异很大时,讨论解释差异来自跨级错误的惩罚,而不是来自模型改变。模型没有改变,变的是评价。评价改变却不声明,读者会以为结果不稳定。不稳定的印象损害的是报告质量,不一定是算法。把报告质量问题误诊成算法问题,会导致无意义的结构搜索。结构搜索消耗的计算应当留给协议已经稳定的实验。协议不稳定时,先停计算。停计算的决定记录在实验登记里,作为方法学纪律的证据。纪律本身是这项工作可被重复的原因。没有纪律的高分无法被重复,因此不属于前瞻性结果。朗慧在与算法组的交接单上增加一项:权重类型未写明的评分脚本不得接收分期标签。标签可以准备好,脚本不合格就不发出。不发出优于发出后无法解释。发出的分期标签还要附带测量协议编号。编号无法解析到窗宽、是否包含毛刺和径线定义时,接收方脚本拒绝。拒绝理由写明缺失的是协议编号而不是网络文件。网络文件可以稍后到达。协议编号必须先到。顺序反了,标签会被用错误的径线解释,Kappa 的下降会被记到模型头上。记错责任对象会改变下一轮实验的设计。设计被错误责任带偏之后,新的数据仍然沿用旧协议,问题重复出现。重复出现的问题应当在第一次拒绝时就停止。停止的权力放在接收脚本里,不放在会议共识里。会议共识没有哈希。脚本的拒绝有日志。日志足以在事后证明标签没有被错误地接收。证明接收链路干净,是分期研究能够称为前瞻性的工程条件。工程条件不满足时,统计段落写得再完整,也缺少可计算的对象。可计算的对象至少要能在三例手算中与脚本一致,手算记录随包保存。保存位置与脚本哈希并列,缺一不可。两者都在,分期标签才允许进入评价队列。队列之外的标签只保存在草稿区。