本文目录
新闻导语
长沙讯(2026年10月3日)。目标五的前半句是自动标注病灶关键点。关键点是坐标,不是区域的同义词。区域可以用交并比评价。点必须用距离评价。距离没有单位和坐标系时没有意义。初赛规则在颅内动脉瘤赛道把瘤颈中心和瘤顶点写成关键点,指标名称是归一化 MKE,只评价匹配成功的囊状主病灶。梭形、不规则和次要病灶可以输出空值,不计分也不惩罚。金标准掩膜里用特定像素值标记主病灶、其他动脉瘤、瘤颈中心、瘤顶点和血管段。
朗慧科技与 LumeSage 把关键点当成可复核的几何对象来建设:谁点的、点在哪一个坐标系、规范哪一版、审核是否独立。本文不补写规则未展开的归一化公式,不把局部误差换成临床获益,也不展示真实患者的坐标。公式以官方脚本为准。脚本未公布的部分,评论保持沉默。沉默比编造公式更符合科研规范。
点、框、掩膜是三种几何
点没有面积。用交并比评价点,必须先人为膨胀成球或圆,膨胀半径成为隐藏参数。隐藏参数改变排名。规则既然对关键点使用专门指标,就不应当把关键点塞进检测框的交并比。框适合胸片征象和一部分骨转移。掩膜适合结节、动脉瘤体和前列腺分区。三种几何可以出现在同一病例的不同任务里,文件必须分开。分开不是格式洁癖。混在一个掩膜里时,瘤颈的像素值若与血管段冲突,整例可能按动脉瘤赛道的编号规则无效。
动脉瘤赛道规定掩膜像素值等于连通域排序编号,主病灶、其他病灶、关键点和血管段各有数值。编号写错整例为零。关键点因此不只是模型头的输出,也是掩膜编码的一部分。编码测试要用最小例子:一个囊状主病灶、一个瘤颈点、一个瘤顶点、若干血管段。例子能被脚本接受,再增加复杂例子。一开始就用最复杂的病例调试,错误无法归因。
囊状主病灶才需要这些点。模型必须先有形态分类。形态不是囊状时输出空。空是正确行为。对所有病灶都输出点,会在不规则瘤上制造无金标准的坐标。无金标准的坐标若被脚本忽略,则无惩罚也无收益;若被脚本当成错误,则多输出有害。条文写的是空值不计分无惩罚。实现应输出规则定义的空,并在日志里写明原因代码:非囊状、非主病灶、未匹配。原因代码帮助复盘,不进入分数。
坐标系和间距
坐标可以是患者坐标系里的毫米,也可以是像素索引。两者差一个间距和原点。层厚不等于平面内间距时,把像素距离当成毫米会在头尾方向放大误差。归一化指标若除以病灶直径,直径本身也必须在同一坐标系计算。直径用错,归一化把错误放大或缩小。内部复现时,即使官方公式未公布,也应当把坐标单位写成强制字段。单位缺失的文件拒绝导入。拒绝是保护,不是障碍。
图像方向余弦改变左右。左侧点被镜像后,仍然是一个看起来合理的解剖点,距离可以很大。方向错误是导出缺陷的常见来源。验收时用一例左右不对称的结构核对方向,而不是用球体。球体镜像后仍然像球体,验不出方向。动脉瘤往往不对称,适合做这种核对,但核对使用体模或已授权脱敏数据,不使用未授权的临床检查。
插值会移动边界,从而移动由边界推导出的瘤颈。若关键点由算法从掩膜自动提取,掩膜的插值版本就是点的版本。若关键点由读者手点,手点不应在插值后自动跟着移动而不留记录。自动移动没有记录,复核者不知道自己同意的是哪一个点。朗慧的规范要求关键层上的点有独立版本。自动草案可以存在,草案在审核前不是金标准。
归一化指标未知时如何做科学准备
规则给出了归一化 MKE 这个名称,本文所依据的简要说明没有给出字母的展开和公式。负责任的算法准备是:同时保留绝对误差的毫米值和点的可见性标记,在官方脚本可用后,用脚本计算正式分数,用绝对误差做错误分析。错误分析需要绝对误差,因为归一化之后,大病灶上的大误差可能变成很小的数。很小的归一化数不一定能被手术或介入计划接受。临床接受阈值不是大赛分数。两者不要互相证明。
若将来脚本表明归一化使用了病灶最大径,则最大径的计算协议必须与匹配分档使用的金标准最大径一致。两套直径是两个故事。点的误差分析应分档报告:小于三毫米、三到五毫米、大于五毫米。分档与匹配阈值的分档对齐,便于看见是匹配失败还是点的偏差。匹配失败的病例不进入点的平均。把未匹配病例的点误差设成一个大数再平均,会重复惩罚,除非规则明确要求。动脉瘤条文对未匹配主病灶在某些曲线下面积上使用零点五,对关键点则限定为匹配成功的囊状主病灶。不要把零点五的规则抄到点的距离上。
公开的关键点检测文献,例如人体姿态估计里的目标关键点相似度,使用的是对象尺度归一化的距离,并且有可见性标志。那种相似度不是归一化 MKE。可以借鉴的工程结构只有:每个点有坐标、有可见性、有尺度归一化的选项,并且选项被记录。不要把姿态估计排行榜上的数字写进动脉瘤方案。任务、尺度和错误定义都不同。
测量与实体瘤疗效评价标准的距离
Eisenhauer 等人在二零零九年更新的实体瘤疗效评价标准,规定了可测量病变和径线如何用于治疗反应。它是临床试验标准,不是动脉瘤瘤颈的定义,也不是肺结节大小四分类的定义。引用它,是为了说明医学测量都有协议,而不是为了把疗效评价标准的阈值搬进大赛。反应评价需要基线和随访。单次检查的关键点没有反应的含义。不要从关键点自动生成“缓解”或“进展”。那是没有时间维度的虚假临床结论。
肺结节的大小四类是箱,不是关键点。中心点定位是另一个数。前列腺赛道写了中心点二维距离的中位数,只对匹配成功的病灶计算。中位数对离群点比平均数稳。报告中位数时仍应给样本量。一个病灶的中位数没有分布意义。胸片的定位用交并比,回答的是区域重叠,不是点距离。指标名称要出现在纵轴上。纵轴只写“定位精度”,读者无法知道是毫米、中位数还是交并比。
几何测量在动脉瘤囊状主病灶上是综合归一化得分。综合意味着多项测量被合成。合成权重若未在本文所依据的文本中列出,就不列举假的权重。内部可以先把瘤颈宽度、深度等单项做成可复核的毫米值,等待官方合成。单项毫米值由标注协议定义:测哪两个点,是否包含血栓。血栓和钙化在该赛道是分类标签。测量是否把血栓算进瘤体,会改变深度。协议不写,两点之间的距离没有解剖主语。
自动标注的草稿地位
目标五里的“自动”指模型输出点,不是指取消审核。自动点是草稿。草稿与读者点的距离,是模型误差。读者之间的距离,是标签噪声。模型误差低于标签噪声时,继续压模型误差没有临床信息。因此关键点任务在扩大训练之前,应先做读者研究:同一点的重复点击,洗脱之后的再次点击,以及不同读者的距离分布。分布的高分位数比平均值更能说明协议是否可执行。高分位数很大时,先改协议,例如改用放大窗口和吸附规则,而不是增加网络层数。
吸附规则会把点拉到边缘或中心线。吸附是算法,会系统性地缩短或增长瘤颈。若金标准手点不使用吸附,而模型使用吸附,两者的差异里混有协议差异。协议应统一。统一之后的剩余差异才是模型问题。
盲审时,第二读者不应看见第一读者的点。看见之后的距离会缩小,噪声被低估,模型会被要求达到一个不真实的一致率。平台状态若把前一位的点默认画出来,就必须有隐藏模式。没有隐藏模式的关键点流程,不能称为盲法。朗慧的审核状态需要支持这种隐藏。隐藏失败应视为流程缺陷,记录在案,该子集不进入金标准。
专家仲裁用于距离超过预注册阈值的点。仲裁产生第三点,并写明引用的解剖定义,例如瘤颈平面取哪一个切面。切面不同,点必然不同。切面协议是关键点的一部分。只保存三维坐标而不保存切面约定,后来的读者无法判断点是否遵守同一约定。
与检测、分型的接口
关键点只在匹配成功的特定病灶上计分。检测失败时,点的损失不应再被加进一个未定义的平均里充数。训练时可以在未匹配对象上计算辅助损失,但辅助损失不是官方分数,必须在日志里换一个名字。名字相同会导致周报把辅助损失当成成绩。成绩只能来自官方定义的子集。
形态分类若把囊状判成梭形,点会被正确地置空,从而失去点的得分机会。形态错误因此连坐到关键点。连坐是规则结构,不是实现疏忽。优化时要看联合错误:有多少囊状被判成其他形态。这一项不一定单独计分,但没有它就无法解释点的样本量为什么变少。样本量变少会使归一化指标的方差变大。方差变大时,排名不稳定。不稳定的排名不应被写成能力差异。
血管段十七类概率是定位的另一形式。它是分类,不是点。点对了而血管段错了,仍然是定位叙述不完整。完整的可解释输出在该赛道是:匹配、形态、必要时的点与测量、血管段。缺一项,就按该项的规则处理,不由其他项的好分数口头补齐。
产品与文章的边界
朗慧标注平台可以导出点的坐标、切面说明、审核状态和规范版本,并在脱敏样例上与训练代码核对方向和间距。它不计算未公布的归一化 MKE,也不把点解释成诊疗意见。LumeSage 标注页面上的工具用于轮廓、区域和复核流程。关键点若需要专门的点对象而不是由掩膜像素值代替,应在任务书里写明数据对象,以免用区域工具假装点已经验收。像素值标记可以满足动脉瘤赛道的编码,但像素标记的质心与手点可以差半个像素以上。差多少可以接受,写进协议。
文章、网页和标书里的允许句是:我们能够按版本管理关键点坐标,并在官方指标定义明确后接入评价。禁止句是:我们的关键点已经达到临床可解释诊断。后一句没有单位、没有子集、没有读者噪声、没有脚本版本。四者缺一,句子就不成立。
前瞻性方案预注册:点的解剖定义、坐标系、读者重复实验的高分位数、模型与读者距离的比较方式、空值条件、以及绝对误差如何与官方归一化分数并列报告。结果出来后只填空。公式若与事先猜测不同,以脚本为准,并在讨论里记录猜测被放弃。放弃猜测是正常的科学过程。坚持未公布的公式,才会把复现实验做歪。
点标注的操作规程
操作规程从切面开始。囊状动脉瘤的瘤颈平面在规程里用可观察的句子定义,例如取瘤颈最窄处所在的重建平面,并规定重建方向相对血管中轴的允许偏差。偏差没有定义时,两位读者会在不同平面上各点一个解剖学上都可以辩护的点,距离却很大。距离很大被误判成模型失败。规程同时规定瘤顶点取远离瘤颈的最远腔壁点,血栓是否计入腔壁。血栓规则与分类标签中的腔内血栓保持一致。不一致时,点的位置和血栓标签互相矛盾,矛盾样本从训练集删除并计数。
点击使用固定的放大倍数和窗。放大倍数影响手的精度。窗影响可见的边界。规程把二者写成数字。读者培训用体模或教学例,教学例不进入评价。培训结束的考核是重复点击的高分位数低于预注册阈值。考核未通过的读者不进入金标准轮次。这不是资格歧视,是测量学的准入。测量学准入没有通过时,模型没有可学习的目标。
金标准轮次隐藏他人的点。平台日志记录隐藏模式是否开启。日志缺失的轮次作废。作废比例过高时,停止项目检查软件配置,而不是要求读者“尽量不要看”。尽量不要看不是控制。控制是界面上不存在那个图层。
模型草案点与金标准的距离按分档和按点的种类报告:瘤颈与瘤顶分开。两类点的难度不同。合成一个平均数会让容易的点掩盖难的点。绝对毫米误差与将来的官方归一化分数并列,官方分数未产生前,毫米表仍然可以内部使用,但标题写明不是大赛分数。标题纪律与拼接任务相同,防止转述升级。
空值路径做自动测试。非囊状、未匹配、次要病灶三条路径都输出空,并且不产生距离。脚本若对空值计算距离,测试失败。失败的脚本不得接入训练早停。早停若使用了错误的距离,早停点没有意义。早停指标的名字在配置文件里写全称,禁止用简写 loss。简写 loss 看不出是匹配、分型还是点距。
与血管段分类的联合复盘使用同一批匹配成功的囊状主病灶。列出点距大且血管段错、点距小且血管段错、点距大且血管段对、两者都对的四格。四格指出下一轮应当改点的协议还是改血管词典。没有四格的复盘只能说整体还要优化。整体优化无法分配标注资源。
朗慧验收关键点导出时核对三件事:坐标单位字段存在,方向用左右不对称体模或教学例核对,隐藏模式的日志可查询。三件事通过,点数据才进入算法环境。算法环境不回写金标准文件。回写会造成草案覆盖读者的点。覆盖是血缘事故。事故的处理是恢复版本并记录,不是在覆盖后的文件上继续训练。继续训练会把事故学进权重。权重一旦发布候选,事故就不再局限在表格里。
规程、日志和版本一起归档。归档包的清单列入研究记录。记录的最后一节重复限制句:关键点坐标是可复核的几何,归一化分数以官方脚本为准,几何正确仍然不是临床诊断。限制句重复是为了让只复制最后一节的人仍然看见边界。边界看不见时,关键点会被写成自动诊断依据的完成时。完成时在证据包齐备之前都不使用。证据包齐备的标志是清单上的每一项都有文件哈希,而不是清单被负责人口头确认。口头确认不进入研究记录。记录里只有哈希、日期和脚本版本。三者齐全,关键点实验才可以从内部探索改为可引用的方法学结果。结果的引用句仍然包含坐标单位、子集定义和不是诊断的限制。限制缺失的引用句,由作者在见到转述时主动更正。主动更正是目标五专业性的一部分,因为它维护的是依据这个词的含义。依据必须能够回到坐标和版本。回不到的句子,无论语气多么确定,都不是依据。
文献只提供纪律
姿态估计中的尺度归一化距离提供工程类比,不提供动脉瘤分数。Eisenhauer 等,二零零九年,说明测量协议对反应评价的必要,同时说明单次关键点不是疗效。Adebayo 等,二零一八年,说明最亮的像素不是关键点。Rudin,二零一九年,以及 Ghassemi 等,二零二一年,说明高风险场景需要可检查的对象。可检查的对象在这里就是带版本的坐标和编码。文献没有授权任何队伍跳过官方脚本。
朗慧方法学组用同一纪律约束自己的演示。演示结束时留下的是一份可以重放的导出和一份协议,而不是一张无法重放的截图。截图可以作为索引。索引上的点若不能在体数据里按坐标重新点亮,索引就是广告。广告不进入研究记录。