从时间序列到多模态证据链:长沙朗慧信息科技有限公司启动长时序多模态肿瘤病例数据集建设专题

长沙,2026 年 8 月 20 日——肿瘤研究的数据难点,从来不只是“有没有数据”,而是能否让同一位患者在不同时间、不同科室、不同系统中留下的证据重新建立可靠联系。长沙朗慧信息科技有限公司近日围绕《长时序多模态肿瘤病历数据集建设需求规格书》启动数据集建设专题,并同步在 DataAssetsAPI 发布“专属长时序多模态肿瘤病例数据集”专题介绍。该专题面向肿瘤研究、临床人工智能方法验证与医疗数据治理,拟以匿名患者为主线,组织全文本病历、结构化诊疗事件、CT/MRI、病理与全切片图像、组学和随访结局等对象,形成可追溯、可核验、可项目化配置的数据建设框架。
需要特别说明的是,这一专题页面和本文所述内容均为建设需求、拟建范围与项目化验收设计。具体数据来源、实际可用病例、覆盖时间、模态、质量档位及交付边界,均须以合法授权、数据字典、来源审核和项目验收方案为准。朗慧科技不将建设目标表述为既成数据成果,也不对任何诊断、疗效预测或医疗器械性能作出承诺。
一、从“孤立片段”到“时间序列”:肿瘤数据真正稀缺的是什么
在肿瘤临床实践中,病程从来不是一张静态表格。确诊前的历史检查可能提示风险线索;病理、影像和分期共同构成基线;手术、药物、放疗、检查检验和病程记录反映治疗过程;复发、进展、转移、死亡或末次随访则构成后续观察。若这些信息只以一次就诊、一份报告或一个文件夹的形式存在,研究者得到的往往只是“切片式事实”,难以还原事件间的先后关系、临床语境和证据来源。
2026 年发表于 IEEE Reviews in Biomedical Engineering 的综述指出,精准肿瘤学正在从单一时间点、单一模态的分析走向纵向与多模态建模;临床、影像、病理和分子数据提供互补信息,但不规则采样、缺失、患者异质性和跨系统差异仍是关键挑战。[1] 这意味着,数据集的竞争力并不取决于文件数量,而取决于能否把“时间”“关系”“来源”和“不确定性”作为一等对象保留下来。没有时间血缘的多模态堆叠,很难回答一个最基本的问题:某份影像、某次用药、某个标本或某条结局,究竟处在患者轨迹的哪个位置,又基于什么原始记录得出。
朗慧科技本次专题的核心出发点,正是将“患者级时间线”置于数据工程中心。建设规格拟围绕“确诊前可追溯阶段—确诊与分期—治疗—随访/结局”组织数据对象,以匿名患者 ID、就诊、检查、序列、标本和组学样本标识建立关联。每一个后续可用的研究变量,均应能够回溯到其文件、字段、记录类型和时间依据;每一项无法充分支持的内容,也应在质量报告中被显式说明,而非由工程处理默默填补。
二、四癌种、五千例:将建设目标转化为可验收的队列边界
按照需求规格书,本专题的建设目标为 5,000 例阳性肿瘤病例,其中肺癌 2,000 例,肠癌、胃癌、胰腺癌各 1,000 例;其他癌种不用于冲抵。与以往以“疾病标签”统揽一切的宽泛队列不同,这一边界强调癌种构成、阳性病例属性和最低建设目标需要可被核对。它不是对现存库存的宣传,而是对项目建设方向、资源组织方式和最终验收口径的提前定义。
在时序要求上,专题优先覆盖既往 5 年,最低有效时序原则上不少于 3 年;患者轨迹应至少出现确诊/基线、治疗和随访等多个节点。这里的“长”并非简单延长观察年限,而是要求关键临床事件之间保有足够的连续性与可解释性。例如,影像检查应尽可能保留检查日期、部位、期相、层厚、study/series 及完整报告;病理报告要尽可能关联标本 ID、取材日期和标本类型;随访结局则应保留复发、进展/转移、死亡、长期无复发或末次随访的时间和记录依据。
“我们关注的不是将多种文件放进同一个目录,而是让每一个文件在患者时间线上拥有可核验的位置。数据的可追溯性、适用边界和质量语境,应该与数据内容同步交付。”——长沙朗慧信息科技有限公司数据资产团队
三、多模态不是拼盘:以原生对象和关联键保护临床证据
多模态肿瘤数据建设最常见的误区,是把文本、图像、组学结果分别“清洗干净”后再试图相连。实际研究中,正是原始对象的上下文决定了关联是否可靠。本专题拟将全文本病历与结构化事件双轨组织:门诊、住院、入院/出院、首次病程、日常病程、会诊、手术、诊断、检验、药物和医嘱等记录,优先以 full_text 保留完整内容,同时同步维护记录类型、时间字段和必要结构化字段。对关键文书而言,“不截断”不是排版要求,而是避免临床语义、证据来源和时间线被人为切断的基础条件。
影像数据的工程化同样不能停留在“有无 CT”层面。需求规格拟关注 CT/MRI 的 DICOM 本体及完整影像报告,并对检查日期、study/series、部位、期相和层厚等元数据提出要求;对于病理,除完整报告外,还拟关注标本 ID、取材日期、标本类型、组织学信息以及按项目可得的 H&E 全切片图像(WSI)与免疫组化对象。NCI 的 Imaging Data Commons 以 DICOM 对影像、测量、标注及伴随信息进行标准化组织,为公共肿瘤影像基础设施提供了重要参考。[2] 本专题借鉴的是其“标准化对象、可追溯元数据与计算就绪性”的方法,而非声称接入或拥有相关公共资源。
在组学侧,建设规格优先考虑 WES/WGS 与 Bulk RNA 的原始或可复用文件及其质量控制和参考版本信息;当原始 FASTQ 无法提供时,BAM/CRAM、VCF、表达结果与对应 QC、版本和样本元数据也需要明确标记。其原则是严格区分原始对象、处理结果和派生结论,避免将缺少来源与版本信息的表格误当作可重复利用的组学证据。标本、病理、组学样本与患者、就诊、时间之间的映射,应通过受控关联键和文件清单进行核验。
四、把“质量”拆解成可复核的工程动作
医疗数据质量不应被压缩成一个看似精确的总分。对于长时序肿瘤数据,完整性、准确性、时间逻辑、跨模态一致性和业务闭环分别对应不同风险,需要被分层检查。本专题拟建立的质量框架,首先核查匿名患者 ID、就诊、检查、序列、标本和组学样本之间的主外键关系,识别孤立对象、重复关联和异常拼接;其次检查全文本是否异常截断、字段是否混杂、记录类型与时间字段是否缺失;再次检验入出院、检查、病理、手术、医嘱和随访之间的时间顺序是否存在明显冲突。
对于结局信息,专题拟坚持“有依据才入表”的原则。复发、进展、转移、死亡、长期无复发以及末次随访,需要保留可追溯的时间或原始记录支持;对无确切依据的内容,不以自动推断替代临床证据。对于 TNM 与分期,则要求尽可能区分临床/病理来源、分期日期、来源记录和可得的版本信息。这类规则看起来细碎,却决定了后续研究能否解释一个变量为何存在、何时产生、是否适用于特定队列。
最终交付不应只包含数据文件。项目级数据字典、文件清单(file_manifest)、覆盖说明、缺失与异常报告、抽样复核记录、降档或剔除建议,都是让数据可以被理解、审计和持续迭代的组成部分。发表于 npj Health Systems 的 2026 年研究显示,结构化与非结构化电子健康记录的互补使用具有方法学价值,也进一步说明数据组织不能只偏向其中一种形态。[3] 对朗慧科技而言,高质量数据并非把数据“修饰得更漂亮”,而是让每一项可用性判断都有清晰的证据与边界。
五、隐私、授权与最小必要:合规不是交付末端的附加项
肿瘤病例数据涉及高度敏感的健康信息。专题建设将把合法授权、来源审核、去标识化、最小必要、项目边界和访问控制前置到数据工程流程中。对病历文本,需要识别和处理可能导致个人再识别的直接标识;对 DICOM、WSI 及其衍生文件,需要同时关注文件头元数据、图像烧录文字和附带文档的敏感信息风险;对外部来源材料和合作数据,则应核对数据使用范围、授权材料、伦理或合规文件的适用性。
合规的另一层含义,是不让技术语言越过医学边界。数据集可为研究队列构建、方法开发、模型评测、数据治理和真实世界研究准备提供基础,但不能因此被表述为诊疗系统,更不能由数据完整性推导出诊断准确性、疗效预测能力或临床决策结果。本专题及其后续项目将持续使用“建设需求”“拟覆盖”“按授权确认”“项目验收”等表达,清晰区分研究基础设施与医疗服务。
六、从数据工程到研究协作:朗慧科技的能力定位
医疗人工智能走向真实研究场景后,瓶颈往往不在单一模型,而在数据链条的每一个接口:临床专家是否能理解队列定义,数据工程师是否能保留原始语境,合规人员是否能核查来源边界,算法团队是否能识别质量限制,项目管理是否能将上述要求固化为可交付、可验收的工作包。朗慧科技以数据资产、专业标注和行业专家网络为基础,正在将这种跨角色协作能力沉淀为项目化的数据基础设施方法。
此次肿瘤数据集专题的推出,体现了公司对医疗数据集建设的一项基本判断:越接近高价值研究问题,越需要以高标准保护数据的时间、关系、原始性和不确定性。 高质量不是抽象口号,而是体现在一份病程是否完整、一次检查是否可追溯、一个标本是否可关联、一个结局是否有依据,以及一批交付是否能被独立复核。对于不同的研究目标,数据目录、观察窗口、模态优先级和验收阈值也不应一刀切,而应在项目开始前共同明确。
朗慧科技诚邀医疗机构、科研团队、药企、生物技术企业和人工智能研发团队,就目标癌种、队列定义、观察窗口、数据模态、去标识化要求、质量门控和交付边界开展专业交流。公司将以合法合规为前提,围绕具体研究问题提供数据字典梳理、质量方案设计和项目化建设支持,共同推动医疗数据从“可存放”走向“可理解、可追溯、可审计”的长期价值。
参考资料
- Zhuang L, et al. Advancing Precision Oncology Through Modeling of Longitudinal and Multimodal Data. IEEE Reviews in Biomedical Engineering, 2026.
- National Cancer Institute. Imaging Data Commons.
- Sivarajkumar S, et al. A multimodal generative model for structured and unstructured electronic health records. npj Health Systems, 2026.
声明:本文为数据集建设专题新闻,所有病例数、模态、时间范围及质量要求均为建设规格或目标描述。相关数据仅在合法授权、去标识化、最小必要和项目约定边界内评估与交付;本文不构成任何医疗建议、诊断、疗效预测或医疗器械性能承诺。