训练数据目录
先按任务方向筛选,再由项目团队确认数据范围、授权、质量口径、样例与交付状态。目录用于评估起点,不替代项目验收说明。
医疗健康 — 新增数据集
医学杂志文章语料(图文病例、影像配文等),附带可说明的转授权路径。采购前核对授权范围、可再分发边界与不能提供项。
500 万例结构化体检记录(按例计数)。性别约 1:1、多年龄段分层。与「带原文报告的 2,000 组」定制子集不是同一产品。
带原文报告的定制子集,按组与份计数。适用于需要报告全文与历史对比的训练场景;不是 500 万例结构化库。
脱敏电子病历语料,覆盖主诉、现病史、既往史、入院与出院等字段。采购前确认切片范围、脱敏规则与不可提供项。
涵盖医学教科书、临床指南、综述文章、药物说明书等海量权威医学知识内容。
约 500 万例 12 导联心电图波形图及诊断报告(按例计数)。含自动分析与医生审核口径;样例受控提供,授权与不可提供项在合作阶段核对。
皮肤镜图像、皮损临床照片与病理金标准报告配对。适用于分类/检测任务;计数口径、脱敏与授权边界见详情与合作说明。
胸部平片与配对报告,用于检测/分类等影像任务。详情页说明模态、质控与授权边界;样例走受控评估。
500万例头部CT平扫+增强DICOM序列影像及诊断报告,涵盖脑梗死、脑出血、颅内肿瘤等。
高质量眼底彩色照片及结构化诊断报告,基于ICDR国际标准糖尿病视网膜病变分期。
全切片数字图像(20倍+扫描倍率)及完整病理诊断报告,含免疫组化结果、TNM分期。
500万例内窥镜视频+关键帧截图+诊断报告,含息肉位置/大小/分型。
500万例上腹部多器官癌症标注,覆盖肝/胆/胰/脾/肾上腺/肾/腹腔淋巴结。
500万例病理诊断全流程图像+文本,覆盖完整诊断链路。
500万例疑难病MDT会诊文本,罕见病/复杂病AI训练,高难度病例稀缺数据。
100万例慢病纵向追踪结构化数据,连续7+次住院追踪。
500万例Qupath精细区域标注,HCC/ICC/MID/TLS/MVI六类标签。
100万例肝脏病变图像标注,肝癌与血管瘤鉴别。
100万例乳腺肿瘤图像标注,乳腺癌AI筛查与诊断。
2000万份住院全周期文本/PDF,涵盖病历质控/DRG/DIP。
医疗健康 — 存量数据集
100万+份深度体检报告,800+结构化医学字段。
328,000条电子病历、诊断报告、医嘱、文献摘要的NER与关系抽取标注数据集。
52,800例DICOM影像及专业医师标注。
52,800例肝细胞癌多序列MRI DICOM影像及专业医师标注。
覆盖CT、X-Ray、超声、MRI四大模态的医学影像通用标注数据集。
100万+标注手术视频帧,24类解剖结构与手术器械像素级语义分割。
百万级妇产科临床数据集,覆盖产前急症、高危妊娠、分娩产后等全孕期场景。
52,800例DICOM影像及专业医师标注。
100万+例舌面/面部影像及50,000+例专业标注。
100万+超声影像标注帧。
100万+DICOM影像切片,覆盖7大器官,薄层CT 512×512+。
AI Coding 数据集 NEW
Agent 评测与任务环境 HOT
DeepResearch 与高难度专家标注 NEW
具身智能数据集 HOT
面向2026年具身智能与世界模型前沿需求,提供Ego-centric行为、人形机器人模仿、世界模型评测、跨本体统一、双臂仿真、触觉力控、工业装配、商业零售、物流分拣、家庭服务、办公文档、餐饮服务等多场景高质量数据,支持LeRobot 3.0格式与JSON元数据交付。
覆盖日常生活、厨房、办公与零售场景的第一视角长视频,配合头部IMU、凝视点与手部关键点标注。适用于VLA模型预训练、Ego4D/EgoSuite类任务与以人为中心的世界模型。
按 episode 计数的人形模仿语料(Stereo RGB-D / 本体感觉 / 力)。适用于模仿学习与策略训练评估;模态矩阵、同步口径与授权在详情页与合作阶段核对。
面向生成式世界模型的大规模评测基准,涵盖动态场景物理一致性、可交互物体轨迹预测、相机视点变换与长期 rollout 稳定性测试。含JSON元数据与真值标注。
医药NEW
全新上线,覆盖药品结构化数据、中药方剂与医疗器械耗材三大医药数据资产。
医保NEW
全新上线,覆盖医保结算清单、DIP病种分组、DRG分组编码与医保支付标准数据。
产业经济
民生
AI+科学家
覆盖数学、物理、化学、计算机等学科高难度题目与详细解答,适用于推理模型训练。
多学科标准化试题与解析,支持智能出题、错题诊断与个性化学习模型。
历年真题、模拟卷与考生作答数据,适用于教育评估与智能阅卷算法研发。
学术文献摘要、引用关系与关键词标注,支持文献检索、综述生成与科研知识图谱。
科技政策、专利、技术标准与产业动态数据,支持科技情报分析与AI4S应用。
高难度多学科专家级问题与答案,用于评估大模型推理能力与知识边界。
AI+安全
覆盖网络攻击、社会工程与提示注入等攻击样本,支持红队测试与安全对齐训练。
安全模型检测边界与误报案例分析,帮助识别防御盲区与提升鲁棒性。
C/C++缓冲区溢出漏洞代码与触发输入样本,支持二进制安全与静态分析模型训练。
路径穿越与目录遍历攻击Payload集合,覆盖多种编码绕过形式,用于文件操作安全检测。
多源日志、流量与告警关联样本,支持SOC智能研判与ATT&CK技战术识别模型。
法律
AI+法律前沿进展(2025-2026)
朗慧法律数据布局 — 长沙朗慧信息科技有限公司
朗慧科技深耕法律AI数据服务,构建覆盖法律问答、裁判文书、合同审查、法律检索、司法推理五大领域的多模态法律数据底座,为法律大模型训练提供高质量、合规授权的专业语料。
海洋法系选择题、案例分析题与判例推理题,支持法律教育AI与司法考试模型。
真实起诉状、答辩状与上诉状样本,支持法律文书生成与格式审查模型训练。
海量中国裁判文书,覆盖案由、事实、理由与判决结果,支持类案推荐与量刑预测。
中央及地方法律、行政法规、司法解释结构化数据,支持法规检索与合规问答。
多类型合同与风险条款标注,支持合同智能审查、条款抽取与风险评估模型。
常见法律问题与专业律师回答配对,支持法律智能客服与问答大模型微调。
裁判文书摘要与争议焦点抽取语料,服务案例速读与类案摘要生成。公开文书来源与字段口径可在合作阶段核验;非法律意见产品。
法律文本中当事人、法条、法院、案由等实体标注,支持法律NER与信息抽取。
案件事实到法律适用与判决结果的推理链数据,支持司法推理大模型训练。
中英等多语种法律文本对照语料,支持跨境法律翻译与国际合规模型。
典型应用场景
文化艺术
古籍、书法、篆刻、甲骨文与金石拓片高清图像及释文标注,支持文化遗产数字化与书法生成模型。
世界模型
多视角物体与场景照片集合,配套相机位姿、内参与稀疏重建结果,支持NeRF/3DGS/Gaussian Splatting重建与世界模型训练。
无人机航拍正射与倾斜摄影数据,包含POS、RTK坐标、云台角度与大范围场景Mesh,适用于城市级三维重建与仿真环境构建。
车载/机载/地面站LiDAR扫描点云,含回波强度、语义类别与轨迹信息,支持高精地图、数字孪生与自动驾驶世界模型。
输入照片与对应高质量三维模型、纹理与材质配对数据,支持图像到3D生成、单目重建与AIGC 3D内容生产。
园区、校园、工厂、古建筑与城市街区的高精三维场景数据,包含语义分割、实例标注与可交互对象,支持数字孪生与仿真训练。
复杂三维模型按功能、结构与装配关系拆分的训练数据,包含部件级语义、装配顺序与约束关系,支持可拆装数字孪生与机器人装配规划。
需要更多行业数据集?定制你的专属数据方案
目录持续更新,当前以本页列表为准(对外口径:110+ 数据集 / 15 大领域)。如需定制采集与标注,请提交需求由顾问确认范围与交付方式。