内科多系统综合
心电图判读/胸片判读/血气分析/肺功能报告/超声心动图等。综合症状+检查结果的鉴别诊断。
证据:MedBench v4 综合诊断 48.1%(GPT-4o)。
朗慧AI STEM-Questions · 学科中心
专为SOTA多模态大模型打造。覆盖临床医学、医学影像诊断、基础医学、药学、公共卫生与护理六大子领域,统一5模型×5轮通过率≤40%难度门槛。人类专家准确率≥95%,零MedBench/NEJM重合。
健康与医学是朗慧AI题库中规模最大的学科板块(占总量30%),也是SOTA多模态大模型公认的最困难领域之一。MedBench v4 显示 GPT-4o 在医学影像判断题上仅 45.3%,NEJM Image Challenge 临床平均正确率仅 37%。朗慧医学题库覆盖 6 大子领域与 7 大高价值难点,全部经人类专家诊断金标准校准(双审制),确保推理链路中的每个诊断结论都可在教科书或临床指南中找到依据。
心电图判读/胸片判读/血气分析/肺功能报告/超声心动图等。综合症状+检查结果的鉴别诊断。
证据:MedBench v4 综合诊断 48.1%(GPT-4o)。
术前影像判读(CT/MRI)+ 术式选择 + 术后并发症管理。
证据:NEJM Image Challenge 37%。
创伤FAST评估/中毒识别/心肺复苏决策。
X光平片/CT平扫+增强/MRI多序列。500万例胸部X光平片+500万例头部CT。
证据:GPT-4o 影像判断 45.3%(MedBench v4)。
腹部/心脏/血管/妇产超声图像及报告。100万+标注帧。
病理WSI全切片(20倍+扫描倍率)、免疫组化、内窥镜视频+关键帧。
大体解剖图、组织学切片(HE染色/特殊染色)、胚胎发育图。
生理机制图、病理生理过程示意图。
药物作用机制图、剂量-反应曲线、药物相互作用。
处方审核、治疗药物监测(TDM)、个体化用药方案。
流行曲线、传播动力学模型、暴发调查。
筛查策略、风险比/比值比、生存分析Kaplan-Meier曲线。
护理评估流程图、生命体征趋势图、体位摆放。
无菌操作、引流管护理、压疮分级评估。
| 难度 | 学段 | 占比 | 典型题型 |
|---|---|---|---|
| L1 大学低年级 | 大一-大三(基础医学) | 10% | 基础解剖/组织学识别 |
| L2 大学高年级 | 大三-大五(临床课程) | 45% | 典型病例+单图诊断 |
| L3 执业医师 | 执业医师考试难度 | 35% | 多图+鉴别诊断+治疗方案 |
| L4 专科难度 | 主治/专科培训 | 10% | 罕见病+多学科会诊MDT |
题干:附胸部正位X光平片。右肺中野可见大片状均匀高密度影,边界模糊。请回答该病变最可能的诊断及需要鉴别的两种疾病。
答案:大叶性肺炎(右肺中叶实变)。鉴别诊断:肺不张、胸腔积液。
5模型评测
题干:附12导联心电图。II/III/aVF导联ST段抬高≥1mm,V4R导联ST段抬高。请回答:(1) 最可能的罪犯血管;(2) 心梗定位。
答案:(1) 右冠状动脉(RCA);(2) 急性下壁+右室心肌梗死。
5模型评测
题干:附乳腺穿刺活检HE染色病理全切片(局部视野)。请描述镜下所见主要异常,并给出可能的病理诊断及免疫组化推荐。
答案:浸润性导管癌(非特殊类型),组织学分级II级。推荐免疫组化:ER/PR/HER2/Ki-67。
5模型评测
JSONL批量下载:完整字段+图片URL+5模型评测+推理链。
REST API:GET /DataAssetsAPI/stem-questions/medical。企业API Key请联系 lk@langhuiai.com。
每道入选题目须在 GPT-5.1、Claude Opus 4.6、Gemini-3.1-Pro、Qwen3.6-Plus、DeepSeek-V4 上各运行5轮,累计正确 ≤10/25(通过率≤40%)方可入选。人类专家准确率≥95%,实施双审金标准。
健康与医学占总题库30%,覆盖文本+图像(X光/CT/MRI/超声/病理/内窥镜/DICOM多序列)+ 结构化数据(心电图波形/实验室检查数值)。
所有含诊断结论的题目均需经两位主治及以上职称医生独立审核,分歧交由第三位主任医师仲裁。诊断结论可在教科书或临床指南中找到依据。
所有数据均已经过脱敏处理(去除姓名、住院号等13类PHI标识),按《个人信息保护法》要求处理,并参考 HIPAA 相关要求(非认证)。
无。经pHash + n-gram指纹去重,与MedBench v4 / NEJM Image Challenge / MIMIC-CXR / CheXpert 等8个公开基准重合度<0.5%。