研究论文
CLINLENS:面向长程临床编码智能体的多模态基准
arXiv 新论文提出 200 题临床多模态基准 CLINLENS,揭示当前 AI 编码智能体在纵向临床数据分析中「可运…
2026.07.30 · 周四约 2 分钟阅读
arXiv 近期发布论文《ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science》,提出面向临床数据科学的 AI 编码智能体基准 CLINLENS,旨在系统评估大模型在真实纵向医疗记录上完成可审计分析任务的能力。论文指出,既有医学 AI 评测多聚焦于医学问答、结构化表格推理或通用科学代码库,难以衡量智能体在跨模态、跨时间的临床数据上完成端到端分析的水平。
基准设计:四类时间范围 × 五类分析能力
CLINLENS 共包含 200 个可执行任务,覆盖五项互联的 MIMIC 数据资源:
- 结构化电子健康记录(EHR)
- 临床笔记(notes)
- 心电图(ECG)
- 胸部 X 光(chest radiographs)
- 超声心动图(echocardiograms)
在任务维度上,论文设计了 4×5 的分类体系,将四种「患者时间范围」(patient-time scopes)与五种分析能力交叉组合,从而覆盖从单次就诊到长程随访的多层次临床场景。
评测机制:程序优先的反向合成
论文采用「program-first reverse synthesis」方法,对每个受限的半原始数据包配套一个评估方私有的参考工作流,并校验其必须产出物、人群与时间语义以及最终答案。这一机制强调对分析流程的完整审计,而非仅看最终数值是否匹配。
关键结果:可运行与正确之间存在巨大鸿沟
在固定的 126 题子集上,论文测试了 24 种标准化的「模型-脚手架」配置:
- 最佳配置仅取得 56.3% 的 scope-macro STRICTPASS,尽管其 EXECSUCCESS 达到 100%;
- 单独配置的编码智能体可解决 126 题中的 83 题;
- 五套在 GPT-4o-mini 上适配的生物医学专用系统,scope-macro STRICTPASS 最高仅为 2.9%。
论文由此揭示出当前 AI 编码智能体在临床数据分析中普遍存在「能跑通代码≠给出正确分析」的显著能力缺口,强调面向长程、多模态临床数据的智能体仍是亟待突破的方向。
