这篇的关键点基准里的高准确率,不能直接转换成现实门诊的诊断准确率。
比一次性问答多了什么
微软在 2025 年 6 月介绍 MAI-DxO 与 SD Bench:将 304 个 NEJM 病例改造成可以逐步提问、请求检查和提交诊断的任务。编排器模拟不同推理角色,并在推进前核对成本与推理。官方报告的最佳配置在该基准达到 85.5%。
怎样理解这个结果
这是复杂病例构造的研究评测,检查成本也是评测设定。它没有直接测量真实门诊中的安全性、患者沟通或长期健康结果。病例分布和可用信息与日常就医不同,因此不能把这个百分比作为面向公众自动诊断的可靠性承诺。
本站分析 · 产品推演
值得复用的工程设计
我们的产品推演:做就诊准备工具时,可借鉴“先找缺失信息”的流程。先整理用户已经提供的事实,再列出时间、持续情况、既往检查等尚未明确的问题;每一步说明为什么需要这条信息,允许跳过。
在内部保留事实表、相互矛盾的信息和推理版本,最终输出一份可供医生快速查看的材料摘要。评估应关注虚构事实率、遗漏率和问题是否重复;不要用增加智能体数量来代替证据核对。
原始来源
事实段落依据下列资料整理;产品方案与评价指标为本站分析。资料核对日期:2026-09-08。
- Microsoft AI · MAI-DxO 与 Sequential Diagnosis Benchmark ↗来源日期 2025-06-30