AI News AI资讯 1d ago Updated 18h ago 更新于 18小时前 52

AI chatbots reading X-rays can be dangerously confident even when they're wrong 阅读X光片的AI聊天机器人在出错时可能表现出危险的自信

RadLE 2.0 introduces a scoring system that penalizes overconfident errors and rewards honest uncertainty, prioritizing safety over raw accuracy in radiological diagnostics. Human radiologists significantly outperformed all 16 tested AI models on the primary metric, highlighting a critical gap in current AI's ability to self-assess reliability. While some models like Gemini 3 Pro achieved high raw accuracy, others such as Meta's Muse Spark 1.1 excelled at recognizing their limitations and deferri RadLE 2.0基准测试由Ashoka大学CRASH Lab开发,旨在评估放射科AI系统在诊断中的准确性、置信度及“知之为知之”的诚实退出能力。 评分机制惩罚高置信度的错误诊断,奖励诚实的“我不知道”,结果显示人类放射学家得分显著高于所有测试的AI模型。 不同模型表现分化:Anthropic Claude Fable 5在安全回答上领先,Google Gemini 3 Pro原始准确率最高,Meta Muse Spark 1.1最擅长识别何时移交人类。 研究指出当前许多AI模型(尤其是开源和医疗专用模型)存在过度自信问题,倾向于在不确定时强行给出错误答案,而非保持沉默。 尽管AI准确率快速提

72
Hot 热度
78
Quality 质量
75
Impact 影响力

Analysis 深度分析

TL;DR

  • RadLE 2.0基准测试由Ashoka大学CRASH Lab开发,旨在评估放射科AI系统在诊断中的准确性、置信度及“知之为知之”的诚实退出能力。
  • 评分机制惩罚高置信度的错误诊断,奖励诚实的“我不知道”,结果显示人类放射学家得分显著高于所有测试的AI模型。
  • 不同模型表现分化:Anthropic Claude Fable 5在安全回答上领先,Google Gemini 3 Pro原始准确率最高,Meta Muse Spark 1.1最擅长识别何时移交人类。
  • 研究指出当前许多AI模型(尤其是开源和医疗专用模型)存在过度自信问题,倾向于在不确定时强行给出错误答案,而非保持沉默。
  • 尽管AI准确率快速提升,但缺乏自我认知限制使其无法独立承担临床决策,且过度依赖AI可能导致医生技能退化(如结肠镜检测率下降)。

为什么值得看

这篇文章揭示了当前医疗AI评估的一个关键盲区:仅关注准确率而忽视不确定性管理,可能导致危险的过度自信诊断。对于AI从业者和医疗行业而言,它强调了构建具备“自知之明”和诚实退出机制的AI系统的重要性,为未来医疗AI的安全部署提供了重要的评估框架和警示。

技术解析

  • RadLE 2.0评估体系:包含200个放射学案例,测试16个模型。核心指标结合诊断准确性与置信度评分(0-4级),允许模型选择“我不知道”。
  • 奖惩计分逻辑:正确且高置信度得满分;错误且高置信度扣除相应分数;选择“我不知道”得零分但不扣分。这种机制旨在抑制模型的幻觉和过度自信。
  • 模型性能对比:人类专家总分988.7/2000;最佳AI模型仅758分。Gemini 3 Pro在纯准确率上接近人类住院医师水平,但在综合置信度评分上落后。
  • 特定模型表现:Anthropic Claude Fable 5在可靠和安全回答方面表现最佳;Meta Muse Spark 1.1通过降低幻觉率,在识别何时移交人类方面表现最好;Grok 4.5则显示出更高的幻觉率和过度自信倾向。
  • 数据趋势:相比RadLE 1.0中最佳模型仅30%准确率,三个月内Gemini 3 Pro已超越住院医师水平,表明准确率提升迅速,但自我认知能力滞后。

行业启示

  • 从“准确率优先”转向“可靠性优先”:医疗AI的开发和评估必须纳入不确定性量化和诚实退出机制,防止因过度自信导致的误诊风险,尤其是在高风险临床场景中。
  • 警惕AI依赖带来的技能退化:研究表明过度使用AI工具可能导致医生核心诊断技能下降(如“Google Maps效应”),行业需在引入AI的同时设计机制以保持人类专家的专业能力。
  • 理性看待AI替代论:尽管AI在特定任务上进步神速,但缺乏整体情境理解和自我认知限制使其短期内无法完全替代人类医生,投资者和公众应警惕夸大AI能力的宣传,关注其在辅助而非自主决策中的角色。

Disclaimer: The above content is generated by AI and is for reference only. 免责声明:以上内容由 AI 生成,仅供参考。

Healthcare AI 医疗AI Evaluation 评测 Benchmark 基准测试 Ethics 伦理 Security 安全