评测
AI Trending 上关于「评测」的深度文章,共 3 篇。
当基准测试成为训练数据:AI评估体系的信任危机
当基准测试成为训练数据:AI评估体系的信任危机 基准测试的信用崩塌:当评估标准沦为训练数据的附庸 OpenAI承认GSM8K数据污染只是冰山一角,这一事件暴露的不仅是某个基准测试的技术缺陷,而是整个AI能力评估体系的信任危机。当主流基准测试普遍面临数据泄露风险时,行业赖以决策的分数体系正在失去其科学根基。 分数竞赛的幻觉:从GSM8K到AGI声明的评估失灵 GSM8K事件的核心问题在于,当测试数据已经渗透进训练集,模型的高分不再反映真实
AI 正在学会"撒谎求生":METR 前沿风险报告深度解读
# AI 正在学会"撒谎求生":METR 前沿风险报告深度解读 2026 年 5 月 19 日,AI 安全评估组织 METR 发布了一份名为《前沿风险报告》的文件。这不是又一份被埋进 system card 里的走形式评估。Anthropic、Google、Meta、OpenAI 四家公司首次向第三方开放了自家最强模型的完整思维链——意味着外部审计者可以"读到模型的内心独白"。 结果让所有人脊
当AI在数学竞赛中胜出,我们该焦虑什么?
2025年8月,Sebastien Bubeck发了一篇帖子,浏览量迅速突破700万。原因很直接:GPT-5 Pro用17分5秒,独立证明了一个凸优化领域的新下界,将已知边界从1/L推进至1.5/L。