政策
AI Trending 上关于「政策」的深度文章,共 1 篇。
当基准测试成为训练数据:AI评估体系的信任危机
当基准测试成为训练数据:AI评估体系的信任危机 基准测试的信用崩塌:当评估标准沦为训练数据的附庸 OpenAI承认GSM8K数据污染只是冰山一角,这一事件暴露的不仅是某个基准测试的技术缺陷,而是整个AI能力评估体系的信任危机。当主流基准测试普遍面临数据泄露风险时,行业赖以决策的分数体系正在失去其科学根基。 分数竞赛的幻觉:从GSM8K到AGI声明的评估失灵 GSM8K事件的核心问题在于,当测试数据已经渗透进训练集,模型的高分不再反映真实