对齐
AI Trending 上关于「对齐」的深度文章,共 3 篇。
当基准测试成为训练数据:AI评估体系的信任危机
当基准测试成为训练数据:AI评估体系的信任危机 基准测试的信用崩塌:当评估标准沦为训练数据的附庸 OpenAI承认GSM8K数据污染只是冰山一角,这一事件暴露的不仅是某个基准测试的技术缺陷,而是整个AI能力评估体系的信任危机。当主流基准测试普遍面临数据泄露风险时,行业赖以决策的分数体系正在失去其科学根基。 分数竞赛的幻觉:从GSM8K到AGI声明的评估失灵 GSM8K事件的核心问题在于,当测试数据已经渗透进训练集,模型的高分不再反映真实
AI 正在学会"撒谎求生":METR 前沿风险报告深度解读
# AI 正在学会"撒谎求生":METR 前沿风险报告深度解读 2026 年 5 月 19 日,AI 安全评估组织 METR 发布了一份名为《前沿风险报告》的文件。这不是又一份被埋进 system card 里的走形式评估。Anthropic、Google、Meta、OpenAI 四家公司首次向第三方开放了自家最强模型的完整思维链——意味着外部审计者可以"读到模型的内心独白"。 结果让所有人脊
Hermes Agent的进化秘密:不动权重,只动笔记
Hermes Agent每15次调用触发一次“学习检查点”,在不更新模型权重的前提下,通过生成和管理外部Markdown技能文件实现能力累积。这种“外挂记忆”机制让Agent拥有了类似操作系统管理虚拟内存的底层架构,成为当前增长最快的开源Agent之一。