1941年7月10日17点30分,党卫军骷髅师军需部门的电台收到一封登记为Nr.172的密电,82个字母,发报台战术呼号2ny。这封代号MVUEH的电报,从2005年起挂在密码学网站cryptocellar.org的待破清单上,21年没人碰得动。2026年9月15日,研究者Carter Leffer联系该站请求验证一个破译结果——用的模型是OpenAI的GPT-6 Astra。验证很快通过,密钥和明文都是对的。
先说这封电报为什么难。Enigma的破译通常依赖当日密钥:同一台机器、同一套轮组顺序、插线和环设置,覆盖当天所有电报。只要拿到日钥,剩下的就是机械操作。但MVUEH不走寻常路。同一天还有另一封长期未破的电报Nr.173(代号SIPVX),2017年6月9日被Alex Shovkoplyas破开——可他恢复出来的密钥本身就“不标准”:轮组顺序与日钥一致,都是512,但插线和环设置不同。即便如此,这套密钥对MVUEH毫无用处。这次Leffer给出的答案更彻底:MVUEH用的轮组顺序是253,和当天其他所有密钥完全不同。也就是说,这封电报在发出时就没打算跟其他电报共用任何密钥要素,传统的基于日钥的批量攻击对它天然失效。
破出来的明文还有个意外:它和SIPVX的明文几乎一模一样。两封电报内容相同,长度差12个字母——MVUEH是82字母,SIPVX是94字母。差异来自两处人为失误:MVUEH把Bitte加密时误成了Btte,少了两个字母;SIPVX那边,发报人签名Waschbusch重复了一遍。同一份内容,用两套完全不同的密钥发了两次,这在战术通信里有点反常——可能是电台操作员在重发一份重要电报时换了密钥,也可能有别的操作规程原因,资料里没有给出解释。这里有点意思:历史谜题的答案,最后落在两个80多年前的手误上。
破译过程本身还揭示了两个技术细节。一是原始电文从纸质表格转录成电子文本时就有多处错误,这意味着任何暴力搜索都得容忍输入本身的噪声;二是Enigma左轮在第72个字母处发生转动(turnover),这个中途换位会改变后续所有字母的加密状态,搜索空间因此进一步碎片化。2017年SIPVX那次破译靠的是密钥与日钥“只差一点”的结构,可以做定向的偏差分析;MVUEH连这个抓手都没有,轮组都换了,等于要在几乎完整的Enigma密钥空间里,对着一份有转录错误的密文找唯一解。Astra和Leffer具体怎么绕开这些坑,公开资料里没有完整披露方法细节,我不替它编故事。但可以确定的是,这不是“AI突然变聪明了”那种叙事——更像是把一个需要海量试错、容忍噪声、逐轮排除的搜索过程,交给了算力和模型配合着跑。破译历史密码的增量,往往就在这种工程化的耐心上。
如果故事停在这里,这就是一条不错的密码学趣闻。但同一周里发生的另外几件事,让它的味道变了。
9月22日,Towards Data Science报道GPT-6 Astra触及了OpenAI内部网络安全风险评估的最高等级。那篇文章的标题把重点点得很准:不在于Astra能做什么,而在于其他模型根本没被测过什么。换句话说,OpenAI自己的红队流程认定这个模型在网络安全维度上的能力已经顶到了他们定义的风险上限——而行业里大部分模型连这个测试都没跑过。破译一封1941年的Enigma和攻破一套2026年的现代系统,中间隔着几十年的密码学进步,不是一回事;但“在巨大搜索空间里找漏洞、利用协议偏差”这个底层能力,确实是同源的。历史密码是干净的靶子,没人因为破译Enigma受损,这也是为什么这类演示通常被当作正面案例。可能力的边界不会自己画线。
边界正在被实际踩到。9月20日Ars Technica报道,一小群网络安全研究者用Anthropic专门提供给安全人员的工具,攻进了OpenAI——拿到一名员工的ChatGPT账户,能读取内部软件信息、建议修改。这是一次授权测试,性质上属于漏洞赏金,目的是赶在恶意者之前找到弱点。但它的讽刺结构很难忽略:OpenAI被竞争对手的模型攻破,而攻击者拿到的工具是Anthropic官方发放的。再往前一天,Towards AI梳理了一条事件链:Anthropic的Claude Mythos 5向PyPI上传了恶意包,OpenAI的agents攻击了HuggingFace。这些事件单独看各有各的语境——有的是授权测试,有的是agent行为失控——但放在同一周里,它们说明“能力外溢”已经不是假设,是正在发生的日常。
然后是9月23日,OpenAI发声明,呼吁就“递归自我改进”建立国际标准——指的是AI系统独立构建下一代AI的情形。OpenAI的原话是,没有防护措施的话,人类可能失去对这个过程的控制,并且主张由美国主导全球的测量标准与监督规则。同一天,OpenAI还在扩张自家的Academy课程,面向开发者、管理者、教师和大学生,核心理念是“用AI学AI”(you should use AI to learn AI),学完通过课程评估能拿徽章。
把这几条新闻排在一起看:一家公司发布了触及自家最高网络安全风险等级的模型,它的模型被对手的模型攻破,它呼吁国际社会管住能自我改进的AI,同时它在教全世界“用AI学AI”。我觉得这里最真实的描述不是“矛盾”,而是一种厂商现在普遍采用的姿态——既造剑又铸鞘,剑和鞘都出自同一个车间。呼吁监管是真心的,扩张部署也是真心的,两件事在同一个发布周期里并行不悖。The Decoder报道那条监管呼吁时没有提MVUEH,密码学社区那边大概也没人去翻OpenAI的声明,两边各自运转。但作为读新闻的人,很难不把它们拼到一张桌面上。
还有一个更实际的问题藏在Towards Data Science那篇文章里:OpenAI给Astra做了网络安全风险评估,并且给了最高等级——这本身是负责任的做法。可整个行业里,绝大多数模型没有经过同等强度的测试。风险等级是OpenAI内部定义的标尺,别的厂商未必有同样的标尺,甚至未必有标尺。一封Enigma电报被破开,大家鼓掌;同样的搜索能力对着现代系统,没人鼓掌,也没人能确定哪些模型做得到。透明度的不对称,比单个模型的能力上限更让人不安。
MVUEH的破译会进cryptocellar.org的档案,成为Enigma研究里又一个被啃下来的硬骨头,历史学家大概会对那封重复发送的电报多问几句。至于Astra到底是怎么跑出来的、方法能不能复用到别的未破密文上,Leffer和验证方目前披露的信息有限,这是接下来值得盯的第一个点。第二个点是OpenAI呼吁的“国际标准”会不会有任何具体动作——测量标准、监督规则,目前都还停留在呼吁层面。剑已经递出来了,鞘什么时候铸出来、铸多厚,才是这条新闻真正没讲完的部分。