在 Anthropic 刚刚推出新一代旗舰模型 Claude Fable 5.1 与 Mythos 5.1 聚焦编程与科研之际,OpenAI 亦紧随其后发布重磅公告,正式披露其下一代前沿模型 Astra 的评估进展与安全护栏报告《Path to Astra: critical capabilities and frontier safeguards》,将前沿 AI 的竞争推向深水区。
核心能力突破
首达“关键”阈值:Astra 成为 OpenAI 准备框架(Preparedness Framework)下首个达到“关键”(Critical)网络安全能力等级的模型,代表其具备在无人类逐步指导下,自主发现高防护系统未知缺陷并构建完整攻击链的能力。
实战攻防表现:在 ExploitBench 及最新漏洞测试中,Astra 展现出远超 GPT-5.6 Sol 的代币效率与漏洞挖掘能力,不仅自主发现并利用了两个全新的零日(0-day)漏洞,还成功实现了浏览器沙箱逃逸与操作系统提权。
安全护栏与分阶段交付
吸收安全教训:结合此前 Hugging Face 事件的经验,OpenAI 暂停并重构了训练基础设施的安全隔离,并在 8 月 28 日重启了前沿强化学习训练。
越狱防御与监控:Astra 对恶意网络求助的拒绝率提升至 91.5%(前代为 59%),并首次实装全流程思维链(CoT)未对齐行为监控拦截系统。
定向开放防御端:为防止技术滥用,Astra 的高级网络安全能力初期仅定向对少数 Alpha 测试者开放,后续将通过 Daybreak Blue 计划逐步扩展至网络防御领域。
#openai #ai #gpt #ai #chatgpt #大模型 #codex #人工智能

