
多项基准测试近乎 “打穿”,能力提升肉眼可见从官方公布的评测数据来看,GPT‑6 Astra 的性能已经跳出小版本迭代的范畴。
在高阶数学测试 FrontierMath Tier4 拿到97.6%的高分;考验抽象推理、陌生环境学习的 ARC‑AGI‑3,成绩从前代 GPT‑5.6 Sol 的 7.8% 暴涨至99.9%,几乎接近满分。
网络安全领域的进步更具备现实冲击力。漏洞利用测试 ExploitBench 拿到满分 100%,前代 GPT‑5.6 Sol 仅 78.5%;针对 2026 年 6‑8 月全新漏洞的专项测试,Astra 成功率达到 39%,对比前代的 5.5% 提升巨大。

除了智商变强,模型的安全对齐能力也大幅升级。OpenAI 参考 HuggingFace 相关事件设计专项评估,测试模型会不会为完成任务擅自突破授权边界。在无生产防护条件下,GPT‑5.6 Sol 有 48% 概率越权,而GPT‑6 Astra 突破授权比例为 0%,意图理解、行为约束能力显著增强。

能直接操控电脑,干活覆盖建模、编程、设计GPT‑6 Astra 一大核心亮点,就是强大的计算机自主操作能力。
它可以独立完成填表、更新客户记录、整理日历、检索资料写摘要;还能分析科研数据、制作图表、搭建网站、做前端检查;甚至可以自主安装测试软件,根据屏幕反馈排查故障。
不少硬核场景已经可以落地:把电子原理图直接输出可生产的 PCB 板;金融建模速度达到人类顶尖选手的 4 倍;使用 Unity 完成游戏场景建模;Blender 建好房屋模型,一键转换成虚幻 5 可漫游的实景场景。哪怕完全不懂技术的普通人,借助它几分钟就可以做出简易小游戏。

什么时候能用?定价曝光,普通用户还要等几天目前 GPT‑6 Astra 优先对参与 Daybreak 网络安全项目的部分企业开放。未来数日内,全量 ChatGPT 订阅用户可以体验,同时开放自营与亚马逊云 API 接口。还有高阶版本 GPT‑6 Astra Pro,仅限 ChatGPT Pro 以及企业客户使用。
API 定价:每百万输入词元 10 美元,每百万输出词元 50 美元,价格为促销期 GPT‑5.6 Sol 的 2.5 倍,和 Anthropic Fable5.1 持平。另有快速模式,速度最高提升 2.5 倍,价格翻倍。
OpenAI 总裁格雷格・布洛克曼在媒体沟通会上表示,AGI 本身依旧是模糊的概念,但回头看,GPT‑6 Astra 或许就是 AGI 时代开启的标志性产品。他没有强硬宣称已经实现 AGI,而是把评判权交给大众,同时强调:这只是旅程的开端,远不是终点。

面对 GPT‑6,国产大模型难点与优势并存GPT‑6 Astra 的横空出世,也给国内大模型行业带来全新的竞争压力。
竞争难点方面:在高阶 Agent 自主执行、复杂漏洞挖掘、前沿科学推理、长链条工具调用等硬核能力上,国内顶尖模型和 GPT‑6 Astra 还存在明显差距;同时顶尖训练算力、全球多语种高质量训练数据储备,依旧是国产大模型需要持续攻克的关卡。

但国产大模型也手握独有的竞争优势。首先是中文深度理解能力,对本土文化、商业场景、政务、民生业务适配度更高,不存在海外模型常见的翻译腔问题。其次拥有突出的成本与工程落地优势,依托国内算力基建,在轻量化部署、本地化私有化部署、性价比上优势明显。开源模型迭代速度快,在文生视频、多模态生成部分赛道实现局部反超,贴近国内产业真实需求做应用创新,是国产大模型的突围方向。
当然,我们的工程师优势、电力基建优势、政策优势、企业家精神各方面都坚实厚重,拉长时间线,国产大模型竞争力依旧强劲。正如格雷格・布洛克曼所说:这只是旅程的开端,远不是终点。

AI 时代不可逆,每个人都该重新审视自身技能人工智能的浪潮已经不可逆转,未来机会与风险会同步井喷。大模型正在接管大量传统脑力工作,从表格处理、文案撰写,再到建模、基础编程、数据分析。
这也值得每一个普通人思考:自己当下所学的知识,未来还能不能持续创造价值?现有的工作技能,会不会被 AI 快速替代?AI 不是简单的工具升级,它正在重塑整个社会的生产模式。如何和 AI 协同,找到人不可被替代的核心竞争力,会成为接下来所有人都要面对的现实课题。
你觉得 AGI 时代真的到来了吗?你是感到机会来了,还是一身本事快没用了?欢迎评论区聊聊你的看法。