GPT6真是太厉害了,看看这个分数,你的Agent又要更新了
GPT-6 Astra 来了。
我们希望它将开始开启新一代创业、科学发现和创造的新时代。
我们相信它是世界上最适合计算机使用、专业工作、科学、编码、网络安全等领域的最佳模型。
我们花了一些额外时间来确保能够满足这一能力水平所需的安全和对齐标准,但我们认为你会觉得等待是值得的。
它在 FrontierMath Tier 4 上得分 98%,在 ARC-AGI 3 上得分 99.9%,在 ExploitBench 上得分 100%。
什么概念? OpenAI公司训练这个模型之后没有立即发布,而是先想到了合规,能力这么强,被用到邪恶的地方怎么办,如何管控?
网上一度怀疑人家是作秀,学习A社做营销,结果现在开始内测了,大家可以试试,账号充满哈
官方这个跑分大概是用codex跑出来的,大家如果用其他的agent工具,可能效果会有折扣。
我现在日常还用gpt5.5 ,5.6很少用,太贵了。不过的确效果是递增的,比之前用的5.4效果好很多,5.5和5.4价格一样,就用5.5了。
而且我还删了一堆harness指令,大家可以仔细斟酌下自己的agent中配置的指令,真的不用写这么多,写的多不代表效果好!
我之前为了保障流程能够稳定,还特别加了文件schema协议,就是每次agent都按照协议输出,上一个agent执行完输出,下一个agent启动时读取这个schema接力,这样能保证无论是串联agent工作就还是并连subagent,都能让流程执行完,保证loop不会断,这是一个小技巧。
现在不用这么写了,gpt5.6试用的时候,我已经开始大刀阔斧地调整架构了,之前是大模型跑偏偷懒,要给他一条路线,一个目标,一个schema约束。
现在这个思路得转一转了,大模型太强了,不要让他超出你的范围,跑得太快,把你的活都干完了,用力过猛,死得更快。大模型不会死,死的是项目,死的是创业的机会。
不说了,要下车了,关注我,下次细聊!
