Anthropic 发布 Claude Opus 5.5,这是 Claude 5.5 系列的首款模型。Anthropic 表示,它在多数任务上的能力已经接近 Claude Fable 5.1,同时相比 Opus 5,典型工作负载的运行成本降低约 40%,输出速度提高超过 30%。Sonnet 5.5 和 Haiku 5.5 计划在未来几周陆续推出。
Opus 5.5 的提升主要集中在长时间编程任务和智能体工作。早期测试中,有用户让模型在不到一天内完成约 68 万行代码的迁移;另一项 20 万行代码库审查与修复任务耗时不到 3 小时,而 Opus 5 超过 20 小时。在 Anthropic 公布的评测中,Opus 5.5 在 Terminal-Bench 4.0 得到 66.4%,FrontierCode v1.1 得到 54.4%,CursorBench 4.0 得到 57.8%。不同模型使用的推理强度和测试设置并不完全相同,因此这些成绩更适合用来观察模型自身的能力变化。
知识工作也是这次更新的重要部分。GDPval-AA v2.1 测试覆盖 44 类真实职业任务,Opus 5.5 获得 1846 Elo。Anthropic 还测试了企业研究、财务分析、Excel 建模和演示文稿制作。在一项虚构并购分析中,Opus 5.5 用 63 分钟完成财务模型和管理层演示,Opus 5 用时 93 分钟,前者的成本低约一半。
价格也同步下调。API 输入价格从 Opus 5 的每百万 token 5 美元降至 4 美元,输出从 25 美元降至 20 美元;缓存读取从 0.50 美元降至 0.20 美元。Fast mode 最高可达到普通模式约 2.5 倍的速度,对应价格为输入 8 美元、输出 40 美元。
Anthropic 还专门调整了模型的表达方式。Opus 5.5 会减少术语堆积和冗长说明,把重要信息放得更靠前,并更严格地遵循用户给出的写作规则。多家早期测试企业反馈,在长时间编程、代码审查和知识工作中,新模型需要的步骤和 token 更少,输出也更容易直接使用。
#AI #Claude #Anthropic #模型
