即梦AI视频
当前位置:首页>AI资讯>Claude Opus 5 发布:性能翻倍价格不变,逼近 Fable 5

Claude Opus 5 发布:性能翻倍价格不变,逼近 Fable 5

7 月 24 日,Anthropic 正式发布 Claude Opus 5,这是 Claude 系列 Opus 层级的新一代模型。官方对其定位是「以一半的价格接近 Claude Fable 5 的前沿智能」——不追求成为体系内最强的模型,而是把重心放在可被日常高频调用的能力密度上。发布同日,Opus 5 已在 Anthropic 全平台上线,并成为 Claude Max 的默认模型与 Claude Pro 订阅可使用的最强模型。

从模型定位看,Opus 5 处在 Anthropic 现有层级结构的中段偏上位置。其上是 Mythos 层级的 Claude Fable 5 与访问受限的 Claude Mythos 5,其下是主打高性价比的 Sonnet 5 与轻量场景的 Haiku 4.5。Opus 5 接替 Opus 4.8 成为该层级的旗舰,API 模型 ID 为 claude-opus-5。官方未公开该模型的参数规模与上下文窗口。

技术表现方面,Anthropic 公布了一组自测基准数据。在编码与知识工作评测 Frontier-Bench 与 GDPval-AA 上,官方称 Opus 5 达到新的 SOTA 水平;在 Frontier-Bench v0.1 上,其表现为 Opus 4.8 的两倍以上,且单任务成本更低。在 CursorBench 3.2 的最高 effort 档位下,Opus 5 得分与 Fable 5 的峰值成绩相差不到 0.5%,而单任务成本约为后者的一半。考察陌生问题求解能力的 ARC-AGI 3 上,官方称其得分为次优模型的三倍;在计算机操作基准 OSWorld 2.0 上,Opus 5 以约三分之一的成本超过了 Fable 5 的最佳成绩。科研方向的提升同样被单独提及,该模型在 Anthropic 的全部生命科学评测中均优于 Opus 4.8,其中从光谱数据推断分子结构一类的有机化学任务在内部基准上高出 10.2 个百分点,蛋白质序列变异的功能预测任务高出 7.7 个百分点。需要说明的是,上述数据均为厂商自测结果,尚无第三方独立复现。

在实际应用层面,这些能力提升指向的场景相对明确。例如,软件工程团队可以将其用于跨文件的大规模重构与疑难缺陷的根因定位,官方案例中模型在一个开源包管理器的真实缺陷上找出了社区补丁遗漏的边界情况;Agent 开发者则可以把它作为长链路自主任务的底层模型,在缺乏现成验证条件时由模型自行搭建测试手段;企业自动化团队可以用它端到端跑通业务流程,Zapier 在其 AutomationBench 上的反馈是模型完整执行了一套客户流失预防流程,包括标记风险账户、通知责任人并为留存团队生成摘要;专业知识工作者——法律、金融、科研方向——则可以借助其在数值推理、表格处理与文书批注上的改进处理精度敏感的任务。

本次升级中最受关注的一点,是模型自我校验与迭代能力的增强。Anthropic 在公告中给出的典型例子是一项 Frontier-Bench 任务:模型被要求根据一张机械零件图纸编写代码,将其重建为 3D FreeCAD 模型,但被刻意剥夺了直接查看图纸的能力。Opus 5 的应对方式是自行编写一套计算机视觉管线,从原始像素中提取几何信息,进而完成整个零件的重建,并可重复成功;在相同条件下,其他参与对比的模型经过五次尝试均未能解决。多家早期客户的反馈也集中在效率而非峰值能力上:法律 AI 公司 Harvey 称 Opus 5 在较低推理档位即可达到 Opus 4.8 最高推理档的质量,平均 token 消耗降低约 26%;应用开发平台 Lovable 则强调该模型在其内部评测中「运行间波动明显更小」,认为这种稳定性对批量构建场景比分数本身更重要。

安全与对齐是本次发布的另一条主线。Anthropic 表示,在部署前的自动化行为审计中,Opus 5 的整体失准行为得分为 2.3,为其近期模型中最低,欺骗性行为比例最低,也最不易被诱导至滥用场景。安全能力方面,官方称 Opus 5 未针对网络安全任务进行专门训练,但随着通用能力提升,其漏洞发现能力已接近 Mythos 5,而在将漏洞转化为可用攻击手段这一环节仍显著落后。相应的安全策略是:允许模型在源代码中发现漏洞,但阻断二进制漏洞扫描、渗透测试与漏洞利用生成。官方预计其分类器的触发频率约为 Fable 5 的 15%,在 Claude.ai、Claude Code 与 Claude Cowork 中,被标记的请求将默认回退至 Opus 4.8。

可用性与定价方面,Claude Opus 5 的 API 价格为每百万输入 token 5 美元、每百万输出 token 25 美元,与 Opus 4.8 完全一致,约为 Fable 5 的一半。模型另提供约 2.5 倍默认速度的 Fast 模式,在 Claude Platform 上按基础价格的两倍计费,在 Claude Code 中通过用量额度使用。与既往 Opus 模型一致,Opus 5 在通用访问下不设数据保留要求。与模型同步发布的还有两项 Beta 功能:Claude Platform 支持在会话中途变更可用工具而不使 prompt 缓存失效;API 侧新增自动回退能力,被安全分类器标记的请求可自动路由至其他模型,而非直接被阻断。

整体来看,Claude Opus 5 的发布反映出模型竞争重心的一次位移。当各家旗舰在绝对能力上的差距逐步收窄,单位成本下能完成多少有效工作,正在取代基准峰值成为更受关注的指标。Anthropic 这次没有宣称推出了最聪明的模型——那个位置仍属于 Fable 5——而是选择在价格不变的前提下把性能推上去,并反复强调 token 效率与运行稳定性。对高频调用的开发团队与企业用户而言,这类改进的实际价值可能高于榜单排名的变化。不过公告中的对比数据目前仍全部来自厂商自测与早期客户反馈,其真实表现还有待更广泛的实际使用与第三方评测检验。

豆包AI助手
©版权声明:如无特殊说明,本站所有内容均为AIHub.cn原创发布和所有。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。否则,我站将依法保留追究相关法律责任的权利。