Anthropic 推出新旗舰 Claude Opus 5:性能直逼 Fable 5,价格仅为其一半
type
status
date
slug
summary
tags
category
icon
password
网址
人工智能领域的竞争再度升级。Anthropic 正式推出了其最新旗舰模型 Claude Opus 5。在面临来自 OpenAI 的 GPT-5.6 Sol 以及中国竞争对手的激烈价格竞争下,Anthropic 将 Opus 5 定位为一款极具性价比的高端替代方案。它不仅在多项基准测试中逼近、甚至超越了定位更高的 Claude Fable 5,而其 Token 资费却仅为 Fable 5 的一半。
极致性价比:直逼 Fable 5 的性能与减半的资费
对于企业和开发者而言,Claude Opus 5 最具吸引力的莫过于其定价策略。Opus 5 维持了前代 Opus 4.8 的价格标准:每百万输入 Token 收费 5 美元,每百万输出 Token 收费 25 美元。相比之下,Claude Fable 5 的输入和输出单价分别高达 10 美元和 50 美元。这意味着,用户可以用一半的预算,获得极度接近甚至在部分场景超越旗舰水平的体验。
为了优化使用成本,Opus 5 提供了五档“投入度”(Effort)设置:低、中、高、极高和最高。Anthropic 官方建议用户在大多数场景下使用“低”或“中”档位,它们能在极低的延迟和成本下输出优质结果。而在编程或复杂智能体任务中,则推荐从“极高”档位起步。
基准测试爆表:ARC-AGI-3 展现惊人推理力
在各项主流学术与工业基准测试中,Claude Opus 5 表现抢眼。在衡量前沿智能体终端编程能力的 Frontier-Bench v0.1 测试中,Opus 5 取得了 43.3% 的佳绩,远超 Fable 5(33.7%)和 GPT-5.6 Sol(34.4%)。在知识工作基准 GDPval-AA v2 测试中,Opus 5 同样以 1861 的 Elo 得分领跑。
最令人意外的突破发生在 ARC-AGI-3 基准测试中。该测试旨在评估模型在没有记忆模式的情况面面临全新问题的逻辑解决能力。在此项测试中,Opus 5 取得了 30.2% 的高分,而前代 Opus 4.8 仅为 1.5%,GPT-5.6 Sol 仅为 7.8%。Opus 5 的得分接近竞争对手的四倍,展现出了令人瞩目的逻辑推理深度。
强大的自主工具构建与自我修正能力
除了跑分抢眼,Opus 5 在实际复杂工作流中也表现出了极强的自主性。Anthropic 透露,该模型具备极强的自我检查和迭代修正能力。例如,在一项要求根据机械零件图纸在 FreeCAD 中重建 3D 模型的任务中,Opus 5 在无法直接查看图像的情况下,自行编写了一套计算机视觉代码流水线来提取像素中的几何信息,并成功完成了建模。在五次尝试中,其他同类模型均未能解决该任务。
此外,该模型在实际的开源软件维护和金融数据流构建中也展现了出色的生产力,能够精准定位社区补丁遗漏的边界情况并予以修复。
局限性与安全边界
尽管性能强悍,Opus 5 并非全能。在 DeepSWE v1.1 编程测试中,它以 68.8% 稍逊于 GPT-5.6 Sol 的 72.7%。在医疗与法律等特定垂直领域的表现也略输于 Fable 5 和 Mythos 5。
出于安全合规考量,Anthropic 有意未对 Opus 5 进行网络攻击任务的训练。虽然它在寻找系统漏洞方面与 Mythos 5 齐平,但在漏洞利用(Exploitation)的开发上能力较弱。不过,其安全过滤器的误触发率比 Fable 5 降低了约 85%,显著改善了此前用户抱怨的“因过度安全限制导致正常请求被阻断”的问题。
结论
Claude Opus 5 的发布标志着大模型市场进入了“高性价比前沿模型”的竞争阶段。通过极致的 Token 效率优化和强悍的推理能力,Anthropic 成功在降低企业使用门槛的同时,维持了技术领先地位。目前,该模型已成为 Claude Max 的默认模型,并已向 Claude Pro 用户开放。开发者还可以通过 API 体验 Mid-Conversation Tool Changes 等最新测试功能。
Loading...
.png?table=collection&id=cbe6506e-1263-8358-a4d7-07ce62fcbb3f&t=cbe6506e-1263-8358-a4d7-07ce62fcbb3f)