人工智能

为何最新版本的 Claude 聪明两倍却也昂贵两倍

Anthropic 发布 Claude Fable 5.1,在关键基准测试中性能翻倍,同时保持溢价定价。了解这将如何影响您的 AI 预算。
为何最新版本的 Claude 聪明两倍却也昂贵两倍

大多数人认为软件更新就像手机更新一样,能以同样的价格获得更多功能。Anthropic 刚刚随着 Claude Fable 5.1 的发布打破了这一循环。虽然该模型的性能远强于其前代产品,但它在市场中的定位却很奇特。它的运行成本是 Anthropic 仅在两个月前发布的模型的两倍,这要求用户在点击提交按钮之前更仔细地考虑他们的预算。

Anthropic 在本周二发布了 Claude Fable 5.1 及其兄弟模型 Mythos 5.1。这是自 6 月份初代 Fable 5 发布以来,高端 Mythos 系列的首次重大更新。此次发布是在公司经历了一个混乱的三个月之后进行的。在此期间,Anthropic 面临了为期 18 天的出口管制停摆以及一场定价纠纷,这让许多用户怀疑他们究竟应该使用哪种模型。

智力飞跃背后的数学逻辑

要理解这次更新的重要性,你必须观察这些模型是如何测试的。Anthropic 使用一种名为 Terminal-Bench-Science 0.1 的测试。该基准测试衡量 AI 代理是否能在计算机终端内执行科学研究任务。它本质上是测试 AI 是否能像一名不知疲倦的实习生一样,在没有人类帮助的情况下熟练操作实验室计算机。

Fable 5.1 在这项测试中获得了 52.6% 的分数。相比之下,之前的版本 Fable 5 仅获得了 24.7%。中端旗舰模型 Opus 5 的分数为 29.0%。通俗地说,新模型在复杂科学推理方面的能力是其取代的旧模型的两倍多。在三个月内实现这种程度的进步在行业内是不寻常的,因为进步通常以个位数来衡量。

在另一项针对编程的测试——Terminal-Bench 4.0——中,该模型表现出了类似的进步。Fable 5.1 正确完成了 55.8% 的任务。这比 Fable 5 的 42.0% 有了显著提升,并稳稳领先于 Opus 5 的 52.3%。数据表明,对于使用 AI 编写、运行和调试代码的人来说,Fable 5.1 现在是 Anthropic 阵容中的首选。

模型名称 科学基准测试分数 编程基准测试分数 输入价格(每 100 万 token) 输出价格(每 100 万 token)
Claude Fable 5.1 52.6% 55.8% $10 $50
Claude Fable 5 24.7% 42.0% $10 $50
Claude Opus 5 29.0% 52.3% $5 $25

高级推理的隐藏成本

虽然性能的提升令人印象深刻,但定价却给普通用户带来了两难境地。7 月份,Anthropic 发布了 Opus 5。该模型大受欢迎,因为它比旧的 Fable 5 更好,但成本却只有一半。在几周的时间里,高端的“Fable”层级似乎已经消亡,因为更便宜的模型反而更好。

Fable 5.1 通过夺回性能桂冠改变了这一现状,但它保持了原有的高价:每百万输入 token 10 美元,每百万输出 token 50 美元。Token 是驱动 AI 的数字原油。它们是模型处理的小块数据,大约等于 750 个单词。如果你是一名每小时运行数千个请求的开发人员,支付 10 美元还是 5 美元就是盈利月份与亏损月份之间的区别。

Anthropic 正试图通过一项名为“推理力度”(reasoning effort)的新功能来缓解这一冲击。用户可以像转动拨盘一样,不再为每项任务都全速运行模型。该公司声称,在低或中等力度水平下运行 Fable 5.1 提供的结果优于旧的 Fable 5,但成本更低。然而,对于需要模型解决其他 AI 无法处理的问题的用户,他们将不得不支付全额溢价。

管理数据缓存

在某个领域,新模型对每个人来说都客观上更便宜了。Anthropic 将缓存读取的成本降低了 75%。在 AI 架构的世界里,缓存就像是把书翻开在特定的一页,这样你就不用再次查找。如果你要求 AI 在一小时内分析同一份 500 页的文档十次,缓存可以避免 AI 每次都重新阅读整份文档。

对于典型工作,这降低了约 25% 的成本。对于高度代理化的工作负载——即 AI 连续执行数十个小步骤以完成一个项目——节省的费用可达 45%。这使得 10 美元的价格对于高级用户来说更容易承受,但它并没有改变单个问题的入门价格依然很高这一事实。

访问新模型的方式也是分级的,这可能会让标准订阅者感到沮丧。如果你拥有 Claude Pro 计划或标准的 Team 席位,Fable 5.1 不包含在你的固定月费中。你必须单独购买使用额度,类似于预付费手机的工作方式。只有那些使用昂贵的 Max 计划或高级 Enterprise 席位的用户才能将该模型包含在订阅中,即便如此,它也只能覆盖其每周使用限制的 50%。

为什么过滤器很重要

Anthropic 在发布 Fable 5.1 的同时也发布了 Mythos 5.1。该公司称这些是具有不同安全过滤器的相同底层模型。Fable 5.1 是公众使用的版本。它具有严格的保护措施,以防止其协助危险活动。

Mythos 5.1 则不同。它仅限经过审核的网络安全和生命科学领域的专业人士使用。这些专家需要 AI 了解病毒的工作原理或黑客如何入侵系统,以便他们建立更好的防御。由于 Mythos 5.1 的过滤器较轻,它在编程测试中的得分实际上更高——为 60.9%,而 Fable 5.1 为 55.8%。这种差距的存在是因为标准安全过滤器有时会将合法的编程任务误认为是恶意任务,并阻止 AI 完成它们。

这对你的工作流程意味着什么

如果你将 AI 用于基础任务,如总结电子邮件或撰写求职信,你可能应该忽略 Fable 5.1。Opus 5 模型对于日常工作仍然是更好的选择。它快速、便宜,且完全能胜任常见的写作任务。使用 Fable 5.1 进行邮件总结就像雇佣一名火箭科学家来帮你做四年级的数学作业。

然而,如果你是一名软件工程师或研究人员,情况就不同了。以 52% 的成功率完成科学研究任务的能力是一项基础性的改变。这意味着 AI 正在从简单的文本生成器转变为能够处理多步骤流程的功能性代理。对于这些用户来说,高昂的价格是为节省时间而进行的实际权衡。

从大局来看,Fable 5.1 表明 AI 行业正分裂成两条路径。一条路径专注于让 AI 对大众来说尽可能便宜。另一条路径(以 Fable 5.1 为代表)则是在不计成本地推高计算机能力的上限。作为消费者,你现在必须决定你是在为基础工具还是高性能引擎付费。观察你下周的使用习惯。如果你发现自己要求 AI 将同一个任务做三次才能做对,那么从长远来看,更聪明模型的溢价实际上可能会帮你省钱。

资料来源:
Anthropic Official Technical Announcement (September 2026)
Terminal-Bench Science 0.1 Performance Report
Anthropic API Pricing Schedule
Cyber and Life Sciences Verification Program Documentation

bg
bg
bg

另一边见

我们的端到端加密电子邮件和云存储解决方案提供了最强大的安全通信手段,确保您的数据安全和隐私。

/ 创建免费账户