导航菜单
首页
排名 涨幅榜 跌幅榜 24h成交额 新币榜 概念版块
快讯 机构 人物 观点 专题

Anthropic发布Claude Fable 5.1和Mythos 5.1,关键基准测试性能翻倍

人工智能公司Anthropic于周二发布了Claude Fable 5.1和Claude Mythos 5.1,这是自6月9日Fable 5发布以来对Mythos系列模型的首次更新。公司声称新AI模型是“全球最先进的编程和知识工作模型”,而此次发布距离上次更新已有三个月,期间经历了18天的出口管制停机、关于订阅访问权限的夏季中期定价争议,以及7月发布的以更低价格冲击Fable 5的Claude Opus 5。

Myriad: When will OpenAI release GPT-6? Click to make your prediction.

据Anthropic介绍,Fable 5.1和Mythos 5.1本质上是相同的底层模型,只是附加了不同的安全过滤器。Fable 5.1对所有拥有Claude账户的用户开放,而Mythos 5.1仍仅限于通过Anthropic的网络安全验证计划和生命科学验证计划认证的专业人士使用,该计划是此前限制Mythos 5访问的Project Glasswing的继承者。

基准测试实际衡量了什么

Anthropic引用的核心数据来自Terminal-Bench-Science 0.1,该基准测试评估AI代理在命令行环境中完成科学研究任务的能力,以通过率计分。Fable 5.1达到52.6%,而Fable 5为24.7%,Opus 5为29.0%,性能较前代翻倍。Terminal-Bench 4.0则测试通过终端进行代理编程的能力——包括编写、运行和调试代码的多步命令行会话,以正确完成任务百分比计分。Fable 5.1得分为55.8%,高于Fable 5的42.0%和Opus 5的52.3%。Mythos 5.1在启用较轻网络安全过滤器的情况下,同一测试得分为60.9%;Anthropic表示差距反映了其安全机制拦截并转交至Opus 4.8处理的任务。

Anthropic发布Claude Fable 5.1和Mythos 5.1,关键基准测试性能翻倍

在“人类最后一场考试”(Humanity's Last Exam)中,这是一项包含数十个学术领域专家级问题的多学科推理测试,以通过率计分。Fable 5.1在不使用外部工具时达到60.9%,使用工具时达到65.0%,均领先于Opus 5,显示出这是Anthropic在学术用途上最先进的模型。

Anthropic发布Claude Fable 5.1和Mythos 5.1,关键基准测试性能翻倍

超越Opus 5之处以及模糊的数学

Opus 5于7月发布,每token价格仅为Fable 5的一半,却在大多数主要基准测试中超越Fable 5,实际上使旗舰模型对大多数付费用户失去了吸引力。Fable 5.1扭转了这一局面:它在Anthropic发布的所有基准测试中均击败Opus 5,包括Opus 5此前曾领先Fable 5的测试项目。但Fable 5.1每token成本仍是Opus 5的两倍——输入10美元、输出50美元,而Opus 5为输入5美元、输出25美元。Token是模型处理信息的基本单位(通常相当于英语单词的三分之二),企业按用量付费,因为重度工作流通常很快耗尽订阅计划中的配额。

Anthropic对模型的推广侧重于推理努力级别而非原始得分:公司表示,将Fable 5.1设置为低或中等推理努力级别,其表现即可匹配或超越Fable 5的旧结果,且成本更低,同时将顶级努力级别保留给其他模型难以解决的高难度问题。对于日常任务而言,这种“跳过Opus 5”的论点随着努力级别调低而减弱。

访问权限遵循与Fable 5相同的分层模式,这已是Anthropic数月调整后的结果。在Pro计划以及标准Team或Enterprise席位中,Fable 5.1完全使用按量付费的API信用额度(按API费率计费),因为该模型不属于这些计划的每周使用限额范围。在Max计划以及高级Team或Enterprise席位中,Fable 5.1作为订阅标准部分包含在内,最多可覆盖每周50%的使用量。

Claude Fable 5.1现已通过Claude API、Amazon Bedrock、Google Cloud和Microsoft Foundry提供,模型ID为“claude-fable-5-1”。