首页文章详情

Claude Sonnet 5.5深夜空降,一半价格击败Opus,开发者实测账单暴涨

智东西2026-09-29 10:16
Anthropic称新模型速度提升超30%,成本降低近30%。

智东西9月29日消息,今日凌晨,Anthropic发布Claude 5.5系列第二款模型Claude Sonnet 5.5,主打快速、高性价比。

Anthropic在博客中透露,相比Claude Sonnet 5,新模型速度提升超30%,成本降低近30%,更擅长处理日常任务,如修复错误、创建文档、制作幻灯片和电子表格等。

先来看几项关键指标,Sonnet 5.5在多项指标中可对标Opus 5.5,相比Sonnet 5有数倍提升。Anthropic称,这是首个仅通过截图就能赢得《口袋妖怪红》游戏的Sonnet模型。在Artificial Analysis上,Sonnet 5.5在AI分析指数上得分为56,仅次于Opus 5.5的58分,该榜单上Claude系列模型包揽前三席。

价格方面,Claude Sonnet 5.5定价与上一代相同,即每百万输入token 2美元(约合人民币13.4元),每百万输出token 10美元(约合人民币60.1元),每百万token的缓存读取操作需0.20美元(约合人民币1.34元)。不过,其博客提到,模型在实际完成任务时,单任务成本比Claude Sonnet 5要低30%。

官方放出的案例显示,Sonnet 5.5复原魔方时仅花费10秒、0.11美元(约合人民币0.74元)就完成任务。

Artificial Analysis的榜单显示,Sonnet 5.5单任务输出token数量更多,其单任务成本为7.60美元(约合人民币51元),比Sonnet 5的单任务成本高出约50%,接近于Opus 5.5的7.63美元(约合人民币51.2元)。

不少开发者实测发现,Sonnet 5.5的成本非常高,“建议坚持使用Opus 5.5”。

Claude Sonnet 5.5现已在全平台上线,包括AWS、谷歌云以及微软Azure。开发者可在Claude 平台通过模型标识符claude-sonnet-5-5接入使用。如果原先在Sonnet模型上关闭思考功能,迁移至Sonnet 5.5前,需要切换至新的between_tools参数配置,该配置可保持前置思考功能处于关闭状态。

Anthropic还透露,其专为高并发和成本敏感的应用而设计的Claude Haiku 5.5,将在未来几周发布。

01.数位开发者实测对比:效果惊艳但烧不起,一款射击游戏花费上千元

不少开发者实测对比了Sonnet 5和Sonnet 5.5,两代模型之间的性能提升幅度肉眼可见。

知名开发者@_re_pete对比了Sonnet 5和Sonnet 5.5生成落叶模拟器的效果。可以看出,Sonnet 5.5的落叶飘落效果更自然,整体画面更和谐。

在不到一分钟内,开发者@kevin_t_ngo让Sonnet 5.5通过JavaScript动画展示了恐龙的历史,其还对比了Sonnet 5和Sonnet 5.5的生成结果。Sonnet 5.5生成的动画主题形象明确,还能添加配套文字,生成带叙事感的完整插画。

另一开发者对比了Sonnet 5.5与GPT-6 Sol、GPT-6 Astra的效果,其与GPT-6 Astra的差距并不大。Sonnet 5.5、GPT-6 Astra在生成骑自行车动作时没有出现太大瑕疵。

不过效果惊艳背后,用户实测发现Sonnet 5.5的成本并不低。

BridgeMind使用Sonnet 5.5制作了一款射击游戏,它称新模型表现出色,生成的游戏堪称神作,但构建成本要达到177美元(约合人民币1187元),耗时49分钟完成。

在下面开发者制作的城市模拟器案例中,Sonnet 5.5的效果明显比Sonnet 5更好,Sonnet 5.5的输出token数量为38万,花费了9.23美元(约合人民币61.94元),Sonnet 5为12万,花费4.85美元(约合人民币32.55元)。

另一开发者使用Sonnet 5.5制作了一个果酱西瓜浏览器动画,最终API使用成本约为8.20美元(约合人民币55元),其中代码与推理2.80美元(约合人民币19元)、缓存上下文数据3.6美元(约合人民币24.16元)、缓存写入操作1.8美元(约合人民币12.08元)、常规输入token 0.02美元(约合人民币0.13元),2/3的资源都被用于处理上下文相关任务。

02.多项测试可对标Opus 5.5,Anthropic建议开发者调节档位降成本

从Anthropic发布的基准测试来看,Sonnet 5.5在多项指标中已经超越比其性能更高的Opus 5.5模型。

具体来看,该基准测试对比了Sonnet 5.5、Sonnet 5、Opus 5.5、GPT-6 Sol四大模型在智能体编程、知识工作、多学科推理、电脑操作、图表识别等方面的性能。

和上代Sonnet 5对比,Sonnet 5.5在编程、图表识别上的分数提升了数倍;和GPT-6 Sol对比,Sonnet 5.5在智能体编程、知识工作、图表识别上都更优;Sonnet 5.5在主动编程领域上的分数甚至超过Claude Opus 5.5,其他几项与之相当。

下图是各模型在不同投入等级下的得分与单任务成本的对比曲线,数据点越靠近图表左上角,代表每花费一美元所能获得的模型能力越强。

在多项基准测试中,低/中等投入档位下的Sonnet 5.5能超越Sonnet 5的最高得分,而单任务成本仅为后者的约1/10。Sonnet 5.5在较低投入档位运行时,单任务成本更低,与Opus 5.5形成互补;拉高投入档位后,它可以达到接近Opus的性能,同时成本处于相近水平。

编程是Sonnet 5.5性能提升的一个突出场景。在智能体编程基准FrontierCode的高投入档位下,它的得分比同档位Sonnet 5高出10分左右,单任务成本仅约后者的1/15。

CursorBench基于Cursor真实编程会话任务开展测试,在该基准上,Sonnet 5.5的最高分与Opus 5.5差距仅约2分。

很多早期测试者称,在直接对比测试中,Sonnet 5.5能够将工具调用合并在一起,从而减少操作步骤、降低成本。

Sonnet 5.5在多项知识工作任务上均取得性能提升。GDPval-AA基准覆盖44个职业、9大行业的真实业务任务,在该测试中,Sonnet 5.5得分与Opus 5.5几乎持平,相比Sonnet 5高出约400分。在电脑操作与图表识别能力上,它的表现也十分接近Opus 5.5;而在长周期知识工作场景,其性能明显优于Sonnet 5和GPT-6 Sol。

价格方面,开发者调整投入档位,可在成本、响应速度与任务整体质量之间做权衡。在Claude Code以及Anthropic官方应用中,默认投入档位为中等(Medium);开发者平台Claude Platform默认档位为高(High)。

Anthropic官方称,档位较低时,Claude响应更快、消耗Token更少,适合常规事务处理;档位调高后,Claude会进行更长时间的推理,并对输出结果做更全面的自检核验。

03.大多数对齐性指标,与Sonnet 5相当

在其自动化行为审计中,Sonnet 5.5在大多数对齐性指标上均优于或达到与Sonnet 5相同的水平。由于其网络安全能力与Opus 5相当,因此它是首个具备网络安全防护措施和回退机制的Sonnet模型。其生物学安全防护机制与Sonnet 5相同。这两种安全防护机制都针对的是少数高风险操作;常规的软件开发和大多数生命科学领域的操作并未受到影响。

Anthropic研究人员在博客中透露,Sonnet 5.5并未突破其模型能力的前沿上限,因此他们将模型的对齐评估,聚焦于一组适用于所有能力等级模型的特定风险,包括损害用户利益、误导用户,以及被用于高风险恶意场景时产生协同危害。

研究人员开展自动化行为审计,在约1850个场景下对Claude进行测试。

结果显示,在对齐性、抗滥用能力与诚实度的大部分指标上,Sonnet 5.5相比Sonnet 5均有提升或持平。 在其新推出的隔离防护评估中,Sonnet 5.5尝试突破沙箱的概率接近本次测试中表现最优的Opus 5.5;并且在所有Anthropic模型里,它去试探容器防护边界的概率最低。他们没有发现Sonnet 5.5会去执行与用户意图相冲突的目标。

网络安全方面,Sonnet 5.5的网络安全相关能力相对Sonnet 5有提升,因此研究人员为其部署了与Opus 5.5相近的安全防护机制。用户仍然可以在常规软件开发流程中,利用模型查找并修复代码漏洞;但高风险网络安全任务会自动降级回Sonnet 5处理。

Sonnet 5.5沿用与Sonnet 5相同的生物相关安全防护机制。该防护体系针对有害请求;绝大多数科研、教育以及临床工作不受影响,但部分微生物学与病毒学相关请求可能出现误拦截。

在模型蒸馏防护方面,Sonnet 5.5是首款内置安全分类器以抵御推理提取攻击的Sonnet系列模型,并扩展了保留思考链路(preserved thinking)机制:Claude的推理思考过程无法脱离生成该内容的账号单独剥离。

此外,Claude Sonnet 5.5版本也提供了不保存任何数据功能的版本。

04.结语:Claude中端主力模型性能暴涨,但成本是个坎

Sonnet 5.5的升级,标志着Anthropic的主力中端大模型正在快速收窄与旗舰模型之间的能力差距。这或许会改变企业落地大模型的选型思路,不必一味追求最高规格旗舰,可采用主力模型承担绝大多数常规任务、旗舰模型仅处理高难度复杂任务的分层调用架构,在能力与成本之间找到更优平衡点。

不过综合开发者的实测结果来看,Sonnet 5.5在成本端并未实现大幅缩减。一旦面对复杂Agent任务,用户往往需要拉高投入等级来换取足够性能,此时单任务开销会明显抬升。

本文来自微信公众号“智东西”(ID:zhidxcom),作者:程茜,编辑:心缘,36氪经授权发布。