10月7日,Anthropic上线Claude Haiku 5.5,AWS官方博客同日宣布其登陆Bedrock,量子位次日跟进解读。这款「小杯」模型把价格与跑分同时打到新低位:跑分超越被视为小模型「斩杀线」的DeepSeek V4.1 Flash与GLM-5.3-Flash,官方数据更逐项压过GPT-6 Luna;Yahoo Finance直言AI价格战正在加剧。
价格:一年降了九成
定价最受关注:10万token以内的请求(约占上代请求量的90%)输入输出价格直降90%,超出部分也有50%折扣——一年前的Haiku 4.5价格是它的10倍;折算下来,除缓存命中输入外,Haiku 5.5已比DeepSeek V4.1 Flash便宜。
关键数字速览
· OSWorld 2.1(真实电脑操作):Low档42.0%准确率、单次成本0.07美元;Max档72.4%、0.61美元;上代Haiku 4.5 Max档仅15.7%、成本1.45美元
· GDPval-AA v2.1(44个职业真实工作):Low档Elo 1125、0.01美元;Max档1620、0.87美元;上代Max档仅735
· Terminal-Bench 4.0:Haiku 5.5得分39.2%,Sonnet 5.5为70.6%
· Sonnet 5.5缓存读取从0.20美元/百万token降至0.10美元,Anthropic称多数Agent任务成本可降约20%
小杯仍是小杯:替不了Sonnet
跑分之外要保持清醒:Anthropic自己也建议复杂Agent编码优先使用Sonnet 5.5或Opus 5.5。Terminal-Bench 4.0上39.2%对70.6%的差距说明,复杂多步编码与长周期自主规划仍是大杯领地;Haiku 5.5的价值在执行层——任务已拆解、验收明确、可并行推进。Cognition的Devin以Opus 5.5为主模型、Haiku 5.5为子智能体,在FrontierCode上跑到66.2%,比各自单跑都高——编排优于单点。
tokenizer暗坑与五处不兼容变更
需要注意的是,Haiku 5.5换了与Sonnet 5.5、Opus 5.5同款的tokenizer,同样任务会消耗更多token,实际节省低于标价折扣。API层面还有五处不兼容变更:budget_tokens改为自适应思考加effort参数、temperature/top_p/top_k全部锁定默认值、取消assistant消息预填充、计算机操作工具从computer_20250124更新为computer_toolset_20260801、响应首块可能是思考块需按type字段过滤。这也是首个支持effort五档调节(low到max)的Haiku。
价格战的红利,属于提前做好评测、路由与迁移抽象的工程团队——「换个模型名就上线」的时代结束了。
至此Claude家族形成三层结构:Opus 5.5管复杂推理、Sonnet 5.5管通用执行、Haiku 5.5管跑量与速度。九天技术在天行平台的模型路由遵循同一思路——按任务复杂度与成本动态分层调度,让小模型承接高频执行层任务,把AI边际成本真正打下来。(信息综合自量子位、Anthropic官方、AWS官方博客、Yahoo Finance等公开报道)