Anthropic刚推的Claude Haiku 5.5,两个核心数字先记牢:OSWorld 2.1评测成绩从上代的15.7%跳至72.4%,平均运行成本直接砍了75%。但有个容易忽略的点:复杂编程任务,它和Sonnet 5.5的差距,没缩多少。
操作能力跳涨,复杂编程还差一截
OSWorld是测模型做连续界面任务的:比如点按钮、输内容,还要跟着页面变化调整后续动作。Haiku 5.5的成绩从15.7%蹦到72.4%,说明它干这类活靠谱太多——批量填表单、处理简单桌面操作,比上代顺手太多。
但编程这块差距还没补。FrontierCode主测试里,Haiku 5.5得46.4%,Sonnet 5.5是52.1%,差得不算特别多,但到了Terminal-Bench(测命令行多步骤任务:读文件、跑命令、处理错误),它只有39.2%,Sonnet 5.5冲到70.6%。Anthropic自己都明确说:Sonnet和Opus还是适合复杂智能体编程,Haiku只做明确的子任务、摘要这类轻量活。
自适应推理:不再固定“思考预算”
之前Haiku 4.5要开发者设死“思考Token数”,不管是查日期还是比合同,推理空间都卡死。现在Haiku 5.5改了Adaptive Thinking:模型自己选什么时候加推理、加多少,开发者只设Effort档位。
比如提取发票日期这种简单活,模型少推理、省算力;对比三份合同的条款差异,就让它多跑几步逻辑。但这里有坑:推理会占用输出Token预算——要是之前按答案长度设输出上限,现在内部推理占了空间,正文可能打不完;还有响应里会带独立的思考数据块,应用得分开处理,不能像以前那样直接拿开头当最终答案。
百万上下文没统一低价,Token费要算细
Haiku 5.5支持100万Token上下文,能放下整个代码库、长文档,这个量不小。但定价不是一口价:不超10万Token,输入每百万0.1美元,输出0.5美元;超过10万的话,输入输出单价直接翻5倍,这可不是小数目。
缓存也分层:短提示每百万缓存读取0.01美元,长的0.05美元。Anthropic说上代90%的请求都在10万以内,这部分降本明显,但分词器变了——同一段文字的Token数可能和上代不一样,计费得重新测。还有长期智能体任务,每次带完整历史,输入会越来越长,得用Prompt缓存,还要做上下文压缩,不然成本涨得比省得快。
这波更新是给Haiku升级了“干活能力”,但没补全它的短板。企业要迁移的话,要么测自己的任务是不是在它擅长的范围,要么算清Token成本,别光看降七成的宣传。最后问一句:你会选降本的Haiku处理日常活,还是选编程稳的Sonnet啃复杂任务?
素材来源:雷峰网 · AI情报、大模型、AI应用落地、AI基础设施
查看报道原文
本文由 WeValue 情报引擎基于公开报道整理改写

发表第一条评论吧