Claude Haiku 5.5 发布:小模型能力提升,定价对标 GPT-6 Luna

Latent Space1 天前

Claude Haiku 5.5 发布:小模型能力提升,定价对标 GPT-6 Luna

Anthropic 发布了 Claude Haiku 5.5,这是 Haiku 系列约一年以来的首次更新。官方称其为目前最便宜、最快、能力最强的 Haiku 小模型,并将其定价设计为与 OpenAI 的 GPT-6 Luna 竞争。

这次发布不仅包括新模型本身,还伴随 Sonnet 5.5 的部分降价、Claude 订阅用户 API 额度调整,以及 Claude SDK 中计算机使用与浏览器使用工具链的更新。

核心变化

1. Haiku 5.5 正式上线

Anthropic 表示,Haiku 5.5 相比 Haiku 4.5 平均运行成本降低约 75%。该模型已在 Claude Platform 和 Claude Code 中可用。

官方对它的定位并不是替代 Opus 或 Sonnet,而是作为高吞吐、成本敏感任务的“副手”模型,用于摘要、压缩、数据库查询等场景。典型组合是:由 Opus 5.5 或 Sonnet 5.5 负责复杂推理,Haiku 5.5 负责大量重复或轻量任务。

2. 分层定价

Haiku 5.5 采用按提示长度分层的价格:

提示长度 输入价格 / 100 万 tokens 输出价格 / 100 万 tokens 缓存读取 / 100 万 tokens
低于 100K tokens 0.10 美元 0.50 美元 0.01 美元
高于 100K tokens 0.50 美元 2.50 美元 0.05 美元

此外,5 分钟缓存写入价格为每 100 万 tokens 0.125 美元;超过 100K tokens 后为 0.625 美元。

3. Sonnet 5.5 缓存读取降价

Anthropic 同日下调了 Sonnet 5.5 的缓存读取价格:从每 100 万 tokens 0.20 美元降至 0.10 美元。

官方称,这会让 Sonnet 5.5 在多数长时间运行或智能体任务中降低约 20% 成本。

4. 订阅用户获得 API 额度

Claude Platform API 额度开始包含在部分订阅计划中:

  • Max 5x:每月 100 美元 API 额度
  • Max 20x:每月 200 美元 API 额度
  • Team:最高 500 美元共享额度

这些额度可用于任意模型,包括 Haiku 5.5,也可在第三方工具链中使用。

第三方评测结果

Artificial Analysis 发布了较完整的独立评测数据。

Intelligence Index:43 分

在最高努力档位下,Haiku 5.5 的 Artificial Analysis Intelligence Index 得分为 43,比上一代 Haiku 提高 26 分。

对比结果包括:

  • 略高于 GLM-5.3 Flash:42
  • 略高于 Gemini 3.8 Flash:41
  • 高于 GPT-6 Luna:38
  • 接近 Kimi K3:44
  • 低于 Claude Sonnet 5.5 最高努力档:56

Haiku 5.5 也是首个支持 Anthropic effort settings 与 adaptive thinking 的 Haiku 模型。

主要限制:token 消耗较高

评测指出,Haiku 5.5 的主要问题在于高努力档下输出 token 消耗明显偏高。

  • 最高努力档下,每个 Index 任务约使用 162K 输出 tokens
  • GPT-6 Luna 最高努力档约为 50K 输出 tokens
  • 从 xhigh 提升到 max,得分只增加 2 分,但 token 消耗约增加 1.8 倍
  • 在相同 38 分水平下,Haiku 5.5 high effort 使用约 55K tokens,GPT-6 Luna max 使用约 50K tokens

Artificial Analysis 同时说明,其成本计算尚未纳入超过 100K tokens 后 5 倍价格阶梯,因此单任务成本数据仍待更新。

其他评测指标

AA-Briefcase

在 Artificial Analysis 的私有智能体知识工作评测 AA-Briefcase 中,Haiku 5.5 得到 1578 Elo。

该成绩高于 Kimi K3 和 GLM-5.3,并与 Muse Spark 1.3 最高努力档接近。

Terminal-Bench 4.0

Haiku 5.5 在 Terminal-Bench 4.0 中得分 33%,而 Haiku 4.5 为 0%。

对比结果:

  • 与 GLM-5.3 Flash 持平
  • 高于 Gemini 3.8 Flash:20%
  • 高于 GPT-6 Luna:13%

需要注意的是,Anthropic 自身报告的 TerminalBench 数据为 39%,与该独立评测的 33% 不同。

知识与幻觉表现

在 AA-Omniscience 中,评测给出如下结果:

模型 准确率 幻觉率
Haiku 5.5 36% 40%
Gemini 3.8 Flash 55% 55%
GPT-6 Luna 44% 77%

评测认为,Haiku 5.5 准确率较低的一部分原因,是它更愿意回答“不知道”,而不是生成错误内容。

AutomationBench-AA

在 AutomationBench-AA 中,Haiku 5.5 得分为 35%,低于 Luna、Gemini 3.8 Flash 和 GLM-5.3 Flash 的 53%–60%。

评测提到,预发布版本存在一个安全相关 bug,导致模型过度拒答。Anthropic 正在修复,Artificial Analysis 计划重新运行评测,并预计分数会上升。

模型规格

Haiku 5.5 的主要规格包括:

  • 1M tokens 上下文窗口,高于 Haiku 4.5 的 200K
  • 支持文本和图像输入
  • 输出为文本
  • 支持 effort settings 和 adaptive thinking

另有报道称,其最大输出约为 12K tokens。

SDK 与生态支持

Anthropic 同日更新 Claude SDK,将计算机使用和浏览器使用工具集内置到 Python 与 TypeScript SDK 中。

新 SDK 可以运行 action loop,并把点击、键盘输入等操作发送到 browser_use、Browserbase、E2B 或 Daytona 等驱动。这样开发者不再需要自行编写这部分循环逻辑。

首日已有多个合作方接入或公布测试结果:

  • Cursor:称短请求成本比 Haiku 4.5 低 10 倍,并发布了 CursorBench 对比
  • GitHub Copilot in VS Code:称其在许多编码任务上接近 Claude Sonnet 5,同时使用更少 tokens 和步骤
  • Devin:报告其在 FrontierCode 1.1 中取得 58.4%,在每任务成本约为 Sonnet 5 八分之一的情况下领先 Sonnet 5,并建议将其作为 Opus 5.5 主模型下的“副手”
  • Arena:已加入 Agent Arena、Code Arena WebDev、Text、Document 和 Vision,分数待公布

文档解析与其他观察

在 ParseBench 文档解析测试中,有独立观察认为:

  • Haiku 5.5 整体接近 GPT-6 Luna
  • 表格解析略好
  • 图表理解较弱
  • 每 1,000 页成本约 1.2 美元
  • 对表格和阅读顺序的性价比较好
  • 在图表、语义格式和边界框方面较弱

此外,一些非系统性测试认为 Haiku 5.5 相比 Haiku 4.5 有明显提升,但这些结果更偏向轶事,不应视为严格基准。

小结

Claude Haiku 5.5 的重点在于:以小模型价格提供更接近中高端模型的能力,尤其适合摘要、批处理、轻量编码辅助、数据库查询和智能体中的高频子任务。

第三方评测显示,它在 Intelligence Index、Terminal-Bench 等指标上相比上一代 Haiku 有显著进步,并在部分项目上超过 GPT-6 Luna。不过,高努力档下 token 消耗偏高、长上下文触发更高价格、自动化任务评测受安全 bug 影响等问题,仍需要在实际使用中进一步验证。

评论

请登录后发表观点

暂无数据