Claude Haiku 5.5 与 GPT-6 Luna 都是站内收录的推理模型,发布时间分别为 2026 年 10 月 7 日和 9 月 22 日,相隔 15 天。两者都支持百万级上下文、文本与图片输入、文本输出。本文结合 Anthropic 的 Haiku 5.5 官方对比图和 DataLearner 在 2026 年 10 月 8 日收录的规格、价格讨论选型。
一句话结论
Anthropic 官网公布的这组对比中,Haiku 5.5 在双方都有数字的六项指标上均高于 Luna;Luna 则在长提示标准 API 计费上更便宜。 知识工作、终端操作和视觉推理任务可以优先测试 Haiku;长文档、高输入量任务可以同时测试 Luna 的成本优势。这是一组厂商报告结果,不能把它扩展为所有任务、所有配置下的全面排名。
官网评测对比
下表逐项转录用户提供的 Anthropic 官方对比图。Elo 分数与百分比分开解释,百分比差值按百分点计算;“—”表示图表未报告,不表示零分。
来源:Anthropic Claude Haiku 5.5 System Card;本表以该发布材料的官方对比图为依据。图中没有完整列出双方推理档位和所有 harness 设置,不能宣称这些数字来自同档位、同成本的严格对照实验。图中 Sonnet 的 Xhigh 标注也不能移用给 Haiku 或 Luna。
知识工作两项反映交付任务的评估结果,Elo 相差 183 或 242 并不等同于质量提高相同百分比。终端任务上 22.8 个百分点的差距明显大于 FrontierCode Main 的 4.0 个百分点,说明即便都属于编码相关任务,不同任务环境呈现的差距也不同。OSWorld 数字仅适用于图中标明的离线子集,不应与完整集或其它 OSWorld 版本混比。
官网图表与下方站内表格为什么可能不同
站内成绩按来源、评测版本和运行模式存储。此前 Haiku 官方来源被设为仅单模型页展示,导致对比页把已有成绩全部过滤,本次已修正展示配置,并补入官网图中的 Luna Terminal-Bench、FrontierCode 与 Chartography 成绩,保留“具体推理档位未注明”的标签。
下方“最佳可用”表按每项指标选择已收录的最佳非并行成绩,并不是上述官网图表的原样复刻。例如 Haiku 的 Chartography 另有使用工具的 86.2%,官网这张图比较的是无工具 46.4%;不能拿 86.2% 与图中 Luna 的无工具 29.1% 来宣称同条件领先。Luna 既有的第三方 Terminal-Bench 12.63% 也应与此图的厂商报告 16.4% 区分。
GDPval-AA v2.1、AA-Briefcase v1.1 和 OSWorld 2.1 离线子集的 Luna 数值在本文官网表中引用;它们还需完成对应版本、子集与协议映射,暂未覆盖站内旧版本或完整集成绩。这里说明的是收录与显示范围,不是官网没有数据。
规格对比
Luna 的窗口多出 50,000 tokens,这表示容量差异,不能直接推断长上下文理解质量。Haiku 的代码、权重和商业许可字段在站内仍有缺失;Luna 标为代码与权重未公开。
价格与性价比:关键在输入长度的分档
下表为官方供应商的标准 API 价格,单位均为美元/百万 tokens,输入列采用非缓存输入价。分档取决于单次提示的输入长度,输出价格也随该输入长度档位变化。
在中间档位,Haiku 5.5 的输入和输出单价都是 Luna 的 5 倍。超过 272K 后,输入单价分别为 $0.50 与 $0.20,输出单价分别为 $2.50 与 $0.75;这时应按实际输入输出比例计算账单,而不是把一个单价倍数当作全部任务的成本倍数。
例如,单次调用使用 200K 输入 tokens 并生成 20K 输出 tokens,不使用缓存、批处理且不计其它费用,Haiku 5.5 的 token 费用为 $0.15,Luna 为 $0.03。这个例子说明的是计费差异,不代表两款模型会产生同样长度、同样质量的答案。
缓存与批处理需要另算。两款模型低长度档的缓存读取价均为 $0.01/百万 tokens,但 Haiku 的该档只覆盖不超过 100K 的提示,Luna 覆盖不超过 272K 的提示。Haiku 的接口还收录了 Batch 价格:不超过 100K 时输入/输出为 $0.05/$0.25,超过 100K 为 $0.25/$1.25。此次 Luna 价格接口未返回 Batch 条目,因此不能据此断言 Luna 不支持批处理,也不能把 Haiku Batch 价格直接与 Luna 标准同步调用价格混为同一口径。
怎么选
知识工作与终端任务: 官网这组结果支持优先测试 Haiku 5.5。用自己的文档、交付标准和工具链检验差距是否能复现,同时记录推理档位、失败重试和实际费用。
编码任务: Terminal-Bench 的差距比 FrontierCode Main 大,不能把终端任务的优势等量推广到所有代码生成、修复或重构场景。应根据真实项目分别测试。
图表理解: 官网无工具结果支持优先测试 Haiku。需要工具的工作流应另比有工具成绩,避免不同条件混用。
长提示与成本敏感任务: 在 100K 至 272K 输入区间,Luna 标准输入与输出单价均只有 Haiku 的五分之一。即使选择 Haiku 处理困难任务,也可以测试把容易的长文档请求路由给 Luna。
不超过 100K 的短提示: 两者标准 token 单价相同,任务质量、输出长度和重试次数比基础单价更能决定实际成本。本文没有可验证的同条件速度数据,因此不作速度排名。

