核验快照:2026-09-05。本文区分模型能力、代理框架、评测版本和运行成本;不同来源的分数不拼接成一次同条件测试。
先看能改变选型的结论
Astra 在 OpenAI 公布的终端、科学工具和长上下文测试中有明显提升。Sol 保留更低的 token 单价;第三方 Codex 测试中,它在部分子项和任务耗时上仍有优势。不能把这组对比压缩成“某模型全面更强”或“每项任务贵 2.5 倍”。
之前的 AA Coding Agent Index 67 对 80 混用了版本。AA 的 2026-07-09 旧报告中,Sol max 得到 80;当前 v1.4 的公开 Codex max 表格为 Astra 67、Sol 65(整数展示精度)。OpenAI 发布表转述 v1.4 时给 Sol 65.1;这与 AA 的 65 不构成 13 分差距。
第三方 Codex 测量:质量、耗时和账单一起看
以下来自 Artificial Analysis 同一张 Coding Agent Index v1.4 表,双方均为 Codex max。数值受该测试集、代理版本和服务条件影响。
Astra 综合分略高且该测试的任务成本略低,但耗时更长;Sol 在 DeepSWE 子项领先。综合指数与其组成子项相互重叠,不能当作多份独立证据重复加权。
OpenAI 发布表中的对照
这一组统一引用 OpenAI 发布表。官方说明成绩是各推理强度中的报告最高值,不能一律标成 max,也不保证相同计算预算。OpenAI 的 DeepSWE 研究配置与上方 AA Codex 测量是两种结果。
GeneBench Pro 的旧页面快照为 37.8 / 28.7,本次核验的正文为 37.1 / 32.3,不能把不同快照两侧交叉使用。不同机构测得的 GPQA、数学成绩同样应分别保存。
ARC 与 HLE:测试框架不能省略
ARC Prize 的 Astra ARC-AGI-1 max 成绩为 97.5,98.5 对应 high/xhigh。ARC-AGI-3 Standard harness 的 max 成绩约 62.7;Provider Adapter 使用保留推理状态和上下文压缩,高档结果约 99.9。它们是不同配置,应分开看,不能把 62.7 当作误录直接覆盖。
HLE 的 Astra 57.2 来自有工具测试;Sol 49.5 是无工具记录,不能据此计算同条件胜负。AA Intelligence Index 本次核验已是 v4.2,max 对照为 55 / 51;旧版约 61 的数字属于另一版量表。
ARC Prize 分档结果 · 两种框架的解释 · AA Intelligence Index
安全与可靠性指标要按正确方向阅读
近期 ExploitBench 的 Sol 在较少触及轮数限制时为 11.5,应与 300 轮限制结果分开记录。内部测试和去除生产防护的测试结果不能直接解释成用户可用能力或生产风险发生率。
规格、访问与完整成本
两者上下文均为 1,050,000 tokens,最大输出均为 128,000。Astra 知识截止为 2026-04-30,Sol 为 2026-02-16。Sol 首次预览为 2026-06-26,全面开放为 2026-07-09;Astra 于 2026-09-03 开始分阶段开放,具体账号权限另行确认。
超过 272K 输入 tokens 时,整次请求使用对应的长上下文费率。Sol 当前促销价格至少持续到 2026-11-21;服务档位、工具费用和每任务 token 消耗还会改变账单。基础 token 单价的 2.5 倍关系不是任务成本的 2.5 倍关系。
Astra 不支持 none 推理档位,工具调用需要 Responses API,并支持异步工具调用和中途追加指令;Sol 支持 none 到 max,API 默认 medium。两者都支持函数调用、结构化输出和工具使用,不应把 Sol 的能力列表缩成“推理、多语言、编程”。
空白表示本站尚未收录该设置下的可比结果,不代表零分或外界没有公布。选型时应先确定任务质量要求,再比较同一配置下的耗时和完成任务的成本。
