GPT-6 Astra 与 Claude Fable 5.1 的竞争并不是简单的单项能力高低,而更像是两种旗舰 Agent 模型路线的正面对比。
在 DataLearner 当前收录的 8 项共同评测中,GPT-6 Astra 领先其中 5 项,整体平均成绩略高。它在 ARC-AGI-1 和 ARC-AGI-2 上分别取得 98.5 和 95.0,显示出很强的抽象推理与新任务适应能力;在更偏 Agent 执行的 AutomationBench 上,Astra 以 41.4 对 31.4 取得明显优势。Terminal-Bench 4.0 中 Astra 为 57.9,略高于 Fable 5.1 的 55.8,而在 Terminal-Bench-Science 0.1 上优势进一步扩大到 64.6 对 52.6。这组结果表明,GPT-6 Astra 的优势更多集中在复杂推理、终端操作、工具调用以及科学任务执行等场景。
Claude Fable 5.1 并没有在所有维度落后。在 AA Intelligence Index 中,Fable 5.1 得分 66.0,高于 Astra 的 61.2;HLE 上也以 65.0 对 57.2 保持明显优势。值得注意的是,在强调真实桌面环境操作的 OSWorld 2.0 中,Fable 5.1 达到 77.9,高于 Astra 的 72.6。因此,如果任务更偏复杂知识工作、研究分析,或者需要在桌面软件和多应用环境中持续操作,Fable 5.1 仍然具有很强竞争力。
规格方面,两款模型已经非常接近。GPT-6 Astra 提供 105 万 token 上下文窗口,Claude Fable 5.1 为 100 万 token,两者最大输出长度均达到 128K tokens。Astra 提供 low、medium、high、xhigh 和 max 多档 reasoning effort,允许开发者显式控制推理强度;Fable 5.1 则采用自适应思考机制,更强调模型根据任务自行分配推理资源。
价格也是这次对比中一个值得注意的地方:两款模型的标准 API 标价均为每百万输入 token 10 美元、每百万输出 token 50 美元,因此表面价格几乎完全一致。不过,两者的缓存策略存在明显差异。GPT-6 Astra 的 cached input 为每百万 token 1 美元,而 Claude Fable 5.1 的 cache read 仅为 0.25 美元。对于包含大量重复上下文、代码库、长文档或持续运行的 Agent 工作流,缓存价格可能比标准输入价格更能影响最终任务成本,因此 Fable 5.1 在高缓存命中率的长时程 Agent 场景中可能具有明显的成本优势。
从模型定位来看,OpenAI 将 GPT-6 Astra 定义为面向最困难端到端工作的最高能力模型,重点覆盖复杂推理、软件开发、Computer Use、研究和文档生成,并提供完整的 Web Search、File Search、Code Interpreter、Hosted Shell、Computer Use、MCP 和 Skills 等工具能力。Anthropic 对 Fable 5.1 的定位则更集中于大型代码工程、复杂知识工作以及持续数小时甚至更长时间的自主 Agent 任务,特别强调规划、工具调用、失败恢复以及长时间运行过程中的稳定性。
因此,两者目前没有形成绝对意义上的“全面胜负”。GPT-6 Astra 在 DataLearner 已收录的共同评测中取得整体领先,尤其在 ARC-AGI、AutomationBench 和 Terminal-Bench-Science 等推理与 Agent 执行任务上优势突出;Claude Fable 5.1 则继续在部分高难知识推理、OSWorld 计算机操作以及长时间 Agent 工作流方面保持竞争力。考虑到二者基础 API 单价完全一致,实际选型更应该根据具体 workload 来决定:偏复杂推理、终端与工具执行可以优先考虑 GPT-6 Astra,而重度长上下文缓存、复杂知识工作和长期 Agent 运行则值得重点评估 Claude Fable 5.1。

