综合分接近 6 Sol Max
47.78 对 47.53;每题 $0.214 对 $1.049。基准生成时间短 68.7%。
五款模型,25 组原生推理组合。把表现、每题费用与等待时间放在一起,找出适合你任务的那一档。
47.78 对 47.53;每题 $0.214 对 $1.049。基准生成时间短 68.7%。
每题 $5.982;基准生成约 807 秒,首答等待约 693 秒。
生成时间增加 110%。如果任务已在 XHigh 解决,Max 的额外投入未必值得。
Low 对应 Codex 桌面的 Light;XHigh 对应 Extra High。每个面板独立着色。
默认显示全部组合。筛选模型、强度或排序,查看你关心的取舍。手机可左右滑动表格。
| 模型 | 强度 | 综合分 ↑ | 编程成功率 ↑ | HLE 正确率 ↑ | 职业工作 Elo ↑ | 每题 USD ↓ | 生成秒数 ↓ |
|---|---|---|---|---|---|---|---|
| GPT-5.6 Sol | Low | 33.47 | 1.0% | 39.4% | 1289 | $0.261 | 54.4 |
| GPT-5.6 Sol | Medium | 39.24 | 14.6% | 42.2% | 1403 | $0.505 | 107.0 |
| GPT-5.6 Sol | High | 42.35 | 20.7% | 46.0% | 1480 | $0.808 | 176.9 |
| GPT-5.6 Sol | Xhigh | 44.01 | 24.7% | 47.3% | 1548 | $1.184 | 251.6 |
| GPT-5.6 Sol | Max | 46.97 | 39.9% | 49.5% | 1588 | $1.988 | 353.1 |
| GPT-6 Sol | Low | 33.90 | 9.1% | 34.9% | 1176 | $0.133 | 47.6 |
| GPT-6 Sol | Medium | 39.78 | 18.7% | 41.0% | 1320 | $0.247 | 70.1† |
| GPT-6 Sol | High | 42.82 | 26.3% | 44.1% | 1376 | $0.375 | 150.5 |
| GPT-6 Sol | Xhigh | 44.10 | 30.3% | 46.3% | 1437 | $0.524 | 221.3 |
| GPT-6 Sol | Max | 47.53 | 43.9% | 47.9% | 1487 | $1.049 | 405.8 |
| GPT-6.1 Sol | Low | 42.08 | 30.8% | 47.4% | 1297 | $0.131 | 54.1 |
| GPT-6.1 Sol | Medium | 47.78 | 48.0% | 49.9% | 1433 | $0.214 | 126.9 |
| GPT-6.1 Sol | High | 50.24 | 51.5% | 51.4% | 1486 | $0.319 | 202.7 |
| GPT-6.1 Sol | Xhigh | 51.04 | 54.0% | 52.6% | 1510 | $0.393 | 271.1 |
| GPT-6.1 Sol | Max | 51.83 | 56.1% | 52.9% | 1575 | $0.724 | 568.7 |
| GPT-6 Astra | Low | 45.78 | 41.9% | 49.2% | 1366 | $0.818 | 91.7 |
| GPT-6 Astra | Medium | 49.57 | 49.5% | 52.7% | 1468 | $1.541 | 206.5 |
| GPT-6 Astra | High | 50.92 | 54.0% | 53.1% | 1485 | $1.725 | 238.3 |
| GPT-6 Astra | Xhigh | 52.39 | 59.6% | 54.6% | 1516 | $2.309 | 339.5 |
| GPT-6 Astra | Max | 52.67 | 59.1% | 54.7% | 1542 | $3.258 | 471.5 |
| Opus 5.5 | Low | 42.31 | 31.3% | 48.3% | 1224 | $0.551 | 86.2 |
| Opus 5.5 | Medium | 51.24 | 52.5% | 54.7% | 1576 | $1.336 | 215.9 |
| Opus 5.5 | High | 53.58 | 56.6% | 55.6% | 1692 | $1.823 | 294.2 |
| Opus 5.5 | Xhigh | 55.99 | 59.6% | 57.5% | 1820 | $3.459 | 503.1 |
| Opus 5.5 | Max | 57.62 | 59.6% | 61.4% | 1846 | $5.982 | 806.5 |
选择综合分相差不超过 1 点的配对;不是对所有具体任务等价的断言。
| 比较:左 / 右 | 综合分 | 每题美元 | 左侧省钱 | 生成秒数 | 左侧时间变化 |
|---|---|---|---|---|---|
| 6.1 Medium / 6 Max | 47.78 / 47.53 | $0.214 / $1.049 | 79.6% | 126.9 / 405.8 | 短 68.7% |
| 6.1 High / Astra High | 50.24 / 50.92 | $0.319 / $1.725 | 81.5% | 202.7 / 238.3 | 短 15.0% |
| 6.1 XHigh / Opus Medium | 51.04 / 51.24 | $0.393 / $1.336 | 70.6% | 271.1 / 215.9 | 长 25.6% |
| Opus High / Astra Max | 53.58 / 52.67 | $1.823 / $3.258 | 44.1% | 294.2 / 471.5 | 短 37.6% |
差值、百分比和情景费用按未舍入数据计算。分数接近不代表统计上等价;更便宜也不一定更快。
| 模型 | 综合分增加 | 费用增加 | 生成时间增加 |
|---|---|---|---|
| GPT-5.6 Sol | +2.96 | +68% | +40% |
| GPT-6 Sol | +3.43 | +100% | +83% |
| GPT-6.1 Sol | +0.80 | +84% | +110% |
| GPT-6 Astra | +0.29 | +41% | +39% |
| Opus 5.5 | +1.64 | +73% | +60% |
5.6 Sol 在全部五档的 GDPval 和 HLE 都高于 6 Sol,编程成功率则低于 6 Sol。只看综合分,会漏掉这类差异。
Astra 的编程成功率从 XHigh 的 59.6% 到 Max 的 59.1%。更高强度不会保证每个分项都上升。
Opus Max 的综合分最高,但 Astra XHigh 的编程成功率与它同为 59.6%;不能把一个分项的并列扩大到整体能力。
Standard API 短上下文价格;USD / 百万 token。输出费用包含推理 token。
| 模型 | 输入 | 缓存读取 | 缓存写入 | 输出,含推理 |
|---|---|---|---|---|
| GPT-5.6 Sol | $4.00 | $0.40 | $5.00 | $20.00 |
| GPT-6 Sol | $2.00 | $0.20 | $2.50 | $10.00 |
| GPT-6.1 Sol | $2.00 | $0.10 | $2.50 | $10.00 |
| GPT-6 Astra | $10.00 | $1.00 | $12.50 | $50.00 |
| Opus 5.5 | $4.00 | $0.20 | $5 / 5分钟 · $8 / 1小时 | $20.00 |
| 模型 | 输入 | 缓存读取 | 输出 |
|---|---|---|---|
| GPT-5.6 Sol | 100 | 10 | 500 |
| GPT-6 Sol | 50 | 5 | 250 |
| GPT-6.1 Sol | 50 | 2.5 | 250 |
| GPT-6 Astra | 250 | 25 | 1250 |
Codex credits 和 API 美元是不同计费口径,不能用每题美元费用反推包月剩余条数。Codex credit 计费没有单独的缓存写入收费。
本页比较 Standard 模式,未将 Fast、Ultrafast、Batch 的价格或速度混入主表。Claude 订阅使用其独立计费与限额。
多代理并行模式,整体结果取决于拆分、协调和验证。以下是条件估算,不是实测。
以各模型 Max 为单代理基线。假设分支等量独立、各代理使用同一模型的 Max;这不是对内部调度的事实描述。
| 模型 | 情景每题美元 | 情景生成秒数 |
|---|---|---|
| GPT-5.6 Sol | $2.486 | 206.0 |
| GPT-6 Sol | $1.312 | 236.7 |
| GPT-6.1 Sol | $0.905 | 331.7 |
| GPT-6 Astra | $4.072 | 275.0 |
默认情景:三个分支各占原任务 ⅓,串行协调占 25%,不计重复上下文成本。费用增加 25%,生成部分缩短约 42%。
这里估算的是生成部分,不是完整等待时间,也不预测质量提升。不能把单代理 Max 分数直接当成 Ultra 整体分数。Opus 5.5 没有 Codex Ultra 这一原生选项。
基于这套基准的选择建议;具体任务的质量和验证要求仍决定最终档位。
$0.131 / 题;首答约 1.8 秒。
综合 47.78;$0.214 / 题;首答约 5.3 秒。
综合 50.24 / 51.04;每题 $0.319 / $0.393。接受约一分钟的首答等待。
综合 53.58;职业工作 Elo 1692;$1.823 / 题。
综合 57.62;$5.982 / 题;首答等待约 11.5 分钟。
按分支、上下文重复量与协调开销估算,而非固定的强度倍数。
核心能力、每题费用与时间数据由同一 AA 页面快照提取;官方文档用于核对价格与模式。