元启 · AI Research
/

5.6 大降价后,别只看价格:用 DeepSWE 选择模型

After the GPT-5.6 Price Cut: Choosing Sol, Terra, and Luna with DeepSWE

结合 DeepSWE 评测图表,拆解 GPT-5.6 Sol、Terra、Luna 的模型与推理档位选择,并说明如何在 Codex 中开启 Max。

YQ元启
·2026 年 7 月 31 日·6 分钟·ai·#ai #notes #openai #gpt-5-6 #deepswe #codex

GPT-5.6 模型选择封面

GPT-5.6 系列大幅降价之后,很多人第一反应是“终于可以随便用了”。但降价改变的是单价,不是你该怎么选模型——尤其是在 Codex 里,同一个模型家族(Sol、Terra、Luna)还分好几档 reasoning effort,选错档位,省下的钱可能都花在返工上了。

这篇文章不聊定价数字,聊一个更实际的问题:面对 Sol、Terra、Luna 这几个模型,以及 low/medium/high/xhigh/max/ultra 这些推理档位,到底该怎么选?我们从一张 DeepSWE 基准测试图表说起,再讲清楚 Codex 里一个容易被忽略的配置项——某些高档位默认在界面上是不显示的。

一张图,两个维度

本文分析依据是用户提供的一张 DeepSWE 评测图表。图表横轴是 Avg cost per task(每个任务的平均成本),纵轴是 DeepSWE score(评测得分)。整体规律很直观:越靠右上角,代表分数越高、且花费的成本相对更低,是效率更好的位置。

DeepSWE 基准测试榜单

图:DeepSWE 基准测试榜单(数据和标注按用户提供的评测图呈现)

顺带说一句,Sol、Terra、Luna 这三个名字在词义上很容易联想到太阳、地球和月亮。不过,公开的官方资料目前主要说明的是三个模型的能力与成本定位,并没有明确把这组词源解释为正式命名规则。因此,本文封面采用的是一个便于记忆的视觉隐喻,而不是对官方命名来源的确认。

图中比较了三个模型——gpt-5.6-sol、gpt-5.6-terra、gpt-5.6-luna——在不同 reasoning effort 档位下的表现。按图中这组评测,几个关键点比较清楚:

  • Sol xhigh:得分最高,约在 71% 左右,但成本也最高,大约 4-5 美元/任务。
  • Terra max:得分约 70%,非常接近 Sol xhigh,但成本明显更低,约 3.96 美元/任务。
  • Luna max:得分约 67%-68%,落在图中标注的 “Luna max zone” 区域,成本比前两者都更低。
  • medium 档位(不论哪个模型):成本进一步下降,但分数也明显掉了一截,性价比反而不如高档位。

这里要强调一句:这些数字都是“按图中这组评测”读出来的,不是官方公布的精确基准,也不代表所有任务场景下的排名。DeepSWE 衡量的是特定类型的软件工程任务,你的实际项目未必和评测任务分布一致。

怎么选:三种典型场景

结合图表和实际使用经验,可以给出几条相对稳妥的判断:

追求最高解题能力、任务本身复杂(比如疑难 bug、跨模块重构、需要深度推理的架构设计)——选 Sol xhigh。它在图中分数最高,虽然成本也最高,但复杂任务本身试错成本更高,宁可一次多花点算力成本,换取更高的正确率。

日常大多数编程任务,想要质量和成本的平衡——优先考虑 Terra max。它的得分只比 Sol xhigh 低一点点,但成本明显更低,是图中性价比最突出的一个点。如果你的团队要控制月度 API 支出,又不想牺牲太多质量,Terra max 是个务实的默认选项。

预算敏感、任务相对简单(小修改、格式调整、简单脚本),或者想要更快的迭代速度——可以考虑 Luna max。分数比前两者低一截,但成本优势明显,适合“跑得多、跑得快”的场景,比如批量处理简单任务、快速试错。

需要提醒的是:不要把 benchmark 上的排名当成所有任务的绝对排名。真实工作中还有几个变量图表没有体现:

  • 代码库规模:大型仓库里的上下文管理能力,不同模型表现可能和评测差异很大。
  • 工具调用能力:如果你的工作流严重依赖多轮工具调用(搜索、执行、验证),稳定性比单次评测分数更重要。
  • 上下文长度:评测任务通常规模有限,长上下文场景下的衰减程度需要自己实测。
  • 速度:高分模型往往响应更慢,如果你在做交互式调试,响应速度本身就是体验的一部分。

简单说:DeepSWE 图表是一个很好的起点,但不是终点。拿它做初筛,再用自己的真实任务跑一跑,才是稳妥的做法。

Codex 里一个容易被忽略的坑:Max 档位可能没显示

选完模型,还有一步容易被忽略——你选中的档位,Codex 界面上不一定看得到

经过实际验证,目前这几个模型支持的 reasoning effort 档位是:

  • gpt-5.6-luna:low、medium、high、xhigh、max
  • gpt-5.6-terra:low、medium、high、xhigh、max、ultra

但 Codex 桌面端默认的 Effort 菜单里,通常只显示 low/medium/high/xhigh/ultra——max 这一档默认是不显示的。也就是说,如果你只看界面菜单,可能会误以为 Luna/Terra 根本没有 max 这个选项,进而错过了图表里性价比最高的 Terra max。

这里有个概念需要说清楚:Max 是一个全局可见性开关,不是“Luna Max”这种独立的模型名字。打开这个开关之后,所有支持 max 档位的模型(目前是 Luna 和 Terra)都会在各自的 Effort 菜单里出现 Max 选项;而 Ultra 则只有 Terra 支持,Luna 不支持 Ultra——打开开关不会让 Luna 凭空多出 Ultra。

也要注意区分:这是 Codex 桌面端的配置项,和调用 API 时传的 reasoning.effort 参数是两回事。API 那边你可以直接在请求里指定档位;但 Codex 桌面端的下拉菜单要显示某个档位,需要单独打开这个可见性开关,这一步不做,菜单里就是找不到。

配置方法

打开 max 档位可见性的方法,是编辑 Codex 的配置文件 config.toml,在 [desktop] 段落加入一行配置。动手前建议先备份一下这个文件,以防手误改错其他配置。

[desktop]
enabled-reasoning-efforts = ["low", "medium", "high", "xhigh", "max", "ultra"]

具体步骤:

  1. 找到你所用 Codex 安装对应的 config.toml(路径因安装方式和账号配置而异,请以你本机实际的 CODEX_HOME 目录为准,不要照抄他人机器上的路径)。
  2. 在文件中找到或新建 [desktop] 段落,加入上面这一行 enabled-reasoning-efforts 配置。如果 [desktop] 段已经存在其他配置,直接在段内追加这一行即可,不要新建重复的 [desktop] 段。
  3. 保存文件后,重启 Codex 或重新加载设置才会生效——不是保存完立刻生效。
  4. 重启后,在支持 max 的模型(目前是 Luna、Terra)的 Effort 菜单里应该能看到 Max 选项;Terra 还会多一个 Ultra 选项。

有一点必须说清楚:这个配置只是让界面显示模型本身已经支持的档位,不会把一个原本不支持 max 的模型强行变成支持 max。换句话说,这是“取消隐藏”,不是“能力升级”。如果某个模型本身就没有 max 这一档,改了配置也不会凭空出现。

小结

GPT-5.6 降价之后,真正值得花时间想清楚的不是“能不能多用了”,而是“该用哪个档位”。按 DeepSWE 图表这组评测来看,Sol xhigh 追求极限质量,Terra max 是质量成本的平衡点,Luna max 适合预算敏感的轻量任务。选定模型之后,记得检查一下 Codex 的 config.toml,把 max 档位的可见性打开,不然图表里性价比最高的选项,你可能压根看不到。

最后还是那句话:benchmark 排名给你一个方向,不是标准答案。真正决定选哪个模型的,永远是你自己的任务在实测里跑出来的结果。

本文说明:文中关于 Sol xhigh、Terra max、Luna max 的得分与成本数据,均来自用户提供的 DeepSWE 评测图表的直观解读,未引用任何官方公布的精确基准数字,仅供参考。Benchmark 分数反映的是特定评测任务集合上的表现,不代表所有生产任务场景下的绝对排名,实际选型请结合自身代码库规模、工具调用需求、上下文长度和响应速度等因素综合判断,并以实测结果为准。

想直接聊聊这篇?扫码加我 →

相关阅读