Codex Claude Code 的推理档位:其实就是一句提示词
原创 Datawhale 2026-07-22 23:20 浙江
Datawhale干货
作者:Sebastian Raschka
现在打开 Codex、Kimi Code、Claude Code 里任何一个,选完模型,旁边往往还有一个推理档位的选择器。大部分人凭手感拨一个,简单问题拨低、难题拨高,但很少有人说得清:拨动的那一刻,模型到底变了什么。
Sebastian Raschka 的这篇文章就把推理档位讲清楚了,把它从你看到的下拉菜单,一直讲到训练管线里那行 reward。看完你会发现,档位不是玄学。
一、「推理模型」不是真在推理,只是答题前先把过程写出来
先厘清一个词。AI 里的技术名词大多不能按字面理解,神经网络并不真的像人脑那样工作,推理模型也不真的像人一样推理。
它指的是这么一件事:模型在给出最终答案前,先输出一段中间的思考过程(reasoning trace),相当于把草稿纸上的步骤也一并写出来。
左边是普通 LLM,直接给答案;右边是推理模型,先绕一段中间过程再作答。
二、只给答案打对错分,它自己就学会了推理
DeepSeek-R1 给出了一个到现在还在被广泛沿用的配方:RLVR,可验证奖励的强化学习。做法很直接,答对给 1,答错给 0。前提是这个领域能自动核对对错,比如数学(用 SymPy 或 WolframAlpha 验算)、代码(用编译器、单元测试或 LeetCode 跑一遍)。
关键的反直觉之处在这里:训练时并不去评判那段草稿本身写得好不好,只看最终答案对不对、格式合不合规。DeepSeek 团队试过把草稿也纳入训练信号,发现帮助不大,就去掉了。
只靠「奖励结果」这一条,模型自己学会了写中间步骤、回头检查、发现错了再改。这种「等一下,这里好像不对」的瞬间,被叫做 Aha moment。
三、<think>标签是装饰性的,对推理能力本身没有贡献
你可能在模型输出里见过<think></think>。很容易以为是这对标签让模型「开始思考」的。并不是。
推理模型里常见的格式标签。它们标记的是草稿的起止,不是思考本身。
这对标签是装饰性的,对推理能力本身没有贡献。它唯一的作用是标记草稿从哪开始、到哪结束,好让界面把它折叠隐藏(ChatGPT、Codex 都这么做)。换成任意一对别的符号,效果一样。用不带这对标签的方式重新训一个模型,benchmark 分数也差不多。
它是怎么来的?训练时在奖励里加一项格式奖励,鼓励模型把草稿放进这对标签里。DeepSeek-R1 的总奖励就是R_accuracy + R_format两部分相加,后者是一条简单的规则检查。
四、第一代推理模型只有一种个性:全程啰嗦,还关不掉
第一代是「专职」推理模型。DeepSeek-V3 是基座,DeepSeek-R1 是另一个独立训练的推理模型。R1 的毛病是,不管你问什么,它都长篇大论,哪怕问题极其简单,而且没有关闭推理的开关。
Qwen3 这类后来的模型开始做混合:同一个模型,既能当普通指令助手,也能按需切成推理模式。Qwen3 用enable_thinking=True/False控制,关掉时的实现其实是在回答开头塞一个空的<think></think>,让模型直接跳到答案。这套开关是在一个叫 Thinking Mode Fusion 的训练阶段里学出来的。
五、推理档位,本质上是往 system prompt 里塞了一句话
到了 GPT-5、GPT-5.6 这一代,开关从「开/关」变成了 low / medium / high / max 这样的多档。
GPT-5.6 暴露出从 Light 到 Ultra 的六档推理档位。
OpenAI 没公开闭源模型的实现,但从它们去年开源的 gpt-oss 能看出端倪:档位就是通过 system prompt 控制的,往每个请求前面加一句Reasoning effort: low/medium/high。ChatGPT 界面上那个选择器,大概率只是把你的选择映射成这么一句话。
六、模型能「听懂」这句话,靠的是训练时的两种配方
问题来了:随便一个模型,你加这句话它也不会理你。要让它真听懂,训练时必须配合。主要有两条路。
路线一 · 在 RLVR 阶段动手脚
不同 system prompt 配不同的长度惩罚。说「low」时对 token 数罚得重,逼它写短;说「high」时几乎不罚,放它写长。
路线二 · RLVR 之后再补一轮 SFT
喂进「这个 prompt 对应这么长的推理」的样本,让模型把档位标签和目标长度对应起来。
档位条件化的 RLVR 与 SFT 两种实现路径示意。这是一种可能的实现,并非 OpenAI 官方披露的训练细节。
两条路也能组合。作者推测 gpt-oss 和 GPT-5.6 就是组合着用的。
七、换模型和调档位,是两个互不干涉的动作
GPT-5.6 的界面把这两件事分得很清楚。左边选 Luna / Terra / Sol,是在换模型本身,粗略对应「训练时投入的算力」;右边调推理档位,模型不变,只是让它多花或少花 token,对应「推理时投入的算力」。
有意思的是这两条曲线会重叠:一个小模型开高档,有时能追平一个大模型开低档的分数。
沿单条曲线移动是调档位(推理 scaling),跨 Luna / Terra / Sol 三条曲线是换模型(训练 scaling)。两者都能提分,也都会推高成本。
所以你手里其实握着两个旋钮。用更大的模型、还是把档位调高、还是两个一起上,取决于你要的精度、成本和延迟。
八、档位不是越高越好,边际递减很明显
档位直接影响输出长度,长度又和精度正相关。这一点在 gpt-oss 上看得很清楚
gpt-oss 在不同推理档位下的响应长度与质量。档位越高,token 花得越多,精度也越高。
但到某个点会饱和。GPT-5.6 Sol 的曲线尤其明显:推理档位越高,API 成本和 coding 表现一起涨,可涨到最高那几档,收益明显变小,继续加预算就不划算了。
推理档位同时抬高 API 成本和 coding 表现,但在 GPT-5.6 最高档出现明显的收益递减。
一句话总结:「拨到max」不等于「答得更对」。多数任务里,中间档才是精度、成本、延迟三者的甜点区。
九、国产旗舰,各有各的真实做法
闭源模型不公开细节,但几个有技术报告的开源模型,给出了「至少被验证可行」的真实配方。
DeepSeek V4 训了三个「专家」:Non-think、Think High、Think Max,每个用不同的上下文窗口和长度惩罚,最后蒸馏进同一个 checkpoint。Think Max 那句 system 指令「Reasoning Effort: 绝对最大,不允许走捷径」看着像 prompt 技巧,其实背后有专门训练撑着,换个模型照抄这句话是没用的。
DeepSeek V4 的三种推理模式:Non-think、Think High、Think Max,背后是不同的训练配置而不只是提示词差异。
Kimi K2.5 的 Toggle 方法在训练时交替「限预算」和「不限预算」两个 RL 阶段,能把生成 token 砍掉约 25% 到 30%,benchmark 几乎不掉。更新的 K3 提供了 low / high / max 三档、max 为默认,但训练细节尚未公开,等它的技术报告。
往后看:档位还会是显式输入,但会有人替你选
GPT-5 曾经做过一个 Auto 模式,想自动帮你选档,结果败多胜少,后来从界面上撤了。
作者的判断是:近期推理档位仍会是一个显式输入,多半通过 system prompt 传进去。但 Agent 外面那层 harness、或者一个内部 router,会越来越多地根据任务状态和剩余预算自动推断该用哪一档,同时保留你手动覆盖的权利。想压延迟、想省成本、或想榨干性能,手动覆盖就派得上用场
参考地址:https://magazine.sebastianraschka.com/p/controlling-reasoning-effort-in-llms
一起“点赞”三连↓
-
07.23
辰思小说app如何注册
-
07.23
Taffyreclaimed45/ppt-agentskill下载-Taffyreclaimed45/ppt-agentskill网页版下载入口
-
07.23
将军留步军团多少级解锁
-
07.23
特价版淘宝如何搜店铺
-
07.23
崩坏星穹铁道姬子成就如何达成
-
07.23
claude-seo 是什么?Claude Code SEO 审计插件介绍
-
-
-
-
- 魔兽世界破敌开路任务攻略详解
- 07.23
-
- 幻兽帕鲁强力技能果实推荐
- 07.23
-
- 魔兽世界口粮及内幕任务攻略
- 07.23
-
-
下载
- |
-
-
下载
- 《行尸走肉第一章》免安装中文汉化硬盘版下载
- 单机|436 MB
- 一款以动作冒险为主题的游戏
-
-
下载
- 《街头霸王X铁拳》免安装中文汉化硬盘版下载
- 单机|111MB
- 一款非常好玩的格斗游戏
-
-
下载
- |
-
-
下载
- 《暗黑破坏神3》免安装繁体中文正式版下载
- 单机|7630 MB
- 一款以角色扮演为主题的游戏
-
-
下载
- 《马克思佩恩3》免安装硬盘版下载
- 单机|27033 MB
- 一款以第三人称射击为主题的游戏