codex 提示用量超限主因是单次请求上下文过重;应分会话处理不同任务、用 /compact 压缩历史、截断命令输出、沉淀流程为 skill、按需下调推理档位。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

Codex用两天就提示用量达到上限,不是消息发得多,而是每条指令背后携带的上下文太重——项目说明、会话历史、读取的代码文件、命令执行结果全被塞进一次请求里,token烧得飞快。
一个对话只干一件事
修 Bug、写新功能、查资料都开新的会话。会话拖得越长,每轮要携带的历史聊天记录就越多,成本会指数级上升。
这一步操作起来很简单,直接在 Codex 界面点“新建会话”就行。
【不要在同一个会话里反复改需求】比如先让 Codex 改按钮颜色,接着又让它加权限校验,再让它优化数据库查询——三次指令实际触发了三次完整上下文重建,历史记录叠加后 token 消耗可能翻倍。
用 /compact 命令压缩历史
当会话变长、输出开始变慢或提示“上下文过长”时,输入 /compact 并回车。
Codex 会自动总结当前状态和关键结论,丢掉中间试错过程、重复解释、冗余日志。压缩后的新上下文体积通常能减少 40%~60%。
注意:/compact 不会删掉你保存的 Skill 或自定义指令,只清理当前会话的临时记忆。
限制命令输出字节数
方法一:在 AGENTS.md 中统一加铁律
COMMAND 2>&1 | head -c 4000
方法二:手动加截断
cat src/utils/auth.js | head -c 3000
不加截断时,Codex 可能把一个没换行的 50MB 日志文件全读进来,单次消耗几万 token。加了 head -c 后,最多只传 4000 字节,够看关键段落又不爆额度。
把流程沉淀成 Skill
第一步:完成一次标准操作,比如“从视频提取字幕→转 Markdown→存入 docs/transcripts/”
第二步:对 Codex 说:
将刚才视频转文本的逻辑,保存成 skill,命名为 video-to-md,后续我可以直接调用
第三步:确认保存位置
想在当前项目用,直接让 skill 保存在当前项目中;想要全局用,就明确告诉 Codex,保存成全局 skill。
Skill 启动时不加载全部内容,只加载名字和简要描述。等你真调用它时,才把完整逻辑载入上下文——从源头避免 System Prompt 堆砌大量闲置提示词。
推理档位按需下调
写代码日常任务,推理用 Medium 就够了;分析项目给建议时,可升到 High;只有处理多约束、多跳逻辑的复杂问题才用 Extra High。
GPT-5.6 内部评测显示:把推理档位从 Ultra 降到 Sol + Medium,token 消耗减少四到六成,效果无明显下降。
【快速模式别乱开】速度提升约 1.5 倍,但 token 消耗是标准模式的 1.5 倍——适合你盯着等结果的短任务,不适合后台跑的批处理。











