揭开Codex“额度为什么掉得快”的技术账
北京时间2026年8月30日,OpenAI Codex 与 ChatGPT 团队成员 Tibo Sottiaux 在 X 发布一条英文长帖,宣布为所有 Codex 和 ChatGPT Work 付费用户重置使用量,同时公开说明团队近期排查出的多项“隐形消耗”问题。公开索引快照显示,这条帖子发布约半天后已获得约160万至170万次浏览、约1.7万次点赞,并引发大量开发者讨论,是过去24小时内与 OpenAI 产品使用体验相关、传播度较高的一条英文帖子。
这条消息最容易被误读成“OpenAI把Codex额度永久提高了10%到50%”,但原帖并不是这个意思。Sottiaux 的表述是:在修复一系列不必要的计算与重复调用后,根据用户如何使用 Codex,原有额度理论上可以比过去“多跑”约10%至50%。也就是说,变化主要来自减少浪费,而不是直接修改所有付费套餐的固定额度。OpenAI 官方帮助中心也明确说明,一次性用量重置并不代表永久提高计划上限,未来是否继续提供类似重置也没有保证。
问题一:上下文压缩本身可能反复制造新的上下文负担
OpenAI 这次公开的第一类问题来自 compaction,也就是长任务中对上下文进行压缩和整理的机制。团队发现,旧实现会在压缩后继续保留部分历史图片,使上下文仍然偏大,甚至可能很快再次触发压缩。对于大量使用截图、视觉输入或图像资料的用户,这类重复处理会悄悄消耗更多配额。Sottiaux 称,在修复后,重度使用图片的场景中用量可下降约10%。
这个细节说明,AI Agent 的成本并不只来自用户看到的那一次提问。为了让长任务保持连续性,系统背后还会进行摘要、记忆、上下文重组和工具结果整理。如果这些后台动作设计不够高效,就会出现“用户没有多做事,但额度却在持续下降”的体验。随着 AI 编程越来越依赖长时间任务和多轮上下文,后台编排效率已经成为影响产品价值的重要指标。
问题二:后台记忆与停止机制曾出现极端长尾
第二类问题来自 memory。OpenAI 发现,一些后台记忆工作进程可能继承 Stop hooks,并在无法正常结束时持续检查自己是否可以停止。该问题影响的用户比例低于1%,但长尾情况非常严重,团队甚至观察到一个线程检查“能否停止”约1.5万次。对于被影响的账户,这种行为可能造成大量用户看不见、却会计入资源消耗的后台工作。
这类故障对 Agent 产品尤其值得警惕。传统聊天机器人通常是一问一答,资源路径相对简单;而 Codex 这类工具会同时运行记忆、工具调用、子代理、自动化和任务状态管理。一旦某个后台循环失控,即使模型本身没有输出更多内容,也可能出现显著的配额浪费。OpenAI 此次把这些问题公开,实际上是在承认:当 AI 产品从“对话框”演变为“持续工作的代理系统”后,工程效率与模型能力同样决定用户体验。
问题三:任务已经完成,Agent却可能继续跑
更直接影响用户用量的是 goals 相关问题。Sottiaux 表示,在部分情况下,用户设定的目标已经完成,系统仍可能继续执行;或者模型在调用损坏工具时反复重试,没有及时停止。OpenAI 观察到的一些案例中,这类异常会消耗单个用户每周额度的15%至70%。对于重度编程用户而言,这已经不是微小误差,而可能直接决定一周内还能完成多少实际工作。
团队同时修复了自动化任务可能比设定频率运行得更频繁的问题,以及子代理选择策略中的异常。例如,较小的模型有时会在没有明确要求的情况下调用更强、更昂贵的辅助模型;非快速模式下的主代理也可能让子代理以更高成本的快速模式运行。这些现象说明,多代理系统的成本控制不能只看主模型,还必须把调度器、子任务拆分与模型路由纳入同一套预算管理。
“Computer History”一项功能,部分场景每周可吃掉约20%用量
OpenAI 还披露,较旧的 Computer History 实现可能反复总结重叠的活动记录。在部分案例中,这一项后台工作每周就能消耗约五分之一的使用量。与此同时,普通对话轮次也曾触发额外的滚动任务摘要请求,虽然单次增加不大,但累计约会带来1%的额外 token 消耗。团队已经停用后者,并重构前者。

MCP 也在此次排查范围内。OpenAI 发现某些工具结果可能被编码两次,部分工具说明还会被截断后再次拉取,从而增加不必要的上下文与调用成本。对于把 Codex 接入数据库、开发工具、浏览器或其他 MCP 服务的用户来说,这类问题会放大,因为工具调用往往会携带较长结构化数据。修复重复编码之后,真正有效的任务步骤可以占据更大比例的使用预算。
为什么“多跑10%至50%”比单纯涨额度更值得关注
如果只是提高固定用量,平台需要直接承担更多算力成本;而通过修复浪费提高有效产出,用户和平台可以同时受益。用户获得更多可完成任务,OpenAI 则不必按同等比例增加底层资源。这也是当前 AI Agent 商业化的关键问题:模型越来越强,但复杂代理往往要调用模型多次、运行更久,并配合搜索、浏览器、终端、文件系统和其他工具。如果每个任务的系统开销控制不好,再强的模型也可能因为成本过高而难以大规模部署。
从这个角度看,OpenAI 此次更新反映出 AI 编程竞争正在进入“系统效率”阶段。过去行业常比较模型在编程基准上的正确率,现在开发者越来越在意另一组指标:一个真实任务需要多少次调用、多少上下文压缩、多少工具重试,以及每周额度究竟能支持多少小时的有效工作。真正能把这些后台损耗压低的平台,可能比单纯增加套餐数字更容易建立长期黏性。
这次重置并不等于永久提高套餐上限
OpenAI 官方帮助中心对这一点给出了清晰边界。Codex 与 ChatGPT Work 的一次性重置可能由 OpenAI 在特定活动、故障或运营场景下发放,但资格、覆盖范围和有效期可能不同,未来重置也不保证继续发生。对于可保存的 banked reset,官方进一步说明,它属于一次性的用量恢复工具,不是购买的 credits,也不会永久增加计划额度。
使用完整 banked reset 时,Codex 的5小时和每周使用窗口都可能重新开始,周重置日期也会随之变化。因此,对部分用户来说,“立即重置”并不一定始终比保留现有剩余额度更划算。此次 Sottiaux 帖子下也出现用户讨论:如果账户原本接近自然周重置时间,新的统一重置可能改变下一次周期日期。这说明未来 OpenAI 若要继续频繁进行额度活动,如何把重置逻辑和剩余用量展示得更透明,会直接影响用户感受。
OpenAI还准备让用户看到“额度到底花到哪里”
Sottiaux 在帖子末尾提到,OpenAI 正在开发更直接的用量可视化,让用户能够在应用里看清资源究竟消耗在哪些环节,而不是只能猜测。这可能是此次更新里最具长期价值的部分。随着 Agent 能够运行数小时甚至更长时间,单纯显示“还剩多少百分比”已经不够,用户更需要知道是主模型推理、图片上下文、子代理、MCP 工具还是后台自动化占用了预算。
如果这种用量明细能够真正落地,它会让 AI Agent 的计费逻辑更接近云计算:不仅告诉用户账单数字,还解释资源使用结构。对于企业开发团队而言,这种可观测性尤其重要,因为他们需要判断哪些自动化值得保留、哪些任务应该换用较小模型,以及哪些 Agent 工作流的单位成本过高。
这条热门X帖子释放出的四个信号
- 第一,OpenAI 正把 Codex 的竞争重点从模型能力延伸到系统工程效率,后台调度、上下文管理和工具调用都会直接影响实际可用量。
- 第二,所谓“多跑10%至50%”主要来自减少无效消耗,并不是对所有用户永久增加同样比例的套餐额度。
- 第三,多代理和长任务时代,隐藏在后台的记忆、摘要、子代理与工具重试可能成为成本大头,AI 产品必须建立更强的资源治理机制。
- 第四,用量透明度正在变得和模型性能一样重要。OpenAI 若能把每类消耗清晰展示给用户,将有助于企业把 Codex 从实验工具进一步变成可管理的生产系统。
结语:AI Agent下一阶段比拼的,是“每一份额度能完成多少有效工作”
这条英文 X 长帖没有发布新模型,却揭示了一个越来越重要的竞争维度。对于经常使用 Codex 的开发者而言,真正影响体验的并不只是 GPT-5.6 Sol 有多强,而是整个代理系统能否避免无意义循环、重复摘要、错误调度和多余工具调用。OpenAI 此次一次性修复多个长期问题并重置付费用户用量,说明公司正在把“资源效率”当成产品质量的一部分。
随着 AI 编程从短代码生成走向长时间自主开发,未来用户选择工具时可能越来越少问“模型一次回答有多聪明”,而更多关注“同样一周额度能交付多少真实任务”。如果 OpenAI 所称的10%至50%改善能够在真实工作流中稳定体现,那么它带来的价值可能比一次简单的额度扩容更持久;但最终效果仍会因用户任务类型、模型选择、图片使用、工具调用和自动化方式而不同,不能被理解为所有账户都统一获得50%的永久增量。
