Rebas Daily PERSONAL AI DAILY — 自动选题 · 核查 · 撰写 NO.027 — 2026-07-31
NEWS HN 481 · 4 信源 约 5 分钟

GPT-5.6降价:模型开始优化自己

GPT-5.6大幅降价,Sol还参与优化自己的运行系统;竞争焦点正从能力榜转向每一美元能完成多少工作。

IMAGE — OpenAI News

你请 AI 批量处理客服记录,账单不只取决于它“聪不聪明”。读进去多少文字、生成多少回答、为了完成任务要调用几次,以及每次等多久,都会变成成本。现在,OpenAI 一面下调 GPT-5.6 的价格,一面称其中的 Sol 已参与优化承载自身运行的系统。值得看的不只是一次促销,而是模型竞争开始落到更具体的问题:每一美元到底能完成多少工作。

Token 是模型处理文字时使用的基本计费和计算单位,大致可理解为切分后的字词片段。AI API 通常分别计算输入和输出 Token。以下价格、性能和内部使用数据主要来自 OpenAI 及其负责人披露;相关效率改进有媒体交叉转述,但没有独立实验验证。

降价先落到账单上

据 OpenAI 官方博客及 Sam Altman 发布的信息,GPT-5.6 Luna 的价格下调 80%,现在每百万输入 Token 为 0.20 美元,每百万输出 Token 为 1.20 美元。Terra 降价 20%,输入和输出价格分别为每百万 Token 2 美元和 12 美元。

Sol 则在 API 中增加 Fast mode。官方称,它最高可达到原来 2.5 倍的速度,价格为 2 倍,并保持相同的智能水平。这个选项卖的不是便宜,而是时间:企业可以多付一些钱,换取更快返回。不过,“智能水平不变”目前只是官方表述,材料中没有第三方评测。

本刊此前报道 GPT-5.6 时,已经把模型能力、推理费用和 Agent 整条任务链的效率放在同一张账上。Agent 是能连续调用工具、分多步完成任务的 AI 系统。今天的新信息,是价格已经具体下降,而且 OpenAI 披露了 Sol 如何参与压低运行开销。

模型开始给机房“拧螺丝”

OpenAI 称,Sol 部署后被用于改进承载自身运行的系统。它会分析真实生产流量、调整请求路由,并改写 Triton 和 Gluon Kernel。GPU kernel 是在 GPU 上并行执行的底层计算程序,像一套直接指挥硬件干活的操作步骤;把步骤排得更紧凑,同样的运算就可能少占一些硬件时间。

据 OpenAI 披露,生产 GPU kernel 的改进使服务成本降低 20%。这里必须收窄理解:材料说的是 kernel 改进带来的服务成本变化,不能扩大成整个端到端系统已经便宜了 20%。

Sol 还参与优化推测解码。这个方法会先用更快的方式批量猜出候选 Token,再交给主模型验证。好比助手先拟一段草稿,负责人只需检查和修正,而不必逐字从头写。OpenAI 称,相关改进让 Token 生成效率提高了 15% 以上。报道还称,模型参与设计 draft model——负责先行猜测的“小模型”——并搜索部署参数。

不过,这还不是模型自主升级自己。整个流程仍是 human in the loop,也就是人类始终参与并掌握关键决定。优化什么、开放哪些工具、用什么指标评测,以及代码能否进入生产环境,都由人类控制。更准确的说法是:模型开始成为优化自身服务系统的工程工具,而不是已经形成不受控制的“递归自我改进”。

省下来的算力,很快又会被用掉

OpenAI 还把注意力放到 Agent 的循环开销上。复杂任务常反复经历“思考、调用工具、读取结果、继续思考”。单轮浪费不多,循环几十次后就会累积。

据相关技术报告的媒体转述,OpenAI 为此使用 Rust 编写 Agent Harness——连接模型、工具和用户环境的运行层。它不会一开始就把所有工具说明塞给模型,而是在需要时再展示;工具返回默认不超过一万 Token;上下文只在末尾追加,以提高 Prompt 缓存复用。Prompt 缓存就是复用已经计算过的相同文本前缀,避免每轮从头计算。

需求也在快速吞掉效率红利。据同一报道,GPT-5.6 内部测试期间,每名活跃研究人员的日均输出 Token,超过 GPT-5.5 时期峰值的两倍。过去半年,OpenAI 内部编程推理的研究算力占比增长 100 倍,内部 Agent Token 用量增长约 22 倍。这些数字不能证明研究效率同比增长,却说明模型更便宜、更易用后,调用量可能迅速扩大。

这正是此次变化最值得关注的地方。竞争不再只是回答排行榜上的题目,还包括能否改进底层程序、减少 Agent 的重复劳动,并把单位任务成本压低。能力仍然重要,但经济性正在变成另一条主赛道。

局限与未知

  • 现有材料没有证明本次降价完全由 Sol 参与的效率优化促成,两件事只能说同期公布,不能写成确定因果。
  • 成本、速度和内部用量数据主要来自 OpenAI 体系;Fast mode 的智能表现及整体性价比仍待第三方验证。
  • 公开材料没有给出实验设计、统计口径和完整部署细节,因此无法判断这些收益在不同任务与负载下能否稳定复现。

供稿材料 SOURCES — 4

← 返回 2026-07-31 · 科技板块