9月11日那天,如果你没有刻意去关注 OpenAI 的开发者动态,大概完全不会知道发生了什么。没有发布会,没有官方博客的大标题,只有 Codex 负责人 Tibo 在社交平台上随手发了一条帖子:GPT-5.3-Codex-Spark,下周退役。
配文很平淡,用量一直在往下掉,团队手上也有明显更好的模型了,是时候给未来腾地方了。发完这条正事,他又补了一句吐槽,说真不敢相信自己团队居然发布过一个名字这么长的模型。
评论区没有太多伤感,倒是有一种奇怪的松了口气的气氛。开发者argofowl的评价很直接:Spark是个好玩的模型,也是个极度糟糕、根本没法用的模型,很高兴它走了,好几个月没碰过了。另一位开发者补充说,几个规模不小的项目里几乎没用过它,连理解项目上下文、分析日志这种基础操作,都能迅速把上下文窗口塞满,逼着他另开一个对话。
真正让人唏嘘的反而不是模型本身,而是它捆绑的那份独立配额。知名开发者Chubby说自己想要一个”GPT-6-Spark”,原因很朴素:那是一份不占用主额度的独立套餐。在主力模型Astra的额度经常紧张的当下,很多人是把Spark当成主额度耗尽后的备用油箱,续一阵子命。模型本身的好坏没那么重要,那个额度池子才是真正被惦记的东西。
这条消息传到国内,新智元和36氪都做了报道(见文末链接),标题里都用了”关停史上最快模型”这个说法。这不是标题党,Spark确实曾经是OpenAI最快的模型,而它从发布到下线,只活了七个月。
排场很大的出场,和很安静的退场
把时间拨回今年2月12日。Spark上线那天,排场相当隆重。这是OpenAI第一个专为实时编程设计的模型,128k上下文,每秒能生成超过一千个token。按官方给出的数字,客户端和服务器之间的往返开销降了80%,每个token的处理开销降了30%,首token延迟直接砍掉一半。代码不再一行一行地往外蹦,而是整块整块地倾泻在屏幕上,视觉冲击力很强。
最早一批上手的开发者反应是真的兴奋。开发者Ryan Vogel把它编进了正式工作流:GPT-5.4负责规划,GPT-5.3-Codex负责构建,Spark负责探索代码库、查文档、给第二意见。他说这是自己第一次搭出一个完全不含Claude模型的工作流,效率更高,花的钱也更少。Instructor的作者Jason Liu更激进,直接开二十个Spark子代理去并行搜索文件系统,宣布”RAG已死”。这个人后来加入了OpenAI的Codex团队。
比这些具体用法更重要的,是Spark背后的战略意义。它是OpenAI第一个跑在英伟达技术栈之外的生产模型,底层算力来自初创公司Cerebras的晶圆级芯片WSE-3。它也是OpenAI与Cerebras签下那份750兆瓦、总价值超过200亿美元算力大单之后,交出的第一份实际答卷。对一家几乎全部生产模型都依赖英伟达GPU的公司来说,这不是一次普通的模型发布,是一次押上真金白银的硬件路线试探。
但热度退得比涨得还快。Spark的致命伤在于,一块晶圆装不下一个完整的旗舰模型,它本质上是为了极致速度做出妥协的蒸馏版小模型。在Terminal-Bench 2.0评测中,Spark只拿到58.4%的准确率,远低于完整版GPT-5.3-Codex的77.3%。OpenAI自己放出的SWE-Bench Pro曲线也不客气:Spark能把单次任务时长压到一到两分钟,但准确率卡在47%到51%这个区间;完整版GPT-5.3-Codex从三分钟起步就有51%,拉到九分钟能到56%,十六分钟能到57%。换句话说,Spark省下的那几分钟,换来的是准确率往下掉五六个百分点。
宣传里最响亮的”15倍提速”也没能撑住。发布第二天,开发者Nicholas Van Landschoot就发了一篇长文,把OpenAI给出的对比条件拆解了一遍:所谓的15倍,是拿Spark去和开着最高推理强度档位的完整版GPT-5.3-Codex比。如果换算到同等准确率下再比速度,Spark其实只快了1.37倍。而在真实的编码场景里,它的短板被无限放大:凭空编造不存在的API端点,JSON格式经常不稳定,多步骤任务很容易跑偏。一家培训机构对它的总结相当扎心:没有智能的速度,只是更快地失败。对写代码的人来说,花十七分钟等一段能跑通的代码,永远比花两分钟拿到一堆bug的半成品要划算。
真正杀死它的,是同一家公司自己的下一代技术
如果Spark只是输给了完整版旗舰模型,那顶多算是速度换准确率的老问题,没什么新鲜的。真正给它宣判死刑的,是8月13日Cerebras发布的Ultrafast模式。
这次跑在晶圆上的不再是缩水版的Spark,而是旗舰模型GPT-5.6 Sol本尊。通过把庞大的旗舰模型按层切分,铺设在多台CS-3节点上组成流水线,Ultrafast模式在保证”与标准版同等智能”的前提下,飙出了每秒750个token的速度。Cerebras给出的对比是,Ultrafast比标准档快14倍,中间还有一档叫Priority,快2.5倍。Cerebras的CEO Andrew Feldman说了一句很直接的话:速度与智能,不再互斥。
他们拿GDP-Val里六个质量对齐的任务做了一组耗时对比:标准档Sol平均要跑7.7分钟,其中7.5分钟花在模型生成上;换到Ultrafast,同样的任务总共只要83秒,模型生成68秒,剩下15秒是工具调用之类的非推理开销。端到端快了整整5.6倍,而回答质量几乎没有差别。
这一句话不仅是一次技术突破的宣告,也直接抽干了Spark存在的全部意义。Spark的设计初衷就是拿智能换速度,而仅仅半年之后,同一家公司的同一批晶圆上已经能跑出完整的旗舰模型,速度只慢了四分之一,能力却一点没少。Cerebras的产能是有限的,当一个无人问津的缩小版和一个排队疯抢的旗舰版挤在同一批晶圆上时,谁该给谁腾地方,答案已经不用讨论。
Spark并不是唯一一个被清理的历史包袱。过去三个月里,OpenAI的模型库经历了一轮相当激进的换血:6月2日,GPT-5.2和GPT-5.3-Codex退役;8月31日,GPT-5.4和5.4 Mini退役,用户整体迁移到5.6世代;9月11日,轮到了GPT-5.3-Codex-Spark。伴随旧世代离场,Codex系列也迎来了新的命名规则:Sol(太阳)、Terra(大地)、Luna(月亮)、Astra(星辰)。像”GPT-5.3-Codex-Spark”这种拖着冗长版本号和产品线后缀的名字,确实已经带上了上一个时代的味道。
这背后的逻辑变化是:”快”这个属性,正在从一个独立存在的专用模型,变成旗舰模型的一项可选档位。就像推理强度分成从Light到Max那样,现在速度也被拆成了Standard、Priority、Ultrafast三档,按档位收费,和算力直接挂钩。回头看,Spark完美完成了它的历史使命。它作为一个过渡期的探路者,证明了Cerebras的晶圆足以扛住生成式AI的生产级流量,也证明了推理任务完全可以脱离英伟达的生态运行。探路结束,大部队正式入驻,探路者的使命也就到头了。
七个月,这个数字应该让谁紧张
如果只是当一条科技八卦看,这条新闻到这里就可以翻页了。但七个月这个数字,值得多停留一会儿。
一个被寄予厚望、承载着公司战略布局、有明确技术亮点、真金白银投入研发和算力的产品,从上线到彻底关闭,只经历了七个月。而且它不是被市场竞争淘汰的,它是被自己的亲哥哥,同一家公司几个月后推出的下一代技术,直接判了死刑。这不是失败,这是正常的迭代节奏本身在加速。
对普通用户来说,这条新闻的直接冲击可能不大,毕竟大部分人根本没在用Spark。但它揭示的规律,已经悄悄影响到每一个在用AI工具的人。你今天依赖的某个AI产品,不管是写代码的助手、生成图片的模型,还是某个垂直场景的智能体,它的生命周期可能正在被压缩到你想象不到的程度。以前一款软件的生命周期是以”年”计的,现在一些AI模型和功能的生命周期,已经开始用”季度”甚至”月”来计量。
这背后有一个容易被忽略的机制:AI公司之间的竞争,不再是单纯比谁的模型更聪明,而是比谁能把算力用得更极限。当底层硬件(不管是英伟达的GPU还是Cerebras的晶圆)本身在快速迭代,当同一批算力上能跑出的模型能力半年就能翻一倍,那么任何一个建立在”当前硬件极限”基础上的产品设计,都天然带着过期日期。Spark的死因说得直白一点,就是它出生的那一刻,已经预定了在硬件下一次跃升时被淘汰的命运,只是没人能提前算准具体是哪一天。
面对这种新常态,普通人和开发者能做什么
先说开发者。如果你已经把某个AI模型或者API深度嵌入了自己的工作流、产品架构,甚至商业逻辑里,Spark这次的退役过程值得当成一个参考案例来研究。它给出了几个可以观察的信号:一是官方是否给了明确的迁移路径(这次OpenAI是让用户整体迁移到5.6世代,没有留下断崖);二是官方给没给出足够的过渡窗口(一周的下线预告不算长,但至少是提前打了招呼,而不是说关就关);三是这个模型的替代品是不是已经存在,并且能力更强(Ultrafast模式已经把这条路堵死了,继续用Spark没有任何优势)。
具体的应对方式其实并不复杂,但需要养成习惯:第一,避免把架构和某个具体模型的具体版本号硬绑定,用抽象层去封装模型调用,换底层模型时改动量越小越好;第二,定期关注自己依赖的模型的用量趋势和官方公告,而不是等到收到停用通知才手忙脚乱;第三,对于那种”专用小模型换取某项性能”的产品,要多一分警觉,因为历史反复证明,专用模型往往只是通用旗舰模型某个能力补齐之前的临时方案,一旦旗舰模型补齐了这个能力,专用模型基本没有生存空间。
再说普通用户。你可能没有能力预判哪个AI工具会先退场,但可以调整一下自己的心态和使用习惯。不要对任何单一的AI产品建立过深的情感依赖或者工作流依赖,尤其是那些定位比较小众、用户量不算大的产品或功能。Spark这次的退役理由说得很清楚,”用量一直在往下掉”,用户基数不够大,是一个产品被优先关停的现实原因之一。定期备份自己在某个AI工具里积累的数据、提示词模板、工作流配置,不要假设它会一直存在。
对企业来说,这条新闻更像是一次风险提示。如果你的业务里有环节依赖某个AI服务商的特定模型或者特定档位,尤其是那种”性价比很高但比较小众”的选项,现在就应该做一次盘点:这个依赖点如果突然消失,你的业务需要多久能切换到替代方案?切换成本有多高?如果答案让你不安,那么现在提前布局备选方案,成本要远低于等到真正被通知下线的那一刻再手忙脚乱。
速度这件事,不会消失,只是换了个位置
Spark走了,但”快”这个需求没有消失,它只是从一个独立的专用模型,变成了旗舰模型内置的一个付费档位。这其实是一个挺值得记住的规律:AI行业里,很多曾经作为独立产品存在的能力,最终都会被整合进主力产品线,变成一个选项、一个开关、一档付费级别。今天很多我们熟悉的、以某个单一功能立身的AI小工具,几年后大概率也会走上类似的路。不是因为它们做错了什么,而是因为大模型本身在不断吞并周边功能,把原本需要单独一个产品才能实现的能力,变成自己身上的一个附加档位。
参考资料:
- https://hub.baai.ac.cn/view/57934
- https://www.36kr.com/p/3981223980923651



