出品 | 网易智能
作者 | 小扣
编辑 | 王凤枝
六天,42 万亿 Token。智谱称,国产 AI 芯片接住了。
8 月 26 日晚,匿名模型 Ox Alpha 揭晓身份。它就是智谱的 GLM-5.3-Flash。

因为 Ox 有"牛"的意思,它过去一周在中文开发者社区被叫作"牛来"。按 OpenCode 的平台统计,Ox Alpha 在六天内处理了 42 万亿 Token,超过 DeepSeek Flash 的 22 万亿 Token,结束了后者连续 56 天占据榜首的纪录。

智谱称,匿名测试期间的全部流量均由国产 AI 芯片承载,但没有公布具体厂商。《晚点 LatePost》援引知情人士称,智谱为 GLM-5.3-Flash 的推理服务调用了超过 10 万张国产芯片,供应商可能包括华为、摩尔线程和海光。智谱没有确认这一规模和供应商名单。

这也不是智谱第一次匿名测试模型。春节前,第三方平台曾出现 Pony Alpha,后来被认领为 GLM-5。两次发布采用了相同顺序:先开放免费接口,让开发者把真实任务跑进来,再公布模型身份。
十万张卡,先接到的是推理
这批卡先接到的是已经上线的模型请求,不是从头训练下一代模型。两件事的迁移难度并不一样。
《南华早报》此前采访多名开发者称,许多大模型的训练流程围绕英伟达 CUDA 建立。换一套芯片,团队还要跟着重写代码、优化算子、调试集群。搬过来的不只是一组模型权重,还有整套研发流程。

推理面对的任务要固定得多。模型已经训练完成,输入、首个 Token 和后续解码可以分别优化。模型公司还能调整缓存、量化方式和集群分工,让手里的硬件跑得更顺。
国产算力更可能先靠推理的日常调用积累规模。至于从头训练下一代前沿模型,迁移会慢得多。
要让这批芯片接住大量请求,智谱先从模型本身减负。
GLM-5.3-Flash 总参数约 3200 亿,每处理一个 Token 激活约 180 亿参数。和 GLM-4.5 相比,它的激活参数从约 320 亿降至 180 亿,层数从 92 层减到 45 层。每个 Token 实际调用的参数更少,需要在芯片之间搬运的数据也随之下降。
长上下文是另一笔开销。智谱称,与完整的 GLM-5.3 相比,Flash 版的注意力计算量减少约 3 倍,KV 缓存减少约 4.4 倍。模型读取的文件越多、对话越长,缓存占用的显存和带宽就越明显。

软件也要跟着模型和硬件一起改。智谱为国产加速器调整了 SGLang 推理引擎,把输入编码、预填充和连续解码分开处理,并围绕量化、内存、通信和缓存继续优化。
按照公司的测试,整套系统的端到端性能较初始版本提高 3 倍,单 Token 成本可以接近主流英伟达 GPU。
强在编程和智能体
在 Artificial Analysis 的独立测试中,GLM-5.3-Flash 综合指数为 57。

从分项成绩看,它更擅长编程和智能体任务。在 GDPval-AA v2 中,它与完整版 GLM-5.3、Grok 4.6 处在相近区间。第三方 VulnPR-100 测试里,它识别出 34 个真实漏洞,总成本 4.21 美元,成绩略高于完整版 GLM-5.3 的 32 个,费用约为后者的十九分之一;但仍落后于 Kimi K3、GPT-5.6 Luna 和 Grok 4.6。

换到知识问答和输出速度,优势就没那么明显了。Artificial Analysis 给出的现实知识准确率为 28%,低于完整版 GLM-5.3 的 34% 和 GPT-5.6 Terra 的 47%;平均输出速度约为每秒 49 个 Token,也低于同类开放权重模型约 66 个的中位数。
智谱 API 价格是每百万输入 Token0.8 元、输出 Token 2.8 元,缓存命中 0.23 元。输入和输出价格都是完整版 GLM-5.3 的十分之一。上线前两周再打五折,分别降至 0.4 元和 1.4 元。

此外,单价降下来后,一项任务最终花多少钱,还取决于模型用了多少 Token。Artificial Analysis 整套测试中,GLM-5.3-Flash 生成约 1.5 亿个输出 Token,高于同类模型 1.1 亿的中位数。价格低,不代表完成任务的总账单也会按同样比例下降。
价格一变,调用量先动
《晚点》称,DeepSeek V4 Flash 调价后,在 OpenCode 上的调用量降至此前约一半;同期免费开放的 Ox Alpha 迅速升到平台第一。
OpenCode 不能代表整个市场,但六天 42 万亿 Token 说明开发者换模型很快。能力差距不大时,价格、免费额度,以及能否直接接入现有工具,都会迅速改变调用量。
与智谱前后脚发布的 Qwen3.8-Flash-Next 也沿着这条路走。它的主模型约 1250 亿参数,另有 510 亿N-gram 嵌入参数,每个 Token 只激活约 60 亿参数。
价格端,阿里云 8 月 27 日把 Qwen3.8-Flash 的国内 API 价格下调至每百万输入 Token 0.8 元、输出 Token 2.7 元。两款 Flash 产品的输入价格相同,输出价格只差 0.1 元。

国内模型的竞争正在落到每一次调用:要激活多少参数,长上下文占多少缓存,同一个任务最终花多少钱。
GLM-5.3-Flash 开放完整权重后,一些开发者也开始测试本地部署。到了自己的机器上,体验不再只由模型决定,硬件配置、量化方式和推理框架都会影响速度与稳定性。
一名用户在双 DGX Spark 上通过 vLLM 运行 GLM-5.3-Flash,单路解码约为每秒 24 至 30 个 Token,八路并发约 72 个。该测试使用的是英伟达硬件,不能用来证明国产芯片能够复现相同性能,却说明模型权重之外,推理内核、量化和并行方式仍会改变最后的速度。

智谱已经先在自己的国产芯片集群上把模型跑起来了。接下来要看,换到其他云厂商和芯片平台后,速度会不会下降、成本会不会增加,服务还能不能保持稳定。
