
出品 | 网易智能
作者 | 小扣
编辑 | 王凤枝
六天,42万亿Token。智谱称,国产AI芯片接住了。
8月26日晚,匿名模型Ox Alpha揭晓身份。它就是智谱的GLM-5.3-Flash。

因为Ox有\"牛\"的意思,它过去一周在中文开发者社区被叫作\"牛来\"。按OpenCode的平台统计,Ox Alpha在六天内处理了42万亿Token,超过DeepSeek Flash的22万亿Token,结束了后者连续56天占据榜首的纪录。

智谱称,匿名测试期间的全部流量均由国产AI芯片承载,但没有公布具体厂商。《晚点LatePost》援引知情人士称,智谱为GLM-5.3-Flash的推理服务调用了超过10万张国产芯片,供应商可能包括、摩尔线程和海光。智谱没有确认这一规模和供应商名单。

这也不是智谱第一次匿名测试模型。春节前,第三方平台曾出现Pony Alpha,后来被认领为GLM-5。两次发布采用了相同顺序:先开放免费接口,让开发者把真实任务跑进来,再公布模型身份。
十万张卡,先接到的是推理
这批卡先接到的是已经上线的模型请求,不是从头训练下一代模型。两件事的迁移难度并不一样。
《南华早报》此前采访多名开发者称,许多大模型的训练流程围绕英伟达CUDA建立。换一套芯片,团队还要跟着重写代码、优化算子、调试集群。搬过来的不只是一组模型权重,还有整套研发流程。

推理面对的任务要固定得多。模型已经训练完成,输入、首个Token和后续解码可以分别优化。模型公司还能调整缓存、量化方式和集群分工,让手里的硬件跑得更顺。
国产算力更可能先靠推理的日常调用积累规模。至于从头训练下一代前沿模型,迁移会慢得多。
要让这批芯片接住大量请求,智谱先从模型本身减负。
GLM-5.3-Flash总参数约3200亿,每处理一个Token激活约180亿参数。和GLM-4.5相比,它的激活参数从约320亿降至180亿,层数从92层减到45层。每个Token实际调用的参数更少,需要在芯片之间搬运的数据也随之下降。
长上下文是另一笔开销。智谱称,与完整的GLM-5.3相比,Flash版的注意力计算量减少约3倍,KV缓存减少约4.4倍。模型读取的文件越多、对话越长,缓存占用的显存和带宽就越明显。

软件也要跟着模型和硬件一起改。智谱为国产加速器调整了SGLang推理引擎,把输入编码、预填充和连续解码分开处理,并围绕量化、内存、通信和缓存继续优化。
按照公司的测试,整套系统的端到端性能较初始版本提高3倍,单Token成本可以接近主流英伟达GPU。
强在编程和智能体
在Artificial Analysis的独立测试中,GLM-5.3-Flash综合指数为57。

从分项成绩看,它更擅长编程和智能体任务。在GDPval-AA v2中,它与完整版GLM-5.3、Grok 4.6处在相近区间。第三方VulnPR-100测试里,它识别出34个真实漏洞,总成本4.21美元,成绩略高于完整版GLM-5.3的32个,费用约为后者的十九分之一;但仍落后于Kimi K3、GPT-5.6 Luna和Grok 4.6。

换到知识问答和输出速度,优势就没那么明显了。Artificial Analysis给出的现实知识准确率为28%,低于完整版GLM-5.3的34%和GPT-5.6 Terra的47%;平均输出速度约为每秒49个Token,也低于同类开放权重模型约66个的中位数。
智谱API价格是每百万输入Token 0.8元、输出Token 2.8元,缓存命中0.23元。输入和输出价格都是完整版GLM-5.3的十分之一。上线前两周再打五折,分别降至0.4元和1.4元。

此外,单价降下来后,一项任务最终花多少钱,还取决于模型用了多少Token。Artificial Analysis整套测试中,GLM-5.3-Flash生成约1.5亿个输出Token,高于同类模型1.1亿的中位数。价格低,不代表完成任务的总账单也会按同样比例下降。
价格一变,调用量先动
《晚点》称,DeepSeek V4 Flash调价后,在OpenCode上的调用量降至此前约一半;同期免费开放的Ox Alpha迅速升到平台第一。
OpenCode不能代表整个市场,但六天42万亿Token说明开发者换模型很快。能力差距不大时,价格、免费额度,以及能否直接接入现有工具,都会迅速改变调用量。
与智谱前后脚发布的Qwen3.8-Flash-Next也沿着这条路走。它的主模型约1250亿参数,另有510亿N-gram嵌入参数,每个Token只激活约60亿参数。
价格端,阿里云8月27日把Qwen3.8-Flash的国内API价格下调至每百万输入Token 0.8元、输出Token 2.7元。两款Flash产品的输入价格相同,输出价格只差0.1元。

国内模型的竞争正在落到每一次调用:要激活多少参数,长上下文占多少缓存,同一个任务最终花多少钱。
GLM-5.3-Flash开放完整权重后,一些开发者也开始测试本地部署。到了自己的机器上,体验不再只由模型决定,硬件配置、量化方式和推理框架都会影响速度与稳定性。
一名用户在双DGX Spark上通过vLLM运行GLM-5.3-Flash,单路解码约为每秒24至30个Token,八路并发约72个。该测试使用的是英伟达硬件,不能用来证明国产芯片能够复现相同性能,却说明模型权重之外,推理内核、量化和并行方式仍会改变最后的速度。

智谱已经先在自己的国产芯片集群上把模型跑起来了。接下来要看,换到其他云厂商和芯片平台后,速度会不会下降、成本会不会增加,服务还能不能保持稳定。
信投配资提示:文章来自网络,不代表本站观点。