一款名为“Ox-Alpha”的匿名模型近期在海外开发者社区引发广泛关注,其真实身份终于揭晓——这款在海外主流聚合平台OpenRouter和OpenCode上连续创造佳绩的模型,正是来自中国的智谱GLM-5.3-Flash。8月26日晚,智谱正式宣布上线这款轻量级多模态模型,并同步以MIT协议向全球开源,标志着中国开源模型在国际舞台上的又一次重要突破。
在正式亮相前,Ox-Alpha以匿名形式在OpenRouter和OpenCode平台进行了多日盲测,表现堪称惊艳。首日即登顶OpenRouter榜单,单日Token处理量达到平台历史峰值的4倍;在OpenCode平台,它更终结了DeepSeek连续56天的霸榜纪录。OpenRouter公开数据显示,Ox-Alpha登顶后,全平台调用量前五的席位全部被中国大模型占据,展现出中国AI技术的强劲实力。
这股席卷海外开发者的流量风暴,背后依托的是由10万张国产算力芯片组成的超大集群。该集群全程承载了超大规模并发请求,累计处理流量高达62T Token,证明国产算力完全有能力支撑全球化、高并发的应用场景。在国际评测机构Artificial Analysis发布的综合智能指数中,GLM-5.3-Flash以57分的成绩追平海外顶级旗舰Claude Opus 4.8,而其实际调用价格仅为后者的四十分之一,重新定义了前沿智能的成本边界。
GLM-5.3-Flash的商业定价策略进一步巩固了其“价格屠夫”的地位。国内官方API标准定价为每百万Token输入0.8元、输出2.8元,仅为GLM-5.3的十分之一;上线期间实行半价后,价格降至二十分之一。与国际市场对比,其输入价格为0.3美元、输出1.2美元,半价期间输出价格仅为0.6美元,约为Claude Opus 4.8官方价格的四十分之一。这种极具竞争力的定价,使得前沿编程与Agent能力的门槛大幅降低。
从技术路径来看,GLM-5.3-Flash与前代模型有显著不同。它没有在既有重型底座上通过蒸馏、剪枝或后训练进行优化,而是从零开始设计了一套经济型专属架构。该架构总参数量为320B,但单次前向传播的激活参数被压缩至18B,模型层数从上一代的92层减少至45层。通过稀疏注意力与线性注意力的混合设计,以及自研的IndexPool技术和流形约束超连接(mHC),模型在单Token注意力计算量和KV缓存占用上分别下降了3.01倍和4.44倍,为国产算力的高效承载扫清了障碍。
在国产算力适配方面,智谱构建了专属推理服务栈。该服务栈在底层结合了节点内张量并行、ReplaySSM、W8A8量化与INT8/FP8/BF16混合缓存量化技术,同时配合自研Layersplit与KV broadcast通信优化;在集群调度层面,全面上线生产级Encode–Prefill–Decode(EPD)分离式架构。最终,这套运行在国产芯片上的服务栈端到端性能提升了3倍,硬件效率和单Token推理成本已基本追平主流英伟达GPU。
作为GLM家族首个原生多模态模型,GLM-5.3-Flash将多模态能力重点投向“视觉编码”领域。模型不仅能理解静态图像,还能观察代码渲染出的图形界面、3D空间或交互动态,并依据视觉反馈进行自主纠错与迭代。在开发者社区披露的案例中,有开发者通过该模型自主编写了50万至60万行代码,端到端生成了一个超大规模的可玩Web游戏;在工业制造领域,模型能直接读取CAD工程图纸草稿,编写出Python参数化代码,复刻复杂的3D机械零件。
在高阶生产力场景中,GLM-5.3-Flash同样表现出色。在金融领域,它能完成从多源信息溯源研报、SOTP估值、三表勾稽复核到DCF敏感性分析的全流程;在商务场景中,它能依据模板起草格式严谨的经销合作协议,直接生成具备专业排版质感的Word与PPT文档。这些能力使得模型在白领高阶生产力场景中具备直接交付价值。
随着大模型进入Agent落地期,行业竞争逻辑正在发生深刻变化。单纯比拼Benchmark跑分已难以维持开发者黏性,谁能通过架构创新和软硬协同压低真实推理成本,谁才能成为开发者工具链中的默认选项。就在智谱开源GLM-5.3-Flash的当晚,阿里也推出了主打极低激活参数的Qwen3.8-Flash,两家厂商不约而同地将发力点转向经济型推理模型,标志着中国AI厂商正在用更务实的工程解法争夺全球生产力底座的话语权。










