智谱AI近日发布了新一代大模型GLM-5.3,这款被创始人唐杰称为“史诗级plus”的模型,在性能上实现了显著突破。与前代GLM-5.2相比,GLM-5.3并未增加基座参数规模,而是通过优化后训练阶段——延长训练时间、丰富任务环境、扩大强化学习规模,实现了能力跃升。智谱将这一方法论命名为“后训练Scaling”,并强调基座模型的智能潜力远未被完全挖掘。
在行业竞速的背景下,GLM-5.3的发布显得尤为关键。过去两个月,大模型领域几乎以“周更”速度迭代:Kimi K3凭借2.8万亿参数规模引发关注后,有网友曾质疑GLM系列能否跟上节奏。唐杰以“史诗级plus”的回应,如今被数据验证——在Terminal-Bench 3.0基准测试中,GLM-5.3得分从4.6飙升至28.3;在DeepSWE v1.1长程软件工程测试中,得分从46.2提升至66.9,两项指标均位列开源模型第一。在覆盖44种职业知识工作的GDPval-AA v2测试中,GLM-5.3以1769分超越Kimi K3的1682分。
编程能力是GLM-5.3的另一大亮点。在智谱自研的Z.ai Code Bench评测中,该模型在High档位准确率达31.4%,超过Claude Opus 4.8的29.5%,且每任务输出约5万tokens,仅为后者的不到一半。不过,在Max档位测试中,GLM-5.3(34.5%)仍略低于Claude Fable 5(39.5%)。网络安全领域同样表现突出:在国际漏洞推理评测CyberGym中,GLM-5.3以84.5%的成绩超越Anthropic的Mythos 5(83.8%)和GPT-5.6 Sol(83.6%);在ExploitBench深度推理测试中,得分54.4%,较上一代模型(24.4%)翻倍,接近国际顶尖水平。
GLM-5.3的发布恰逢全球大模型市场定价策略剧变。8月初,OpenAI将GPT-5.6 Luna的API价格下调80%,谷歌随后推出五折促销的Gemini 3.7 Flash,Anthropic也将Claude Opus 5定价砍半。海外巨头降价的核心原因,是应对Kimi K3、DeepSeek V4等国产模型的冲击。与此同时,国产模型却集体告别“低价策略”:DeepSeek V4-Pro高峰时段输出价格从6元涨至27元,Kimi K3输出定价达100元/百万token,较前代上涨2至3倍。智谱GLM系列也经历多轮提价,中国大模型平均API输出价格已从2025年一季度的12.2元/百万token升至2026年二季度的21.9元/百万token。
尽管智谱未披露GLM-5.3的具体定价,但行业分析指出,若沿用GLM-5.2的API价格(输入8元/百万token、输出28元/百万token),其成本已与DeepSeek V4-Pro高峰时段(输入9元、输出27元)基本持平。这一趋势背后,是国产模型从“性价比换市场”向“价值变现”的战略转型。GLM-5.3的选择尤为耐人寻味——它未加入参数规模竞赛,而是通过后训练工程挖掘现有基座的潜力。这条路径能否持续,取决于三个关键因素:后训练Scaling的技术红利能维持多久、开源模型的安全管控能否经受考验,以及在海外降价与国产涨价的双重变局中,GLM-5.3能否凭借编程开源与安全能力,在开发者生态中构建不可替代性。










