8月14日,智谱正式推出新一代大模型 glm-5.3。其基座参数量仍维持在7400亿级别,与 glm-5.2 共享同一技术底座,此前外界热议的“万亿参数”升级并未落地——该升级极有可能被预留至后续版本 glm-5.5。不过,智谱通过强化后训练策略,成功将 glm-5.3 的综合性能较前代提升达50%,在多项主流评测中登顶开源模型榜首,编程能力与智能体表现已逼近 claude fable5,实际编码体验更优于其他国产竞品。
几项核心基准测试成绩跃升尤为亮眼。在评估模型于真实终端环境执行复杂任务的 Terminal-Bench3.0 中,得分由4.6飙升至28.3;聚焦长周期软件工程与持续代码迭代能力的 DeepSWE v1.1,分数从46.2跃升至66.9;面向多工具协同、长程任务规划的 Agents' Last Exam,则由23.8提升至28.5。而在覆盖44类职业、深度检验高价值专业知识应用能力的 GDPval-AA v2 测评中,GLM-5.3斩获1769分,印证了其依托强大编程能力所涌现的专业级任务执行实力。总体而言,该模型在复杂软件开发、终端交互操作及泛化性更强的真实世界 Agent 场景中均实现显著突破。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

最具说服力的是智谱自主研发的 Z.ai Code Bench 评测体系——该框架将模型直接部署于真实本地开发环境,在不同推理强度档位下完成端到端编程任务,最大程度还原开发者使用 Coding Agent 的真实体验。测试数据显示,GLM-5.3 在效果与 Token 效率之间实现了更优权衡:High 档位下准确率达31.4%,超越 Claude Opus4.8 最高档位的29.5%;而单任务平均输出仅约5万 tokens,Opus4.8 则需约12万 tokens——表明 GLM-5.3 能以更精简的推理路径达成同等甚至更高水准的任务完成质量。

在产品落地层面,GLM-5.3 已于即日起上线智谱官方编程平台 ZCode 与效率工具 AutoClaw,并向 GLM Coding Plan 全量用户及订阅用户全面开放。同时,TraeWork、TraeCode、扣子、WorkBuddy、CodeBuddy、Qoder、QwenWork、CatPaw、JoyCode、OpenCode 等主流第三方编码平台也同步开启抢先体验通道。API 接口即将上线,完整模型权重将在完成为期两周的安全加固后正式开源——智谱此次采取审慎策略,在严格限制模型潜在滥用风险的同时,充分保留其防御性价值与安全可用性。今日13:00起,GLM Coding Plan 全体用户的调用配额已完成重置,所有用户后台用量统计均已显示额度满额。











