智谱AI于2026年8月26日正式发布并开源新一代大模型GLM-5.3-Flash:总参数量320B、激活参数仅18B,采用MIT许可证,支持1M token超长上下文与原生多模态能力。该模型在权威的Artificial Analysis智能指数中拿到57分,与Anthropic Claude Opus 4.8持平,而价格仅为后者的约1/40,被业内视为”开源高性价比”的新标杆。

从匿名爆火到正式开源
GLM-5.3-Flash正是此前以”ox-alpha”代号在OpenCode和OpenRouter上匿名测试、并登顶当周最受欢迎榜单的模型。它完全运行在国产AI芯片大型集群上,团队基于SGLang构建专用推理引擎,端到端服务性能较同硬件基线提升约3倍,硬件效率与单token成本已接近主流NVIDIA GPU方案。
混合注意力架构带来的效率革命
该模型是首个采用稀疏注意力+线性注意力混合架构的开源前沿模型,相比GLM-5.3,注意力计算量和KV缓存大小分别降低3.01倍与4.44倍,并引入IndexPool与流形约束超连接(mHC)进一步压降长上下文推理开销。官方数据称,它把”智能/价格”帕累托前沿推进到此前约10倍价格才能达到的水平,每任务成本仅约0.045美元(折扣价)。
获取与部署方式
GLM-5.3-Flash已全量上线GLM Coding Plan(额度为GLM-5.3的3倍),权重在HuggingFace开放下载(MIT许可证),本地部署支持SGLang、vLLM、TokenSpeed,API已同步上线docs.z.ai全平台,ZCode还解锁了Browser Use与Computer Use能力。
常见问题(FAQ)
总参数量320B、激活参数18B;定价约为GLM-5.3的1/10,限时折扣为1/20,约为Claude Opus 4.8的1/40。
支持1M token(约100万token)上下文,原生支持视频、图像、文本、文件多模态输入;采用MIT开源许可证,权重开放下载,允许免费商用。
在Artificial Analysis智能指数(AA指数)中得分57分,与Claude Opus 4.8持平;自研Z.ai Code Bench编码测试中表现也与其相当,但具体场景仍需按需实测。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...












