智谱开源GLM-5.3-Flash:320B总参仅18B激活,价格只有Opus 4.8的1/40

AI科技热点2天前更新
8 00

智谱AI于2026年8月26日正式发布并开源新一代大模型GLM-5.3-Flash:总参数量320B、激活参数仅18B,采用MIT许可证,支持1M token超长上下文与原生多模态能力。该模型在权威的Artificial Analysis智能指数中拿到57分,与Anthropic Claude Opus 4.8持平,而价格仅为后者的约1/40,被业内视为”开源高性价比”的新标杆。

智谱GLM-5.3-Flash大模型架构图

从匿名爆火到正式开源

GLM-5.3-Flash正是此前以”ox-alpha”代号在OpenCode和OpenRouter上匿名测试、并登顶当周最受欢迎榜单的模型。它完全运行在国产AI芯片大型集群上,团队基于SGLang构建专用推理引擎,端到端服务性能较同硬件基线提升约3倍,硬件效率与单token成本已接近主流NVIDIA GPU方案。

混合注意力架构带来的效率革命

该模型是首个采用稀疏注意力+线性注意力混合架构的开源前沿模型,相比GLM-5.3,注意力计算量和KV缓存大小分别降低3.01倍与4.44倍,并引入IndexPool与流形约束超连接(mHC)进一步压降长上下文推理开销。官方数据称,它把”智能/价格”帕累托前沿推进到此前约10倍价格才能达到的水平,每任务成本仅约0.045美元(折扣价)。

获取与部署方式

GLM-5.3-Flash已全量上线GLM Coding Plan(额度为GLM-5.3的3倍),权重在HuggingFace开放下载(MIT许可证),本地部署支持SGLang、vLLM、TokenSpeed,API已同步上线docs.z.ai全平台,ZCode还解锁了Browser Use与Computer Use能力。

常见问题(FAQ)

总参数量320B、激活参数18B;定价约为GLM-5.3的1/10,限时折扣为1/20,约为Claude Opus 4.8的1/40。

支持1M token(约100万token)上下文,原生支持视频、图像、文本、文件多模态输入;采用MIT开源许可证,权重开放下载,允许免费商用。

在Artificial Analysis智能指数(AA指数)中得分57分,与Claude Opus 4.8持平;自研Z.ai Code Bench编码测试中表现也与其相当,但具体场景仍需按需实测。

© 版权声明

相关文章

暂无评论

none
暂无评论...