智谱正式发布并开源 GLM-5.3-Flash
智谱正式发布并开源原生多模态模型
GLM-5.3-Flash,该模型总参数 320B、激活参数 18B,采用稀疏注意力与线性注意力混合架构。官方称其在各项基准测试和实际使用中全面超越GLM-5.2。发布前该模型以匿名名称Ox Alpha在OpenCode和OpenRouter免费测试。在GLM Coding Plan中调用GLM-5.3-Flash的可用额度是GLM-5.3的 3 倍,同时为庆祝模型发布,官方重置了GLM Coding Plan用户的额度。国内 API 定价为GLM-5.3的十分之一,同时上线五折优惠限时两周。
智谱正式发布并开源原生多模态模型 GLM-5.3-Flash。
该模型总参数 320B、激活参数 18B,原生支持文本、图片和视频输入,支持 1M 上下文。
模型以 MIT License 开源,权重已在 HuggingFace 公开。
发布前,智谱以代号 Ox Alpha 在 OpenCode 和 OpenRouter 上进行大规模测试。
架构方面,GLM-5.3-Flash 是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,并采用流形约束超连接进一步提升 scaling 能力。
官方通过 IndexPool 将索引器的 4 个缓存向量压缩为 1 个,以降低 1M 上下文下的时延与内存开销。
性能方面,官方称 GLM-5.3-Flash 在 Artificial Analysis Intelligence Index v4.1.1 中取得 57 分。
在六项 coding 和 agentic 基准中全面超越 GLM-5.2。
官方基座模型评测显示,GLM-5.3-Flash-Base 整体超越 GLM-4.5-Base,在大多数基准上与 GLM-5-Base 相当。
能力方面,视觉能力被原生融入 Coding 循环,模型可在代码、浏览器和图形界面之间协同工作,支持前端开发、游戏构建、Blender 3D 场景以及 BUA、CUA 驱动的真实环境操作。
使用上,思考模式不可关闭,thinking.type 仅支持 enabled。
推理服务方面,智谱称过去一周首次在大规模流量中使用国产芯片集群提供服务,芯片通过自研高带宽互联网络连接。
Ox Alpha 测试期间的全部流量也由国产芯片提供算力。
官方称与同一硬件上的初始基线相比,端到端服务性能提升 3 倍,硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。
定价与可用性方面,在GLM Coding Plan 中调用 GLM-5.3-Flash 的可用额度是 GLM-5.3 的 3 倍。
同时为庆祝模型发布,官方重置了GLM Coding Plan用户的额度。
国内 API 定价原价为 GLM-5.3 的十分之一,并开启限时两周五折折扣。





相关链接:















