8月26日,智谱正式上线并开源GLM-5.3-Flash(320B-A18B)——这是 GLM-5 系列的首个原生多模态模型。
320B 总参数,能力超越 GLM-5.2,在全球权威的Artificial Analysis Intelligence Index(AA 综合智能指数)中取得 57 分,进入全球前沿模型能力区间,与Anthropic最受欢迎的Claude Opus 4.8 得分持平。
更值得关注的是:过去一周的大规模流量 由国产芯片集群提供服务。
GLM-5.3-Flash 已上线魔乐社区,开发者可直接下载开源权重。
📌 链接:https://modelers.cn/models/zhipuai/GLM-5.3-Flash
01 模型亮点
极致性价比:一半参数,更强能力,十分之一价格
GLM-5.3-Flash 的架构专为极低成本设计。总参数量与 GLM-4.5 相当(320B vs 355B),但激活参数量从 32B 降到 18B,层数从 92 层减半到 45 层——却在各项基准测试和实际使用中全面超越参数量高出一倍的 GLM-5.2,定价仅为后者的 1/10。
这得益于两项关键架构创新:
稀疏注意力 + 线性注意力混合架构
首个采用该架构的开源前沿模型,线性注意力通过递归机制捕获局部依赖关系,稀疏注意力则借助轻量级索引器召回全局上下文,在保持精准长上下文能力的同时大幅降低服务成本。
流形约束超连接(mHC)
进一步提升模型 Scaling 效率,让更少的计算资源产出更强的性能。
结合智谱最新的 30T Token 多模态预训练语料,GLM-5.3-Flash 能用更少的计算资源实现更强的性能。支持 1M Token 超长上下文,同时支持图像和视频输入。
官方博客:https://z.ai/blog/glm-5.3-flash
原生多模态:代码循环中的视觉反馈
GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型。视觉编码不只是“处理图片”,它拓展了编程能触及的边界。
对于前端开发、游戏开发、3D 仿真等任务,最终产物是用户能感知的界面、交互或虚拟世界。视觉能力被原生集成进模型后,它能自主判断何时需要“观察”,并利用视觉反馈指导下一步行动——很多问题只有在渲染、交互或试玩时才会暴露。
智谱为此开发了数据合成流水线,聚焦模型的自我视觉判断与测试时改进。在前端 Coding 方面,还探索了基于环境反馈的强化学习,通过真实用户流程的 Agent 验证强化 GUI 判断能力,把验证范畴从功能正确性延伸到渲染效果与交互体验。
「Code 让模型构建和改变世界,Vision 让它进入人们看见和使用的世界。」
一个令人意外的发现:Coding 成了模型表达并检验世界知识的代理。在没有任何外部素材的情况下,GLM-5.3-Flash 自主运行 16 个小时,在 Blender 中搭建了一套约 400 平方米的专业主厨自宅与测试厨房——几何、材质、光照、空间,在不同视角下都保持一致。
在 ZCode 中,Browser Use Agent(BUA)与 Computer Use Agent(CUA)进一步拓展多模态能力,让模型在代码、浏览器与图形界面之间协同工作,同时观察并验证自身输出。以下是在ZCode中使用GLM-5.3-Flash实测合集:从图像到可运行工程,从两小时电影到8分钟成片,以及可直接交付的白领专业文档。
超越 Coding:专业工作的全能伙伴
视觉理解能力让 GLM-5.3-Flash 在专业工作中表现显著提升。针对 PPTX、PDF、DOCX、XLSX 等 Office 文档任务,模型能检查并优化自身输出,具备更强的审美判断——可以将输出结果与视觉上下文、预期结果对比,实现更有效的自我验证与优化。
金融领域
覆盖从基于来源的金融研究、报告生成到金融建模与分析的完整流程,全程提供可追溯的参考依据。
法律领域
能审查合同中的费用、账户与责任条款,按律师惯例批注留痕;也能起草律师函、合同与诉讼文书,格式版式符合实务规范,生成即可交付。
02 跑在国产芯片上
过去一周,GLM-5.3-Flash 首次在大规模流量中用国产芯片集群提供服务,芯片通过自研高带宽互联网络连接。
挑战与突破
单张国产芯片的算力与内存容量相对有限,尤其是支持 1M 上下文长度对内存容量和带宽要求极高。智谱团队做了以下优化:
专用推理引擎:在 SGLang 基础上构建专用推理引擎。值得一提的是,整个构建工作由 GLM-5.3 驱动的 infra agent大大加速——它协助工程师开发优化算子、诊断性能瓶颈、改进部署服务栈,形成“模型优化系统,系统承载模型”的正向循环。
激进的内存优化:针对底层架构进行以算力换带宽、以通信换显存等定制优化。技术栈结合了线性注意力和 LM head 的节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合缓存量化,以及 Layer Split 等技术。
EPD 分离架构:集群层面采用生产级 Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt 预填充和逐 token 解码拆分为可独立调度、独立扩缩容的工作池,在数万颗国产加速芯片上实现高效可靠的服务。
结果
3×: 端到端性能提升
持平: 硬件效率与单 token 成本对标英伟达 GPU
💡 国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。
03 下载体验
GLM-5.3-Flash 已正式面向全球开源,欢迎广大开发者在魔乐社区下载权重:
https://modelers.cn/models/zhipuai/GLM-5.3-Flash