news 2026/9/8 18:39:10

原生多模态・极致性价比|GLM‑5.3‑Flash 上线魔乐社区

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
原生多模态・极致性价比|GLM‑5.3‑Flash 上线魔乐社区

8月26日,智谱正式上线并开源GLM-5.3-Flash(320B-A18B)——这是 GLM-5 系列的首个原生多模态模型。

320B 总参数,能力超越 GLM-5.2,在全球权威的Artificial Analysis Intelligence Index(AA 综合智能指数)中取得 57 分,进入全球前沿模型能力区间,与Anthropic最受欢迎的Claude Opus 4.8 得分持平。

更值得关注的是:过去一周的大规模流量 由国产芯片集群提供服务。

GLM-5.3-Flash 已上线魔乐社区,开发者可直接下载开源权重。

📌 链接:https://modelers.cn/models/zhipuai/GLM-5.3-Flash

01 模型亮点

极致性价比:一半参数,更强能力,十分之一价格

GLM-5.3-Flash 的架构专为极低成本设计。总参数量与 GLM-4.5 相当(320B vs 355B),但激活参数量从 32B 降到 18B,层数从 92 层减半到 45 层——却在各项基准测试和实际使用中全面超越参数量高出一倍的 GLM-5.2,定价仅为后者的 1/10。

这得益于两项关键架构创新:

稀疏注意力 + 线性注意力混合架构

首个采用该架构的开源前沿模型,线性注意力通过递归机制捕获局部依赖关系,稀疏注意力则借助轻量级索引器召回全局上下文,在保持精准长上下文能力的同时大幅降低服务成本。

流形约束超连接(mHC)

进一步提升模型 Scaling 效率,让更少的计算资源产出更强的性能。

结合智谱最新的 30T Token 多模态预训练语料,GLM-5.3-Flash 能用更少的计算资源实现更强的性能。支持 1M Token 超长上下文,同时支持图像和视频输入。

官方博客:https://z.ai/blog/glm-5.3-flash

原生多模态:代码循环中的视觉反馈

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型。视觉编码不只是“处理图片”,它拓展了编程能触及的边界。

对于前端开发、游戏开发、3D 仿真等任务,最终产物是用户能感知的界面、交互或虚拟世界。视觉能力被原生集成进模型后,它能自主判断何时需要“观察”,并利用视觉反馈指导下一步行动——很多问题只有在渲染、交互或试玩时才会暴露。

智谱为此开发了数据合成流水线,聚焦模型的自我视觉判断与测试时改进。在前端 Coding 方面,还探索了基于环境反馈的强化学习,通过真实用户流程的 Agent 验证强化 GUI 判断能力,把验证范畴从功能正确性延伸到渲染效果与交互体验。

「Code 让模型构建和改变世界,Vision 让它进入人们看见和使用的世界。」

一个令人意外的发现:Coding 成了模型表达并检验世界知识的代理。在没有任何外部素材的情况下,GLM-5.3-Flash 自主运行 16 个小时,在 Blender 中搭建了一套约 400 平方米的专业主厨自宅与测试厨房——几何、材质、光照、空间,在不同视角下都保持一致。

在 ZCode 中,Browser Use Agent(BUA)与 Computer Use Agent(CUA)进一步拓展多模态能力,让模型在代码、浏览器与图形界面之间协同工作,同时观察并验证自身输出。以下是在ZCode中使用GLM-5.3-Flash实测合集:从图像到可运行工程,从两小时电影到8分钟成片,以及可直接交付的白领专业文档。

超越 Coding:专业工作的全能伙伴

视觉理解能力让 GLM-5.3-Flash 在专业工作中表现显著提升。针对 PPTX、PDF、DOCX、XLSX 等 Office 文档任务,模型能检查并优化自身输出,具备更强的审美判断——可以将输出结果与视觉上下文、预期结果对比,实现更有效的自我验证与优化。

金融领域

覆盖从基于来源的金融研究、报告生成到金融建模与分析的完整流程,全程提供可追溯的参考依据。

法律领域

能审查合同中的费用、账户与责任条款,按律师惯例批注留痕;也能起草律师函、合同与诉讼文书,格式版式符合实务规范,生成即可交付。

02 跑在国产芯片上

过去一周,GLM-5.3-Flash 首次在大规模流量中用国产芯片集群提供服务,芯片通过自研高带宽互联网络连接。

挑战与突破

单张国产芯片的算力与内存容量相对有限,尤其是支持 1M 上下文长度对内存容量和带宽要求极高。智谱团队做了以下优化:

  1. 专用推理引擎:在 SGLang 基础上构建专用推理引擎。值得一提的是,整个构建工作由 GLM-5.3 驱动的 infra agent大大加速——它协助工程师开发优化算子、诊断性能瓶颈、改进部署服务栈,形成“模型优化系统,系统承载模型”的正向循环。

  2. 激进的内存优化:针对底层架构进行以算力换带宽、以通信换显存等定制优化。技术栈结合了线性注意力和 LM head 的节点内张量并行、ReplaySSM、W8A8 量化、INT8/FP8/BF16 混合缓存量化,以及 Layer Split 等技术。

  3. EPD 分离架构:集群层面采用生产级 Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、prompt 预填充和逐 token 解码拆分为可独立调度、独立扩缩容的工作池,在数万颗国产加速芯片上实现高效可靠的服务。

结果

3×: 端到端性能提升

持平: 硬件效率与单 token 成本对标英伟达 GPU

💡 国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。

03 下载体验

GLM-5.3-Flash 已正式面向全球开源,欢迎广大开发者在魔乐社区下载权重:

https://modelers.cn/models/zhipuai/GLM-5.3-Flash

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/8 18:39:09

终端AI编程代理opencode实践指南:安装、模型接入与Skills配置

最近大半年,我把主力编程环境从IDE的AI插件,慢慢挪到了终端里的AI Agent上。前后试了Claude Code、Codex CLI,最后日常用得最多的反而是opencode。这项目是SST团队开源的,在GitHub上叫sst/opencode,主打一个“终端里的…

作者头像 李华
网站建设 2026/9/8 18:38:37

opencode:开源终端AI编程助手安装配置与实战指南

如果你跟我一样,习惯在终端里用 AI 干活,最近一定绕不开一个名字:opencode。它不是一个 IDE 插件,也不只是"另一个 ChatGPT 壳子",而是一个真正跑在命令行里、能读你代码、改你文件、执行你命令的开源 AI 编…

作者头像 李华
网站建设 2026/9/8 18:38:14

CodeGraph 安装部署指南:给 AI 编码助手装上本地代码知识图谱

CodeGraph 安装部署指南:给 AI 编码助手装上本地代码知识图谱 【免费下载链接】codegraph Pre-indexed code knowledge graph, auto syncs on code changes, for Claude Code, Codex, Gemini, Cursor, OpenCode, AntiGravity, Kiro, CoPilot, and Hermes Agent — f…

作者头像 李华
网站建设 2026/9/8 18:37:30

爱享素材下载器:5分钟抓取视频号短视频存到电脑

爱享素材下载器:5分钟抓取视频号短视频存到电脑 【免费下载链接】res-downloader 视频号、小程序、抖音、快手、小红书、直播流、m3u8、酷狗、QQ音乐等常见网络资源下载! 项目地址: https://gitcode.com/GitHub_Trending/re/res-downloader 爱享素材下载器&a…

作者头像 李华
网站建设 2026/9/8 18:36:00

图表设计实战:从架构图到Graphviz的完整指南

很多项目最后发现推倒重来的原因,不是需求没对齐,而是那张图没人看懂。这里说的“图”,不只是UI设计稿,而是架构图、流程图、时序图、ER图、拓扑图这类用于表达逻辑关系的diagram。diagram-design(图表设计&#xff09…

作者头像 李华