news 2026/9/9 19:06:24

“牛来模型”身世大揭秘!国产多模态低价大模型双开源,结尾附加限时免费GLM Coding Plan限量卡!!!!

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
“牛来模型”身世大揭秘!国产多模态低价大模型双开源,结尾附加限时免费GLM Coding Plan限量卡!!!!

前沿智能不再是奢侈品:两个「Flash」改写成本曲线

一周之内,两款「Flash 系」前沿模型先后落地:智谱的 GLM-5.3-Flash,通义千问的 Qwen3.8-Flash。把两份官方信息放在一起读,能读出同一个信号——前沿智能与前沿价格,正在解绑。

一、GLM-5.3-Flash:同样智力,1/40 价格

智谱方面提到,为收集广大用户的广泛、专业反馈,团队在正式发布前,以匿名模型Ox-Alpha(中文社区称作牛来)在OpenCode和OpenRouter上进行了大规模测试。Ox-Alpha迅速成为当周最受欢迎的模型,创下双平台调用量新高。

很长一段时间里,行业有一个默认前提:想要前沿能力,就得付前沿价格,这是技术进步必须支付的成本。

今天,GLM-5.3-Flash 把这个前提打碎了。

能力端。320B 总参数,能力超过上一代 GLM-5.2;在全球权威的 Artificial Analysis Intelligence Index(AA 综合智能指数)取得57 分,进入全球前沿模型能力区间,与 Anthropic 最受欢迎的模型Claude Opus 4.8 得分持平。在自研 Z.ai Code Bench 体感评估中,其编程表现同样与 Claude Opus 4.8 相当。

价格端。GLM-5.3-Flash 定价为 GLM-5.3 的1/10,限时折扣内为 GLM-5.3 的1/20,仅为Opus 4.8 的 1/40

把这两组数字放到同一条轴上,会得到一个很刺眼的点:57 分的前沿智力,落在低价区间的成本上。画在 AA 智能指数的帕累托前沿上,GLM-5.3-Flash(限时折扣价)是低价段少有的拐点——比它便宜一档,能力掉得厉害;比它贵一个数量级,分数却只多几格。

一句话:同样智力,1/40 价格,前沿智能,第一次不需要省着用。

这对开发者的意义,比对榜单更大。当前沿模型的单 token 成本降到 1/40,过去「偶尔调用大模型」的用法,可以换成「让 agent 全天挂着跑」——agentic 应用的规模上限,从来不是模型能力决定的,是边际成本决定的。

二、更深一层:国产芯片跑前沿模型

如果说定价是显性层,基础设施是隐性层。这次智谱走到了一步很多人没料到的地方:过去一周,首次在大规模流量中用国产芯片集群提供服务,芯片通过自研高带宽互联网络连接。

国产芯片单卡算力与内存容量相对有限,核心瓶颈在内存容量与带宽——在这样一块硬件上撑住 1M 上下文长度,是真问题。

智谱的解法是在 SGLang 基础上构建专用推理引擎,并对底层架构做激进的内存优化,核心是两条交换原则:

  • 以算力换带宽:用冗余计算降低访存压力
  • 以通信换显存:用节点内通信腾出稀缺的片上显存

具体技术栈包括:用于线性注意力和 LM head 的节点内张量并行ReplaySSMW8A8 量化INT8/FP8/BF16 混合缓存量化Layer Split等。集群层面采用生产级Encode–Prefill–Decode(EPD)分离式架构,把多模态编码、prompt 预填充、逐 token 解码拆成三个可独立调度、独立扩缩容的工作池。

结果:与同一硬件上的初始基线相比,端到端服务性能提升 3 倍,硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。

还有一个细节值得注意:整个构建工作由 GLM-5.3 驱动的 infra agent 大大加速——协助工程师开发与优化算子、诊断性能瓶颈、改进部署服务栈,形成「模型优化系统,系统承载模型」的正向循环。模型和底座互相喂养,这是这次发布里最有长期想象力的部分。

这件事的意义超出一次发布:它证明了国产芯片完全可以在大规模场景下高效、经济地支撑前沿模型的推理需求。前沿推理不再只是「谁的英伟达多」的单变量游戏,供应链自主第一次进入了第一梯队的记分牌。

三、Qwen3.8-Flash:每 token 只激活 6B

同一周,通义千问发布 Qwen3.8-Flash,定位与 GLM-5.3-Flash 高度同构:高效率前沿模型

它的架构参数很值得细看:

  • 多模态 MoE,主模型125B参数
  • 额外配备51B 的 N-gram Embedding
  • 每 token 仅激活6B参数
  • 原生支持262,144 token上下文,可经 YaRN 扩展至1M

定价方面:API输入 1 元 / 百万 tokens,输出 3 元 / 百万 tokens。已上线千问 AI 平台,今晚首发上线「千问办公」。

这里的设计信号是51B N-gram Embedding:它本质上是用「记忆」换「计算」——把高频固定模式从激活路径里挪到查表路径上,配合每 token 仅 6B 的激活量,把推理成本压到极致。这和 GLM 的「以算力换带宽」殊途同归:前沿能力 × 低边际成本的配方,正在收敛成一套标准答案。

四、「Flash」到底意味着什么

行业里「Flash / Lite / Mini」的命名传统,长期等于「缩水低端」。但把这次两个发布放在一起看,Flash 系的定义被改写了:

  1. 能力基线上移:GLM-5.3-Flash 以 AA 指数 57 分进入前沿区间、与 Opus 4.8 持平——Flash 不再是旗舰的小弟,而是旗舰的先锋。
  2. 架构路线收敛:MoE + 极致激活稀疏 + N-gram 记忆压缩 + 激进量化与内存优化,「前沿能力 × 低成本」的配方正在标准化。
  3. 硬件叙事改变:国产芯片集群 + EPD 分离架构,把「硬件主权」第一次带进前沿推理的一等公民名单。

剥到底层,正在发生的事是:智能的成本,正在比智能本身增长得更快下降。当一个 token 的边际成本跌破某个阈值,AI 应用的形态会从「工具」变成「基础设施」——agent 可以长时间跑而不看价格,这是下一张入场券。

五、上手入口

GLM-5.3-Flash

  • 正式面向全球开源,已接入 ZCode 等编码平台,同步开放 API 调用
  • 纳入 GLM Coding Plan:7 天体验卡每天限量发放 10,000 张(从未订阅过套餐的用户可领取);所有套餐用户的体验卡数量已重置
  • 领取链接:https://bigmodel.cn/activity/trial-card/PU9MTWG0PM

Qwen3.8-Flash

  • 千问 AI 平台:https://www.qianwenai.com/models/qwen3.8-flash
  • 技术报告:https://github.com/QwenLM/Qwen3.8-Flash-Next/blob/main/tech_report.pdf
  • 技术博客:https://qwen.ai/blog?id=qwen3.8-flash-next
  • Hugging Face:https://huggingface.co/Qwen/Qwen3.8-Flash-Next
  • ModelScope:https://modelscope.cn/models/Qwen/Qwen3.8-Flash-Next

以上基准数据均来自官方发布与官方对比图;不同评测口径下分数可能存在差异,细节以官方技术报告为准。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/30 15:26:11

Keras自定义损失函数:解决Unknown loss function错误与Focal Loss实践

1. 问题场景与核心痛点解析“ValueError: Unknown loss function: focal_loss”这个错误,对于任何一个在Keras框架下尝试使用自定义损失函数,尤其是像Focal Loss这样热门但非内置函数的开发者来说,都像是一盆冷水。你满怀期待地编译模型&…

作者头像 李华
网站建设 2026/9/9 19:03:52

动效性能要在真实设备上测量

动效性能要在真实设备上测量Canvas 背景和 CSS 滤镜可以共存,但它们不该抢走输入响应的预算。判断要不要上 OffscreenCanvas,先看真实页面:主线程是否被绘制占住、目标浏览器是否支持、静态替代是否完整。不是每个粒子效果都值得引入 Worker。…

作者头像 李华
网站建设 2026/9/9 19:02:55

MoveKit:一款功能强大的Cobalt Strike横向渗透套件

关于MoveKit MoveKit是一款功能强大的Cobalt Strike横向渗透套件,本质上来说MoveKit是一个Cobalt Strike扩展,它利用的是SharpMove和SharpRDP .NET程序集的execute_assembly函数实现其功能,攻击脚本能够通过读取指定类型的模板文件来处理Payl…

作者头像 李华
网站建设 2026/8/30 14:56:28

AI创作者实践指南:本地部署AI绘画工具链与提示词工程

AI时代的创作者正处在一个很有意思的交叉口:过去我们习惯把“懂艺术”“会设计”“搞技术”当成三种完全不同的职业路径,但生成式 AI 把三者狠狠拉到了同一条赛道上。ZHO 谈 AI 时代创作者需要融合艺术、设计与科学,这个观点放到实际生产环境…

作者头像 李华
网站建设 2026/8/30 14:04:50

C语言与汇编混合编程实战:从调用约定到性能优化

1. 项目概述:混合编程的“破壁”之旅搞汇编的兄弟,是不是总觉得这玩意儿离现代开发有点远?寄存器、中断、端口地址,写起来爽是爽,但一遇到复杂逻辑或者图形界面就头大。反过来,用惯了C、Python的哥们&#…

作者头像 李华
网站建设 2026/8/30 17:58:25

数模竞赛必备:Pandas数据处理从入门到实战精讲

1. 为什么数模竞赛选手必须啃下Pandas这块硬骨头?如果你正在准备数学建模竞赛,或者刚刚开始接触数据分析,那你大概率已经听过Pandas这个名字了。很多新手教程会告诉你:“Pandas是Python的数据分析库,用它来处理表格数据…

作者头像 李华