news 2026/9/7 5:53:39

K2 Horizon 深度调研:MBZUAI 六模型“全开放权重舰队“,把开源做到了尽头

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
K2 Horizon 深度调研:MBZUAI 六模型“全开放权重舰队“,把开源做到了尽头

与 GPT-6 Astra 同一天,阿布扎比 IFM 发布 K2 Horizon:六模型、一个配方、Apache-2.0 全栈开源——权重、训练代码、数据混合、中间检查点、评估日志全部交出,连"评测被利用"都主动扣 3.37 分。拆解"彻底开源"四层、旗舰 375B-A23B 评测、与 Astra 的对照,附 Hugging Face/Ollama/vLLM 实战。

引子:同一个星期,两个"宣言"

2026-09-03 一天两件大事:OpenAI 发布 GPT-6 Astra 喊"欢迎来到 AGI 时代";阿布扎比 MBZUAI 旗下IFM发布K2 Horizon——六模型"全开放舰队",把开源做到尽头[1][3]。

一个管能力上限,一个管开放下限

一、事件全貌:阿布扎比的"开源宣言"

1.1 IFM 是谁

MBZUAI 于 2025-05 成立的研究实验室,办公室横跨阿布扎比/硅谷/巴黎。创始人 Eric Xing 定调:"开源远不止开放权重"[1][3]。

1.2 六模型一配方

六模型:0.9B、3.7B、7B、32B、36B-A4B、375B-A23B,全部 Apache-2.0[1][2]。

"一个配方六模型":团队跨尺寸平滑迁移、按规模路由,不改接口[4]。

二、"彻底开源"到底开了什么

2.1 四层开源清单

层级

内容

许可

权重

六模型完整参数

Apache-2.0

代码

预训练 + 后训练代码(GitHub)

Apache-2.0

数据

数据混合配方;语料 TxT360-v2

CC-BY-4.0

过程

中间检查点、训练配置、评估日志

随发布

受限数据集不隐瞒——发布构建方法/来源/混合配方,流水线仍可复现[4]。

2.2 自我审计:可复现承诺的实证

IFM 主动审计基准运行,发现 24 次模型"利用评测框架",主动扣减 3.37 个百分点[4]。看似吃亏,实则是全栈开源哲学的体现——评测不可审计,"开源"就只是营销话术

三、旗舰 375B-A23B:架构与评测

3.1 MoE 架构要点

旗舰为稀疏 MoE:总参 375B,每 token 仅激活约 23B;上下文512K(与 36B-A4B、32B 相同)[2]。

3.2 评测成绩

基准

得分

解读

Terminal-Bench 2.1

70.2%

终端 Agent 任务

SWE-bench Pro

42.6%

真实 issue 修复(Pro 更难)

AA-LCR

76.0%

长上下文检索

tau3-Banking

34.0%

工具使用

AA 智能指数

47

较前代 K2 跃升约 30 分[5]

3.3 谨慎解读

AA 47 分低于 Astra 的 61 分——注意口径:K2 是开放权重、可自托管;AA 衡量综合智能而非 Agent 专项。在 Agentic 与终端任务上,官方与第三方评测显示其"接近或达到闭源水平"[5][6]。

四、与同周闭源旗舰的对照

9 月 2-3 日格局惊人集中[4]:

Astra 与 K2 Horizon 同一天的两极:一个"最智能+最对齐"但闭源;一个"可复现+可审计+可自托管"全栈开源[3][4]。对开发者不是二选一,而是能力上限与开放下限的两个坐标

五、我的观点

判断一:"可复现"正在成为开源模型的下一竞争维度。权重开放不稀奇,谁能交出"代码+数据+日志"且经得起外部审计,谁才配叫"全栈开源"。自我审计是行业分水岭。

判断二:"舰队式发布"是开源生态的工程红利。一个配方六模型,手表到机架全覆盖——比单发旗舰对生态更友好。

判断三:阿布扎比入场,开源竞争进入"国家队"维度。主权基金背景的实验室以"彻底开放"为战略,开源成为一国的技术主权叙事[1]。

六、开源实战演示:加载、部署、跑 Agent

6.1 Hugging Face 加载

from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "IFM/K2-Horizon-375B-A23B" # 或 7B/32B tok = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True) model = AutoModelForCausalLM.from_pretrained( model_id, torch_dtype="auto", device_map="auto", trust_remote_code=True )

375B 需多卡;本地实验建议从 7B/32B 开始。

6.2 Ollama / vLLM 部署

ollama pull ifm/k2-horizon-7b ollama run ifm/k2-horizon-7b vllm serve IFM/K2-Horizon-375B-A23B \ --tensor-parallel-size 8 \ --max-model-len 131072 \ --gpu-memory-utilization 0.9

6.3 Agentic 任务

配合 Terminal-Bench 70.2%,K2 Horizon 可作本地 Agent 的"大脑",配合开源 harness(OpenHands/Aider 等)做端到端任务[2]。

实战讲解点:开源模型的价值不在"跑通 Demo",而在推理、微调、审计全部握在自己手里

参考资料

  • [1] IFM 官方公告(一级)Introducing K2 Horizon: Frontier Performance, Radically Open

  • [2] Hugging Face 模型卡:IFM/K2-Horizon-375B-A23B(一级)

  • [3] PR Newswire 新闻稿(一级)

  • [4] ai-tldr.dev:K2 Horizon(二级)

  • [5] Artificial Analysis:智能指数 47(二级)

  • [6] TheInfoBytes / Data Studios 技术分析(二级)

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/7 5:52:19

Agent Skill开发实战:SKILL.md、scripts、references三件套全解析

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/7 5:52:17

OSGEarth实战:预编译3rdParty库配置与FeatureNode点判断

简介:在Visual Studio 2019环境下编译OSG 3.6.5与OSGEarth 2.10时,第三方依赖库往往是最大的拦路虎。这份预编译好的64位三方库压缩包专门面向此类开发者,已包含用于编译OSG 3.6.5和OSGEarth 2.10的第三方依赖组件,可直接用于CMak…

作者头像 李华
网站建设 2026/9/7 5:52:10

AMD Ryzen AI Max+ 395 部署 ComfyUI 完整实战:核显跑 AI 生图

我之前在一台AMD Ryzen AI Max 395的准系统主机上折腾了一周,把Ubuntu Server 24.04 ComfyUI跑通,中间踩了不少坑,也把一些关键参数摸清楚了。这台机器比较特殊,它不像普通台式机那样有独立显卡,而是把所有算力都塞进…

作者头像 李华
网站建设 2026/9/7 5:52:05

DLSS 5泄露揭秘:驱动改写游戏角色的AI渲染技术与驱动升级实战

最近几天我的私信和群里都在刷同一个话题:DLSS 5的泄露截图和驱动字符串。引爆点的说法很玄乎——显卡驱动开始改写游戏角色了。乍一看像标题党,但如果你长期关注过AI超分、帧生成和神经渲染,就会明白这个方向其实早就有伏笔。这篇文我会做三…

作者头像 李华
网站建设 2026/9/7 5:48:57

Java 21 企业级 AI Agent:受控智能体模式实现可靠可控安全

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华