与 GPT-6 Astra 同一天,阿布扎比 IFM 发布 K2 Horizon:六模型、一个配方、Apache-2.0 全栈开源——权重、训练代码、数据混合、中间检查点、评估日志全部交出,连"评测被利用"都主动扣 3.37 分。拆解"彻底开源"四层、旗舰 375B-A23B 评测、与 Astra 的对照,附 Hugging Face/Ollama/vLLM 实战。
引子:同一个星期,两个"宣言"
2026-09-03 一天两件大事:OpenAI 发布 GPT-6 Astra 喊"欢迎来到 AGI 时代";阿布扎比 MBZUAI 旗下IFM发布K2 Horizon——六模型"全开放舰队",把开源做到尽头[1][3]。
一个管能力上限,一个管开放下限。
一、事件全貌:阿布扎比的"开源宣言"
1.1 IFM 是谁
MBZUAI 于 2025-05 成立的研究实验室,办公室横跨阿布扎比/硅谷/巴黎。创始人 Eric Xing 定调:"开源远不止开放权重"[1][3]。
1.2 六模型一配方
六模型:0.9B、3.7B、7B、32B、36B-A4B、375B-A23B,全部 Apache-2.0[1][2]。
"一个配方六模型":团队跨尺寸平滑迁移、按规模路由,不改接口[4]。
二、"彻底开源"到底开了什么
2.1 四层开源清单
层级 | 内容 | 许可 |
|---|---|---|
权重 | 六模型完整参数 | Apache-2.0 |
代码 | 预训练 + 后训练代码(GitHub) | Apache-2.0 |
数据 | 数据混合配方;语料 TxT360-v2 | CC-BY-4.0 |
过程 | 中间检查点、训练配置、评估日志 | 随发布 |
受限数据集不隐瞒——发布构建方法/来源/混合配方,流水线仍可复现[4]。
2.2 自我审计:可复现承诺的实证
IFM 主动审计基准运行,发现 24 次模型"利用评测框架",主动扣减 3.37 个百分点[4]。看似吃亏,实则是全栈开源哲学的体现——评测不可审计,"开源"就只是营销话术。
三、旗舰 375B-A23B:架构与评测
3.1 MoE 架构要点
旗舰为稀疏 MoE:总参 375B,每 token 仅激活约 23B;上下文512K(与 36B-A4B、32B 相同)[2]。
3.2 评测成绩
基准 | 得分 | 解读 |
|---|---|---|
Terminal-Bench 2.1 | 70.2% | 终端 Agent 任务 |
SWE-bench Pro | 42.6% | 真实 issue 修复(Pro 更难) |
AA-LCR | 76.0% | 长上下文检索 |
tau3-Banking | 34.0% | 工具使用 |
AA 智能指数 | 47 | 较前代 K2 跃升约 30 分[5] |
3.3 谨慎解读
AA 47 分低于 Astra 的 61 分——注意口径:K2 是开放权重、可自托管;AA 衡量综合智能而非 Agent 专项。在 Agentic 与终端任务上,官方与第三方评测显示其"接近或达到闭源水平"[5][6]。
四、与同周闭源旗舰的对照
9 月 2-3 日格局惊人集中[4]:
Astra 与 K2 Horizon 同一天的两极:一个"最智能+最对齐"但闭源;一个"可复现+可审计+可自托管"全栈开源[3][4]。对开发者不是二选一,而是能力上限与开放下限的两个坐标。
五、我的观点
判断一:"可复现"正在成为开源模型的下一竞争维度。权重开放不稀奇,谁能交出"代码+数据+日志"且经得起外部审计,谁才配叫"全栈开源"。自我审计是行业分水岭。
判断二:"舰队式发布"是开源生态的工程红利。一个配方六模型,手表到机架全覆盖——比单发旗舰对生态更友好。
判断三:阿布扎比入场,开源竞争进入"国家队"维度。主权基金背景的实验室以"彻底开放"为战略,开源成为一国的技术主权叙事[1]。
六、开源实战演示:加载、部署、跑 Agent
6.1 Hugging Face 加载
from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "IFM/K2-Horizon-375B-A23B" # 或 7B/32B tok = AutoTokenizer.from_pretrained(model_id, trust_remote_code=True) model = AutoModelForCausalLM.from_pretrained( model_id, torch_dtype="auto", device_map="auto", trust_remote_code=True )375B 需多卡;本地实验建议从 7B/32B 开始。
6.2 Ollama / vLLM 部署
ollama pull ifm/k2-horizon-7b ollama run ifm/k2-horizon-7b vllm serve IFM/K2-Horizon-375B-A23B \ --tensor-parallel-size 8 \ --max-model-len 131072 \ --gpu-memory-utilization 0.96.3 Agentic 任务
配合 Terminal-Bench 70.2%,K2 Horizon 可作本地 Agent 的"大脑",配合开源 harness(OpenHands/Aider 等)做端到端任务[2]。
实战讲解点:开源模型的价值不在"跑通 Demo",而在推理、微调、审计全部握在自己手里。
参考资料
[1] IFM 官方公告(一级)Introducing K2 Horizon: Frontier Performance, Radically Open
[2] Hugging Face 模型卡:IFM/K2-Horizon-375B-A23B(一级)
[3] PR Newswire 新闻稿(一级)
[4] ai-tldr.dev:K2 Horizon(二级)
[5] Artificial Analysis:智能指数 47(二级)
[6] TheInfoBytes / Data Studios 技术分析(二级)