news 2026/9/4 19:50:13

Meta 5 个月迭代 4 版 Muse Spark,新模型 1.3 成本低编程强,能否超越竞品?

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Meta 5 个月迭代 4 版 Muse Spark,新模型 1.3 成本低编程强,能否超越竞品?

标题:Meta 5 个月迭代 4 版 Muse Spark,新模型 1.3 成本低、编程强,能否超越竞品?

智东西 9 月 3 日消息,今日,Meta 发布新一代最强旗舰模型 Muse Spark 1.3。嘿,在 Artificial Analysis 的 AI 分析指数榜上,这新模型的分数可厉害啦,仅次于 Claude Fable 5.1、Claude Opus 5。

Meta 联合创始人、CEO 马克·扎克伯格(Mark Zuckerberg)在社交平台 X 上那可是直呼,Muse Spark 1.3 的性能超乎想象!Meta 超级智能实验室负责人、首席 AI 官汪滔(Alexander Wang)也来夸,说这模型成本低到几乎可以忽略不计,智能体、编程能力以及易用性都大幅提升。而且啊,Muse Spark 1.3 搭配 Muse Code,评测表现能和 Claude Code + Opus 5、Claude Code + Fable 5 媲美呢。

有开发者用 Muse Spark 1.3 制作了《我的世界》游戏,成本才 10 美分(约合人民币 0.67 元),这也太划算了吧!

就在 Meta 新模型发布的 4 个小时前,谷歌发布了自家迄今为止最强的推理与编程模型 Gemini 3.8 的 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber 版本。不过呢,随后在 Artificial Analysis 榜单上就被 Meta 反超咯。目前在 AI 分析指数榜上,Muse Spark 1.3 得分为 62 分,仅次于 66 分的 Claude Fable 5.1 和 63 分的 Claude Opus 5,Gemini 3.8 Flash 为 59 分。

谷歌在 Artificial Analysis 指数上就领先了几个小时,就被 Meta 反超,汪滔还在社交平台上对谷歌“放狠话”:“gemini who?”,还说“Gemini 现在取消(上线)还不算晚”。

过去 5 个月,Meta 那迭代节奏越来越密集啦,接连推出四款 Muse Spark 模型:4 月首发 Muse Spark,7 月更新 Muse Spark 1.1、8 月上线 Muse Spark 1.2,再加上最新的 Muse Spark 1.3。

从 Meta 放出的基准测试图能看到,Muse Spark 1.3 拿下 5 项第一,在长上下文、编程的绝大部分测试都比 GPT‑5.6 Sol、Claude Opus 5 好,就 Terminal‑Bench 终端操作 Agent 测试和 GPT‑5.6 Sol 打了个平手。不过它相对薄弱的是 Agent 能力,在联网搜索类 Agent、通用知识任务 GDPVal‑AA v2 中分数比较低。

价格方面,Muse Spark 1.3 的‌API 定价和前代 1.2 一样,每百万 token 输入(缓存未命中)1.25 美元(约合人民币 8.4 元),每百万 token 输入(缓存命中)0.15 美元(约合人民币 1 元),每百万 token 输出为 4.25 美元(约合人民币 28.55 元)。Muse Spark 1.3 的价格比 Gemini 3.8 Flash 略高,比 DeepSeek -V4-Pro 的高峰期价格还便宜。

Muse Spark 1.3 已经在 Muse Code 与 Meta Model API 中逐步推送上线,之前支持的推理模式现在都能用啦;max‑reasoning(极致推理模式)完成额外安全测试后很快就开放。Meta 还说,已经规划好令人期待的产品路线图,有更大参数规模模型、Muse Spark 开源权重版本发布以及更多更新呢。

开发者实测:速度快、成本低,但生成效果一般

在社交平台 X 上,好多开发者都晒出了自己实测 Muse Spark 1.3 的案例。大部分人觉得它速度快、成本低,可生成效果不怎么惊艳。

有个开发者对比了 Muse Spark 1.1 到 1.3 对同一栋建筑仅基于照片进行 3D 模拟的效果,在几何形状、结构以及视觉效果上都有明显提升,总成本一直保持在 0.6 美元(约合人民币 4.03 元)。

还有个开发者晒出了 Muse Spark 1.3 Ultra Contributor(开启 Ultra 超高算力模式)版本和 Claude Fable 5.1 xHigh 的对比效果,用相同提示词,双方都运行了约 2 小时。提示词里有套自我迭代优化规则:要是独立评审模型给输出结果打分低于 9.5/10,模型就得持续优化、重新尝试。结果可把他惊到了,Muse Spark 一直在迭代,一共跑了 20 轮自我优化循环,每轮启动 3 个智能体;两小时内累计执行 60 次以上智能体任务,成本还不到 1 美元(约合人民币 6.7 元)。

有网友在评论区质疑,这是不是说明 Muse Spark 1.3 一直没完成任务,花 1 美元(约合人民币 6.7 元)就停了。

在开源的 3D 空间推理基准测试 MineBench 中,对比 Gemini 3.8 Flash 和 Muse Spark 1.3 的实测结果显示,Gemini 3.8 Flash 总测试成本 1.18 美元(约合人民币 7.93 元),平均推理耗时 1 分 51 秒,首测 Elo 评分为 1888 分;Muse Spark 1.3 总测试成本 6.57 美元(约合人民币 44.14 元),平均推理耗时 5 分 36 秒,首测得分 1787 分,它生成输出质量和顶尖前沿模型比起来还有差距。

另一位开发者对比了 Muse Spark 1.3、Qwen 3.8 Max、GLM 5.3、GPT - 5.6 Sol 的效果,他觉得 Muse Spark 1.3 在成本与速度方面能和 Qwen 3.8 Max 媲美,GLM 5.3 在性能、成本、速度以及 token 使用量方面综合表现最佳。虽然 Muse Spark 1.3 价格低、运行速度快,但表现也就算不错。Qwen 3.8 Max 输出成果质量好、完成度高,可耗时大概一个半小时,Muse Spark 只要约 2 分钟。

长周期任务不跑偏,编程 token 量减少 25%

Meta 的博客说,Muse Spark 1.3 的优势是支撑长周期任务以及编程。它能和用户协同,在单条长对话会话中并行处理多条工作流。面对开放式目标,它会调用工具,从杂乱、相互矛盾的信息源中自主构建上下文,然后主动修正方案漏洞,最后根据已获取的信息输出完整交付成果。

同时,Meta 的研究人员用多套多样化评测框架完成模型训练,让它能适配各类智能体运行环境。就像下面这个例子,Muse Spark 1.3 拿到的提示词特别复杂,得在不同位置找到活动详情、文案、图片,然后编辑组合在广告管理平台中创建并发布。

和之前的 Muse Spark 模型比,Muse Spark 1.3 在多步骤任务中,更能保留细节要求,不会遗漏约束条件,也不会偏离既定工作流程。Meta 还改进了多任务处理能力,就算在信息杂乱的单会话上下文里,不管用户是接着做过往任务,还是中途打断任务,模型都能把新输入提示匹配到对应的任务上。

Muse Spark 1.3 知道自己能做什么、不能做什么,知道什么、不知道什么,遇到障碍也知道怎么应对,不会产生错误的预测结果。比如提示词是“你是一家小型航空企业的机械工程师,正在为下一代飞行器设计一款实验型 X 型机翼组件。为配合设计评审,请基于附件材料撰写一份流体仿真报告初稿:(1)初步 CFD 仿真结果;(2)用于本次仿真的机翼组件 CAD 模型 STEP 文件。”Muse Spark 1.3 就会生成对应的文件。

编程方面,和 Muse Spark 1.2 比,Muse Spark 1.3 需要的操作步骤少,表述简洁,整体编码风格也更清晰。根据 Meta 工程师的测试结果,它的工具调用次数减少了 20%,使用的 token 数量减少了 25%。

此外,研究人员围绕智能体与代码能力相关的多个维度完成了安全能力升级。Muse Spark 1.3 的对抗鲁棒性增强了,对对抗输入与提示注入攻击的抵御能力提升;处理复杂智能体任务时,模型对不可逆操作有风险判断,会谨慎执行动作。

结语:5 个月迭代 4 版,Meta 的大模型要起飞了?

Meta 5 个月迭代 4 个 Muse Spark 模型版本,这密集的发布节奏,可能标志着 Meta 的 AI 研发进程有明显转变。从模型能力看,Muse Spark 1.3 没追求全维度通杀,而是把资源集中用在长上下文、编程等方面,在 DeepSWE、OSWorld 等面向真实工程任务的基准上超过了前沿模型。

这种取舍也许能证明,未来开发者、企业选型不会再追求“一个模型搞定全部”,多模型路由,根据任务类型调度不同专长模型,可能会成为企业落地 Agent 的主流方案。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/9/4 19:50:00

潍坊企业出海的法律同行者——山东求是和信律师事务所涉外法律服务能力全景介绍

这是一篇关于一家地市级律师事务所涉外业务能力的介绍。文中涉及的数据与事实,均来自政府门户网站、司法行政部门公开平台、行业媒体公开报道以及该所公开发布的信息,并已在文中标注来源。本文属于机构与业务介绍性质的普法宣传内容,不构成正式法律意见,不能替代具有执业资格的…

作者头像 李华
网站建设 2026/9/4 19:48:05

桥梁病害检测数据集实战:YOLO格式解析与YOLOv8模型训练全流程

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 19:45:54

模型蒸馏实战:从YOLOv11到轻量工具链的设计与优化

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华
网站建设 2026/9/4 19:45:34

基于OpenCV的工业视觉检测:从原理到印刷字符缺陷实战

简介:本资源是一套基于OpenCV实现的轻量级机器视觉缺陷检测与印刷质量检测实践方案,面向工业自动化初学者、质检工程师及计算机视觉入门开发者,解决产线中常见划痕、污渍、套印偏差、文字模糊等典型问题。压缩包共9个文件(2.89MB&…

作者头像 李华
网站建设 2026/9/4 19:44:12

ADS实战:宽带连续F类功率放大器从理论、仿真到版图的全流程设计

简介:本资源是一套完整的宽带连续F类射频功率放大器设计实践工程包,面向射频电路工程师、微波通信方向研究生及高频电路设计从业者,聚焦高效率宽带功放的理论建模、ADS仿真优化与版图实现全流程。资源包含2000个文件,主体为590个A…

作者头像 李华
网站建设 2026/9/4 19:43:46

零成本AI漫剧制作:基于Stable Diffusion的完整实战指南

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

作者头像 李华