一句话总结
9 月 2 日,Meta Superintelligence Labs 发布旗舰模型 Muse Spark 1.3——五个月内第四次迭代。已开放的 xhigh 档在 Artificial Analysis 智能指数拿到 61 分,追平 GPT-5.6 Sol(max)与 Grok 4.6;限量预览的 max 档 62 分,仅次于 Claude Fable 5.1(66)与 Claude Opus 5(63)。扎克伯格称这是「编码与智能体工作上最大的一次跃升」,定价则维持 1.2 代不变。但细看 Meta 自己公布的 11 项对比表:Agent 类 6 项基准一场未胜——这是一次漂亮的「偏科」进步。

数据来源
- Meta 官方发布(2026-09-02,Muse Code + Meta Model API 同步上线)
- Artificial Analysis 独立评测《Muse Spark 1.3: Meta reaches the frontier》(2026-09-03)
- The Times of AI / TradePoint.io / heise online / Laura Martel 等媒体报道与第三方交叉验证(2026-09-02 至 09-04)
两个月三代:被「逼」出来的迭代速度
Muse Spark 家族诞生于今年 4 月,彼时 Meta 刚在 Llama 4 翻车后转向闭源旗舰路线。随后节奏明显加快:8 月 5 日 1.2 携终端编程 Agent Muse Code 亮相(本站有深度解析),8 月 10 日又开源了 Apache 2.0 的 Glimmer 30B 作为「对冲棋」,9 月 2 日 1.3 直接跟进。负责这一切的 Meta Superintelligence Labs(MSL)围绕 Scale AI 创始人 Alexandr Wang 组建——Meta 为这笔人才与算力投资花了 143 亿美元。
新模型照例有两位高管的「嘴上功夫」:扎克伯格称其性能「几乎便宜到无法计量(almost too cheap to meter)」,Wang 则在 X 上对 Google 开炮:「我真不想这么说,但是……gemini who?」
第三方标尺下的真实位置:追平,但没超越

Artificial Analysis 的智能指数(9 项评测加权)给出的座次是:Claude Fable 5.1(max)66 分居首、Claude Opus 5(max)63 分次之,Muse Spark 1.3 的 max 档 62 分、xhigh 档 61 分——与 GPT-5.6 Sol(max)、Grok 4.6(high)并列第三梯队。相比 1.2 的 57 分,一个月涨了 4 分,进步集中在智能体知识工作与科学推理:Tau3-Bench 银行任务从 35% 跳到 47%(max 档 52%、全场第一)、GPQA Diamond 90% → 94%、Terminal-Bench 2.1 达 85%。
但要泼两盆冷水:一是 AA 的 max 评分为限量预览测算、尚未独立复测;二是也有退步项——AA-LCR 长上下文检索从 83% 掉到 79%,事实校准(Omniscience)小幅下滑。
「偏科冠军」:代码与长上下文全面领先,Agent 六项全负

Meta 官方对比表(1.3 max 对 GPT-5.6 Sol max、Claude Opus 5 max)呈现出罕见的「偏科」格局:
- Coding 编码:2 胜 1 平。DeepSWE v1.1 长程仓库编码 75.4 分登顶(Opus 5 为 74.0);SWEAtlas 代码库问答 59.4 分领先(GPT-5.6 Sol 53.5、Opus 5 52.7);Terminal-Bench 2.1 以 88.8 与 GPT-5.6 Sol 打平(Opus 5 为 86.7);
- Long Context 长上下文:2 项全胜。MRCR 256K-512K 拿 98.5(GPT-5.6 Sol 91.5)、512K-1M 拿 98.1(GPT-5.6 Sol 73.8),断层式领先,Opus 5 未参测;
- Agent 智能体:6 项全负。GDPval 知识工作 1754 对 Opus 5 的 1824、OSWorld 电脑操作 66.9 对 68.3、AutomationBench 49.4 对 50.3、DeepSearchQA 89.4 对 GPT 的 93.0……一场没赢。
翻译成人话:1.3 是把「读代码、写代码、翻超长文档」练到顶级的模型,但让它像 Opus 5 那样自主跑完一整条业务流,还差半步。 另外提醒一句:Meta 的宣传图用 1.3(max)对比 1.2(xhigh),同档位对比时跃升幅度会小一些——第三方口径下 1.2 的 Terminal-Bench 是 80.1(厂商自报 82.9),这个「厂商分 vs 第三方分」的落差同样存在于 1.3。
价格没涨,但「便宜」另有代价

1.3 的公开定价与 1.2 完全一致:标准档 $1.25 / 百万输入 token、$4.25 / 百万输出 token(缓存输入 $0.15)。第三方实测 xhigh 每任务成本约 $0.55,是同级别智能里最低的——上一代 1.2 是 $0.40 但只有 57 分,相当于「每分更便宜」。
真正便宜到夸张的是 Contributor 档:输入 $0.10、输出 $0.20(约为标准档的 1/12),代价是 Meta 可以把你的提示词与代码上下文用于训练,且速率上限只有 60 req/min(标准档 3000)。对于无专有代码的独立开发者,这是捡便宜;对于接 NDA 项目或「代码即护城河」的团队,这一档基本可以直接划掉。
其他值得知道的变化:官方称同样编码工作流下工具调用少约 20%、token 少约 25%;模型被训练得更「会沟通」——需求含糊时主动反问、卡住时承认卡住、做不可逆操作前先确认;对提示词注入的对抗鲁棒性也有增强。上下文窗口维持 1M token,输入支持文本/图像/视频。
怎么用、以及开源悬念
1.3 现已通过 Muse Code(macOS / Linux 终端编程 Agent)与 Meta Model API(OpenAI 兼容格式)开放,xhigh 为当前最高可用档位;更强的 max 模式要等 Meta 完成额外安全测试后放行(Wang 对 Axios 表示,与本周因安全暂停部分工作的其他实验室不同,Meta 没有为安全暂停开发)。面向 Meta AI、Instagram、Facebook 的消费端铺开预计随后跟进。
开源悬念依旧:此前媒体报道 Meta 计划开放 1.2 权重,结果等来的是又一个闭源版本 1.3。MSL 的路线已很清晰——闭源旗舰 Muse Spark 高速迭代抢前沿,开源侧用 Glimmer 30B 这样的「小模型」维持社区基本盘。想等 Muse Spark 级别权重开源的朋友,恐怕还要继续等。
总结
- Muse Spark 1.3 是「偏科」的前沿模型:长上下文与编码全面领先 Opus 5 / GPT-5.6 Sol,Agent 类任务 6 项全负;
- 已开放的 xhigh 档(AA 61 分)性价比突出:同分水平下任务成本最低($0.55/任务);
- Contributor 档 $0.10/$0.20 的「骨折价」本质是数据换折扣,有保密需求的团队慎用;
- max 档与开源权重都还在「即将到来」——对开发者而言,当下能实际调用的上限就是 xhigh。
相关工具:Meta AI · Cursor · Claude · Codex CLI · GitHub Copilot