展开目录
#Meta#Muse Spark#大模型#AI编程#智能体#基准测试

Meta Muse Spark 1.3 发布:5 个月第 4 次迭代追平 GPT-5.6 Sol,编码与长上下文领先、Agent 却一场未胜

9 月 2 日 Meta 发布 Muse Spark 1.3:已开放的 xhigh 档在第三方智能指数拿到 61 分,追平 GPT-5.6 Sol(max)与 Grok 4.6;限量预览的 max 档 62 分,仅次于 Claude Fable 5.1 与 Opus 5。DeepSWE 75.4 登顶、MRCR 长上下文 98.1 断层领先,但 Meta 自家 11 项对比表里 Agent 类 6 项全负——「偏科的前沿模型」到底能不能打?

预计阅读 8 分钟

一句话总结

9 月 2 日,Meta Superintelligence Labs 发布旗舰模型 Muse Spark 1.3——五个月内第四次迭代。已开放的 xhigh 档在 Artificial Analysis 智能指数拿到 61 分,追平 GPT-5.6 Sol(max)与 Grok 4.6;限量预览的 max 档 62 分,仅次于 Claude Fable 5.1(66)与 Claude Opus 5(63)。扎克伯格称这是「编码与智能体工作上最大的一次跃升」,定价则维持 1.2 代不变。但细看 Meta 自己公布的 11 项对比表:Agent 类 6 项基准一场未胜——这是一次漂亮的「偏科」进步。

Muse Spark 版本迭代时间线

数据来源

  • Meta 官方发布(2026-09-02,Muse Code + Meta Model API 同步上线)
  • Artificial Analysis 独立评测《Muse Spark 1.3: Meta reaches the frontier》(2026-09-03)
  • The Times of AI / TradePoint.io / heise online / Laura Martel 等媒体报道与第三方交叉验证(2026-09-02 至 09-04)

两个月三代:被「逼」出来的迭代速度

Muse Spark 家族诞生于今年 4 月,彼时 Meta 刚在 Llama 4 翻车后转向闭源旗舰路线。随后节奏明显加快:8 月 5 日 1.2 携终端编程 Agent Muse Code 亮相(本站有深度解析),8 月 10 日又开源了 Apache 2.0 的 Glimmer 30B 作为「对冲棋」,9 月 2 日 1.3 直接跟进。负责这一切的 Meta Superintelligence Labs(MSL)围绕 Scale AI 创始人 Alexandr Wang 组建——Meta 为这笔人才与算力投资花了 143 亿美元。

新模型照例有两位高管的「嘴上功夫」:扎克伯格称其性能「几乎便宜到无法计量(almost too cheap to meter)」,Wang 则在 X 上对 Google 开炮:「我真不想这么说,但是……gemini who?」

第三方标尺下的真实位置:追平,但没超越

第三方智能指数排名:1.3 追平 GPT-5.6 Sol

Artificial Analysis 的智能指数(9 项评测加权)给出的座次是:Claude Fable 5.1(max)66 分居首、Claude Opus 5(max)63 分次之,Muse Spark 1.3 的 max 档 62 分、xhigh 档 61 分——与 GPT-5.6 Sol(max)、Grok 4.6(high)并列第三梯队。相比 1.2 的 57 分,一个月涨了 4 分,进步集中在智能体知识工作与科学推理:Tau3-Bench 银行任务从 35% 跳到 47%(max 档 52%、全场第一)、GPQA Diamond 90% → 94%、Terminal-Bench 2.1 达 85%。

但要泼两盆冷水:一是 AA 的 max 评分为限量预览测算、尚未独立复测;二是也有退步项——AA-LCR 长上下文检索从 83% 掉到 79%,事实校准(Omniscience)小幅下滑。

「偏科冠军」:代码与长上下文全面领先,Agent 六项全负

Meta 官方 11 项基准对比:三分类胜负格局

Meta 官方对比表(1.3 max 对 GPT-5.6 Sol max、Claude Opus 5 max)呈现出罕见的「偏科」格局:

  • Coding 编码:2 胜 1 平。DeepSWE v1.1 长程仓库编码 75.4 分登顶(Opus 5 为 74.0);SWEAtlas 代码库问答 59.4 分领先(GPT-5.6 Sol 53.5、Opus 5 52.7);Terminal-Bench 2.1 以 88.8 与 GPT-5.6 Sol 打平(Opus 5 为 86.7);
  • Long Context 长上下文:2 项全胜。MRCR 256K-512K 拿 98.5(GPT-5.6 Sol 91.5)、512K-1M 拿 98.1(GPT-5.6 Sol 73.8),断层式领先,Opus 5 未参测;
  • Agent 智能体:6 项全负。GDPval 知识工作 1754 对 Opus 5 的 1824、OSWorld 电脑操作 66.9 对 68.3、AutomationBench 49.4 对 50.3、DeepSearchQA 89.4 对 GPT 的 93.0……一场没赢。

翻译成人话:1.3 是把「读代码、写代码、翻超长文档」练到顶级的模型,但让它像 Opus 5 那样自主跑完一整条业务流,还差半步。 另外提醒一句:Meta 的宣传图用 1.3(max)对比 1.2(xhigh),同档位对比时跃升幅度会小一些——第三方口径下 1.2 的 Terminal-Bench 是 80.1(厂商自报 82.9),这个「厂商分 vs 第三方分」的落差同样存在于 1.3。

价格没涨,但「便宜」另有代价

定价对比:Standard vs Contributor

1.3 的公开定价与 1.2 完全一致:标准档 $1.25 / 百万输入 token、$4.25 / 百万输出 token(缓存输入 $0.15)。第三方实测 xhigh 每任务成本约 $0.55,是同级别智能里最低的——上一代 1.2 是 $0.40 但只有 57 分,相当于「每分更便宜」。

真正便宜到夸张的是 Contributor 档:输入 $0.10、输出 $0.20(约为标准档的 1/12),代价是 Meta 可以把你的提示词与代码上下文用于训练,且速率上限只有 60 req/min(标准档 3000)。对于无专有代码的独立开发者,这是捡便宜;对于接 NDA 项目或「代码即护城河」的团队,这一档基本可以直接划掉。

其他值得知道的变化:官方称同样编码工作流下工具调用少约 20%、token 少约 25%;模型被训练得更「会沟通」——需求含糊时主动反问、卡住时承认卡住、做不可逆操作前先确认;对提示词注入的对抗鲁棒性也有增强。上下文窗口维持 1M token,输入支持文本/图像/视频。

怎么用、以及开源悬念

1.3 现已通过 Muse Code(macOS / Linux 终端编程 Agent)与 Meta Model API(OpenAI 兼容格式)开放,xhigh 为当前最高可用档位;更强的 max 模式要等 Meta 完成额外安全测试后放行(Wang 对 Axios 表示,与本周因安全暂停部分工作的其他实验室不同,Meta 没有为安全暂停开发)。面向 Meta AI、Instagram、Facebook 的消费端铺开预计随后跟进。

开源悬念依旧:此前媒体报道 Meta 计划开放 1.2 权重,结果等来的是又一个闭源版本 1.3。MSL 的路线已很清晰——闭源旗舰 Muse Spark 高速迭代抢前沿,开源侧用 Glimmer 30B 这样的「小模型」维持社区基本盘。想等 Muse Spark 级别权重开源的朋友,恐怕还要继续等。

总结

  • Muse Spark 1.3 是「偏科」的前沿模型:长上下文与编码全面领先 Opus 5 / GPT-5.6 Sol,Agent 类任务 6 项全负
  • 已开放的 xhigh 档(AA 61 分)性价比突出:同分水平下任务成本最低($0.55/任务);
  • Contributor 档 $0.10/$0.20 的「骨折价」本质是数据换折扣,有保密需求的团队慎用
  • max 档与开源权重都还在「即将到来」——对开发者而言,当下能实际调用的上限就是 xhigh。

相关工具Meta AI · Cursor · Claude · Codex CLI · GitHub Copilot

Related

相关文章

延伸阅读

查看全部 →
AI安全

阿莫代伊发文《We Must Pace the Frontier》:Anthropic 单方面承诺「嵌入式评估员」,Altman 说同意,Musk 说 Dario 是对的

2026 年 9 月,Anthropic CEO 达里奥·阿莫代伊发表长文《We Must Pace the Frontier》,首次把「放慢前沿能力进步」提为具体方案:三步走——嵌入式第三方评估员、民主国家内部协调、全球协调,Anthropic 单方面承诺第一步。两件事让他改主意:递归自我改进加速,以及 OpenAI-Hugging Face 的 Agent 蜂群越界事件。Sam Altman 表示同意,Elon Musk 说「Dario 是对的」,也有记者批评这是「监管俘获」。

OpenAI

GPT-6 Astra 需求爆表:OpenAI 暂停 200 美元 Pro 新订阅,Altman 说 2026 年不上市

9 月 3 日发布的 GPT-6 Astra 需求「前所未有」,OpenAI 在 9 月 10 日暂停了 200 美元 ChatGPT Pro 的新订阅——Go、Plus 与 API 不受影响。三天后,Sam Altman 又说「考虑到安全方面正在发生的一切,现在上市是不明智的时机」,被追问是否指 2026 年时回答「不是 2026,对」。一个模型,同时顶住了 OpenAI 的产能与 IPO 时间表。

DeepSeek

DeepSeek-V4.1-Flash 发布:552B 参数只激活 8B,KV 缓存砍到 1/4,Agent 账单降了七成

9 月 10 日,DeepSeek 上线 DeepSeek-V4.1-Flash:552B 参数的 MoE 新架构,输入侧只激活 8B、输出侧 16B,KV 缓存压到上一代的 1/4(HBM)与 1/8(SSD),缓存命中低至 0.003 美元/百万 token。峰值输入价格从 V4-Pro 的 1.32 美元降到 0.30 美元,并发从 500 提到 2,500,官方称已全面超越 V4-Pro。