返回文章列表

Meta 的开源回马枪:Muse Glimmer 想把"超级智能"装进你的显卡

8 月 10 日,Meta 发布 30B 开源 Agent 模型 Muse Glimmer,Apache 2.0 许可,4-bit 量化后仅约 17GB,单张消费级显卡即可运行本地常驻智能体。扎克伯格同步发出万字长文为"个人超级智能"叙事押注——这一次,开源不再是姿态,而是产品。

9 分钟阅读

沉寂两个月后,Meta 又举起了开源大旗

8 月 10 日,Meta 超级智能实验室(Meta Superintelligence Labs)正式发布 Muse Glimmer:一个 300 亿参数、以 Apache 2.0 许可证开放权重、专为本地常驻智能体(always-on local agent)设计的模型。同一天,扎克伯格发布了一篇 14 页长文《The Future is for Everyone》,主张"与其把超级智能集中起来,不如把它广泛分发,让每个人都能指挥它",并呼吁美国政府降低开源 AI 的准入门槛。

这个时间点很微妙。就在几天前,Meta 的社交平台正因未成年人成瘾性设计面临被喊到约 1.4 万亿美元的索赔诉讼;而在今年 4 月,Meta 才刚刚用闭源的 Muse Spark 取代了 Llama 家族,一度让开源社区以为这家公司要放弃老本行。如今这个"回马枪",把开源从姿态变成了产品。

一个为"常驻本地"而生的 30B 模型

Muse Glimmer 不是又一个通用聊天模型。Meta 官方将它定位为"优化本地常驻智能体工作流"的模型:日程管理、起草消息、整理文件、编码、工具调用、以及"以大模型评估大模型"(LLM-as-a-judge)等任务。

按照 Hugging Face 模型卡的信息,Glimmer 是一个稠密(dense)因果 Transformer,总参数量约 296 亿,52 层,包含一个约 18 亿参数的 ViT-G/14 感知编码器用于图像输入;默认上下文窗口 131072 token,文档标注上限可达 262144;支持 100 多种语言,知识截止时间为 2026 年 1 月 4 日。

它由 Meta 的旗舰模型 Muse Spark 1.2 蒸馏而来。训练分三个阶段:预训练阶段用 Muse Spark 的输出做 logit 蒸馏,采用与教师模型相近的数据组合;中期训练加入更长上下文、更高比例的智能体任务数据和更丰富的推理轨迹;后训练阶段结合监督微调、在线策略蒸馏和强化学习,覆盖通用、推理、编程和智能体任务。

怎么把 30B 塞进 24GB 显卡

300 亿参数全精度(fp16)运行需要超过 55GB 内存,远超任何消费级显卡的承受范围。Meta 的解法是量化与推测解码的组合拳:

  • 量化:官方提供 K-Quant-Dynamic 和 K-Quant-17GB 两个量化版本,把权重压到约 4-bit 精度,体积缩到 17-20GB,加上 KV cache 后,24GB 或 32GB 显存的单张消费级显卡(如 RTX 3090/4090)或 Apple Silicon Mac 即可运行。
  • 推测解码:配套一个名为 DFlash 的微型伴生模型,一次预测 16 个 token 的文本块,再由主模型一次性校验。按 Meta 公布的数据,在 RTX 5090 上生成速度从 74.9 提升到 233.4 tokens/s(约 3.1 倍),在 M4 Max 上从 23.7 提升到 37.8 tokens/s(约 1.5 倍)。

架构上,Glimmer 使用 Gated Grouped-Query Attention 将 KV cache 内存需求降低约 16 倍,进一步压低端侧部署门槛。运行时生态覆盖了主流推理框架:llama.cpp、MLX、ExecuTorch、Ollama、LM Studio、vLLM、SGLang,以及 Together AI、Fireworks AI、OpenRouter 等托管平台。

Agent 才是重点:规划、调用、自查、恢复

如果只看参数和跑分,30B 并不稀奇。Glimmer 真正被训练的对象,是智能体循环本身:规划一步、调用工具、读取结果、决定下一步、出错时恢复。

Meta 首席 AI 官 Alexandr Wang 在发布线程里的描述是:Glimmer"可以通过规划、工具调用、检查自身结果和失败恢复,像大得多的模型一样作为完整智能体运行,并且能在 24GB 显存下不损失智能体可靠性"。官方演示视频展示了一个典型的端到端场景:Glimmer 通过工具调用自主发现局域网内的 Home Assistant 实例,查询设备 API,现场写出一套响应式 HTML/CSS/JavaScript 仪表盘,再部署本地服务器验证自己的工作。

失败恢复是这个模型的差异化细节。本地智能体的大部分时间都花在"调用工具-读取返回-决定下一步"的循环里,工具调用返回错误、空结果或意外格式时,能力不足的模型会当作成功继续跑,直到几步之后任务彻底不可恢复。Meta 专门针对这条路径做了训练,包括长任务执行和重试逻辑。

基准:赢了 agent 测试,但不是全部

Meta 将 Glimmer 与同尺寸的两款开源模型做了对比:Google Gemma 4-31B 和阿里 Qwen3.6-27B。在 MCP Atlas(围绕 Model Context Protocol 的智能体工具调用基准)上,Glimmer 得分 75.5,Gemma 4 为 62.5,Qwen3.6 为 54.2,差距明显。Glimmer 自报的其他成绩包括:DeepSearch QA 74.6、SWE-Bench Verified 76.0、AIME 2026 推理 94.7、IFBench 77.0。

需要说明的是,除 MCP Atlas 外,这些数字大多只有 Glimmer 单方成绩,没有并排的对手数据;而在部分智能体编程基准上,Qwen3.6 仍保持领先。也有开发者指出 Qwen 3.6 已不是最新一代,Glimmer 需要与后续 27B 级模型直接对测,才能判断真实竞争力。

Apache 2.0 的分量

许可证是这次发布里比参数更值得注意的新闻。Glimmer 采用 Apache 2.0,这是 Meta 在 Llama 之后第一个真正宽松的开源许可——没有月度活跃用户上限、没有可接受使用政策、没有归属条款,商用、修改、再分发均不受限。

过去两年,Llama 家族自研的 community license 一直因 7 亿月活上限等限制被开发者诟病,也让不少商业公司需要法务审核才能采用。这次直接上 Apache 2.0,等于向开发者生态释放了明确的诚意信号。

战略:开源从姿态变成了产品

更值得行业观察的是 Meta 的布局逻辑。今年 4 月,Meta 用闭源的 Muse Spark 取代 Llama;7 月发布 Muse Spark 1.1 并首次为模型定价,API 价格约为 Anthropic 和 OpenAI 同类模型的四分之一;8 月初推出基于 Muse Spark 1.2 的终端编码智能体 Muse Code。如今开源 Glimmer,并预告"很快"开放 Muse Spark 1.2 的权重——这是一条清晰的曲线:旗舰模型继续留在 API 后面,开源模型则负责圈占开发者心智和端侧市场。

扎克伯格在长文中把这一选择与地缘竞争绑定:他直言美国开源 AI 开发者在训练数据使用和蒸馏技术等方面相比中国同行处于监管劣势。据路透社报道,月之暗面、阿里和 DeepSeek 的开源权重模型已具备与领先美国系统相当的能力,而 OpenAI、Anthropic、Google 的顶级模型均不开放权重。

配套动作也在同步展开:Meta 宣布设立 10 亿美元基金,用于应对数据中心扩张对美国社区的影响;成立独立董事会负责制定安全标准并逐项审核模型发布,扎克伯格称即使创始人控股,也不再由 CEO 单独决定高危 AI 上线。资本层面,Meta 2026 年资本开支承诺高达 1450 亿美元,发布当天股价盘前上涨近 3%。

观察:端侧 Agent 赛道的分水岭

把 Glimmer 放回行业坐标里,它标志着"本地智能体"从概念走向可交付的产品:一个个人助理要深度访问日程、文件、消息、健康乃至家庭数据,最可信的交付方式就是把计算留在用户设备上,而不是把隐私数据送往云端。对数据敏感、有数据驻留要求的组织和预算有限的团队,这是第一次能用一个开源权重跑通完整智能体工作流。

但也要看到它的天花板:30B 模型跑在单张消费级显卡上,面对复杂长程智能体工作流,与云端前沿模型的差距客观存在。OpenAI、Anthropic、Google 把最强模型留在云端并按 token 收费,Meta 则试图用 Apache 2.0 在端侧先圈下一块地。这场"云端闭源"与"本地开源"的路线之争,才刚刚开始。

(内容由AI生成,仅供参考)