Meta 发布了 Muse Glimmer,这是一个从 Muse Spark 蒸馏而来的 300 亿参数多模态模型。它专为始终在线的本地智能体工作流调优,并以 Apache 2.0 许可证发布。一个 300 亿参数的模型在全精度下通常需要超过 55 GB 的显存。Meta 将其压缩至大约 4 位精度,并加入块级推测解码,使其应答速度足够快,能够嵌入真实的智能体循环中。结果是,该模型可在单块消费级 GPU 或 Mac 上运行,无需网络调用。
它能部署吗?
是的,权重文件已基于 Apache 2.0 许可证开源。Hugging Face 合集 中提供了 BF16 权重、GGUF k-quants、ExecuTorch 构建版本以及 DFlash 起草器。自托管是首日即可实现的路径。
- 适用公司:独立开发者与初创公司可在单块 24 GB GPU 或 M4/M5 Max Mac 上运行。中端市场团队可以获得本地推理能力,而无需按 Token 付费。受监管的企业可以获得一个可气隙隔离的智能体。Meta 建议增加系统级护栏,而非将模型当作一个裸端点来交付。
- 适用行业:医疗、法律、金融服务、国防与公共部门、制造业以及现场服务。这些场景下,数据驻留、离线操作或延迟要求排除了云端调用的可能。
- 应用场景:阅读截图的桌面智能体、编程智能体以及基于模式定义的函数调用。还包括文档与图表理解、合成数据生成以及 LLM-as-a-judge(以大语言模型作为评判者)评估。
模型与训练技术解读:Muse Glimmer 是什么?参数、架构、训练阶段与关键技术一览(第 2/3 段详情)
模型与训练
Muse Glimmer 是一个密集因果变换器(dense causal transformer),并配有一个专用的感知编码器(perception encoder)。总参数量约为 30B,这一数字包含了视觉塔(vision tower)。它采用分组查询注意力(grouped-query attention)机制,使用 32 个查询头(query heads)和 2 个键值头(KV heads)。注意力模式按照 [局部、局部、局部、全局] 的方式重复出现,局部注意力使用了 2,048 长度的滑动窗口。旋转位置编码(RoPE)仅应用于局部层,其 theta 值设为 500,000。在视觉方面,模型搭载了一个约 1.8B 参数的 ViT-G/14 感知编码器,每张图像最多可接收 4,096 个视觉令牌(visual tokens)。模型的上下文长度超过 131,072 个令牌,词汇表包含 202,048 个令牌,知识截止日期为 2026 年 1 月 4 日。输入形式为文本和图像,输出为文本。模型不支持音频,视频则作为独立帧进行处理。
训练过程分为三个阶段:
- 预训练阶段,利用了对 Muse Spark 模型输出结果的 logit 蒸馏技术。
- 中期训练阶段,加入了包含更长上下文、更丰富推理轨迹的智能体(agent)相关的高比重数据。
- 后训练阶段,结合了监督微调、在线策略蒸馏与强化学习,覆盖了通用、推理、编程和智能体等多个领域。
如何将 30B 参数模型装进消费级硬件?
在全精度条件下,该模型需要超过 55 GB 的显存。Meta 将模型权重压缩至约 4 比特精度,使语言模型部分的体积降至 20 GB 以下。这在 24 GB 或 32 GB 的显存容量内留下了运行空间。键值缓存(KV cache)、感知编码器和起草器(drafter)共享这块空间。官方发布了两款量化构建版本。K-Quant-Dynamic 版本的目标是 32 GB 显存,平均性能退化为 0.2%。K-Quant-17GB 版本的目标是 24 GB 显存,平均性能退化为 1.0%。这里的性能退化是基于跨越 15 项常用基准测试的准确度指标所计算的平均值。
生成速度的提升来自于 DFlash,这是一种区块扩散起草器(block-diffusion drafter),能在一次前向传播中预测出 16 个令牌。主模型则对区块进行并行验证。该起草器使用了 5 层网络、2,048 的滑动窗口注意力,以及 32 个查询头与 8 个键值头。Meta 在批量大小为 1 并使用贪心解码(greedy decoding)的条件下对 K-Quant-17GB 版本进行了评测。在 RTX 5090 上,吞吐量从 74.9 token/s 提升至 233.4 token/s,加速比达到 3.1 倍。苹果 M5 Max 的吞吐量从 26.6 token/s 提升到 50.2 token/s,M4 Max 则从 23.7 token/s 提升到 37.8 token/s。
基准测试表现
Meta 将 Muse Glimmer 与处于思维模式下的 Gemma4-31B 和 Qwen3.6-27B 进行了对比。它在 MCP Atlas 基准上以 75.5 分领先,后两者分别为 54.2 和 62.5 分。同时在 DeepSearch QA 上以 74.6 分领先,在 Gaia2 上以 43.3 分领先,在 SWE-Bench Pro 上以 51.2 分领先。推理得分如下:AIME 2026 为 94.7,IFBench 为 77.0,AA-LCR 为 80.0。Qwen3.6-27B 在 OSWorld-Verified 上保持领先,以 75.6 分对比 65.9 分。它在 TerminalBench 2.1(60.7 分)和 SWE-Bench Verified(77.2 分)上也居于领先地位。这个规律是一致的:Muse Glimmer 在智能体编排与推理方面胜出,但在计算机使用和终端任务方面则稍显逊色。
在安全性方面,Siren AgentDojo 的攻击成功率为 28.4,实用度(utility)为 94.2。Meta 表示,该模型未达到其高级人工智能扩展框架(Advanced AI Scaling Framework)中定义的“前沿人工智能(Frontier AI)”标准。该框架将化学/生物、网络以及失控风险评级为中等或更低。
核心要点
- 30B 开源权重智能体模型,Apache 2.0 许可,由 Muse Spark 蒸馏而来。
- 4 比特量化可在 24 GB 显存内运行,性能衰减仅 1.0%。
- DFlash 16 令牌块推测在 RTX 5090 上带来 3.1 倍解码加速。
- 在 MCP Atlas、DeepSearch QA 及 SWE-Bench Pro 上均超越两个对比对象。
- 在 OSWorld-Verified 和 TerminalBench 2.1 上落后于 Qwen3.6-27B。
请查看 Hugging Face 上的模型权重、详情 以及 Meta 博客。同时,欢迎在 Twitter 上关注我们,并加入我们的 150k+ ML SubReddit,订阅 我们的 Newsletter。等等!你上 Telegram 吗? 现在你也可以在 Telegram 上加入我们。
如需合作推广你的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会等,请联系我们。
Asif Razzaq
Asif Razzaq 是 Marktechpost Media Inc. 的 CEO。作为一名富有远见的企业家与工程师,Asif 致力于将人工智能的潜力用于社会公益。他最近的举措是推出人工智能媒体平台 Marktechpost,该平台以对机器学习和深度学习新闻的深度报道而著称,内容既有技术深度,又易于广大受众理解。该平台月浏览量已超过 200 万次,足见其受观众欢迎的程度。
- Asif Razzaq NVIDIA 发布 NemotronLabs VoiceChat 11B:一个支持约 450 毫秒轮流发言与实时工具调用的开放式全双工语音到语音模型
- Asif Razzaq 2026 年顶级 LLM 可观测性与评估平台对比:Langfuse、LangSmith、Braintrust、Arize 等
- Asif Razzaq Mistral AI 发布 Shieldstral 1.0 3B:一个开源权重、策略自适应的多模态安全分类器,性能可匹敌其七倍大小的模型
- Asif Razzaq NVIDIA AI 发布 NOOA:一个面向对象的 Python 框架,能将 AI 智能体转化为单一 Python 类











