Muse Glimmer是什么
Muse Glimmer 是 Meta Superintelligence Labs 发布的 300 亿参数开放权重多模态模型,从旗舰模型 Muse Spark 蒸馏而来,专为常驻本地运行的智能体工作流设计。模型原生支持文本与图像交错输入、131K+ 上下文、精确函数调用与失败重试,经 4-bit 量化后可在 24GB 显存的消费级显卡或 Mac 上完整运行,无需联网。权重、量化版本、投机解码 drafter 与视觉编码器全部以 Apache 2.0 协议发布,可自由商用、修改与再分发。
模型支持 low/medium/high/xhigh 四档推理强度调节,可在质量与速度之间取舍,并兼容 OpenClaw、Hermes Agent 等主流 Agent 编排框架。

Muse Glimmer的主要特性
- 本地可跑: 全精度下 30B 模型需要 55GB 以上显存,官方通过约 4-bit 量化把语言模型压到 20GB 以内,为 KV 缓存、视觉编码器和投机解码 drafter 留出余量,整体可装入 24GB 或 32GB 显存。官方给出的精度损失数据为 K-Quant-Dynamic 版本 0.2%、K-Quant-17GB 版本 1.0%(跨 15 项常用基准的平均准确率衰减)。
- 投机解码加速: 随模型附带基于 DFlash 的轻量 drafter,单次前向可预测 16 个 token 的整块内容,主模型并行校验。官方实测在 RTX 5090 上解码速度从 74.9 tok/s 提升至 233.4 tok/s(3.1 倍),Apple M5 Max 提升 1.8 倍、M4 Max 提升 1.5 倍。
- 智能体任务闭环: 针对端到端任务完成度训练,在 DeepSearch QA、MCP-Atlas、𝛕3-Bench、SWE-Bench 等全流程基准上评测,覆盖在 scaffold 内工作、写代码调试、多轮请求解决等环节。
- 失败恢复能力: 工具调用失败或返回异常结果时,模型被训练为诊断错误并重试,而不是直接中断任务链——这是长程 Agent 能否持续运行的关键。
- 原生多模态输入: 通过独立的 ViT-G/14 感知编码器接受文本与图像交错输入,单图最多 4,096 视觉 token,可让 Agent 直接读截图、图表和文档。
- 长上下文: 131,072+ tokens 上下文长度,采用「局部×3 + 全局」循环注意力模式与 2048 滑动窗口,配合 GQA(32 查询头 / 2 KV 头)控制显存开销。
- 多语言: 训练数据覆盖 100 种以上语言,但官方明确未对全部语言做评测,强支持语种之外表现可能下降。
- 完全宽松的开源协议: BF16 全精度权重、两个 4-bit 量化版本、DFlash drafter、感知编码器全部以 Apache 2.0 发布,可商用、可修改、可再分发,无用户规模门槛限制。
Muse Glimmer的应用场景
- 本地常驻个人助理: 管理日程、起草消息、整理文件类的 Agent,需要长期访问个人上下文,本地运行可避免敏感数据出网。
- 私有化编程 Agent: 在自有硬件上跑代码编写、调试与工单解决流程,官方在 SWE-Bench 系列基准上做了专门评测。
- 函数调用与工具编排: 多轮长流程中按精确 schema 稳定调用工具,适合搭建自动化工作流。
- 多模态信息处理: 读取截图、图表、文档并结合对话推理,适合做界面理解或文档处理类 Agent。
- 合成数据生成: 为下游模型训练批量生成高质量数据,本地运行没有按 token 计费的成本压力。
- LLM-as-a-judge 评估: 作为评测模型对其他模型输出打分,是官方明确列出的适用场景之一。
- 模型微调与二次开发: BF16 权重加 Apache 2.0 协议,配合 PyTorch TorchTitan 可做领域定制。
Muse Glimmer的产品定价
模型权重免费开放下载,采用 Apache 2.0 协议,允许无限制商用、修改与再分发,Meta 未对下载版本收取任何费用。本地部署的实际成本取决于自有硬件——官方推荐配置为 24GB 或 32GB 显存的消费级显卡,或 Apple M4 Max / M5 Max 级别的 Mac。
Meta 未为该模型提供官方 API 定价。如需云端调用,可通过 Together AI、Fireworks AI、OpenRouter 等第三方推理平台,具体价格以各平台公示为准。
如何使用Muse Glimmer
- 下载权重: 从 Hugging Face 获取模型,仓库地址 https://huggingface.co/meta-models/Muse-Glimmer-30B,可选 BF16 全精度或两个 4-bit 量化版本。
- 选择运行方式: 本地推理可用 Ollama、LM Studio、Unsloth;边缘部署可用 llama.cpp、ExecuTorch、MLX;服务端部署可用 vLLM 或 SGLang,均已提供 Day-0 支持。
- 一行启动服务: 以 vLLM 为例,安装后执行
vllm serve "meta-models/Muse-Glimmer-30B"即可开启 OpenAI 兼容接口;SGLang 用python3 -m sglang.launch_server --model-path "meta-models/Muse-Glimmer-30B"。 - 调优采样参数: 官方推荐 temperature 1.0、top_p 0.95、top_k 64;在 system prompt 中写入
Reasoning strength: <值>控制推理强度,复杂编程与智能体任务建议用 high 或 xhigh。 - 接入 Agent 框架: 模型兼容 OpenClaw、Hermes Agent 等编排模式,官方文档提供自定义 scaffold 的配置指引,见 https://developer.meta.com/ai/models/muse-glimmer/
- 云端快速试用: 不想本地部署可直接走 Together AI、Fireworks AI 或 OpenRouter 调用托管版本。
常见问题
Q:Muse Glimmer 和 Llama 系列是什么关系?
A:两者都来自 Meta,但分属不同产品线。Muse 系列由 Meta Superintelligence Labs 推出,Muse Glimmer 是该实验室首个开放权重模型,从旗舰模型 Muse Spark 蒸馏而来。协议上差别更明显:Llama 使用 Meta 自定义的社区许可,附带月活用户规模等使用限制;Muse Glimmer 采用 Apache 2.0,没有这类附加条款。
Q:Muse Glimmer真的能在个人电脑上跑吗?需要什么配置?
A:可以。4-bit 量化后语言模型体积压到 20GB 以内,官方给出的目标硬件是 24GB 显存(K-Quant-17GB 版本)或 32GB 显存(K-Quant-Dynamic 版本),Apple M4 Max / M5 Max 的 Mac 也在官方实测范围内。全精度 BF16 版本则需要 64GB 显存,主要用于微调与研究。
Q:Muse Glimmer可以商用吗?
A:可以。全部发布物均为 Apache 2.0 协议,允许商业使用、修改和再分发,无用户规模限制。唯一的排除项是违反适用法律法规(含贸易合规法规)的用途,以及 Apache 2.0 本身禁止的行为。
Q:支Muse Glimmer持哪些模态?能处理视频吗?
A:输入支持文本与图像交错,输出为文本,不支持音频输入输出。视频未做专门优化,只能按单帧图像处理。
Q:Muse Glimmer和 Qwen3.6-27B、Gemma4-31B 比表现如何?
A:按 Meta 官方评测,Muse Glimmer 在智能体编排与推理类基准上领先,如 MCP Atlas 75.5(对比 54.2 / 62.5)、DeepSearch QA 74.6、Gaia2 43.3、AIME 2026 94.7、AA-LCR 80.0;在电脑操作与终端任务上落后,OSWorld-Verified 65.9 对 Qwen3.6-27B 的 75.6,TerminalBench 2.1 为 51.7 对 60.7。多模态基准三者接近。以上均为官方自测数据,对比集为 Gemma4-31B Thinking Mode 与 Qwen3.6-27B Thinking Mode。

