豆包AI助手
当前位置:首页>AI资讯>Meta 发布开源模型 Muse Glimmer:30B 参数,Apache 2.0 协议,单张消费级显卡可运行

Meta 发布开源模型 Muse Glimmer:30B 参数,Apache 2.0 协议,单张消费级显卡可运行

Muse Glimmer

2026 年 8 月 10 日,Meta Superintelligence Labs 发布开放权重多模态模型 Muse Glimmer,这是该实验室成立以来首个公开权重的模型,也是 Meta 首次采用 OSI 认可的 Apache 2.0 协议发布模型,此前 Llama 系列使用的是带月活规模门槛的自定义社区许可。模型从旗舰闭源模型 Muse Spark 蒸馏而来,定位于常驻本地运行的智能体工作流。

Muse Glimmer 采用稠密因果 Transformer 架构,约 296 亿参数,外挂一个约 18 亿参数的独立视觉感知编码器,支持文本与图像交错输入、131072 tokens 以上上下文,输出为文本,不支持音频,视频只能按单帧图像处理。注意力机制采用「局部×3 + 全局」的循环模式,配合 2048 滑动窗口与分组查询注意力控制显存开销。模型支持 low、medium、high、xhigh 四档推理强度调节,训练数据覆盖 100 种以上语言,知识截止时间为 2026 年 1 月 4 日。

在使用场景上,Meta 将其定位为本地常驻的个人助理与私有化编程智能体,适合处理日程管理、文件整理这类需要长期访问个人上下文、又不希望数据出网的任务;同时也适用于多轮函数调用与工具编排、读取截图与图表的多模态信息处理、合成数据生成,以及作为评估模型对其他模型输出打分。官方在训练中特别强化了失败恢复能力,工具调用返回异常时模型会诊断并重试,而非直接中断任务链。

本次发布最受关注的是本地可运行性。全精度状态下模型需要 55GB 以上显存,官方随发布提供了两个约 4-bit 量化版本,将语言模型压缩至 20GB 以内,可装入 24GB 或 32GB 显存的消费级显卡,官方给出的精度损失为 0.2% 与 1.0%。同时附带的 DFlash 投机解码 drafter 单次前向可预测 16 个 token 的整块内容,官方实测在 RTX 5090 上解码速度由 74.9 tok/s 提升至 233.4 tok/s。基准表现方面,模型在智能体编排类任务上领先同尺寸开源模型,MCP Atlas 达到 75.5,DeepSearch QA 74.6,AIME 2026 94.7;但在电脑操作与终端任务上落后,OSWorld-Verified 为 65.9,低于 Qwen3.6-27B 的 75.6,以上均为官方自测数据,对比集为 Gemma4-31B 与 Qwen3.6-27B 的思考模式。

模型权重现已在 Hugging Face 开放下载,仓库地址为 meta-models/Muse-Glimmer-30B,提供 BF16 全精度与两个量化版本,全部采用 Apache 2.0 协议,允许商用、修改与再分发,无用户规模限制。Ollama、LM Studio、vLLM、SGLang 等推理框架已提供首日支持,llama.cpp、MLX 与 ExecuTorch 优化版本随后落地,云端可通过 Together AI、Fireworks AI、OpenRouter 调用托管版本。Meta 未为该模型提供官方 API 及定价。同日,扎克伯格发布长文《The Future is for Everyone》,阐述其反对能力集中、主张广泛分发的 AI 立场,并表示 Meta 将恢复发布部分开源模型。

整体来看,Muse Glimmer 的意义更多在协议与定位而非能力上限。Apache 2.0 相比 Llama 社区许可是实质性放开,加上量化版本与投机解码组件一次给全,让 30B 级别的智能体模型真正落到了个人硬件上。但需要注意的是,Meta 的旗舰模型 Muse Spark 依然闭源且是变现主力,本次开源的是从中蒸馏出的小模型,边际成本有限。这更接近一次分层策略的调整——前沿能力留在闭源 API,本地场景交给开源——而非回到 Llama 时代的全面开放。真正的检验点是 Meta 此前预告的 Muse Spark 1.2 开源权重版本能否兑现。

©版权声明:如无特殊说明,本站所有内容均为AIHub.cn原创发布和所有。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。否则,我站将依法保留追究相关法律责任的权利。