要点

Metaは30Bパラメータのエージェント向けモデル「Muse Glimmer」を、Apache 2.0ライセンスのオープンウェイトとして公開しました。ローカルでのツール呼び出し、コーディング、画像を含む入力、長い手順の実行と失敗からの復旧を主な用途としています。

公式説明では、約4bitへの量子化で言語モデル部分を20GB未満にし、KVキャッシュ、画像用エンコーダー、投機的デコード用モデルを含めて24GBまたは32GBのメモリ枠に収める設計です。MetaはDFlashによる投機的デコードについて、検証環境で通常の逐次生成より高速になったと報告しています。数値はMeta自身の評価であり、実際の速度と品質は端末・量子化形式・ランタイム・タスクで確認が必要です。

開発者への影響

ローカルLLMの評価軸が「会話ができるか」から、「長い処理を完了し、正確にツールを選び、失敗後に復旧できるか」へ移っています。個人データや社内コードをクラウドへ送らずに扱いたい用途では有力な比較対象です。

一方、30Bモデルは量子化しても軽量ではありません。手元の通常構成で快適に動くとは限らず、公開ベンチマークだけで自律操作を任せるのは危険です。

必要な対応

開発への活かし方

採用判断

様子見。Apache 2.0とローカルエージェント特化は魅力的ですが、主要ランタイムの最適化は公開時点で順次提供予定です。まず実測報告とモデルカードを確認する段階です。

何が作れるようになったか

端末内の文書・画像・コードを参照し、決められたローカルツールだけを呼ぶ個人用エージェントが現実的な候補になります。オフライン環境や、クラウドへ送信しにくい情報を扱う補助処理にも向きます。

15分ミニ課題

モデルをダウンロードせず、公式記事とモデルカードから「必要メモリ」「対応ランタイム」「ライセンス」「自分が許可するツール」「失敗時の停止条件」の5項目を表にしてください。自分の端末と用途に合わなければ、その時点で見送る判断も成果です。

最小コード例

ランタイムごとの最適化が順次提供される段階のため、未検証の起動コードは掲載しません。公式の対応手順が揃ってから再評価します。

一次情報を確認する ↗