GemmaをMacで動かす|軽いモデルで足りる仕事の見分け方

gemmaで検索すると、世代の名前と型番が入り混じった一覧が出てきます。Macに落として使う場合に迷うのは、どの型番を選ぶか、機械のメモリで足りるのか、そして軽い版で自分の仕事が済むのかという3点です。ここでは公開されている数値だけを使って、その3点を順に埋めていきます。結論を先に書くと、容量の大小と型番の数字は素直に対応していません。

軽いモデルの基準としてGemmaが見られている背景

Gemmaは、Google DeepMindが公開しているオープンモデルの一群です。重みが配布されているため、ブラウザのサービスではなく自分の機械に置いて動かせます。世代の進み方については、次のような見方が示されています。

2026年6月4日にGoogleより、新しいローカルLLM「Gemma 4 12B」を発表しました。 出典: note.com

世代が上がるたびに、同じ機械で動く範囲が広がっています。前の世代のGemma 3は、テキストと画像の両方を受け取れて、140を超える言語に対応し、文脈は128Kまで扱えるという構成でした。続くGemma 4では、全部の型番が推論を組み込んだ設計になり、小さい型番は128K、中くらいの型番は256Kまで文脈が伸びています。

Macでの前提条件は他のモデルと同じです。macOS Sonoma(バージョン14)以降で、Appleシリコン搭載機であればCPUとGPUの両方が使われます。Gemma 3を扱う場合は、実行の道具の側にもバージョンの下限があり、Ollamaでは0.6以降が必要とされています。

いま選べる世代と、1本あたりの容量

2026年9月26日時点で配布されている主な型番と容量は次のとおりです。

名前 容量 扱える文脈の長さ 入力
gemma4:e2b 7.2GB 128K テキスト・画像
gemma4:e4b 9.6GB 128K テキスト・画像
gemma4:12b 7.6GB 256K テキスト・画像
gemma4:26b 19GB 256K テキスト・画像
gemma4:31b 20GB 256K テキスト・画像
gemma3:270m 292MB 32K テキスト
gemma3:1b 815MB 32K テキスト
gemma3:4b 3.3GB 128K テキスト・画像
gemma3:12b 8.1GB 128K テキスト・画像
gemma3:27b 17GB 128K テキスト・画像

Appleシリコン向けに用意された系列もあり、こちらは名前の末尾にmlxが付きます。容量は元の型番と近く、e4bで9.5GB、12bで7.7GB、31bで19GBです。Macで動かす前提の系列があることを知っておくと、選択肢の幅が広がります。

容量の数字が素直でない理由

上の表で目を引くのは、e4bの9.6GBが12bの7.6GBより大きいという点です。数字だけを見ると逆に見えますが、これは仕組みの違いによるものです。

先頭のEは有効なパラメータという意味で、この型番には層ごとの埋め込みという仕掛けが入っています。埋め込みの表そのものは大きく、参照のためだけに使われます。そのため、重みを読み込むために要る合計のメモリが、有効なパラメータの数から想像する量より大きくなります。公式の説明にも、この点がはっきり書かれています。

もう1つ素直でないのが26bです。この型番は専門家を切り替える方式で、生成の1トークンごとに使われるのは40億パラメータ分だけですが、切り替えを速く保つために260億パラメータの全部をメモリに載せる必要があります。つまり、必要なメモリは4B規模ではなく26B規模の側に近くなります。活性化するパラメータの数を根拠に「軽い」と判断すると、読み込みの段で行き詰まります。

メモリの見積りは量子化の段で決まる

同じ型番でも、精度をどこまで落とすかで必要なメモリが大きく変わります。Googleが公開しているGemma 4の推論時のメモリ要件は次のとおりです。

型番 16ビット 8ビット 4ビット
E2B 11.4GB 5.7GB 2.9GB
E4B 17.9GB 8.9GB 4.5GB
12B 26.7GB 13.4GB 6.7GB
26B A4B 57.7GB 28.8GB 14.4GB
31B 69.9GB 34.9GB 17.5GB

この表には注意する点が添えられています。数値は静的な重みを読み込むための分だけで、文脈のために動的に増える領域は含まれていません。文脈を長く取るほど、この上に積み上がります。つまり16GBの機械で4ビットの12Bを選んだ場合、6.7GBは重みの分であって、256Kの文脈をいっぱいに使えば余裕は残りません。

精度を落とすと品質も落ちますが、その落ち幅を抑える作りもあります。量子化を訓練の過程に組み込む方式で用意された版は、精度の低下を補うように学習されているため、高い精度の版に近い振る舞いをします。前の世代では、この方式の版が半精度の版と同程度の品質を保ちながら、量子化していない版と比べてメモリを3分の1に抑えられるとされていました。

始め方は3ステップで済む

道具の名前がいくつも出てくるため難しく見えますが、実際の手順は3段です。

1段目は、実行の道具を入れることです。ディスクイメージを開いてアプリをアプリケーションフォルダへ移します。起動時にコマンドの置き場所を作るかどうかを尋ねられるので、許可しておくとターミナルからも呼べます。

2段目は、型番を1つ選んで落とすことです。最初は小さい型番から始めます。gemma3の270mは292MB、1bは815MBなので、落とす時間も短く、機械が耐えられるかどうかの見当が数分で付きます。

3段目は、保存先の確認です。実体はホームの下の ~/.ollama/models に置かれます。起動ディスクの空きが心細い場合は、環境変数 OLLAMA_MODELS に別のディレクトリを指定して外付けのドライブへ移せます。上の表の型番を3つ落とすだけで30GBを超えるため、ここを先に決めておくと後から詰まりません。

型番の名前の読み方

一覧に並ぶ名前は、いくつかの部品の組み合わせで決まっています。読み方が分かると、落とす前に見当が付きます。

  • 世代の番号(gemma3、gemma4)。世代が上がると、同じ数字の型番でも扱える文脈の長さや入力の種類が変わる
  • パラメータの規模(270m、1b、4b、12b、27b、31b)。mは百万、bは十億の単位
  • 先頭のE(e2b、e4b)。有効なパラメータという意味で、端末の上で動かすことを前提にした系列
  • 末尾のA4B(26b A4B)。専門家を切り替える方式で、1トークンあたりに使われるのが40億パラメータ分であることを示す
  • 末尾のit(指示に沿って答える形に調整済み)と、qat(量子化を訓練に組み込んだ版)
  • 末尾のmlx。Appleシリコンの上で動かすことを前提に用意された系列

この6つを覚えておくと、一覧の中で自分に関係のない行を素早く飛ばせます。逆に、名前の一部だけを見て判断すると誤ります。26bのA4Bを「4B相当だから軽い」と読むのが典型的な間違いで、実際には全部の重みをメモリに載せる必要があります。

使い始めてから気づく3か所

設定を触らないまま使い始めると、性能とは関係のないところで期待を外します。

1つ目は、文脈の長さの既定値です。実行の道具の側で既定が4,096トークンに設定されている場合、モデルが256Kまで扱えても指定しなければこの値が使われます。長いファイルを渡したのに途中までしか読まれていない症状は、ここが原因になっていることが多いです。

2つ目は、メモリに残る時間です。既定では5分で降りるため、少し間を置いてから次の依頼を出すと、読み込みの待ち時間が再び発生します。連続して使う時間帯だけ長く残す設定にすると、体感が変わります。

3つ目は、下書き用のモデルです。Gemma 4では全部の型番に投機的デコード向けの下書きモデルが同梱されていて、品質を保ったまま推論を速くできる作りになっています。使っている道具がこの仕組みに対応しているかどうかで速さが変わるため、遅いと感じたときは道具の側の対応状況も確かめる価値があります。

軽い版で足りる仕事と、足りない仕事

選び方の要点は、点数の高い型番を探すことではなく、自分の仕事がどちらに入るかを見分けることです。

  • 足りる: ファイル名から中身を推測する、拡張子で振り分ける、短い文を言い換える、決まった形式に整える
  • 足りる: 画像1枚の中身を短く説明する、スクリーンショットから日付や題名を読み取る
  • 足りない: 長い契約書の条項どうしの辻褄を確かめる、複数のファイルを横断して矛盾を探す
  • 足りない: 敬体と常体を一貫して書き分ける、業界特有の言い回しを外さずに直す

上の2つは、手がかりが短く判断も単純なため、270mや1bのような小さい型番でも成立します。下の2つは、文の係り受けをたどる必要があるため、12b以上でないと取りこぼしが出ます。作業を洗い出して、上に入るものだけを軽い型番に任せると、機械の条件を上げずに済みます。

見分けが付かない作業は、両方に投げて結果を並べるのが早い判断方法です。小さい型番で済むなら、落とす容量も待ち時間も大きく減ります。

画像を渡す作業で気をつける点

同じ世代でも、画像を受け取れる型番と受け取れない型番があります。Gemma 3では4b以上が画像に対応していて、270mと1bはテキストだけです。Gemma 4では、公開されている一覧の全部の型番がテキストと画像の両方を受け取れる構成になっています。

スクリーンショットの整理を頼む場面では、この違いがそのまま結果に出ます。テキストだけの型番に画像を渡しても内容は読まれないため、ファイル名の情報だけで判断されます。日付と題名を画像から読ませたい場合は、画像に対応した型番を選ぶ必要があります。

画像を渡すと、文脈の消費量も増えます。メモリの余裕が小さい機械では、画像を1枚ずつ渡す形にしたほうが処理が安定します。

無料で使える範囲と、条件を確かめる場所

重みは公開されているため、落として自分の機械で動かす範囲では追加の料金は発生しません。実質的な負担は、電気代と占める容量です。利用の条件は世代ごとの利用規約に定められているので、業務で使う前には配布元の条項を確認しておいてください。

料金が関わるのは、道具の側です。推論そのものを売る仕組みの道具を使うと、量が増えるほど毎月の請求が伸びます。手元で動かすモデルにも、自分で契約したAPIの鍵にも繋がる作りであれば、請求が伸びる要因を自分の側で抑えられます。どこまでが無料で、どこから有償になるのかは道具ごとに違うため、料金の条件を先に読んでおくと見積りが立てやすくなります。日本語の画面で使えるかどうかを確かめたい場合は対応言語の一覧が参考になります。

軽い型番に落としても、作業の往復は残る

型番を小さくして待ち時間を削っても、1日の終わりに軽くなった感じがしないことがあります。原因はモデルの側ではなく、経路の形にあります。

Finderでフォルダを開き、パスをコピーし、ターミナルに貼り、一覧を取り、その一覧をチャットの画面に貼り、返ってきたコマンドをまたターミナルに貼る。この往復が1件あたり6回発生します。型番を変えても、この回数は1つも減りません。

減らせるのは経路のほうです。フォルダとターミナルとAIが同じ窓にある作りであれば、いま見ているフォルダがそのまま対象になり、貼り付けの工程が消えます。どの操作がこの形で成立するかはできることのページに並んでいます。他の道具がこの部分をどう扱っているかを横に並べたい場合は他のファイル管理との比較が近い資料です。運用上の細かい条件はよくある質問に載っていることが多いので、対象を広げる前に目を通しておくと想定外が減ります。

よくある質問

Gemmaのどの型番を選べばよいですか?

機械に載る範囲を先に決めて、その中から選ぶ順序が確実です。4ビットに落とした場合の目安はE2Bで2.9GB、E4Bで4.5GB、12Bで6.7GB、31Bで17.5GBです。この数値は重みの分だけで、文脈のための領域は別に積み上がります。16GBの機械なら12Bまでが現実的な範囲になります。

E4Bが12Bより容量が大きいのはなぜですか?

Eは有効なパラメータという意味で、この型番には層ごとの埋め込みという仕掛けが入っています。埋め込みの表そのものは大きく、参照のためだけに使われるため、重みを読み込むのに要る合計のメモリが有効なパラメータ数から想像する量より大きくなります。公式の説明にも記載があります。

無料で使えますか?

重みが公開されているため、落として自分の機械で動かす範囲では料金は発生しません。負担は電気代と占める容量です。利用の条件は世代ごとの利用規約に定められているので、業務で使う場合は配布元の条項を先に確認してください。料金が関わるのは、推論を売る仕組みの道具を選んだ場合です。

画像を渡して読ませたいのですが、どの型番なら対応していますか?

Gemma 3では4b以上が画像に対応していて、270mと1bはテキストだけです。Gemma 4では公開されている一覧の型番がテキストと画像の両方を受け取れます。テキストだけの型番に画像を渡しても内容は読まれず、ファイル名の情報だけで判断されるので注意してください。

記事一覧へ戻る