memory & vram / pillar

LM StudioのメモリとVRAMの目安|ファイルサイズ・KVキャッシュ・コンテキスト長を統合解説

「モデルが動くか」はメモリ(RAM)だけで決まるわけではありません。VRAM、ファイルサイズ、KVキャッシュ、コンテキスト長、GPUオフロードが絡みます。 本ページでは、各がどう消費されるかを仕組みから説明し、自分の環境での判断の仕方をまとめます。

読了後に判断できること:空きRAM/VRAMの確認、KVキャッシュの増え方、オフロードの意味、 「動かないときの切り分け」の手順。数値はあくまで目安であり、精密値は環境依存です。 LM Studio公式の「16GB RAM推奨」はアプリのシステム要件で、特定の7B/8B GGUFが必ず収まるという対応表ではありません。

RAM / VRAM / ストレージの違い

3つのメモリの役割
項目役割GGUF選びでの意味
ストレージ(SSD/HDD)ファイルの保存場所GGUFファイルサイズの置き場。実行時メモリではない。
RAM実行時の作業メモリCPU動作や部分的なオフロードで消費。
VRAMGPUの専用メモリGPU全オフロード時はここが主戦場。
重要:「ファイルサイズ=必要メモリ」ではありません。mmap、runtime buffer、KVキャッシュを含めた実使用量は ランタイム・OS・設定で変わります。計画時は 空き(available) RAM/VRAM を見ます。 OSや常駐アプリが使っている分は引かれます。

共有メモリと iGPU

Apple Silicon や一部の APU/SoC では、RAM と VRAM が 統合(unified memory) されています。 この場合「RAM と VRAM の合計」ではなく、共通のメモリプールからモデルも描画も消費します。 一方、Intel/AMD の内蔵GPU(iGPU)は、BIOS で確保した 共有メモリ を使うことがあり、 システムから見える空きRAM が減る場合があります。

どちらが自分の環境かは、OSのシステム情報(macOS「このMacについて」、Windows「タスクマネージャー」の パフォーマンスタブ等)で確認してください。数値を断定する前に、まず「自分の空き状況」を観察します。

何がメモリを食うか

ローカルLLMの実行時、大きく次のものがメモリを消費します。

メモリ消費の要素
要素概要増減の鍵
weight fileモデル重み本体(量子化済み)量子化精度・モデル規模
mmapファイルをメモリにマップして読む仕組み実装・OS依存。全ロードとは限らない
KV cacheコンテキストの「記憶」保持分コンテキスト長・アーキテクチャ
compute buffer計算の中間バッファバッチサイズ・実装
context / flash attnコンテキスト処理の設定長くするほど増大
vision / MoEマルチモーダル・専門層モデル構成依存

「計算バッファが何GB」などの精密値は、モデル・実装・設定で変わるため、ここでは範囲の目安として扱います。

KVキャッシュの増え方(目安)

KVキャッシュはコンテキスト長にほぼ比例して増大します。理論的な目安式と、仮モデルでの例は コンテキスト長とKVキャッシュ で詳しく扱っています。 要点:コンテキスト長を2倍にすると、KVキャッシュも約2倍になる傾向があります。

長い履歴が不要なら、既定値(多くは8k付近)から始めるのが無難。長くしすぎてメモリ不足になるケースを避けられます。

GPUオフロード

GPUオフロードは、モデルの層をどれだけ GPU(VRAM)へ載せるかを決めます。 全層を載せる(full offload)なら VRAM が主戦場になり、載せきれない分は RAM(CPU)へ回ります(部分オフロード)。

ここでも断定しない:部分オフロード時の「VRAM使用量は層数に比例する」という単純な倍数は、 配置ルール・実装・活性化タイミングで変わるため使いません。LM Studio の --estimate-only や 実測(コマンド作成ツール)で確認するのが確実です。

decision tree(動かないときの切り分け)

  1. 自分の 空きRAM と(あれば)空きVRAM を確認する。
  2. 同一モデルのGGUF一覧で実ファイルサイズを確認し、小さい候補へ下げる。
  3. コンテキスト長を既定値(8k付近)に戻す。
  4. GPUオフロードを下げる(部分オフロード、あるいは一旦CPUのみ)でロードできるか試す。
  5. それでもダメなら、より小さいモデル・軽い量子化を選ぶ。

これは「目安の手順」です。正確なエラー原因はログ・バージョンを確認(トラブルシューティング)。

具体例(仮定付き・目安)

環境別の目安(あくまで一般的な目安)
環境まず試す注意点
8GB RAM / GPUなし1B〜3B級の小型候補OS分を差し引き、小さい実ファイルからCPU速度も確認。
16GB RAM小型〜7B/8B級を候補に実ファイル、context、他アプリを確認。適合保証ではない。
32GB RAM / VRAM 8GB7B/8B級から比較全オフロード可否はファイルとKV/runtime bufferで変わる。
64GB RAM / VRAM 12GB+候補は広いMoE全重み、mmproj、GPU/CPU速度、同時アプリを確認。

上の「まず試す」は仮定付きの目安。OSと常駐アプリを除いた空きRAM、同時に使うアプリのメモリも影響します。 特に unified memory 環境では「合計」ではなく「空きプール」で考えます。

確認シート(ご自身で埋める)

自分の環境チェック
項目あなたの値
空きRAM(OS起動直後)__ GB
空きVRAM(GPUありの場合)__ GB
試したいモデル規模__ B
量子化__(例: Q4_K_M)
コンテキスト長__(既定値から開始推奨)
GPUオフロード__(full / 部分 / CPU)

架空の数値は入れません。ご自身の環境の実測値を記入してください。

適用外と限界

  • 本ページの数値は目安。精密値はモデル・量子化・ハードウェア・実装・設定に依存。
  • 「計算バッファが○GB」等の固定値は使いません(環境依存)。
  • unified memory と 専用VRAM では、余裕の計算が変わります。
  • 常駐アプリ・ブラウザの消費も無視できません。実測値で判断。

よくある質問

「VRAM 8GB だと何Bまで?」
パラメータ数だけでは決まりません。同じ7B/8Bでも量子化・architecture・contextで変わるため、GGUF実ファイルサイズを見て lms load --estimate-only で確認します。
「システムRAM と VRAM、どちらが重要?」
GPUで動かすなら VRAM がボトルネックになりやすいです。VRAM不足なら CPU/統合GPUへオフロードしますが、速度は落ちます。
「計算バッファは何GB?」
固定値ではなく、実装・設定・コンテキスト長で変わります。本サイトの数値は保守的な計画幅で、LM Studioの見積もりや実測値ではありません。
「チェッカーの数字は正確?」
目安です。実際の使用量は環境で変わるため、まずは「動くか」を実測で確認するのが確実です。

更新履歴:2026-08-31 16GB推奨要件とモデル適合を分離し、実ファイルサイズ・MoE/mmproj・現行estimate-onlyを判断軸へ追加。