PCを用意してOllamaやLM Studioを導入したあと、次に検討するのがどのモデルを選ぶかです。
選択肢が多いだけでなく、日本語の処理精度はモデルによって大きく異なります。
この記事では、搭載メモリ別に日本語で実用的に動くモデルを整理します。
最初に導入する候補を迷わず選べるよう、メモリ容量ごとの目安をまとめました。
メモリ別・まず導入したいおすすめモデル
| 搭載メモリ | おすすめ | ファイルサイズ目安 | 主な用途・動作感 |
|---|---|---|---|
| 8GB | Gemma 3 4B | 約3GB | 要約・短文の下書き向き |
| 16GB | Qwen3 8B | 約5GB | 日本語が安定。最初の1基に最適 |
| 32GB | Qwen3 14B | 約9GB | 長文作成や複雑な応答に対応 |
| 64GB | Qwen3 32B / Gemma 3 27B | 約20GB | 高精度な実務文章の生成が可能 |
| 128GB | gpt-oss 120B | 約65GB | 高度な論理推論や複雑なタスク向け |
迷ったらまずはQwen3 8Bの導入を検討してください。
日本語出力の自然さと動作の軽さのバランスが良く、メモリ16GB環境でスムーズに動作します。
用途別に選ぶ
日本語の文章作成:Qwen系
Alibabaが開発したQwen3は多言語対応に優れ、日本語の文章生成が比較的安定しています。
要約やメールの下書き、文章のリライトといった日常業務で扱いやすいモデルです。
8B・14B・32Bとサイズ展開が豊富なため、PCのスペックに合わせて選べる点も特徴です。
ollama run qwen3:8b
動作の軽さ重視:Gemma 3
Googleが公開したGemma 3は、軽量なパラメータサイズでも的確な応答を返します。
4Bであればメモリ8GBの環境でも動作するため、スペックが限られたPCで試す場合の入門モデルとして適しています。
27B版はメモリ64GBクラスの環境を要しますが、文章の精度や表現力が一段と向上します。
ollama run gemma3:4b
プログラミング支援:Qwen2.5-Coder
ソースコードの生成や修正に特化したモデルです。
日本語で指示やコメントを記述しながらコードを出力させる運用に適しています。
汎用モデルよりもコード記述の精度が高いため、開発補助が目的であれば個別に追加する価値があります。
ollama run qwen2.5-coder:7b
論理推論・ステップ処理:gpt-oss
OpenAIが公開したオープンモデルで、20Bと120Bのサイズが提供されています。
20Bはメモリ16GBクラスから稼働し、前提条件を整理しながら段階的に推論する作業を得意とします。
120Bは約65GBの容量があるため、快適に動かすには128GBのユニファイドメモリ環境が求められます。
ollama run gpt-oss:20b
120B版の詳しい設定手順はgpt-oss-120bをローカルで動かす方法で解説しています。
量子化形式の選び方
同じモデルでも「Q4_K_M」「Q5_K_M」「Q8_0」などの選択肢があり、どれを選ぶべきか迷いやすい点です。
これらはモデルを圧縮する度合い(量子化ビット数)の違いを表しています。
| 種類 | サイズ | 品質 | 推奨シーン |
|---|---|---|---|
| Q4_K_M | 小さい | 実用十分 | 標準的な選択肢 |
| Q5_K_M | 標準 | 良好 | メモリに余力がある場合 |
| Q8_0 | 大きい | 元モデルに極めて近い | 精度を最優先する場合 |
特段のこだわりがなければQ4_K_Mを選べば問題ありません。
メモリ消費と出力品質のバランスが優れており、広く利用されている標準形式です。
同じメモリを割り当てる場合、小さいモデルをQ8_0で動かすよりも、一段大きいモデルをQ4_K_Mで動かすほうが回答精度が高くなりやすい傾向があります。
日本語でローカルLLMを運用する注意点
- モデル規模が小さいほど日本語の破綻が起きやすくなります。
特に4B前後の小型モデルは英語と比較して語彙や文法の破綻が出やすい傾向があります - プロンプトは前提と出力形式を具体的に指定します。
クラウド型の大規模モデルに比べて文脈の補完能力が限られるため、役割や回答フォーマットを明記すると安定します - 最新の時事情報やリアルタイムデータは保持していません。
学習データに含まれない最新事実の確認を求める用途には適していません
複数モデルを試す際のストレージ容量の管理
複数種類のモデルをダウンロードしていくと、モデルファイルだけでストレージを数百GB消費します。
検証が終わったモデルは削除するか、高速な外付けSSDの追加を検討してください。
ollama rm モデル名
2TB以上のNVMe SSDがあれば、複数の大型モデルを削除せず手軽に比較検証できます。
より大規模なモデルを動かしたくなった場合の検討点
利用を続けるなかで14B以上のモデルを試したくなった場合、性能のボトルネックはPCのハードウェア構成にあります。
ロードできるモデルの最大サイズはメモリ容量で決まり、トークンの生成速度はメモリ帯域幅に依存します。
32Bクラスを快適に動かす構成例:GMKtec EVO-X2(64GB)
256GB/sのメモリ帯域と64GBのユニファイドメモリを備えており、Qwen3 32BやGemma 3 27Bがスムーズに動作します。
小型モデルと比べて文章の論理構成が明確になるため、実務で常用する環境として有力な選択肢です。
120Bクラスまで視野に入れる構成例:GMKtec EVO-X2(128GB)
gpt-oss 120Bクラスの大規模モデルをオンメモリで読み込むには、128GB以上のメモリが必須です。
ユニファイドメモリは後から増設できないため、超大型モデルの稼働を想定する場合は初期構成の選定が重要になります。
まとめ
最初はQwen3 8B、量子化はQ4_K_Mを選択すれば、標準的な環境でスムーズに検証を開始できます。
そこから目的に応じてコード特化型やgpt-ossなどの大型モデルを追加していく進め方が効率的です。
各モデルの具体的なセットアップ方法はLM Studioの使い方またはOllamaの使い方入門で解説しています。
マシンスペックの選定についてはAI向けPC比較データベースもあわせて参照してください。
※本記事に掲載した価格・仕様は2026年9月3日時点の調査に基づきます。
最終調査日:2026年9月3日。
価格は変動するため、購入前に各販売ページで最新の情報をご確認ください。
記事内のリンクにはアフィリエイトリンクを含みます。
複数モデルの保存領域を確保する方法
モデルのダウンロードによって空き容量が逼迫した場合は、モデルファイルの総容量を把握したうえで外付けSSDの導入を検討してください。
外付けSSDの具体的な選び方については、運営メディア「デザノマ」のモデル保存にも使える外付けSSDの選び方で詳しく解説しています。
