Amazonで商品を見るセール会場へ

gpt-oss-120bをローカルで動かす方法|必要メモリ128GB・実測30トークン/秒の現実

OpenAIがオープンウェイトで公開したgpt-oss-120bは、本格的な大型モデルをローカルPCで動かす選択肢を現実的なものにしました。

特徴は、本モデルがMoE(Mixture of Experts)型であり、1200億パラメータ規模でありながら推論時の計算負荷が抑えられている点です。

この記事では、gpt-oss-120bの動作に必要なメモリ容量、実際の生成速度、Windows環境での設定手順、動作要件を満たすPCの構成を解説します。

目次

gpt-oss-120bのスペックと必要メモリ

項目gpt-oss-20bgpt-oss-120b
ファイルサイズ約14GB約65GB
必要メモリ目安16GB以上96GB以上(実質128GB機)
コンテキスト長128K128K
量子化形式MXFP4(MoE部)MXFP4(MoE部)

注意すべき点は65GBというサイズです。

VRAM 24GBのRTX 4090でも単体ではVRAMに収まりません。

一方、メインメモリ128GBのユニファイドメモリ搭載ミニPCであれば、GPUへ96GBを割り当てて全体をロードできます。

大容量VRAMを単体で確保しにくい単体GPU環境よりも、大容量メモリを確保できるユニファイドメモリ機が有利になる点が本モデルの特徴です。

MoEによる推論の高速化

gpt-oss-120bは全1200億パラメータのうち、1トークン生成ごとに一部のエキスパートのみを呼び出して処理します。

そのため、同じ65GBの密結合型(dense)モデルと比べて数倍速く動作します。

メモリ容量さえ確保できれば実用的な生成速度を得られる点が、本モデルをローカル運用する大きなメリットです。

実際の生成速度:Ryzen AI Max+ 395で約30トークン/秒

128GBメモリを搭載したRyzen AI Max+ 395(Strix Halo)機での実測レポートでは、gpt-oss-120bがおおむね30トークン/秒前後で動作しています。

環境設定を最適化した場合、さらに高速な数値も報告されています。

一般的な読書速度(10〜15トークン/秒程度)を上回るため、読む速度より速く生成される水準です。

完全なローカル環境で通信を介さずこの速度を維持できる点は実用上大きな利点となります。

環境gpt-oss-120bの可否速度目安
Ryzen AI Max+ 395 / 128GB◎ 動く約30 tok/s
Ryzen AI Max+ 395 / 64GB× 載らない-(20bなら快適)
Mac Studio M系 / 128GB以上◎ 動く構成による
RTX 5090(VRAM 32GB)△ 一部CPU処理で大幅減速実用的でない
メモリ32GBの一般的なPC× 不可-(20bも厳しい)

一覧のとおり、64GB機では動きません。

gpt-oss-120bの運用を前提とする場合、購入時に128GB構成を選択する必要があります(オンボードのユニファイドメモリは後から増設できません)。

動作手順:Ollamaを利用した実行方法

実行環境が整っていれば、以下のコマンド1行で起動できます。

ollama run gpt-oss:120b

初回実行時は約65GBのモデルダウンロードが発生するため、十分なネットワーク帯域と空きストレージ容量を確保してください。

20B版を試す場合は以下のコマンドを実行します(メモリ16GB環境でも動作します)。

ollama run gpt-oss:20b

Ollama自体の導入手順はOllamaの使い方入門で解説しています。

【Windows+Ryzen AI Max】GPUメモリの割り当て設定

Strix Halo機では、初期設定のままだとGPUへ割り当てられるメモリが不足し、65GBのモデルをロードできません。

AMD Software: Adrenalin Editionで可変グラフィックスメモリ(VGM)の割り当て容量を拡張します。

  1. AMD Software: Adrenalin Edition を開く
  2. パフォーマンス → チューニング → システム を開く
  3. 可変グラフィックスメモリ(Variable Graphics Memory) を「カスタム」に設定
  4. 割り当てを96GB程度に指定してPCを再起動

LM Studioを使用する場合は、モデル読み込み時に「手動でパラメータを設定」を有効にし、GPUオフロードのレイヤー数をMAX、Flash Attentionをオンに設定してください。

大規模モデルの推論ではこれらの設定が処理速度に直結します。

なお、Windows+Vulkan環境において、モデルサイズが64GB前後に達した際に読み込みが失敗する事象が報告されています。

問題が発生する場合は、LM Studio本体および推論ランタイムを最新版へ更新するか、Ollamaでの実行を試してください。

gpt-oss-120bの動作に対応するPC

動作条件の要点は、ユニファイドメモリ128GBの確保です。

選択肢となる主な製品は以下の2機種です。

GMKtec EVO-X2(128GB / 2TB)|120b動作対応の最小構成

Ryzen AI Max+ 395に128GBのLPDDR5X-8000メモリを搭載した構成です。

256GB/sのメモリ帯域幅が直接生成速度に反映されます。

gpt-oss-120bを自宅環境で動かす目的において、導入コストを抑えやすい選択肢です。

GMKtec
¥656,469(2026/09/23 13:00時点 | Amazon調べ)
\楽天セール開催中!ポイント最大11倍!/
楽天市場

MINISFORUM MS-S1 MAX(128GB / 2TB)|拡張性重視

同じくRyzen AI Max+ 395の128GB構成を採用し、ネットワークインターフェースやポート類の拡張性を高めた設計です。

常時稼働させる推論サーバー用途に適しています。

MINISFORUM
¥659,899(2026/09/23 13:00時点 | Amazon調べ)
\楽天セール開催中!ポイント最大11倍!/
楽天市場

予算を抑える場合:64GB機+gpt-oss-20bの構成

120bの動作にはこだわらず、ローカルLLMを実用運用したい場合は64GB機が適しています。

gpt-oss-20bやQwen3 32Bが快適に動作し、導入コストも大幅に抑えられます。

GMKtec
¥351,999(2026/09/23 13:00時点 | Amazon調べ)
\楽天セール開催中!ポイント最大11倍!/
楽天市場

Ryzen AI Max+ 395搭載機の詳細な比較はRyzen AI Max+ 395搭載ミニPC比較にまとめています。

購入前に確認すべき3つの注意点

  • ストレージ容量:モデル単体で約65GBの容量を消費します。
    複数のモデルを試す場合は2TB以上のSSDを推奨します
  • プロンプト処理速度の特性:長文コンテキスト入力時のプロンプト処理(TTFT)はディスクリートGPUに比べて時間を要します。
    トークン生成速度は高速ですが、最初の出力までの初動待ち時間が発生する点に注意してください
  • 用途の適合性:クラウド提供の最上位商用モデルと単純な推論精度で同等というわけではありません。
    データを外部送信しないこと、従量課金が発生しないこと、完全オフラインで動作することに運用上の価値を見出せるかが選定の判断軸になります

ローカルLLMを動かす記事は、ほかにもあります。

まとめ

gpt-oss-120bは、ユニファイドメモリ128GB搭載のミニPC単体で、100B超のモデルを実用速度(約30トークン/秒)で実行できる環境が整ったことを示すモデルです。

以前はマルチGPUサーバーを要していた規模のモデルが卓上マシンで完結します。

必要なのは単体の超高額GPUではなく、大容量かつ広帯域のメモリです。

用途に応じた必要スペックの詳細は、ローカルLLMに必要なスペック解説とPC比較データベースで確認してください。

※本記事に掲載した価格・仕様は2026年9月3日時点の調査に基づきます。

最終調査日:2026年9月3日。

価格は変動するため、購入前に販売ページで最新の情報をご確認ください。

記事内のリンクにはアフィリエイトリンクを含みます。

よかったらシェアしてね!
  • URLをコピーしました!
  • URLをコピーしました!

次に学ぶ・作業環境を選ぶ

学習を続けたい方や、作業環境を整えたい方は、目的に合うガイドをご覧ください。

生成AIのおすすめ書籍

周辺機器の優先度

目次