目次 / llama.cpp の準備

llama.cpp の準備(OS別)

Pixubus EX の頭脳は llama.cpp(の llama-server)です。これだけは アプリに同梱していないので、お使いの OS に合わせて自分で用意します。ここがいちばんの山場ですが、当てはまる OS の箇所だけ読めば大丈夫です。

用意するのは llama-server(実行ファイル)1 つ。 モデル本体(GGUF)は 次のページで別に入手します。ここでは「エンジン」だけ手に入れます。

まず方針:GPU?CPU?どのビルド?

llama.cpp は環境に合わせて何種類かのビルドがあります。迷ったら下の図と早見で選んでください。速度を求めるなら GPU、確実さを求めるなら CPU が基本です。

llama.cpp の選び方の分岐図。Windows は NVIDIA GPU があれば CUDA 12.4 ビルド(推奨)、手軽に試すなら winget の Vulkan、GPU なしは CPU。macOS は brew の Metal(推奨)。Linux は NVIDIA GPU があれば CUDA をソースビルド(推奨)、GPU なしは CPU。
OS と GPU で決まる — 自分の行だけ読めば OK。
あなたの環境選ぶビルド体感
NVIDIA GPU(GeForce/RTX 等)CUDA ビルド速い(画像解析が数秒〜)
Apple Silicon(M1〜)macOS arm64(Metal 内蔵)速い・省電力
GPU が無い / 不安定CPU ビルド遅いが確実(数十秒〜/枚)
AMD / Intel GPUVulkan ビルド環境差が大きい(下の注意)
速度が出なくても「動けばよい」 なら CPU ビルドが一番ラクで確実です。あとから GPU ビルドに差し替えても、llama-server を新しいビルドで起動し直して同じ URL につなぐだけです。

入手の手段は大きく2つ。パッケージマネージャ(一番ラク)か、公式の配布 zip を手で展開(GPU ビルドを細かく選びたいとき)です。配布 zip は llama.cpp 公式の GitHub Releases にあります。

※ ファイル名の b####(例 b9821)はリリース番号で、頻繁に更新されます。Releases ページで最新の番号に読み替えてください。以下の例の番号はあくまで一例です。

Windowswindows 10 / 11 · x64

かんたん:winget で入れる

コマンドプロンプトか PowerShell で 1 行。新しいバージョンが出ても更新されます。

winget install llama.cpp

入ったら llama-server --version で確認できます。NVIDIA GPU をフルに使いたい / Blackwell 世代(RTX 50 系)の場合は、次の「手で展開」で CUDA ビルドを選ぶほうが確実です。

確実:配布 zip を手で展開(GPU を選びたいとき)

Releases から、環境に合う zip を落として好きなフォルダに展開します。

環境落とすファイル(例)
GPU 無し / まず確実にllama-b####-bin-win-cpu-x64.zip
NVIDIA GPU(推奨)llama-b####-bin-win-cuda-12.4-x64.zip
cudart-llama-bin-win-cuda-12.4-x64.zip
AMD / Intel GPUllama-b####-bin-win-vulkan-x64.zip
CUDA を使う場合は cudart-… も必ず一緒に展開してください(CUDA ランタイム DLL。これが無いと起動しません)。本体 zip と同じフォルダに上書き展開すれば OK です。
Blackwell 世代(RTX 50 系 / sm_120)の注意。 本 PoC では CUDA 12.4 ビルドで動作を確認しています。一方 CUDA 13.x はクラッシュ(MMQ)、Vulkan は不安定でした。50 系は CUDA 12.4 を選んでください。それ以前の世代は素直に最新の CUDA ビルドで構いません。

展開すると llama-server.exe が入っています。これが本体です。場所(フルパス)を控えておきます(例 C:\tools\llama\llama-server.exe)。動作確認:

cd C:\tools\llama          # 展開した場所
.\llama-server.exe --version
macOSapple silicon (M1〜) 推奨

Apple Silicon なら Metal(GPU)が標準で有効なので、特別なことをしなくても速く動きます。Homebrew が一番ラクです。

brew update
brew install llama.cpp

これで llama-server が使えるようになります(新リリースに追従して更新されます)。確認:

llama-server --version
which llama-server        # 実行ファイルの場所を確認(設定で使う)

Homebrew を使わない場合は、Releases から llama-b####-bin-macos-arm64.tar.gz を落として展開します。

tar -xf llama-b####-bin-macos-arm64.tar.gz   # 展開
xattr -dr com.apple.quarantine .             # Gatekeeper の隔離属性を外す(必要なら)
ダウンロードしたバイナリは、初回に「開発元を確認できない」と止められることがあります。上の xattr で隔離属性を外すか、Finder で右クリック →「開く」で許可してください。
Linuxubuntu 等 · x64

Linux は ソースからビルドするのが確実です(私たちが実機で検証した手順。クラウド GPU の RTX 5090 + CUDA 12.8 でこのまま成功しています)。Linux 向けの CUDA プリビルドは配布されていないため、GPU を使うなら実質これ一択です。

ソースからビルド(おすすめ・実測済み)

手順は ①依存 → ②取得 → ③設定(cmake)→ ④ビルド → ⑤確認 の一本道です。上から順に全部実行してください(GPU/CPU の違いは ③ の 1 行だけ)。

# ① 依存(初回のみ)
sudo apt-get update && sudo apt-get install -y build-essential cmake git libcurl4-openssl-dev

# ② 取得
git clone https://github.com/ggml-org/llama.cpp && cd llama.cpp

# ③ 設定(NVIDIA GPU / CUDA 12.x。RTX 50xx=Blackwell は世代を明示・実測: RTX 5090 で成功)
cmake -B build -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES=120

# ④ ビルド(★ここが本体。数分〜十数分かかります)
cmake --build build --config Release -j

# ⑤ できあがり
./build/bin/llama-server --version
「build/bin が空」になったら ④ を実行し忘れています。 ③ の cmake -B build … は「設定」だけで、まだ何もコンパイルしていません。cmake --build build --config Release -j(④)を流して初めて build/bin/llama-server ができます。

CPU だけで手早く試すなら、Releasesllama-b####-bin-ubuntu-x64.tar.gz を展開して使う手もあります。Homebrew(Linuxbrew)の brew install llama.cpp でも入るはずですが、こちらは未検証です(参考まで)。

用意できたら:アプリにつなぐ

Pixubus EX は自分で起動した llama-server に URL でつなぐ方式です(アプリは llama-server を起動しません。詳しくは 設定)。

1
自分で起動
--jinja 付き
  • 手に入れた llama-server をモデル指定で起動しておく。
  • --jinja などの必須オプションは自分で付ける(設定画面に推奨コマンドあり)。
2
URL を教える
設定 → LLM
  • アプリには URL(例 http://127.0.0.1:8080)とラベルを入れるだけ。
  • 別 PC・クラウド GPU の llama-server にもつなげる。
--jinja を必ず付けてください。 無いと画像を渡した瞬間にクラッシュします(Windows では 0xC0000409)。最大のハマりどころです。あわせて --reasoning-format deepseek --image-max-tokens 1120 も付けるのが推奨(具体例は モデルの入手・設定画面の推奨コマンドにも入っています)。

次は、その llama-server に読ませる モデル(Gemma4 の GGUF + mmproj) を入手します。