$ sudo apt update
$ sudo apt install git cmake build-essential
$ sudo apt install nvidia-cuda-toolkit
$ cd llama.cpp
$ cmake --build build --config Release -j 8
ビルドはそれなりに時間がかかるので、放置して寝ていたら朝には終わっていました。ちなみに、今回のコマンドには入れていませんが、-DCMAKE_CUDA_ARCHITECTURES=native オプションを付与すると、GPUの型番に合わせて自動で最適化してくれるらしいです。次回ビルドする機会があれば、ぜひ試してみたい。
というわけで、llama-server が起動できるように専用のシェルスクリプトを作りました。
#!/bin/bash
cd "$HOME/llama.cpp" || exit 1
declare -A MODELS
MODELS[e4b]="./models/Gemma-4-E4B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf"
MODELS[q4b]="./models/Qwen3.5-4B-Uncensored-HauhauCS-Aggressive-Q4_K_M.gguf"
MODEL_KEY="${1:-e4b}"
MODEL="${MODELS[$MODEL_KEY]}"
if [ -z "$MODEL" ]; then
echo "利用可能モデル:"
printf ' %s\n' "${!MODELS[@]}"
exit 1
fi
if [ ! -f "$MODEL" ]; then
echo "モデルファイルが見つかりません: $MODEL"
exit 1
fi
echo "モデル: $MODEL_KEY"
echo "ファイル: $MODEL"
LLAMA_SERVER="./build/bin/llama-server"
HOST="0.0.0.0"
PORT="8080"
CTX_SIZE="4096"
N_GPU_LAYERS="-1"
THREADS="$(nproc)"
exec "$LLAMA_SERVER" \
--model "$MODEL" \
--host "$HOST" \
--port "$PORT" \
--ctx-size "$CTX_SIZE" \
--n-gpu-layers "$N_GPU_LAYERS" \
--threads "$THREADS" \
--temp 1.0 \
--top-p 0.95 \
--top-k 64 \
--repeat-penalty 1.1
---
サーバーが起動後、ブラウザからアクセスすると、見覚えのある画面が表示されます。質問するとこんな感じ。

























