本文へスキップ

Ollama導入ガイド:Windows/Mac/Linuxのインストール・API・保存先

Ollamaの導入からollama pull/run、REST API(/api/generate・/api/chat)とOpenAI互換/v1、モデル保存先と環境変数までを整理。RTX 3090環境で2026年9月14日に実行した出力を根拠に書いています。

SHAYOUWORLD 更新 約6分

Ollamaの導入で必要なのは、インストーラを入れて ollama run <モデル名> を打つことだけです。モデルの取得・ロード・チャットが一度に始まり、同時にポート11434でREST APIも立ち上がります。つまずくとすれば、モデル保存先のディスク容量、コンテキスト長の既定値、そしてWindowsのターミナルの文字コードの3点でした。

この記事では、2026年9月14日にWindows 11 + RTX 3090の環境でOllama 0.30.6を実際に叩いた出力を根拠に、OS別の導入、CLI、3系統のAPI、保存先と環境変数を順に整理します。ローカルLLMそのものの選び方はVRAM別のモデルサイズ早見、GUIで始めたい場合はLM Studioの使い方に分けています。

  1. 導入はOS別に1手順。 Windowsは OllamaSetup.exe(管理者権限不要)、macOSは dmg、Linuxは curl -fsSL https://ollama.com/install.sh | sh
  2. CLIは run pull ls ps stop rm の6つで日常が回る。 ollama launch でClaude CodeやCodexとの連携メニューも開ける。
  3. APIは3系統。 ネイティブ /api/generate /api/chat、OpenAI互換 /v1/chat/completions、Anthropic互換 /v1/messages。すべて同じ11434番。
  4. 保存先とコンテキスト長は先に決める。 OLLAMA_MODELS で置き場所、ollama ps のCONTEXT列で実際のコンテキスト長を確認する。

OS別インストール

公式ドキュメント(docs.ollama.com)の各OSページで確認した要件と手順です。

Windows

  • 要件は「Windows 10 22H2 以降、Home または Pro」。GPUを使う場合は「NVIDIA 551.61 以降」、AMDは「ROCm v7 / HIP7 対応ドライバ」。
  • OllamaSetup.exe は管理者権限なしでユーザーアカウント配下にインストールされます。場所を変えたい場合は OllamaSetup.exe /DIR="d:\some\location"
  • 置き場所は、バイナリが %LOCALAPPDATA%\Programs\Ollama(ユーザーPATHに追加される)、ログが %LOCALAPPDATA%\Ollamaapp.log server.log)、モデルと設定が %HOMEPATH%\.ollama
  • サービス組み込み向けにGUIなしの ollama-windows-amd64.zip も配布されています。

macOS

  • 要件は「macOS Sonoma (v14) 以降」、Apple Mシリーズ(CPU/GPU対応)またはx86(CPUのみ)。
  • ollama.dmg をマウントして Applications へドラッグ。CLIをPATHに追加するか初回起動時に聞かれます。
  • モデルと設定は ~/.ollama 配下。

Linux

Terminal window
curl -fsSL https://ollama.com/install.sh | sh

インストーラがsystemdのサービス(/etc/systemd/system/ollama.service)まで作ります。手動で入れる場合は ollama serve で起動。NVIDIAはCUDAを入れて nvidia-smi で確認、AMDはROCm v7が必要です。環境変数は sudo systemctl edit ollama[Service]Environment=... 行を足します。

対応GPU

公式のHardware supportページでは、NVIDIAは「compute capability 5.0以上、ドライバ550以降」。RTX 30xxは8.6、40xxは8.9、50xxは12.0として列挙されています。複数GPUのうち一部だけ使う場合は CUDA_VISIBLE_DEVICES(AMDは ROCR_VISIBLE_DEVICES)で絞ります。Apple MetalとVulkan(Intel/AMD向け、WindowsとLinux)にも対応と記載されています。

CLI:最初の10分

Terminal window
ollama run gemma4 # 未取得なら pull してからチャット開始。/bye で終了
ollama pull qwen3.6:27b # 取得だけ
ollama ls # 取得済み一覧
ollama ps # ロード中のモデルとVRAM使用量
ollama stop gemma4 # 即時アンロード
ollama rm gemma4 # 削除
ollama show qwen2.5:7b # アーキテクチャ・コンテキスト長・量子化

筆者の環境で ollama ls を実行した結果です(2026-09-14)。

NAME ID SIZE MODIFIED
qwen2.5:3b 357c53fb659c 1.9 GB 3 months ago
gemma4:31b 6316f0629137 19 GB 3 months ago
qwen3.6:35b-a3b 07d35212591f 23 GB 3 months ago
qwen3-coder:30b 06c1097efce0 18 GB 3 months ago
gpt-oss:20b 17052f91a42e 13 GB 3 months ago
qwen2.5-coder:14b 9ec8897f747e 9.0 GB 3 months ago
qwen2.5:14b 7cdf5a0187d5 9.0 GB 3 months ago
qwen2.5:7b 845dbda0ea48 4.7 GB 3 months ago
0.30.6
Ollamaのバージョン
/api/version の応答。起動時に 0.34.0 への更新通知が出ていた
8本 / 94GB
取得済みモデルとディスク使用量
du -sh ~/.ollama/models の実測
11434
待ち受けポート
既定は 127.0.0.1 のみ。OLLAMA_HOST で変更
32768
qwen2.5:7b ロード時のCONTEXT
num_ctx 未指定で ollama ps に表示された値
2026-09-14、Windows 11 + RTX 3090 での実測

Hugging Face上のGGUFは、ライブラリ未登録でも ollama run hf.co/<user>/<repo>:<量子化> の形式で直接実行できます(Hugging Face公式ドキュメントに記載。既定はリポジトリ内に Q4_K_M があればそれが選ばれる)。

Terminal window
ollama run hf.co/llm-jp/llm-jp-4-8b-thinking-gguf:Q4_K_M

ollama launch で外部ツールに接続する

0.30系には ollama launch があり、ollama launch --help にはClaude Code、Codex、OpenCode、Cline、VS Codeなど16の連携先が列挙されていました。ollama launch claude --model <model> のように呼ぶと、対象ツールの設定を自動で書いて起動します。Claude Code / Codexとの実際のやり取りはローカルLLMをClaude Code / Codexから使うで扱います。

REST API:3系統を同じポートで

ネイティブAPI(/api/generate と /api/chat)

/api/generate は単発のプロンプト、/api/chatmessages 配列を受け取る会話向けです。どちらも stream の既定値はtrue(部分応答を逐次返す)なので、curlで確認するときは false にします。

Terminal window
# gen.json(UTF-8で保存)
# {"model":"qwen2.5:7b","prompt":"Ollamaとは何ですか。日本語で一文で答えてください。","stream":false}
curl -s http://localhost:11434/api/generate -d @gen.json

実際の応答(context 配列は省略)です。

{
"model": "qwen2.5:7b",
"created_at": "2026-09-14T04:29:26.1790325Z",
"response": "Ollamaはアリババクラウドによって作成された大規模な言語モデルです。",
"done": true,
"done_reason": "stop",
"total_duration": 724213200,
"load_duration": 221589300,
"prompt_eval_count": 46,
"prompt_eval_duration": 280750000,
"eval_count": 24,
"eval_duration": 217519000
}

内容はモデルの勘違い(OllamaをQwen自身の作者と混同している)ですが、フィールドの意味を見るには十分です。公式リファレンスによれば total_duration などはナノ秒、prompt_eval_count が入力トークン数、eval_count が出力トークン数です。eval_count / eval_duration から生成速度が出せます(この例は24トークン / 0.218秒 ≒ 110 tok/s)。

/api/chat では options にサンプリングやコンテキスト長を渡せます。

{"model":"qwen2.5:7b",
"messages":[{"role":"system","content":"日本語で簡潔に答えてください。"},
{"role":"user","content":"ローカルLLMの利点を2つ、箇条書きで。"}],
"stream":false,
"options":{"num_ctx":8192,"temperature":0}}
{"message":{"role":"assistant","content":"1. 高いプライバシー保護\n2. 即時性の向上"},
"done":true,"done_reason":"stop","prompt_eval_count":42,"eval_count":19}

keep_alive を指定するとロード保持時間を変えられます("0" で即アンロード、既定は5分)。thinktrue"high" にすると対応モデルで思考出力を分離できる、と公式リファレンスにあります。

OpenAI互換(/v1/…)

公式のOpenAI compatibilityページに列挙されているのは /v1/chat/completions /v1/completions /v1/models /v1/models/{model} /v1/embeddings /v1/responses(非ステートフルのみ、previous_response_id 不可)です。api_key は「必須だが無視される」ので 'ollama' で構いません。

Terminal window
curl -s http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" -d @v1.json
{"id":"chatcmpl-220","object":"chat.completion","model":"qwen2.5:7b",
"system_fingerprint":"fp_ollama",
"choices":[{"index":0,"message":{"role":"assistant","content":"Hello"},"finish_reason":"stop"}],
"usage":{"prompt_tokens":44,"completion_tokens":2,"total_tokens":46}}

/v1/models はローカルの8モデルを owned_by: "library" として返しました。注意点として、OpenAI仕様にはコンテキスト長のパラメータがないため、/v1 経由でコンテキストを変えるにはModelfileで PARAMETER num_ctx を書いた派生モデルを ollama create するか、OLLAMA_CONTEXT_LENGTH を使います。

Anthropic互換(/v1/messages)

同じポートに /v1/messages もあります。公式ページでは「Streaming、System prompts、Vision、Tools、Thinking」に対応し、tool_choice、Prompt caching、Batches、PDFは非対応と明記されています。

{"id":"msg_906c680ecdc295181b7aa081","type":"message","role":"assistant",
"model":"qwen3-coder:30b",
"content":[{"type":"text","text":"OK from local"}],
"stop_reason":"end_turn","usage":{"input_tokens":15,"output_tokens":4}}
ネイティブ /api
互換 /v1
エンドポイント
/api/generate, /api/chat, /api/embed, /api/tags, /api/ps, /api/pull
/v1/chat/completions, /v1/embeddings, /v1/models, /v1/responses, /v1/messages
コンテキスト長
options.num_ctx で毎回指定できる
パラメータなし。Modelfile か OLLAMA_CONTEXT_LENGTH で事前設定
ロード制御
keep_alive で保持時間、"0" で即アンロード
なし(既定の5分か環境変数に従う)
計測情報
eval_count / eval_duration などナノ秒単位で返る
usage の prompt_tokens / completion_tokens のみ
向く用途
Ollama専用のスクリプト、速度計測、ロード管理
既存のOpenAI/Anthropic SDKやツールの差し替え
docs.ollama.com のAPIリファレンスと2026-09-14の実行結果より

モデルの保存先とディスク管理

公式FAQに書かれている既定の保存先です。

macOS ~/.ollama/models
Linux /usr/share/ollama/.ollama/models
Windows C:\Users\%username%\.ollama\models

変更は環境変数 OLLAMA_MODELS です。筆者はWindowsのシステムドライブを圧迫しないよう、~/.ollama 自体をEドライブへのシンボリックリンクにしています(ls -la ~/.ollama/e/ollama_C)。du -sh では94GBでした。

モデルの実体は models/blobs/sha256-... のレイヤーで、同じ重みを共有するタグ同士は重複しません。不要になったタグは ollama rm で消せば、参照されなくなったblobも回収されます。

環境変数:最低限押さえるもの

公式FAQに記載のあるものから、日常運用で触る頻度が高い順に並べます。

OLLAMA_HOST 待ち受けアドレス。既定 127.0.0.1:11434。LAN公開は 0.0.0.0:11434
OLLAMA_MODELS モデル保存先
OLLAMA_CONTEXT_LENGTH 既定コンテキスト長(FAQの記載では 4096)
OLLAMA_KEEP_ALIVE ロード保持時間。既定 5m
OLLAMA_NUM_PARALLEL モデルごとの同時リクエスト数。既定 1
OLLAMA_MAX_LOADED_MODELS 同時ロード数。既定は GPU数×3(CPUのみなら 3)
OLLAMA_FLASH_ATTENTION 1 で有効
OLLAMA_KV_CACHE_TYPE KVキャッシュの量子化。f16 / q8_0 / q4_0
OLLAMA_ORIGINS ブラウザ拡張などのCORS許可オリジン

設定方法はOSごとに違います。Windowsは「設定」で「環境変数」を検索してユーザー変数を追加しOllamaを再起動、Linuxは systemctl edit ollama.service[Service]Environment="OLLAMA_HOST=0.0.0.0" を追加して daemon-reload、macOSは launchctl setenv OLLAMA_HOST "0.0.0.0" のあとアプリを再起動、というのがFAQの手順です。

コンテキスト長は「実値」を見る

FAQの既定値は4096ですが、筆者の環境で num_ctx を指定せずに qwen2.5:7b をロードすると ollama ps のCONTEXT列は32768でした。バージョン差やアプリ側の設定が効いている可能性があるので、既定値を信じず ollama ps で確認するのが確実です。同じモデルで num_ctx を4096から32768に上げるとVRAM使用量は4.7GBから6.6GBに増えました。この差の内訳はVRAM別モデルサイズ早見で式と一緒に説明しています。

FAQには「必要メモリは OLLAMA_NUM_PARALLEL × OLLAMA_CONTEXT_LENGTH に比例して増える」とあるので、並列数を上げるときはコンテキスト長とセットで考えます。

まとめ

  • 導入はOS別に1手順。Windowsは管理者権限不要、Linuxはワンライナーでsystemdサービスまで作られる
  • ollama run で取得と起動が同時に済み、ollama ps でVRAMとコンテキスト長の実値が見える
  • APIはネイティブ /api、OpenAI互換 /v1、Anthropic互換 /v1/messages の3系統が同じ11434番で動く
  • 保存先は OLLAMA_MODELS、LAN公開は OLLAMA_HOST、コンテキストは num_ctxOLLAMA_CONTEXT_LENGTH
  • Git Bashのcurlで日本語を -d に直書きすると化ける。UTF-8ファイルを -d @file で渡す

次は、手元のGPUで何が載るかをVRAM別に整理した記事か、用途からモデルを絞る用途別モデル選びへどうぞ。GUI派はLM StudioとOllamaの比較で違いを確認してから選んでも遅くありません。

この記事の情報・検証メモ
Tags
公開日
情報確認
参考リンク
11件
更新性
長く使える
更新管理

仕様・料金・提供範囲が変わりやすいテーマは、公開日・更新日・情報確認日を分けて管理します。 導入前には必ず記事末尾の一次情報と公式ドキュメントで最新状況を確認してください。

検証メモ
Ollama 0.30.6 (Windows 11, RTX 3090 24GB) curl 実行日 2026-09-14
図解を保存・共有

記事の要点を1枚にまとめました。画像は新しいタブで開いて保存できます。

Ollama導入ガイド:Windows/Mac/Linuxのインストール・API・保存先 Ollamaは「入れて、pullして、11434番を叩く」だけで動く。つまずくのは保存先・コンテキスト長・Windowsの文字コードの3点 導入の要点:Windowsは管理者権限なしでユーザー領域に入る。/DIR で場所指定可。macOSはSonoma以降、LinuxはワンライナーでsystemdサービスまでOK。ollama run <model> で取得と起動が一度に済む。 APIの3系統:/api/generate と /api/chat がネイティブ。/v1/chat/completions はOpenAI互換、api_keyは"ollama"。/v1/messages はAnthropic互換(Claude Code連携に使える)。 運用で効く設定:OLLAMA_MODELS で保存先を変える(実環境は94GB)。コンテキスト長は ollama ps の CONTEXT 列で実値を確認。Git Bashのcurlで日本語を -d 直書きすると化ける。
Ollama導入ガイド:Windows/Mac/Linuxのインストール・API・保存先 記事の要約 2026.09.14 入門・導入ガイド
Primary sources

一次情報・参考リンク

About the author
SHAYOUWORLD

日本の公共データAPIを使うMCPサーバーを作って公開し、ローカルLLMを自分のGPUで測った記録を、一次情報・検証ログ・失敗例とあわせて整理します。