Ollama導入ガイド:Windows/Mac/Linuxのインストール・API・保存先
Ollamaの導入からollama pull/run、REST API(/api/generate・/api/chat)とOpenAI互換/v1、モデル保存先と環境変数までを整理。RTX 3090環境で2026年9月14日に実行した出力を根拠に書いています。
Ollamaの導入で必要なのは、インストーラを入れて ollama run <モデル名> を打つことだけです。モデルの取得・ロード・チャットが一度に始まり、同時にポート11434でREST APIも立ち上がります。つまずくとすれば、モデル保存先のディスク容量、コンテキスト長の既定値、そしてWindowsのターミナルの文字コードの3点でした。
この記事では、2026年9月14日にWindows 11 + RTX 3090の環境でOllama 0.30.6を実際に叩いた出力を根拠に、OS別の導入、CLI、3系統のAPI、保存先と環境変数を順に整理します。ローカルLLMそのものの選び方はVRAM別のモデルサイズ早見、GUIで始めたい場合はLM Studioの使い方に分けています。
- 導入はOS別に1手順。 Windowsは
OllamaSetup.exe(管理者権限不要)、macOSは dmg、Linuxはcurl -fsSL https://ollama.com/install.sh | sh。 - CLIは
runpulllspsstoprmの6つで日常が回る。ollama launchでClaude CodeやCodexとの連携メニューも開ける。 - APIは3系統。 ネイティブ
/api/generate/api/chat、OpenAI互換/v1/chat/completions、Anthropic互換/v1/messages。すべて同じ11434番。 - 保存先とコンテキスト長は先に決める。
OLLAMA_MODELSで置き場所、ollama psのCONTEXT列で実際のコンテキスト長を確認する。
OS別インストール
公式ドキュメント(docs.ollama.com)の各OSページで確認した要件と手順です。
Windows
- 要件は「Windows 10 22H2 以降、Home または Pro」。GPUを使う場合は「NVIDIA 551.61 以降」、AMDは「ROCm v7 / HIP7 対応ドライバ」。
OllamaSetup.exeは管理者権限なしでユーザーアカウント配下にインストールされます。場所を変えたい場合はOllamaSetup.exe /DIR="d:\some\location"。- 置き場所は、バイナリが
%LOCALAPPDATA%\Programs\Ollama(ユーザーPATHに追加される)、ログが%LOCALAPPDATA%\Ollama(app.logserver.log)、モデルと設定が%HOMEPATH%\.ollama。 - サービス組み込み向けにGUIなしの
ollama-windows-amd64.zipも配布されています。
macOS
- 要件は「macOS Sonoma (v14) 以降」、Apple Mシリーズ(CPU/GPU対応)またはx86(CPUのみ)。
ollama.dmgをマウントしてApplicationsへドラッグ。CLIをPATHに追加するか初回起動時に聞かれます。- モデルと設定は
~/.ollama配下。
Linux
curl -fsSL https://ollama.com/install.sh | shインストーラがsystemdのサービス(/etc/systemd/system/ollama.service)まで作ります。手動で入れる場合は ollama serve で起動。NVIDIAはCUDAを入れて nvidia-smi で確認、AMDはROCm v7が必要です。環境変数は sudo systemctl edit ollama で [Service] に Environment=... 行を足します。
対応GPU
公式のHardware supportページでは、NVIDIAは「compute capability 5.0以上、ドライバ550以降」。RTX 30xxは8.6、40xxは8.9、50xxは12.0として列挙されています。複数GPUのうち一部だけ使う場合は CUDA_VISIBLE_DEVICES(AMDは ROCR_VISIBLE_DEVICES)で絞ります。Apple MetalとVulkan(Intel/AMD向け、WindowsとLinux)にも対応と記載されています。
CLI:最初の10分
ollama run gemma4 # 未取得なら pull してからチャット開始。/bye で終了ollama pull qwen3.6:27b # 取得だけollama ls # 取得済み一覧ollama ps # ロード中のモデルとVRAM使用量ollama stop gemma4 # 即時アンロードollama rm gemma4 # 削除ollama show qwen2.5:7b # アーキテクチャ・コンテキスト長・量子化筆者の環境で ollama ls を実行した結果です(2026-09-14)。
NAME ID SIZE MODIFIEDqwen2.5:3b 357c53fb659c 1.9 GB 3 months agogemma4:31b 6316f0629137 19 GB 3 months agoqwen3.6:35b-a3b 07d35212591f 23 GB 3 months agoqwen3-coder:30b 06c1097efce0 18 GB 3 months agogpt-oss:20b 17052f91a42e 13 GB 3 months agoqwen2.5-coder:14b 9ec8897f747e 9.0 GB 3 months agoqwen2.5:14b 7cdf5a0187d5 9.0 GB 3 months agoqwen2.5:7b 845dbda0ea48 4.7 GB 3 months agoHugging Face上のGGUFは、ライブラリ未登録でも ollama run hf.co/<user>/<repo>:<量子化> の形式で直接実行できます(Hugging Face公式ドキュメントに記載。既定はリポジトリ内に Q4_K_M があればそれが選ばれる)。
ollama run hf.co/llm-jp/llm-jp-4-8b-thinking-gguf:Q4_K_Mollama launch で外部ツールに接続する
0.30系には ollama launch があり、ollama launch --help にはClaude Code、Codex、OpenCode、Cline、VS Codeなど16の連携先が列挙されていました。ollama launch claude --model <model> のように呼ぶと、対象ツールの設定を自動で書いて起動します。Claude Code / Codexとの実際のやり取りはローカルLLMをClaude Code / Codexから使うで扱います。
REST API:3系統を同じポートで
ネイティブAPI(/api/generate と /api/chat)
/api/generate は単発のプロンプト、/api/chat は messages 配列を受け取る会話向けです。どちらも stream の既定値はtrue(部分応答を逐次返す)なので、curlで確認するときは false にします。
# gen.json(UTF-8で保存)# {"model":"qwen2.5:7b","prompt":"Ollamaとは何ですか。日本語で一文で答えてください。","stream":false}curl -s http://localhost:11434/api/generate -d @gen.json実際の応答(context 配列は省略)です。
{ "model": "qwen2.5:7b", "created_at": "2026-09-14T04:29:26.1790325Z", "response": "Ollamaはアリババクラウドによって作成された大規模な言語モデルです。", "done": true, "done_reason": "stop", "total_duration": 724213200, "load_duration": 221589300, "prompt_eval_count": 46, "prompt_eval_duration": 280750000, "eval_count": 24, "eval_duration": 217519000}内容はモデルの勘違い(OllamaをQwen自身の作者と混同している)ですが、フィールドの意味を見るには十分です。公式リファレンスによれば total_duration などはナノ秒、prompt_eval_count が入力トークン数、eval_count が出力トークン数です。eval_count / eval_duration から生成速度が出せます(この例は24トークン / 0.218秒 ≒ 110 tok/s)。
/api/chat では options にサンプリングやコンテキスト長を渡せます。
{"model":"qwen2.5:7b", "messages":[{"role":"system","content":"日本語で簡潔に答えてください。"}, {"role":"user","content":"ローカルLLMの利点を2つ、箇条書きで。"}], "stream":false, "options":{"num_ctx":8192,"temperature":0}}{"message":{"role":"assistant","content":"1. 高いプライバシー保護\n2. 即時性の向上"}, "done":true,"done_reason":"stop","prompt_eval_count":42,"eval_count":19}keep_alive を指定するとロード保持時間を変えられます("0" で即アンロード、既定は5分)。think を true や "high" にすると対応モデルで思考出力を分離できる、と公式リファレンスにあります。
OpenAI互換(/v1/…)
公式のOpenAI compatibilityページに列挙されているのは /v1/chat/completions /v1/completions /v1/models /v1/models/{model} /v1/embeddings /v1/responses(非ステートフルのみ、previous_response_id 不可)です。api_key は「必須だが無視される」ので 'ollama' で構いません。
curl -s http://localhost:11434/v1/chat/completions \ -H "Content-Type: application/json" -d @v1.json{"id":"chatcmpl-220","object":"chat.completion","model":"qwen2.5:7b", "system_fingerprint":"fp_ollama", "choices":[{"index":0,"message":{"role":"assistant","content":"Hello"},"finish_reason":"stop"}], "usage":{"prompt_tokens":44,"completion_tokens":2,"total_tokens":46}}/v1/models はローカルの8モデルを owned_by: "library" として返しました。注意点として、OpenAI仕様にはコンテキスト長のパラメータがないため、/v1 経由でコンテキストを変えるにはModelfileで PARAMETER num_ctx を書いた派生モデルを ollama create するか、OLLAMA_CONTEXT_LENGTH を使います。
Anthropic互換(/v1/messages)
同じポートに /v1/messages もあります。公式ページでは「Streaming、System prompts、Vision、Tools、Thinking」に対応し、tool_choice、Prompt caching、Batches、PDFは非対応と明記されています。
{"id":"msg_906c680ecdc295181b7aa081","type":"message","role":"assistant", "model":"qwen3-coder:30b", "content":[{"type":"text","text":"OK from local"}], "stop_reason":"end_turn","usage":{"input_tokens":15,"output_tokens":4}}モデルの保存先とディスク管理
公式FAQに書かれている既定の保存先です。
macOS ~/.ollama/modelsLinux /usr/share/ollama/.ollama/modelsWindows C:\Users\%username%\.ollama\models変更は環境変数 OLLAMA_MODELS です。筆者はWindowsのシステムドライブを圧迫しないよう、~/.ollama 自体をEドライブへのシンボリックリンクにしています(ls -la ~/.ollama → /e/ollama_C)。du -sh では94GBでした。
モデルの実体は models/blobs/sha256-... のレイヤーで、同じ重みを共有するタグ同士は重複しません。不要になったタグは ollama rm で消せば、参照されなくなったblobも回収されます。
環境変数:最低限押さえるもの
公式FAQに記載のあるものから、日常運用で触る頻度が高い順に並べます。
OLLAMA_HOST 待ち受けアドレス。既定 127.0.0.1:11434。LAN公開は 0.0.0.0:11434OLLAMA_MODELS モデル保存先OLLAMA_CONTEXT_LENGTH 既定コンテキスト長(FAQの記載では 4096)OLLAMA_KEEP_ALIVE ロード保持時間。既定 5mOLLAMA_NUM_PARALLEL モデルごとの同時リクエスト数。既定 1OLLAMA_MAX_LOADED_MODELS 同時ロード数。既定は GPU数×3(CPUのみなら 3)OLLAMA_FLASH_ATTENTION 1 で有効OLLAMA_KV_CACHE_TYPE KVキャッシュの量子化。f16 / q8_0 / q4_0OLLAMA_ORIGINS ブラウザ拡張などのCORS許可オリジン設定方法はOSごとに違います。Windowsは「設定」で「環境変数」を検索してユーザー変数を追加しOllamaを再起動、Linuxは systemctl edit ollama.service で [Service] に Environment="OLLAMA_HOST=0.0.0.0" を追加して daemon-reload、macOSは launchctl setenv OLLAMA_HOST "0.0.0.0" のあとアプリを再起動、というのがFAQの手順です。
コンテキスト長は「実値」を見る
FAQの既定値は4096ですが、筆者の環境で num_ctx を指定せずに qwen2.5:7b をロードすると ollama ps のCONTEXT列は32768でした。バージョン差やアプリ側の設定が効いている可能性があるので、既定値を信じず ollama ps で確認するのが確実です。同じモデルで num_ctx を4096から32768に上げるとVRAM使用量は4.7GBから6.6GBに増えました。この差の内訳はVRAM別モデルサイズ早見で式と一緒に説明しています。
FAQには「必要メモリは OLLAMA_NUM_PARALLEL × OLLAMA_CONTEXT_LENGTH に比例して増える」とあるので、並列数を上げるときはコンテキスト長とセットで考えます。
まとめ
- 導入はOS別に1手順。Windowsは管理者権限不要、Linuxはワンライナーでsystemdサービスまで作られる
ollama runで取得と起動が同時に済み、ollama psでVRAMとコンテキスト長の実値が見える- APIはネイティブ
/api、OpenAI互換/v1、Anthropic互換/v1/messagesの3系統が同じ11434番で動く - 保存先は
OLLAMA_MODELS、LAN公開はOLLAMA_HOST、コンテキストはnum_ctxかOLLAMA_CONTEXT_LENGTH - Git Bashのcurlで日本語を
-dに直書きすると化ける。UTF-8ファイルを-d @fileで渡す
次は、手元のGPUで何が載るかをVRAM別に整理した記事か、用途からモデルを絞る用途別モデル選びへどうぞ。GUI派はLM StudioとOllamaの比較で違いを確認してから選んでも遅くありません。
この記事の情報・検証メモ
- 公開日
- 情報確認
- 参考リンク
- 11件
- 更新性
- 長く使える
仕様・料金・提供範囲が変わりやすいテーマは、公開日・更新日・情報確認日を分けて管理します。 導入前には必ず記事末尾の一次情報と公式ドキュメントで最新状況を確認してください。
一次情報・参考リンク
- Ollama Docs: Quickstart https://docs.ollama.com/quickstart
- Ollama Docs: Windows https://docs.ollama.com/windows
- Ollama Docs: macOS https://docs.ollama.com/macos
- Ollama Docs: Linux https://docs.ollama.com/linux
- Ollama Docs: FAQ(環境変数・保存先) https://docs.ollama.com/faq
- Ollama API: Generate a response https://docs.ollama.com/api/generate
- Ollama API: Generate a chat message https://docs.ollama.com/api/chat
- Ollama Docs: OpenAI compatibility https://docs.ollama.com/api/openai-compatibility
- Ollama Docs: Anthropic compatibility https://docs.ollama.com/api/anthropic-compatibility
- Ollama Docs: Hardware support https://docs.ollama.com/gpu
- Hugging Face Hub: Use Ollama with any GGUF Model https://huggingface.co/docs/hub/ollama