
Ollama 是开源的本地大模型运行平台,把模型下载、配置、运行抽象成极简 CLI,ollama pull llama3.3 + ollama run 即可对话,自动在 localhost:11434 暴露 OpenAI 兼容 API。支持 NVIDIA CUDA、AMD ROCm、Apple Metal 加速,MIT 许可证。模型库覆盖 Llama 3.3、Qwen3、DeepSeek V4、Gemma 3、Mistral 等 200+ 开源模型。2026 Q1 月下载量突破 5200 万,是本地 LLM 开发者的事实标准。
产品概述
Ollama 于 2023 年开源,定位”本地 LLM 的 Docker”——把模型当成镜像来管。底层用 llama.cpp 做推理引擎,上层封装极简 CLI 和 REST API。4-bit 量化下 7B 模型仅占 5GB 显存、70B 模型约 40GB 显存。与 LangChain、LlamaIndex、Open WebUI、Dify 等生态无缝集成,可作为后端为上层应用提供推理能力。社区集成数超 40000+,GitHub Stars 165k+(2026/03)。最新版本 v0.30.8(2026 年 6 月发布),Apple Silicon 上已切换至 MLX 后端。
核心能力
- 模型管理:一行命令拉取/切换/删除 200+ GGUF 模型
- API 服务:localhost:11434/v1 原生 OpenAI 兼容,直接替换 base_url 即可对接现有代码
- 硬件加速:自动检测 GPU/CPU,CUDA/ROCm/Metal 全支持
- 流式输出、结构化输出(JSON/XML/CSV)、多模态视觉理解、向量化、Tool Use、联网搜索
优势亮点
- 一行命令跑模型,是所有本地工具里上手最快的
- OpenAI 兼容 API 标准,LangChain/Cursor/Claude Code 等任意框架通用
- 跨平台 + MIT 开源,商用免费
- 生态最成熟:40000+ 社区集成,下游工具链最完整
- 2026 Q1 月下载 5200 万,社区活跃度第一
短板
- 最佳性能仍需现代硬件(Apple M4 或 RTX 4090 上 7B 模型 45-120 t/s,纯 CPU 仅 5-22 t/s)
- 不支持多模型并发(单用户设计,无 PagedAttention/连续批处理,5-10 并发后延迟陡增,多用户生产场景应改用 vLLM)
- 量化/批处理/底层调优的控制力弱于 llama.cpp
- 小模型能力不及云端 API(复杂推理仍逊 GPT-5.5/Claude Opus)
- 显存不足时会静默 spill 到 CPU 导致极慢,需用
ollama ps排查
适用人群
开发者、需要本地 API 集成场景的团队、AI 编程工具后端、隐私敏感的原型开发、学生/研究人员。
安装与快速开始
Step 1:安装 Ollama
Linux / macOS:
curl -fsSL https://ollama.com/install.sh | sh
macOS(Homebrew):
brew install ollama
Windows:从 ollama.com/download 下载 OllamaSetup.exe 安装(Windows 10/11,需 NVIDIA CUDA 或 AMD ROCm 驱动)。
Step.2:验证安装
ollama --version
Step.3:拉取并运行模型
ollama run llama3.2
首次运行会自动下载模型(Llama 3.2 3B 约 2GB),然后进入
>>>交互式对话。输入/bye退出。
Step 4:掌握常用命令
ollama pull llama3.3 # 下载模型(不运行) ollama list # 查看已下载模型 ollama ps # 查看运行中的模型(含 GPU/CPU 占用) ollama rm llama3.3 # 删除模型 ollama serve # 手动启动 API 服务(默认 localhost:11434)
Step 5:调用 API(任选一种方式)
CURL
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "llama3.2",
"messages": [{"role": "user", "content": "Hello!"}]
}'
Python
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1",
api_key="ollama" # 本地无需真实 key
)
response = client.chat.completions.create(
model="llama3.2",
messages=[{"role": "user", "content": "你好"}]
)
print(response.choices[0].message.content)
硬件配置参考
| 模型规格 | 最低内存 | 推荐配置 | 纯 CPU 速度 |
|---|---|---|---|
| 7B(如 Llama 3.2 3B) | 8GB | 8GB 内存 | 5-22 t/s |
| 13B-14B | 16GB | 16GB 内存 | — |
| 33B | 32GB | 32GB 内存 | — |
| 70B | 64GB 内存 + RTX 4090 | 64GB 内存 + 40GB 显存 | — |
* Apple M4 MacBook 上 7B 模型可达 45-120 t/s。24GB RTX 3090/4090 可解锁 27-32B 档位,本地质量开始接近云端 API。
相关导航


GPT4All

Open WebUI

PocketPal AI
TextGen

MLC LLM

Jan

