Ollama翻译站点

3天前更新 26 0 0

本地LLM推理服务框架,一键拉取模型,MIT许可,全平台。

语言:
英文
收录时间:
2026-07-27
核心定位:本地LLM模型运行框架
开源协议:MIT
核心能力:一键拉取,OpenAI兼容API,跨平台
特色功能:模型库,Modelfile,并发,GPU加速
GPU 必需:可选(CPU/GPU皆可)

Ollama 是开源的本地大模型运行平台,把模型下载、配置、运行抽象成极简 CLI,ollama pull llama3.3 + ollama run 即可对话,自动在 localhost:11434 暴露 OpenAI 兼容 API。支持 NVIDIA CUDA、AMD ROCm、Apple Metal 加速,MIT 许可证。模型库覆盖 Llama 3.3、Qwen3、DeepSeek V4、Gemma 3、Mistral 等 200+ 开源模型。2026 Q1 月下载量突破 5200 万,是本地 LLM 开发者的事实标准。

 

产品概述

Ollama 于 2023 年开源,定位”本地 LLM 的 Docker”——把模型当成镜像来管。底层用 llama.cpp 做推理引擎,上层封装极简 CLI 和 REST API。4-bit 量化下 7B 模型仅占 5GB 显存、70B 模型约 40GB 显存。与 LangChain、LlamaIndex、Open WebUI、Dify 等生态无缝集成,可作为后端为上层应用提供推理能力。社区集成数超 40000+,GitHub Stars 165k+(2026/03)。最新版本 v0.30.8(2026 年 6 月发布),Apple Silicon 上已切换至 MLX 后端。

 

核心能力

  • 模型管理:一行命令拉取/切换/删除 200+ GGUF 模型
  • API 服务:localhost:11434/v1 原生 OpenAI 兼容,直接替换 base_url 即可对接现有代码
  • 硬件加速:自动检测 GPU/CPU,CUDA/ROCm/Metal 全支持
  • 流式输出、结构化输出(JSON/XML/CSV)、多模态视觉理解、向量化、Tool Use、联网搜索

 

优势亮点

  • 一行命令跑模型,是所有本地工具里上手最快的
  • OpenAI 兼容 API 标准,LangChain/Cursor/Claude Code 等任意框架通用
  • 跨平台 + MIT 开源,商用免费
  • 生态最成熟:40000+ 社区集成,下游工具链最完整
  • 2026 Q1 月下载 5200 万,社区活跃度第一

 

短板

  • 最佳性能仍需现代硬件(Apple M4 或 RTX 4090 上 7B 模型 45-120 t/s,纯 CPU 仅 5-22 t/s)
  • 不支持多模型并发(单用户设计,无 PagedAttention/连续批处理,5-10 并发后延迟陡增,多用户生产场景应改用 vLLM
  • 量化/批处理/底层调优的控制力弱于 llama.cpp
  • 小模型能力不及云端 API(复杂推理仍逊 GPT-5.5/Claude Opus)
  • 显存不足时会静默 spill 到 CPU 导致极慢,需用 ollama ps 排查

 

适用人群

开发者、需要本地 API 集成场景的团队、AI 编程工具后端、隐私敏感的原型开发、学生/研究人员。

 


安装与快速开始

 

Step 1:安装 Ollama

Linux / macOS:

curl -fsSL https://ollama.com/install.sh | sh

macOS(Homebrew)

brew install ollama

Windows:从 ollama.com/download 下载 OllamaSetup.exe 安装(Windows 10/11,需 NVIDIA CUDA 或 AMD ROCm 驱动)。

 

Step.2:验证安装

ollama --version

 

Step.3:拉取并运行模型

ollama run llama3.2

首次运行会自动下载模型(Llama 3.2 3B 约 2GB),然后进入 >>> 交互式对话。输入 /bye 退出。

 

Step 4:掌握常用命令

ollama pull llama3.3        # 下载模型(不运行)
ollama list                 # 查看已下载模型
ollama ps                   # 查看运行中的模型(含 GPU/CPU 占用)
ollama rm llama3.3          # 删除模型
ollama serve                # 手动启动 API 服务(默认 localhost:11434)

 

Step 5:调用 API(任选一种方式)

CURL

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "llama3.2",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

Python

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama"  # 本地无需真实 key
)

response = client.chat.completions.create(
    model="llama3.2",
    messages=[{"role": "user", "content": "你好"}]
)
print(response.choices[0].message.content)

 

硬件配置参考

模型规格 最低内存 推荐配置 纯 CPU 速度
7B(如 Llama 3.2 3B) 8GB 8GB 内存 5-22 t/s
13B-14B 16GB 16GB 内存
33B 32GB 32GB 内存
70B 64GB 内存 + RTX 4090 64GB 内存 + 40GB 显存

* Apple M4 MacBook 上 7B 模型可达 45-120 t/s。24GB RTX 3090/4090 可解锁 27-32B 档位,本地质量开始接近云端 API。

 

相关导航