
Jan 是一个免费开源的桌面应用,用于在个人电脑上本地运行大模型。基于 llama.cpp 和 MLX 推理引擎,提供 ChatGPT 风格的聊天界面,所有数据——模型、对话、设置——都存储在你拥有的本地文件夹中。
支持从 HuggingFace 下载 GGUF 格式的 Llama、Gemma、Qwen、Mistral、DeepSeek 等开源模型,100% 离线运行,无任何遥测、无数据采集。同时也可接入 OpenAI、Anthropic、Google Gemini、Groq 等云端模型,在同一界面里自由切换。提供 localhost:1337 的 OpenAI 兼容 API 服务,可被 Cursor、Claude Code、Open WebUI 等任意 OpenAI 兼容客户端调用。Apache 2.0 协议,免费商用。
产品概述
Jan 由 Menlo Research(JanHQ)团队开发,使命是”AI 应该开放、私有、人人可用”。2025 年 5 月从原许可证切换到 Apache 2.0,进一步降低商用门槛。技术栈采用 Tauri(Rust + TypeScript),前端 TypeScript 72.4% + Rust 21.1%,二进制体积小、内存占用低。
底层推理引擎为 llama.cpp(CPU/GPU 通用)和 MLX(Apple Silicon 专属加速),在 Apple Silicon Mac 上 Jan-V1-4B 模型 MLX q4 量化可达 90 tokens/s。
截至 2026 年 6 月发布的 0.8.3 版本,新增了消息版本分支、Linux 自定义标题栏、统一的推理/工具调用思维链时间线、交互式 HTML/SVG 产物预览、本地视觉模型视频输入等能力。产品矩阵包括:Jan Desktop(桌面应用)、Jan Web(浏览器版)、Jan Server(本地 OpenAI 兼容 API 服务)、Jan CLI(终端服务)、Jan Platform(企业级 AI 产品基础设施,即将推出)。社区生态活跃,GitHub 40.7k+ Stars。
核心能力
- 本地模型运行:从 HuggingFace 下载 GGUF 模型,100% 离线推理,零遥测
- 聊天界面:线程化对话管理,会话中可切换模型,本地管理聊天历史
- Projects:用共享指令和文件组织对话
- Assistants:创建个性化的 AI 助手
- Agents:自主 AI 智能体,可读取文件、管理日历,通过 WhatsApp/Discord/Slack 执行动作
- MCP 连接器:通过 Model Context Protocol 集成网络搜索(Exa/Serper)、代码执行、数据库、生产力工具(Linear/Todoist)、设计工具(Canva)等
- 云端模型混合:可同时连接 OpenAI/Anthropic/Google/Groq/Mistral 等云端 API,与本地模型在同一界面切换
- 本地 API 服务:localhost:1337 提供 OpenAI 兼容 API
- 内置模型:Jan 团队自研 Jan-V1(4B 推理优化)、Jan-Code-4B(代码生成)、Jan-v2-VL(视觉语言)等
优势亮点
- 100% 离线 + 零遥测:所有数据留在本地,适合法律、医疗、金融等隐私敏感行业
- Apache 2.0 开源:免费商用,可审计、可修改、可自托管的”Right to Repair”理念
- ChatGPT 级用户体验:界面美观、操作简单,非技术用户零门槛上手
- 本地 + 云端混合:同一界面自由切换本地开源模型和云端前沿模型
- MCP 集成:通过 Model Context Protocol 扩展出搜索、代码执行、数据库等智能体能力
- Apple Silicon 极致优化:MLX 后端下 Jan-V1-4B 可达 90 tokens/s
- 跨平台一致体验:macOS/Windows/Linux 原生应用,行为统一
- 产品矩阵完整:Desktop/Web/Server/CLI 覆盖个人到企业全场景
短板
- 底层仍依赖 llama.cpp,推理性能与 Ollama 相当,不及 vLLM 的生产级吞吐
- 不支持多模型并发(单用户设计)
- 云端模型接入需要自备 API Key,且 Jan 本身不提供
- 企业级特性(如 Jan Server 的 OAuth、可观测性)尚在完善中,Jan Platform 未正式发布
- 模型质量天花板受限于开源模型,复杂任务仍不及 Claude Opus / GPT-5.5
- 社区生态规模不及 Ollama(40.7k vs 165k Stars)
适用人群
隐私敏感的个人用户、法律/医疗/金融从业者、非技术用户、需要 ChatGPT 体验但要求数据不出本机的团队、 journalist、研究人员、需要在同一界面混合使用本地和云端模型的用户。
安装与快速开始
Step 1:下载并安装 Jan
访问 下载对应系统的安装包:
- macOS:下载
.dmg安装包,打开后拖入 Applications 文件夹。Apple Silicon Mac 上 Jan 自动使用 Metal 加速 - Windows:下载
.exe安装包,双击运行安装向导。NVIDIA GPU 用户若驱动最新,自动启用 CUDA 加速 - Linux:下载
.AppImage或.deb包。AppImage 需赋予执行权限:
chmod +x jan-*.AppImage ./jan-*.AppImage
Debian/Ubuntu 用
sudo dpkg -i jan-*.deb安装。AMD GPU 用户可启用 Vulkan 支持
系统要求:
- macOS 13.6+ / Windows 10+ / Linux 主流发行版
- 3B 模型需 8GB 内存;7B 模型需 16GB 内存;13B 模型需 32GB 内存
- Apple Silicon(M1/M2/M3)可获得最佳体验
Step 2:首次启动与模型下载
- 启动 Jan,首次打开会自动下载默认基础模型(如 Jan v3,约 2.8GB),无需账号
- 下载完成后即可在底部输入框开始对话
- 如需更多模型,点击左侧 Hub 标签,浏览或搜索模型(如
qwen2.5、llama 3.3) - 每个模型会标注是否适配你的硬件(Recommended/Slow 标签),点击 Download 下载
- Q4_K_M 量化是大多数硬件的质量与速度最佳平衡点;16GB+ 内存可尝试 Q5_K_M 或 Q6_K
- 下载完成后,在任意对话的模型选择器里切换到新下载的模型即可开始聊天
Step 3:启动本地 API 服务
- 进入 Settings → Local API Server
- 选择已下载的模型
- 点击 Start Server
- 服务默认在
http://localhost:1337启动,提供 OpenAI 兼容 API
Step 4:调用 API(任选一种方式)
curl 调用:
curl http://localhost:1337/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "your-model-id",
"messages": [{"role": "user", "content": "Hello!"}]
}'
model 字段填你在 Jan 里选择的模型 ID(如 qwen2.5-7b-instruct)。无需 API Key,任意字符串即可。
Python 调用:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:1337/v1",
api_key="sk-no-auth" # 本地无需真实 key
)
response = client.chat.completions.create(
model="your-model-id", # 替换为你的实际模型 ID
messages=[{"role": "user", "content": "你好"}]
)
print(response.choices[0].message.content)
硬件配置参考
| 模型规格 | 最低内存 | 推荐配置 |
|---|---|---|
| 3B(如 Jan v1-4B) | 8GB | 8GB 内存 |
| 7B(Q4_K_M) | 16GB | 16GB 内存 + Apple Silicon / RTX 3060 |
| 13B | 32GB | 32GB 内存 + RTX 4090 |
| 32B+ | 64GB+ | 64GB 内存 + 多卡 |
*最佳实践:量化优先选 Q4_K_M(质量与速度最佳平衡);Apple Silicon Mac 用户可用 MLX 量化获得更快推理(Jan-V1-4B MLX q4 可达 90 tokens/s);首次启动 Jan 会自动下载默认模型,无需手动配置;启用 MCP 服务器(如 Exa 搜索)需在 Settings → MCP Servers 里配置 API Key。
相关导航


MLC LLM
TextGen

GPT4All

Open WebUI

llama.cpp

vLLM

