
LM Studio 是开箱即用的桌面本地大模型运行工具,基于 llama.cpp 构建,提供图形化界面搜索 HuggingFace 上的 GGUF/MLX 模型、一键下载并运行。内置聊天界面和本地服务器(localhost:1234,OpenAI 兼容 API)。支持 Apple MLX(Apple Silicon 自动加速)、NVIDIA CUDA、AMD ROCm、Vulkan。2025 年 7 月起,LM Studio 条款不再要求单独的商业许可——个人在家和公司/组织内使用均免费;企业如需集中管控模型、MCP 服务器和插件,可选用 LM Studio Enterprise & Teams 方案。
产品概述
LM Studio 于 2024 年初推出,由 Element Labs 开发,定位”零命令行、纯 GUI 的本地模型运行器”。核心创新是将 HuggingFace 模型浏览器嵌入桌面应用,用户无需记住模型名、无需写命令,在图形界面里搜索、筛选、下载、运行一气呵成。底层基于 llama.cpp,在 Apple Silicon Mac 上还支持 Apple MLX 推理,4-bit 量化下 7B 模型仅占 5GB 显存。内置的本地服务器兼容 OpenAI API,可被 Cursor、Claude Code、Open WebUI、Continue.dev、AnythingLLM 等工具直接调用。此外,LM Studio 还提供 lms 命令行工具和 llmster 无 GUI 守护进程,支持服务器/CI 环境部署。
核心能力
- 模型浏览:内置 HuggingFace 浏览器,按大小/架构/热度筛选 GGUF/MLX 模型
- 一键运行:选中模型点击下载,下载完成后自动加载并进入聊天界面
- 本地服务器:localhost:1234/v1 OpenAI 兼容 API,支持流式输出、Tool Calling、Structured Output
- 多模型管理:同时下载多个模型,运行时切换模型无需重启
- RAG 文档对话:可附加文档到聊天消息,完全离线进行文档交互
- 硬件加速:自动检测 GPU,支持 MLX/CUDA/ROCm/Vulkan
优势亮点
- 纯 GUI 操作,零命令行,最适合非技术用户
- 内置 HuggingFace 浏览器,模型发现和下载一站式
- 2025 年 7 月起个人与工作用途免费,企业可零成本起步
- OpenAI 兼容 API,可被 Cursor/Claude Code/Open WebUI 等任意工具调用
- 跨平台 + 多加速后端,Apple Silicon 上 MLX 推理速度显著提升
- 支持完全离线运行,数据不出本机
短板
- 不支持多模型并发(单模型独占资源)
- 底层控制力弱于 llama.cpp(无法精细调整量化/批处理参数)
- 专有软件,不开源(但商用免费)
- Intel Mac 不支持,Apple Silicon Mac 需 macOS 13.4+
- 模型依赖 HuggingFace,国内访问 HuggingFace 可能受限
- 本地模型质量仍不及云端前沿模型(GPT-5/Claude Opus)在复杂任务上的表现
适用人群
初学者、模型评估者、Mac 用户、非技术用户、需要快速试玩开源模型的人员、企业本地部署(商用免费)。
安装与快速开始
Step 1:下载并安装 LM Studio
访问 下载对应系统的安装包:
- macOS:下载
.dmg安装包(Apple Silicon 版本),拖入 Applications 文件夹 - Windows:下载
.exe安装包(x64 或 ARM64/Snapdragon X Elite),双击安装 - Linux:下载
.AppImage或.deb包,赋予执行权限后运行
首次启动 LM Studio GUI 会初始化本地配置,之后才能使用
lms命令行工具。
Step 2:下载模型
打开 LM Studio,按 ⌘ + Shift + M(Mac)或 Ctrl + Shift + M(Windows/Linux)打开模型搜索。
搜索模型名(如 qwen3、llama 3.2),LM Studio 会从 HuggingFace 拉取结果,并为你推荐最适合硬件的量化版本(通常标为 Q4_K_M)。点击 Download 等待下载完成。
硬件与模型选择参考:
| 显存/内存 | 推荐模型 |
|---|---|
| 8GB | Llama 3.2 3B Q8 或 Qwen3 8B Q4 |
| 16GB | Gemma 4 12B Q8 或 Qwen2.5-Coder 14B Q4 |
| 24GB | Mistral Nemo 12B Q8 或 DeepSeek R1 32B Q4 |
| 48GB+ | Llama 3.3 70B Q4 或 DeepSeek R1 70B Q4 |
Step 3:加载并聊天
下载完成后,点击顶部模型选择器切换到刚下载的模型,点击 Load Model(10-30 秒加载完成)。在底部输入框开始对话。
Step 4:启动本地服务器
点击左侧 Local Server(开发者/</> 图标)标签,选择已加载的模型,点击 Start Server。服务器在 http://localhost:1234 启动。
Step 5:调用 API(任选一种方式)
curl 调用:
curl http://localhost:1234/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3-8b",
"messages": [{"role": "user", "content": "Hello!"}]
}'
model 字段填 LM Studio 对已加载模型显示的标识符(如 qwen3-8b 或 llama-3.3-70b-instruct),可在 Local Server 页面的模型下拉框中查看。
Python 调用:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:1234/v1",
api_key="lm-studio" # 本地无需真实 key
)
response = client.chat.completions.create(
model="qwen3-8b", # 替换为你的实际模型标识符
messages=[{"role": "user", "content": "你好"}]
)
print(response.choices[0].message.content)
硬件配置参考
- 7B Q4 模型:8GB 内存即可运行,纯 CPU 推理约 5-22 t/s
- 16GB 内存推荐,可流畅运行 14B Q4
- 24GB RTX 4090:可运行 32B Q4,速度接近云端体验
- Apple Silicon Mac:使用 MLX 模型推理速度显著提升
- Intel Mac 不支持;macOS 需 13.4+
最佳实践:量化优先选 Q4_K_M(质量与速度最佳平衡);Apple Silicon 上选 MLX 模型获得更快推理;启动时预加载常用模型避免等待;监控显存占用,红色表示需换更小或更高量化的模型。
相关导航


GPT4All
TextGen

Jan

vLLM

MLC LLM

Open WebUI

