LM Studio翻译站点

3天前更新 8 0 0

桌面GUI本地模型客户端,个人与工作免费,全平台。

语言:
英文
收录时间:
2026-07-27
LM StudioLM Studio
核心定位:桌面GUI本地模型客户端
开源协议:专有(个人与工作免费)
核心能力:HuggingFace浏览器,GGUF/MLX,OpenAI兼容API
特色功能:多模型加载,GPU加速,聊天模板
GPU 必需:可选(CPU/GPU皆可)

LM Studio 是开箱即用的桌面本地大模型运行工具,基于 llama.cpp 构建,提供图形化界面搜索 HuggingFace 上的 GGUF/MLX 模型、一键下载并运行。内置聊天界面和本地服务器(localhost:1234,OpenAI 兼容 API)。支持 Apple MLX(Apple Silicon 自动加速)、NVIDIA CUDA、AMD ROCm、Vulkan。2025 年 7 月起,LM Studio 条款不再要求单独的商业许可——个人在家和公司/组织内使用均免费;企业如需集中管控模型、MCP 服务器和插件,可选用 LM Studio Enterprise & Teams 方案。

 

产品概述

LM Studio 于 2024 年初推出,由 Element Labs 开发,定位”零命令行、纯 GUI 的本地模型运行器”。核心创新是将 HuggingFace 模型浏览器嵌入桌面应用,用户无需记住模型名、无需写命令,在图形界面里搜索、筛选、下载、运行一气呵成。底层基于 llama.cpp,在 Apple Silicon Mac 上还支持 Apple MLX 推理,4-bit 量化下 7B 模型仅占 5GB 显存。内置的本地服务器兼容 OpenAI API,可被 Cursor、Claude Code、Open WebUI、Continue.dev、AnythingLLM 等工具直接调用。此外,LM Studio 还提供 lms 命令行工具和 llmster 无 GUI 守护进程,支持服务器/CI 环境部署。

 

核心能力

  • 模型浏览:内置 HuggingFace 浏览器,按大小/架构/热度筛选 GGUF/MLX 模型
  • 一键运行:选中模型点击下载,下载完成后自动加载并进入聊天界面
  • 本地服务器:localhost:1234/v1 OpenAI 兼容 API,支持流式输出、Tool Calling、Structured Output
  • 多模型管理:同时下载多个模型,运行时切换模型无需重启
  • RAG 文档对话:可附加文档到聊天消息,完全离线进行文档交互
  • 硬件加速:自动检测 GPU,支持 MLX/CUDA/ROCm/Vulkan

 

优势亮点

  • 纯 GUI 操作,零命令行,最适合非技术用户
  • 内置 HuggingFace 浏览器,模型发现和下载一站式
  • 2025 年 7 月起个人与工作用途免费,企业可零成本起步
  • OpenAI 兼容 API,可被 Cursor/Claude Code/Open WebUI 等任意工具调用
  • 跨平台 + 多加速后端,Apple Silicon 上 MLX 推理速度显著提升
  • 支持完全离线运行,数据不出本机

 

短板

  • 不支持多模型并发(单模型独占资源)
  • 底层控制力弱于 llama.cpp(无法精细调整量化/批处理参数)
  • 专有软件,不开源(但商用免费)
  • Intel Mac 不支持,Apple Silicon Mac 需 macOS 13.4+
  • 模型依赖 HuggingFace,国内访问 HuggingFace 可能受限
  • 本地模型质量仍不及云端前沿模型(GPT-5/Claude Opus)在复杂任务上的表现

 

适用人群

初学者、模型评估者、Mac 用户、非技术用户、需要快速试玩开源模型的人员、企业本地部署(商用免费)。

 

 


安装与快速开始

 

Step 1:下载并安装 LM Studio

访问 lmstudio.ai 下载对应系统的安装包:

  • macOS:下载 .dmg 安装包(Apple Silicon 版本),拖入 Applications 文件夹
  • Windows:下载 .exe 安装包(x64 或 ARM64/Snapdragon X Elite),双击安装
  • Linux:下载 .AppImage.deb 包,赋予执行权限后运行

首次启动 LM Studio GUI 会初始化本地配置,之后才能使用 lms 命令行工具。

 

Step 2:下载模型

打开 LM Studio,按 ⌘ + Shift + M(Mac)或 Ctrl + Shift + M(Windows/Linux)打开模型搜索。

搜索模型名(如 qwen3llama 3.2),LM Studio 会从 HuggingFace 拉取结果,并为你推荐最适合硬件的量化版本(通常标为 Q4_K_M)。点击 Download 等待下载完成。

硬件与模型选择参考:

显存/内存 推荐模型
8GB Llama 3.2 3B Q8 或 Qwen3 8B Q4
16GB Gemma 4 12B Q8 或 Qwen2.5-Coder 14B Q4
24GB Mistral Nemo 12B Q8 或 DeepSeek R1 32B Q4
48GB+ Llama 3.3 70B Q4 或 DeepSeek R1 70B Q4

 

Step 3:加载并聊天

下载完成后,点击顶部模型选择器切换到刚下载的模型,点击 Load Model(10-30 秒加载完成)。在底部输入框开始对话。

 

Step 4:启动本地服务器

点击左侧 Local Server(开发者/</> 图标)标签,选择已加载的模型,点击 Start Server。服务器在 http://localhost:1234 启动。

 

Step 5:调用 API(任选一种方式)

curl 调用:

curl http://localhost:1234/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-8b",
    "messages": [{"role": "user", "content": "Hello!"}]
  }'

model 字段填 LM Studio 对已加载模型显示的标识符(如 qwen3-8b 或 llama-3.3-70b-instruct),可在 Local Server 页面的模型下拉框中查看。

Python 调用:

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:1234/v1",
    api_key="lm-studio"  # 本地无需真实 key
)

response = client.chat.completions.create(
    model="qwen3-8b",  # 替换为你的实际模型标识符
    messages=[{"role": "user", "content": "你好"}]
)
print(response.choices[0].message.content)

 

硬件配置参考

  • 7B Q4 模型:8GB 内存即可运行,纯 CPU 推理约 5-22 t/s
  • 16GB 内存推荐,可流畅运行 14B Q4
  • 24GB RTX 4090:可运行 32B Q4,速度接近云端体验
  • Apple Silicon Mac:使用 MLX 模型推理速度显著提升
  • Intel Mac 不支持;macOS 需 13.4+

最佳实践:量化优先选 Q4_K_M(质量与速度最佳平衡);Apple Silicon 上选 MLX 模型获得更快推理;启动时预加载常用模型避免等待;监控显存占用,红色表示需换更小或更高量化的模型。

相关导航