本地部署 Local Deployment 指将 AI 模型下载并运行在用户自己的硬件设备上(个人电脑、私有服务器、边缘设备),而非通过云端 API 调用。涉及的技术栈包括模型量化(GGUF、GPTQ)、推理框架(llama.cpp、Ollama、vLLM)、硬件加速(CUDA、ROCm、Metal)等。
你可以把它理解为把 AI 模型“搬回家”——不用联网、不用付费、数据不出门,但需要自己承担硬件成本和运维工作。
Local Deployment 的核心组件:
- 模型文件:量化后的权重文件(如 Q4_K_M.gguf)
- 推理引擎:负责加载和运行模型的软件(如 Ollama、llama.cpp)
- 硬件资源:CPU、GPU(显存)、RAM、存储
- 前端界面:交互界面(如 Open WebUI、ChatGPT-Next-Web)
大白话理解:
没有本地部署的时候:
- 你用 ChatGPT → 每次都要联网,数据传到 OpenAI 服务器
- 你每个月付 $20 → 用多少都有限制
- 你想在公司内部用 AI 处理机密数据 → 不敢上传到云端
有了本地部署之后:
- 你下载 Llama 3 到自己的电脑 → 断网也能用
- 你一次性买了显卡 → 之后无限次使用,没有月费
- 你把公司数据喂给本地模型 → 数据不出门,安全合规
打个比方:
|
云端 API |
本地部署 |
|---|---|
|
像租车,按里程付费,随时可用 |
像买车,一次性投入,之后随便开 |
|
车况由租车公司维护 |
自己要保养、加油、修车 |
|
不能改装车辆 |
可以随意定制模型参数和行为 |
一句话总结:
本地部署是把 AI 模型下载到自己的设备上运行,数据不外传、不限次数,但需要自己准备硬件和维护。