
TextGen(原Text Generation WebUI)是由 oobabooga 开发的基于 Gradio 的本地大模型 Web 界面,定位”本地 LLM 的瑞士军刀”——把业界最广泛的后端(llama.cpp、Transformers、ExLlamaV2/V3、GPTQ、AWQ、TensorRT-LLM 等)集成到一个统一界面里。提供 Windows/Linux/macOS 便携包(下载解压即运行),以及一键安装器(支持扩展和更多后端)。100% 离线运行,零遥测、零外部请求。API 模式下提供 OpenAI 格式的 Completions 端点,支持工具调用。AGPL-3.0 协议。
产品概述
Text Generation WebUI(社区常称 oobabooga)诞生于 2023 年,是本地 LLM 界最早一批 Web UI 之一,2024 年进入 v4.x 时代(亦称 TextGen)。它的核心竞争力是”后端灵活性”——同期竞品中支持加载器最多的:Transformers(全精度或 8-bit)、llama.cpp(GGUF)、ExLlamaV2(EXL2)、HQQ、AQLM、AutoAWQ、GPTQ、TensorRT-LLM。这种”全后端”策略让它成为研究者、模型格式尝鲜者、LoRA 训练者的首选。
2025 年起项目新增图像生成能力(Z-Image-Turbo、4bit/8bit 量化)。采样参数暴露到极致——temperature、top_p、top_k、min_p、repetition_penalty、mirostat、dynamic temperature 等全部可调,Creative writing 和 research 场景尤为受用。Notebook 模式允许自由形式文本生成,不受聊天回合限制。扩展生态包括 SD 集成、TTS、长程记忆、多模态视觉、网络搜索等数十种内置和用户贡献扩展。AGPL-3.0 协议意味着个人使用免费,但若将其作为网络服务分发修改后的版本,需同样以 AGPL 开源。
核心能力
- 多推理后端:Transformers / llama.cpp (GGUF) / ExLlamaV2 (EXL2) / HQQ / AQLM / AutoAWQ / GPTQ / TensorRT-LLM
- 模型格式全覆盖:GGUF、EXL2、GPTQ、AWQ、SafeTensors、PyTorch 全格式
- 采样参数全暴露:temperature、top_p、top_k、min_p、repetition_penalty、mirostat、dynamic temperature、XTC 等
- Chat / Instruct / Notebook 三种模式:聊天、指令跟随、自由文本生成随时切换
- LoRA / QLoRA 训练:内置 Training 标签页,最易上手的 LoRA 训练 UI
- 角色卡(Character Cards):Tavern 风格角色卡、人格管理、角色扮演模板
- 扩展生态:SD 集成、TTS(Silero/Coqui)、Whisper STT、多模态视觉、网络搜索、RAG(superboogav2)等
- OpenAI 兼容 API:API 模式下提供 OpenAI 格式 Completions 端点,支持工具调用
- 文件附件:上传文本、PDF、DOCX 文档进行对话
- 图像生成:专用标签页运行 Z-Image-Turbo 等 diffusers 模型
优势亮点
- 后端灵活性业界第一:同期竞品中支持加载器最多,几乎覆盖所有本地 LLM 格式
- 采样参数完全可控:每一个生成参数都可调,Creative writing 和研究场景无可替代
- LoRA 训练零门槛:UI 内直接训练 LoRA/QLoRA,是 Accessibility 最高的训练入口
- 100% 离线零遥测:无外部请求、无远程更新、无数据统计
- 便携包零配置:Windows/Linux/macOS 下载解压即运行,1 分钟启动
- 角色卡生态最强:Tavern 风格角色卡社区活跃,互动小说和角色聊天首选
- Notebook 模式独特:不受聊天回合限制的自由文本生成,prompt hacking 利器
- 扩展生态丰富:SD/TTS/STT/视觉/搜索/RAG 数十种扩展,功能可塑性极强
- ExLlamaV2 在 NVIDIA GPU 上最快:7B 模型 8GB 显存即可获得极致速度
- AGPL-3.0 开源:个人使用完全免费
短板
- AGPL-3.0 协议:若作为网络服务分发修改版,需同样开源,商用 SaaS 需法律评估
- Apple Silicon 优化不如 MLX 工具:Mac 上 Ollama 或 LM Studio 更快
- Gradio 较重:单个聊天会话占用浏览器 200-400MB 内存,低性能设备不友好
- 更新偶尔破坏扩展:升级时扩展兼容性可能出问题,需 pin 扩展 commit
- 模型文件管理粗糙:user_data/models 目录不会去重 tokenizer 文件
- API 模式默认无鉴权:默认监听所有网卡且无 auth,暴露公网前需反向代理加鉴权
- 入门难度高:多后端、多采样参数对初学者不友好,LM Studio 更适合小白
- 纯 CPU 推理慢 5-10 倍:7B 模型 CPU only 性能显著下降,16GB+ 内存仅可跑 7B 以下
适用人群
需要最大后端灵活性的进阶用户、研究者、模型格式尝鲜者、LoRA/QLoRA 训练者、角色扮演和创意写作用户、Linux + NVIDIA GPU 玩家、已经用 Gradio 做原型开发的团队。
安装与快速开始
Step 1:选择安装方式
便携包(推荐,GGUF 模型 1 分钟启动):
从 下载对应系统的便携包,解压后运行:
- Windows:双击
start_windows.bat - Linux:
./start_linux.sh --auto-launch - macOS:
./start_macos.sh --auto-launch
一键安装器(需要 ExLlamaV2/Training/扩展):
克隆仓库后运行启动脚本,按提示选择 GPU 厂商:
git clone https://github.com/oobabooga/text-generation-webui cd text-generation-webui # Windows start_windows.bat # Linux ./start_linux.sh # macOS ./start_macos.sh
手动 venv 安装:
git clone https://github.com/oobabooga/text-generation-webui cd text-generation-webui python -m venv venv source venv/bin/activate # Windows: venv\Scripts\activate pip install -r requirements/portable/requirements.txt --upgrade python server.py --portable --api --auto-launch
Step 2:下载模型
从 HuggingFace 下载 GGUF 模型文件,放入 user_data/models 文件夹,UI 会自动检测。
Step 3:启动并启用 API
启动后在浏览器打开 http://127.0.0.1:7860。
启用 API 模式(命令行参数):
python server.py --api
或在 user_data/CMD_FLAGS.txt 中添加 --api。
Step 4:调用 API(任选一种方式)
curl 调用:
curl http://127.0.0.1:5000/v1/completions \
-H "Content-Type: application/json" \
-d '{
"model": "model_name",
"prompt": "Hello!",
"max_tokens": 100
}'
Python 调用:
from openai import OpenAI
client = OpenAI(
base_url="http://127.0.0.1:5000/v1",
api_key="sk-no-auth"
)
response = client.completions.create(
model="model_name",
prompt="你好",
max_tokens=100
)
print(response.choices[0].text)
硬件配置参考
| 场景 | 推荐配置 |
|---|---|
| 7B 模型(GGUF Q4) | 8GB 显存(如 RTX 4060) |
| 13B 模型(EXL2) | 16GB 显存(如 RTX 4080) |
| 30B+ 模型 | 24GB+ 显存(如 RTX 4090) |
| 纯 CPU 推理 | 16GB+ 内存,速度慢 5-10 倍 |
| Apple Silicon | Metal 加速可用,但 MLX 工具更快 |
*最佳实践:NVIDIA GPU 用户首选 ExLlamaV2 后端(EXL2 格式最快);快速体验用便携包 + GGUF;LoRA 训练用一键安装器 + Transformers 后端;采样参数调优是 TextGen 的强项,Creative writing 推荐 min_p + dynamic temperature 组合;API 模式公网暴露前务必加反向代理鉴权。
相关导航


Jan

LocalAI

LM Studio

GPT4All

vLLM

PocketPal AI

