TextGen翻译站点

3天前更新 4 0 0

多后端本地LLM Web UI平台,支持LoRA训练,AGPL-3.0。

语言:
英文
收录时间:
2026-07-27
核心定位:本地LLM Web UI与推理平台
开源协议:AGPL-3.0
核心能力:多后端,LoRA训练,OpenAI兼容API
特色功能:聊天,角色扮演,笔记本模式,扩展
GPU 必需:可选(CPU/GPU皆可)

TextGen(原Text Generation WebUI)是由 oobabooga 开发的基于 Gradio 的本地大模型 Web 界面,定位”本地 LLM 的瑞士军刀”——把业界最广泛的后端(llama.cpp、Transformers、ExLlamaV2/V3、GPTQ、AWQ、TensorRT-LLM 等)集成到一个统一界面里。提供 Windows/Linux/macOS 便携包(下载解压即运行),以及一键安装器(支持扩展和更多后端)。100% 离线运行,零遥测、零外部请求。API 模式下提供 OpenAI 格式的 Completions 端点,支持工具调用。AGPL-3.0 协议。

 

产品概述

Text Generation WebUI(社区常称 oobabooga)诞生于 2023 年,是本地 LLM 界最早一批 Web UI 之一,2024 年进入 v4.x 时代(亦称 TextGen)。它的核心竞争力是”后端灵活性”——同期竞品中支持加载器最多的:Transformers(全精度或 8-bit)、llama.cpp(GGUF)、ExLlamaV2(EXL2)、HQQ、AQLM、AutoAWQ、GPTQ、TensorRT-LLM。这种”全后端”策略让它成为研究者、模型格式尝鲜者、LoRA 训练者的首选。

2025 年起项目新增图像生成能力(Z-Image-Turbo、4bit/8bit 量化)。采样参数暴露到极致——temperature、top_p、top_k、min_p、repetition_penalty、mirostat、dynamic temperature 等全部可调,Creative writing 和 research 场景尤为受用。Notebook 模式允许自由形式文本生成,不受聊天回合限制。扩展生态包括 SD 集成、TTS、长程记忆、多模态视觉、网络搜索等数十种内置和用户贡献扩展。AGPL-3.0 协议意味着个人使用免费,但若将其作为网络服务分发修改后的版本,需同样以 AGPL 开源。

 

核心能力

  • 多推理后端:Transformers / llama.cpp (GGUF) / ExLlamaV2 (EXL2) / HQQ / AQLM / AutoAWQ / GPTQ / TensorRT-LLM
  • 模型格式全覆盖:GGUF、EXL2、GPTQ、AWQ、SafeTensors、PyTorch 全格式
  • 采样参数全暴露:temperature、top_p、top_k、min_p、repetition_penalty、mirostat、dynamic temperature、XTC 等
  • Chat / Instruct / Notebook 三种模式:聊天、指令跟随、自由文本生成随时切换
  • LoRA / QLoRA 训练:内置 Training 标签页,最易上手的 LoRA 训练 UI
  • 角色卡(Character Cards):Tavern 风格角色卡、人格管理、角色扮演模板
  • 扩展生态:SD 集成、TTS(Silero/Coqui)、Whisper STT、多模态视觉、网络搜索、RAG(superboogav2)等
  • OpenAI 兼容 API:API 模式下提供 OpenAI 格式 Completions 端点,支持工具调用
  • 文件附件:上传文本、PDF、DOCX 文档进行对话
  • 图像生成:专用标签页运行 Z-Image-Turbo 等 diffusers 模型

 

优势亮点

  • 后端灵活性业界第一:同期竞品中支持加载器最多,几乎覆盖所有本地 LLM 格式
  • 采样参数完全可控:每一个生成参数都可调,Creative writing 和研究场景无可替代
  • LoRA 训练零门槛:UI 内直接训练 LoRA/QLoRA,是 Accessibility 最高的训练入口
  • 100% 离线零遥测:无外部请求、无远程更新、无数据统计
  • 便携包零配置:Windows/Linux/macOS 下载解压即运行,1 分钟启动
  • 角色卡生态最强:Tavern 风格角色卡社区活跃,互动小说和角色聊天首选
  • Notebook 模式独特:不受聊天回合限制的自由文本生成,prompt hacking 利器
  • 扩展生态丰富:SD/TTS/STT/视觉/搜索/RAG 数十种扩展,功能可塑性极强
  • ExLlamaV2 在 NVIDIA GPU 上最快:7B 模型 8GB 显存即可获得极致速度
  • AGPL-3.0 开源:个人使用完全免费

 

短板

  • AGPL-3.0 协议:若作为网络服务分发修改版,需同样开源,商用 SaaS 需法律评估
  • Apple Silicon 优化不如 MLX 工具:Mac 上 Ollama 或 LM Studio 更快
  • Gradio 较重:单个聊天会话占用浏览器 200-400MB 内存,低性能设备不友好
  • 更新偶尔破坏扩展:升级时扩展兼容性可能出问题,需 pin 扩展 commit
  • 模型文件管理粗糙:user_data/models 目录不会去重 tokenizer 文件
  • API 模式默认无鉴权:默认监听所有网卡且无 auth,暴露公网前需反向代理加鉴权
  • 入门难度高:多后端、多采样参数对初学者不友好,LM Studio 更适合小白
  • 纯 CPU 推理慢 5-10 倍:7B 模型 CPU only 性能显著下降,16GB+ 内存仅可跑 7B 以下

 

适用人群

需要最大后端灵活性的进阶用户、研究者、模型格式尝鲜者、LoRA/QLoRA 训练者、角色扮演和创意写作用户、Linux + NVIDIA GPU 玩家、已经用 Gradio 做原型开发的团队。

 

 


安装与快速开始

 

Step 1:选择安装方式

便携包(推荐,GGUF 模型 1 分钟启动)

GitHub Releases 下载对应系统的便携包,解压后运行:

  • Windows:双击 start_windows.bat
  • Linux:./start_linux.sh --auto-launch
  • macOS:./start_macos.sh --auto-launch

一键安装器(需要 ExLlamaV2/Training/扩展)

克隆仓库后运行启动脚本,按提示选择 GPU 厂商:

git clone https://github.com/oobabooga/text-generation-webui
cd text-generation-webui
# Windows
start_windows.bat
# Linux
./start_linux.sh
# macOS
./start_macos.sh

手动 venv 安装

git clone https://github.com/oobabooga/text-generation-webui
cd text-generation-webui
python -m venv venv
source venv/bin/activate  # Windows: venv\Scripts\activate
pip install -r requirements/portable/requirements.txt --upgrade
python server.py --portable --api --auto-launch

 

Step 2:下载模型

从 HuggingFace 下载 GGUF 模型文件,放入 user_data/models 文件夹,UI 会自动检测。

 

Step 3:启动并启用 API

启动后在浏览器打开 http://127.0.0.1:7860

启用 API 模式(命令行参数):

python server.py --api

或在 user_data/CMD_FLAGS.txt 中添加 --api

 

Step 4:调用 API(任选一种方式)

curl 调用

curl http://127.0.0.1:5000/v1/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "model_name",
    "prompt": "Hello!",
    "max_tokens": 100
  }'

Python 调用

from openai import OpenAI

client = OpenAI(
    base_url="http://127.0.0.1:5000/v1",
    api_key="sk-no-auth"
)

response = client.completions.create(
    model="model_name",
    prompt="你好",
    max_tokens=100
)
print(response.choices[0].text)

 

硬件配置参考

场景 推荐配置
7B 模型(GGUF Q4) 8GB 显存(如 RTX 4060)
13B 模型(EXL2) 16GB 显存(如 RTX 4080)
30B+ 模型 24GB+ 显存(如 RTX 4090)
纯 CPU 推理 16GB+ 内存,速度慢 5-10 倍
Apple Silicon Metal 加速可用,但 MLX 工具更快

*最佳实践:NVIDIA GPU 用户首选 ExLlamaV2​ 后端(EXL2 格式最快);快速体验用便携包 + GGUF;LoRA 训练用一键安装器 + Transformers 后端;采样参数调优是 TextGen 的强项,Creative writing 推荐 min_p + dynamic temperature 组合;API 模式公网暴露前务必加反向代理鉴权。

相关导航