
AnythingLLM 是一个全栈开源 AI 应用程序,让你用任何 LLM 提供商来”和你的文档对话”。它将文档摄取、向量存储、LLM 交互和 AI 智能体全部打包进一个可部署的套件中。核心突破是把 RAG(检索增强生成)变得极其简单——拖入 PDF/DOCX/TXT/代码/网页,AnythingLLM 自动分块、向量化、存储,聊天时检索相关片段发给 LLM 生成答案。
提供两种形态:桌面应用(单机、100% 本地、零配置、无账号)和 Docker 自托管(多用户、RBAC、可嵌入聊天组件、可公网发布)。默认向量数据库为 LanceDB(零配置嵌入式),也可切换 Pinecone/Chroma/Qdrant/Weaviate/Milvus/pgVector。LLM 提供商支持 30+ 家:本地的 Ollama/LM Studio/vLLM,云端的 OpenAI/Anthropic/Azure/AWS Bedrock/Mistral/Groq 等。MIT 协议,免费自托管 。
产品概述
AnythingLLM 由 Mintplex Labs 开发,定位”全栈开源 RAG 与 AI 智能体平台”——把文档摄取、向量存储、LLM 连接、智能体编排全部封装进一个 Web UI,用户无需写 LangChain 胶水代码、无需手动搭 ChromaDB 。
技术栈上,AnythingLLM 本身是轻量的”包装器”,真正干活的是可插拔的 LLM、Embedder、向量数据库三大组件——这种架构让它可以在树莓派上跑(自身仅需 2GB 内存/2 核 CPU ),也可以在多 GPU 服务器上承载生产级负载。
2025-2026 年的重要更新包括:MCP(Model Context Protocol)原生支持,可将 AnythingLLM 工作区暴露为 MCP 工具供 Claude 等智能体调用 ;Meeting Assistant 会议助手完全本地转录和总结;Magic 功能实现鼠标指针处的智能听写;Agent Skills 一键激活智能体技能;Community Hub 插件市场。桌面端提供一键安装包,内置 LLM Provider 可直接下载运行 GGUF 模型,真正”零配置”;Docker 版则面向团队,提供多用户隔离、工作区权限管理、嵌入聊天组件、白标等能力 。GitHub 63k+ Stars,5M+ Docker 拉取量 。
核心能力
- 文档摄取:拖拽 PDF/Word/Excel/CSV/Markdown/代码/整个网站,自动分块与向量化
- Workspace 工作区:每个工作区是独立知识库,文档/对话/模型/RAG 设置互不污染
- 多 LLM 支持:Ollama/LM Studio/vLLM 本地推理 + OpenAI/Anthropic/Azure/Bedrock 等 30+ 云端,按工作区切换
- 多 Embedder 支持:nomic-embed-text 等本地嵌入模型 + OpenAI/Cohere/Voyage 云端嵌入
- 向量数据库:默认 LanceDB 嵌入式零配置,可切换 Chroma/Pinecone/Qdrant/Weaviate/Milvus/pgVector
- AI 智能体:在工作区里让模型调用工具——网页抓取、SQL 查询、文件系统读写、自定义脚本
- MCP 支持:原生 Model Context Protocol,工作区可作为 MCP 工具被外部智能体调用
- Developer API:完整的 REST API,Bearer Token 认证,可被 n8n/Make/Raycast 等反向调用
- 多模态:支持图像、音频等多模态 LLM
- 会议助手:本地转录和总结任意会议平台的通话,无机器人加入
- 智能体技能与 Slash Commands:社区驱动的技能市场和快捷命令
优势亮点
- 100% 离线 + 零配置:桌面端一键安装,模型和文档全留本地,无账号、无遥测
- MIT 协议:免费自托管,可商用、可修改、可分发
- RAG 开箱即用:文档摄取→分块→向量化→检索→对话全链路封装,15 分钟搭好(Ollama 已运行时)
- 架构极轻:自身仅需 2GB 内存/2 核 CPU,可在树莓派上运行
- LLM 无厂商锁定:本地 Ollama 今天、云端 OpenAI 明天,文档和嵌入向量保持可移植
- 两种形态覆盖个人到企业:桌面端单机隐私优先;Docker 多用户 RBAC、嵌入聊天组件、白标
- MCP 原生支持:工作区可作为 MCP 工具被 Claude 等智能体调用
- 向量数据库灵活:默认 LanceDB 零配置,生产环境可切换任意主流向量库
- 智能体生态完整:Agent Skills、Slash Commands、Community Hub、Meeting Assistant、Magic 功能
- 跨平台一致:macOS/Windows/Linux 桌面端 + Docker 服务端全平台
短板
- 分块控制有限:文本切分的粒度调节不如 LlamaIndex/LangChain 程序化灵活
- 检索调试不透明:RAG 检索过程黑盒化,难以排查”为什么没检索到那段”
- 不是企业级文档管理:无审计日志、无大规模细粒度权限、无 SSO(社区版)
- Docker 版才有多用户:桌面端是单机应用,多用户/工作区权限隔离/RBAC 仅 Docker 版支持
- 本机跑本地模型受限于硬件:16GB 内存/8 核 CPU 是基础体验门槛,Windows 推荐 8-12GB+ 显存
- 自身不做推理:必须对接 Ollama/vLLM 等后端或云端 API,推理性能取决于所接后端
- 嵌入性能依赖 CPU:大文档集合在 CPU 上嵌入较慢,万级 PDF 索引需要耐心
适用人群
需要将本地/私有文档变成可对话知识库的个人和团队、隐私敏感企业、法律/医疗/金融从业者、已在本地部署 Ollama/vLLM/LM Studio 的用户、需要 RAG + 智能体但希望避免写 Python 胶水代码的技术用户、小团队多用户协作(Docker 版)、研究者管理文献库。
安装与快速开始
Step 1:选择安装方式
AnythingLLM 提供两种主要使用方式 :
- 桌面应用:一键安装,单机使用,100% 本地,无多用户需求 → 选这个
- Docker 版:多用户、RBAC、嵌入聊天组件、公网发布 → 选这个
Step 2:桌面应用安装
访问 下载对应系统安装包 :
- macOS:下载
.dmg安装包 - Windows:下载
.exe安装包 - Linux:下载
.AppImage或.deb包
安装完成后:
- 首次启动会自动推荐适合你硬件的模型
- 选择模型(或让 AnythingLLM 自动推荐)
- 即可开始聊天、上传文档
系统要求:
- 基础体验:16GB 内存 / 8 核 CPU / 存储视模型大小而定
- Windows 推荐 8-12GB+ 显存以启用 GPU 加速
- macOS M 系列芯片原生支持本地模型
- Intel Mac 受限较大,主要受内存约束
Step 3:Docker 部署(多用户场景)
docker pull mintplexlabs/anythingllm:latest
docker run -d -p 3001:3001 \
-v ${PWD}/storage:/app/server/storage \
--name anythingllm \
mintplexlabs/anythingllm:latest
启动后访问
http://localhost:3001,跟随设置向导配置 LLM 提供商、Embedder、向量数据库 。
完全离线 + Ollama 后端配置:
# 1. 安装 Ollama 并拉取模型
ollama pull llama3.2
ollama pull nomic-embed-text
# 2. 启动 AnythingLLM(Docker)
docker run -d -p 3001:3001 \
-v ${PWD}/storage:/app/server/storage \
--name anythingllm \
mintplexlabs/anythingllm:latest
# 3. 在 AnythingLLM 设置中:
# LLM Provider → Ollama → http://localhost:11434
# Embedder → Ollama → nomic-embed-text
# 4. 创建工作区 → 上传文档 → 开始聊天
Step 4:调用 Developer API(任选一种方式)
AnythingLLM 提供完整的 REST API ,认证方式为 Bearer Token(从 Settings → Developer API 获取)。
curl 调用:
curl -X POST http://localhost:3001/api/v1/workspace/{slug}/chat \
-H "Authorization: Bearer YOUR_API_TOKEN" \
-H "Content-Type: application/json" \
-d '{
"message": "这个文档的核心观点是什么?",
"mode": "chat"
}'
{slug}替换为你的工作区 slug,YOUR_API_TOKEN替换为 Settings → Developer API 中生成的令牌。
Python 调用:
import requests
API_BASE = "http://localhost:3001/api/v1"
API_TOKEN = "YOUR_API_TOKEN" # 从 Settings → Developer API 获取
WORKSPACE_SLUG = "your-workspace-slug"
response = requests.post(
f"{API_BASE}/workspace/{WORKSPACE_SLUG}/chat",
headers={"Authorization": f"Bearer {API_TOKEN}"},
json={
"message": "请总结上传的文档",
"mode": "chat"
}
)
print(response.json()["text_response"])
硬件配置参考
| 部署形态 | 推荐配置 |
|---|---|
| AnythingLLM 自身(最小) | 2GB 内存 / 2 核 CPU / 5GB 存储 |
| 桌面端基础体验(本机跑本地模型) | 16GB 内存 / 8 核 CPU |
| Windows + GPU 加速 | 8-12GB+ 显存 |
| Docker 稳定.document 嵌入 | 4GB+ 内存 |
| 7B 本地模型(Ollama 后端) | 8GB 显存(如 RTX 4060) |
| 14B 本地模型(Ollama 后端) | 10-12GB 显存 |
| 嵌入任务(nomic-embed-text) | CPU 即可,无 GPU 需求 |
*最佳实践:个人单机用桌面应用,零配置最快上手;团队多用户用 Docker 版;完全离线场景用 Ollama 作 LLM + Embedder 后端;大文档集合嵌入建议在 GPU 机器上跑 Embedder;AnythingLLM 自身极轻量,真正的资源瓶颈在所选 LLM 后端 。



