推理与本地部署
共 17 篇网址
Navi2AI.com关于【AI 大模型基建】二级分类【模型服务 MaaS&API】的分类定义与收录描述:把模型跑起来的引擎与本地运行环境:生产级服务 + 桌面端侧。推理引擎决定模型上线后的吞吐、延迟与成本。vLLM、SGLang、TensorRT-LLM 面向生产高并发;llama.cpp、Ollama、LM Studio 让模型在个人电脑离线运行,兼顾隐私与零边际成本。
AI 大模型基建
AI 文案与写作
AI 图像与设计
AI 视频与创作
AI 音频与制作
AI 代码与开发
AI 效率与办公
AI 通用智能体
模型服务 MaaS&API
开源模型
推理与本地部署
API 网关与聚合
检索增强 RAG
向量数据库
训练与微调
排序
发布
更新
浏览
点赞
Ollama
本地LLM推理服务框架,一键拉取模型,MIT许可,全平台。
44
0
推理与本地部署
# Ollama
PocketPal AI
手机端本地LLM客户端,100%设备端推理,MIT许可。
34
0
推理与本地部署
# PocketPal AI
vLLM
vLLM 生产级LLM推理与服务引擎,PagedAttention高吞吐,Apache 2.0。
23
0
推理与本地部署
# vLLM
MLC LLM
跨平台移动端LLM部署引擎,ML编译原生GPU加速,Apache 2.0。
22
0
推理与本地部署
# MLC LLM
TextGen
多后端本地LLM Web UI平台,支持LoRA训练,AGPL-3.0。
21
0
推理与本地部署
# Text Generation WebUI
# TextGen
LM Studio
桌面GUI本地模型客户端,个人与工作免费,全平台。
21
0
推理与本地部署
# LM Studio
llama.cpp
C/C++高性能LLM推理引擎,GGUF发明者,MIT许可,15+后端。
19
0
推理与本地部署
# llama.cpp
GPT4All
桌面级本地LLM聊天客户端,一键安装100%离线,MIT许可。
18
0
推理与本地部署
# GPT4All
Jan
开源桌面ChatGPT替代客户端,100%离线运行,Apache 2.0。
18
0
推理与本地部署
# Jan
Sonar
PygmalionAI主导的vLLM分支推理引擎,量化格式覆盖最广,AGPL-3.0许可。
16
0
推理与本地部署
# Sonar
LMDeploy
上海AI Lab开源,TurboMind引擎驱动,国产LLM/VLM高性能部署工具箱。
16
0
推理与本地部署
# LMDeploy
ExLlamaV3
turboderp主导,消费级NVIDIA GPU本地LLM推理库,EXL3量化格式发源地,MIT许可。
15
0
推理与本地部署
# ExLlamaV3
DeepSpeed-MII
微软DeepSpeed团队开源,Blocked KV Cache+Dynamic SplitFuse高吞吐推理库。
15
0
推理与本地部署
# DeepSpeed-MII
MLX
Apple机器学习研究团队出品,Apple Silicon统一内存原生的数组框架与LLM推理引擎。
14
0
推理与本地部署
# MLX
# MLX LM
TensorRT-LLM
NVIDIA官方开源,编译优化大模型推理,NVIDIA GPU上极限吞吐引擎。
14
0
推理与本地部署
# TensorRT-LLM
CTranslate2
OpenNMT团队开源,Transformer模型高效C++推理引擎,自定义运行时+faster-whisper底层。
13
0
推理与本地部署
# CTranslate2
SGLang
SGLang是基于RadixAttention前缀缓存的高吞吐LLM/VLM服务框架。
12
0
推理与本地部署
# SGLang
没有了
网址
网址
文章
软件
书籍