Navi2AI

      推理与本地部署

      共 17 篇网址
      Navi2AI.com关于【AI 大模型基建】二级分类【模型服务 MaaS&API】的分类定义与收录描述:把模型跑起来的引擎与本地运行环境:生产级服务 + 桌面端侧。推理引擎决定模型上线后的吞吐、延迟与成本。vLLM、SGLang、TensorRT-LLM 面向生产高并发;llama.cpp、Ollama、LM Studio 让模型在个人电脑离线运行,兼顾隐私与零边际成本。
      AI 大模型基建AI 文案与写作AI 图像与设计AI 视频与创作AI 音频与制作AI 代码与开发AI 效率与办公AI 通用智能体
      模型服务 MaaS&API开源模型推理与本地部署API 网关与聚合检索增强 RAG向量数据库训练与微调
      排序
      发布更新浏览点赞
      Ollama

      Ollama

      本地LLM推理服务框架,一键拉取模型,MIT许可,全平台。
      440
      推理与本地部署# Ollama
      PocketPal AI

      PocketPal AI

      手机端本地LLM客户端,100%设备端推理,MIT许可。
      340
      推理与本地部署# PocketPal AI
      vLLM

      vLLM

      vLLM 生产级LLM推理与服务引擎,PagedAttention高吞吐,Apache 2.0。
      230
      推理与本地部署# vLLM
      MLC LLM

      MLC LLM

      跨平台移动端LLM部署引擎,ML编译原生GPU加速,Apache 2.0。
      220
      推理与本地部署# MLC LLM
      TextGen

      TextGen

      多后端本地LLM Web UI平台,支持LoRA训练,AGPL-3.0。
      210
      推理与本地部署# Text Generation WebUI# TextGen
      LM Studio

      LM Studio

      桌面GUI本地模型客户端,个人与工作免费,全平台。
      210
      推理与本地部署# LM Studio
      llama.cpp

      llama.cpp

      C/C++高性能LLM推理引擎,GGUF发明者,MIT许可,15+后端。
      190
      推理与本地部署# llama.cpp
      GPT4All

      GPT4All

      桌面级本地LLM聊天客户端,一键安装100%离线,MIT许可。
      180
      推理与本地部署# GPT4All
      Jan

      Jan

      开源桌面ChatGPT替代客户端,100%离线运行,Apache 2.0。
      180
      推理与本地部署# Jan
      Sonar

      Sonar

      PygmalionAI主导的vLLM分支推理引擎,量化格式覆盖最广,AGPL-3.0许可。
      160
      推理与本地部署# Sonar
      LMDeploy

      LMDeploy

      上海AI Lab开源,TurboMind引擎驱动,国产LLM/VLM高性能部署工具箱。
      160
      推理与本地部署# LMDeploy
      ExLlamaV3

      ExLlamaV3

      turboderp主导,消费级NVIDIA GPU本地LLM推理库,EXL3量化格式发源地,MIT许可。
      150
      推理与本地部署# ExLlamaV3
      DeepSpeed-MII

      DeepSpeed-MII

      微软DeepSpeed团队开源,Blocked KV Cache+Dynamic SplitFuse高吞吐推理库。
      150
      推理与本地部署# DeepSpeed-MII
      MLX

      MLX

      Apple机器学习研究团队出品,Apple Silicon统一内存原生的数组框架与LLM推理引擎。
      140
      推理与本地部署# MLX# MLX LM
      TensorRT-LLM

      TensorRT-LLM

      NVIDIA官方开源,编译优化大模型推理,NVIDIA GPU上极限吞吐引擎。
      140
      推理与本地部署# TensorRT-LLM
      CTranslate2

      CTranslate2

      OpenNMT团队开源,Transformer模型高效C++推理引擎,自定义运行时+faster-whisper底层。
      130
      推理与本地部署# CTranslate2
      SGLang

      SGLang

      SGLang是基于RadixAttention前缀缓存的高吞吐LLM/VLM服务框架。
      120
      推理与本地部署# SGLang
      没有了
      Navi2AI
      Navi2AI 是一个专注 AI 工具的一站式导航站。汇集对话、绘画、编程、办公等热门 AI 产品,分类清晰、直达可用,帮你快速找到趁手的 AI 利器。

      友链申请 免责声明 广告合作 关于我们

      扫码加QQ群Navi2AI
      扫码加QQ群
      扫码加微信Navi2AI
      扫码加微信
      Copyright © 2026 Navi2AI 京ICP备2024080263号-3  京公网安备11010502061824号 
      网址
      网址文章软件书籍