
PocketPal AI 是一个 React Native 写的开源移动应用,让你在手机上 100% 离线运行 GGUF 格式的大模型。底层基于 llama.cpp,支持从 HuggingFace 直接拉取模型(v1.9.0 起支持 gated 模型,需填 HF Token)。应用内提供聊天界面、模型切换、推理参数调节、实时性能监控面板。
当切换走模型时自动卸载释放内存。无账号、无遥测、无外部请求,所有推理在设备端完成。Android 通过 F-Droid 或 Play Store 安装,iOS 通过 App Store 安装。
产品概述
PocketPal AI 是 2024-2026 年移动端本地 LLM 热潮中最易用的应用代表。它的定位非常清晰:”让普通用户在手机上 2 分钟跑起一个本地模型”。底层用 llama.cpp 做推理,因此继承了 llama.cpp 的 ARM CPU 优化(包括 Arm KleidiAI 指令集加速)和 Vulkan GPU 加速能力。
模型来源直接对接 HuggingFace,用户可以浏览和下载任意 GGUF 模型——从 Gemma 3 1B、Llama 3.2 1B/3B 到 Qwen2.5 1.5B 等小模型为主。2026 年的实测数据显示:现代旗舰手机(如 Pixel 10 Pro、iPhone 16 Pro)上运行 1B-4B 量化模型可达 15-40 tokens/s。PocketPal AI 与 MLC Chat 是目前唯二在 Android 和 iOS 上都能提供”下载任意 GGUF 模型聊天”体验的应用,但 PocketPal 的安装和使用更简单,因此被列为”移动端本地 LLM 的最易用起点”。
核心能力
- 设备端推理:GGUF 模型 100% 在手机本地运行,离线可用
- HuggingFace 直连:浏览和下载任意 GGUF 模型,v1.9.0 起支持 gated 模型(需 HF Token)
- 模型切换:多个模型之间热切换,自动内存管理(切换走时卸载释放内存)
- 推理参数调节:temperature、top_p、上下文长度等参数可调
- 实时性能监控:显示 tokens/s、内存占用等指标
- 聊天界面:线程化对话,移动端原生体验
优势亮点
- 双平台一致体验:Android 和 iOS 同一套 UI、同一套功能
- 2 分钟上手:下载 App → 选模型 → 下载 → 聊天,无命令行、无配置
- 100% 离线零遥测:无账号、无数据上传、无外部请求
- HuggingFace 全量 GGUF:可下载任意 GGUF 模型,选择最丰富
- 自动内存管理:切换模型时自动卸载,避免手机内存耗尽
- 实时性能面板:tokens/s 和内存监控,便于了解设备推理能力
- 开源免费:React Native 代码开源
- 底层 llama.cpp:继承 ARM CPU 优化和 Vulkan GPU 加速
短板
- 控制力有限:相比 Termux + llama.cpp,暴露的参数较少
- 模型规模受限:手机 RAM 是硬瓶颈,1B 模型 6-8GB 手机流畅,3-4B 需旗舰 8-12GB,7B+ 基本不可用
- 无对外 API:应用内推理,无法被其他程序调用(不像桌面端 Ollama 可暴露 API)
- 长时间生成会发热降频:手机无主动散热,长文本生成时速度会衰减
- iOS 上模型下载受 App Store 约束:大模型下载可能需要规避某些限制
- 上下文长度受限:手机内存限制,上下文通常 2K-4K tokens
适用人群
想在手机上体验本地 LLM 的个人用户、隐私敏感用户(出差/通勤/离线场景)、不想触碰命令行的非技术用户、拥有 8-12GB RAM 旗舰手机的用户。
安装与快速开始
Step 1:安装 App
- iOS:App Store 搜索 “PocketPal AI” 下载
- Android:F-Droid 或 Play Store 搜索 “PocketPal AI” 下载
Step 2:下载并运行模型
- 打开 App,进入模型选择界面
- 浏览 HuggingFace 上的 GGUF 模型(推荐:Gemma 3 1B、Llama 3.2 1B/3B、Qwen2.5 1.5B)
- 点击下载,等待下载完成
- 下载完成后点击模型即可开始聊天
模型选择建议:
| 手机 RAM | 推荐模型 | 预期速度 |
|---|---|---|
| 6-8GB | Gemma 3 1B / Llama 3.2 1B(Q4) | 20-40 tokens/s |
| 8-12GB(旗舰) | Llama 3.2 3B / Qwen2.5 3B(Q4) | 15-25 tokens/s |
| 12-16GB(超大内存) | Llama 3.2 7B(Q4_K_M) | 5-10 tokens/s |
Step 3:使用
直接在 App 内聊天即可。点击模型名称可切换模型,App 会自动管理内存。
硬件配置参考
- 最低:6GB RAM 手机(如 Pixel 6、Galaxy S21),可跑 1B 模型,3-6 tokens/s
- 推荐:8GB RAM 手机(如 Pixel 7 Pro、iPhone 15 Pro),3B-4B 模型可用
- 最佳:12-16GB RAM 旗舰(如 Pixel 10 Pro、iPhone 16 Pro),可跑 3B-4B 模型 15-40 tokens/s
- GPU 加速:Snapdragon 8 Gen 2+ 的 Adreno GPU 通过 Vulkan 加速;Apple A16+ 通过 Metal 加速
💡 最佳实践:1B 模型是手机端最实用的选择,速度快、内存占用小;3B 模型在旗舰机上可用但长时间生成会发热降频;避免尝试 7B+ 模型(除非 12-16GB 内存旗舰);PocketPal 会自动管理内存,切换模型时旧模型自动卸载。
相关导航

TextGen

llama.cpp

vLLM

MLC LLM

LocalAI

Jan

