
PaperQA2 是 Future House 团队开源的科研文献高精度 RAG 库,Apache-2.0 许可。它针对科学论文 PDF/文本做检索增强生成,回答自带页级引用(in-text citations),通过 Paper Search → Gather Evidence → Generate Answer 三段式 Agentic 工作流,由语言智能体按需调用工具 。
Future House 的研究证明:PaperQA2 在 LitQA2 基准上超越 PhD 与博士后水平的生物学科研人员,基于它构建的 WikiCrow 生成的维基百科式综述准确度也超过人类策展的维基百科条目 。它是 RAG 分类中“科研文献垂直高精度”子类的代表作,与 RAGFlow(深度文档解析)、FastGPT(企业级 Agent 平台)形成清晰的差异化。
产品概述
PaperQA2 由 Future House(一家致力于”用 AI 加速科学发现”的非盈利研究机构)开发,团队负责人 Sam Rodriques。2024 年 9 月发表的论文《Language agents achieve superhuman synthesis of scientific knowledge》证明:PaperQA2 是首个在多种科学文献检索任务上达到超人表现的 AI 智能体 。
版本演进关键点 :
- PaperQA1(v1-v4):早期的检索增强生成器
- PaperQA2(v5 起):2024 年 12 月发布的 v5 是分水岭,新增:
- CLI
pqa:Agentic 工作流命令行工具 - 工具调用:paper search、gather evidence、generate answer 可由语言智能体按任意顺序调用
- LiteLLM 迁移:兼容多家 LLM 提供商,集中限速与成本管理
- Bundled 配置:提供已知良好的超参数组合
- CLI
- 2025 年 12 月起:改用日历版本化(如 v2025.12.17),解决”PaperQA2″命名与版本号混淆问题
核心定位哲学:
官方 GitHub 描述开宗明义——”High accuracy RAG for answering questions from scientific documents with citations” 。三个不可妥协的设计原则:
- 科学文献专精:聚焦于学术论文 PDF/文本,而非通用文档
- 引用可追溯:每个回答都带页级引用,可追溯到具体论文的具体位置
- Agentic 工作流:语言智能体可迭代细化查询与答案,而非单次检索-生成
它做什么 / 不做什么(关键归类):
- ✅ 做:接收科研问题 → 通过 LLM 生成关键词查询 → 获取候选论文 → 分块/嵌入/加入状态 → 嵌入查询向量 → 对 top-k 文档块排序 → LLM 重打分选择最相关摘要 → 将最佳摘要放入 prompt 生成带引用的答案
- ❌ 不做:不做通用文档 RAG(非科研 PDF 效果不如通用 RAG 引擎)、不提供企业管理后台、不支持多用户协作、不构建知识图谱(这些是 R2R 的能力)
- 本质是科研文献垂直 RAG 库:它是 RAG 分类中唯一的”科学文献高精度引用问答”专用库——LangChain/LlamaIndex 是通用框架,PaperQA2 是”framework-agnostic”的科研专精 RAG 库,底层驱动外包给 LiteLLM,自身只用 Pydantic 做工具抽象 。
技术架构 :
- 核心语言:Python(要求 3.11+)
- LLM 驱动:LiteLLM(兼容 OpenAI/Anthropic/Gemini/本地 llamafile 等任意 LiteLLM 兼容模型)
- 嵌入模型:默认 OpenAI embeddings,支持本地 Sentence Transformers
- 向量存储:NumPy 向量库(本地全文本搜索引擎)
- 元数据服务:Crossref API + Semantic Scholar API(获取论文元数据、引用数、撤稿检查)
- CLI:
pqa命令行工具 - 部署形态:PyPI 包
pip install paper-qa>=5,本地 Python 库调用或 CLI 使用
默认工作流(三段式 Agentic) :
| 阶段 | PaperQA2 动作 |
|---|---|
| 1. Paper Search | LLM 生成关键词查询 → 获取候选论文 → 分块、嵌入、加入状态 |
| 2. Gather Evidence | 嵌入查询向量 → 对当前状态中 top-k 文档块排序 → 为每个块创建评分摘要 → LLM 重打分选择最相关摘要 |
| 3. Generate Answer | 将最佳摘要放入 prompt 上下文 → 生成带引用的答案 |
💡 语言智能体可按任意顺序调用这些工具——例如先做窄搜索再做宽搜索,或为 gather evidence 与 generate answer 使用不同的措辞。
许可策略:Apache-2.0 许可证 ,允许商用、修改、分发,明确包含专利授权条款,是”最干净许可”阵营中最宽松的之一。
💡 与同层 RAG 项目的关键差异:
- vs RAGFlow:RAGFlow 是”深度文档理解的开源 RAG 引擎”,擅长复杂文档(PDF/Word/扫描件)的精准解析;PaperQA2 是”科研文献高精度 RAG 库”,擅长科学论文的带引用问答
- vs FastGPT:FastGPT 是”企业级 Agent 构建平台”,可视化工作流+知识库 RAG;PaperQA2 是科研专精的 Python 库,无 UI、无工作流编排
- vs R2R:R2R 是”生产级 RAG 引擎”,带 REST API、多模态、知识图谱、用户管理;PaperQA2 是单机 Python 库,专注科研文献场景
- vs Quivr:Quivr 是”第二大脑”式通用 RAG 平台;PaperQA2 是科研垂直 RAG 库
核心能力
-科研文献专精 RAG
- PDF/文本文件 RAG:针对科学论文优化
- 页级引用:回答中的每个论断都追溯到具体论文的具体位置
- 元数据自动获取:通过 Crossref + Semantic Scholar API 自动获取论文元数据、引用数、撤稿检查
- 本地全文本搜索:论文不外出,本地 NumPy 向量库索引
-Agentic 工作流(v5+)
pqaCLI:命令行 Agentic 工作流- 工具调用:paper search、gather evidence、generate answer 由 LLM 智能体按任意顺序调用
- 迭代细化:智能体可做窄搜索+宽搜索,或为不同步骤使用不同措辞
- 已知良好配置:bundled 配置集提供调优过的超参数
-多 LLM 兼容
- LiteLLM 驱动:兼容任意 LiteLLM 支持的模型
- 云端模型:OpenAI、Anthropic、Gemini 等(设置 API Key 环境变量)
- 本地模型:通过 llamafile 等开源 LLM 服务器
- 集中限速与成本管理:LiteLLM 提供统一限速与成本跟踪
-大规模论文索引
- 100+ 论文索引:大规模论文集索引推荐配置 Crossref + Semantic Scholar API Key 以避免公共限流
- 增量索引:第二次查询同一目录时跳过索引与分块步骤,仅检测差异(如新增论文)
- 答案持久化:所有历史答案索引并存储,可通过
pqa search查询
-开发者友好
- Python 库调用:
paper_qa库直接集成到 Python 项目 - CLI 一键问答:
pqa ask '你的问题'直接在含 PDF 的目录运行 - 高度可配置:
pqa --help显示所有选项,pqa view查看所有设置 - Pre/Post Prompts:支持在查询前后插入自定义 prompt(如答案批判)
优势亮点
- Apache-2.0 最干净许可:与 Quivr 同属最宽松许可阵营,含专利授权
- 超人级科学文献检索:Future House 论文证明在 LitQA2 基准上超越 PhD/博士后生物学科研人员
- 页级引用可追溯:每个回答都带具体论文具体位置的引用,科研场景刚需
- Agentic 工作流:v5 起的
pqaCLI 让 LLM 智能体迭代细化查询与答案 - LiteLLM 多模型兼容:OpenAI/Anthropic/Gemini/本地 llamafile 全支持
- 元数据自动丰富:Crossref + Semantic Scholar 自动获取引用数、撤稿检查
- 科研场景 SOTA:基于 PaperQA2 构建的 WikiCrow 生成的维基百科式综述准确度超过人类策展条目;ContraCrow 可检测论文间的矛盾陈述(平均 2.34 条/篇)
- Future House 机构背书:由致力于”用 AI 加速科学发现”的专业研究团队维护,非个人玩具项目
- 本地优先:论文不外出,本地 NumPy 向量库索引
局限
- 自己不执行推理:PaperQA2 是 RAG 库,需要外接 LLM(通过 LiteLLM)
- 科研文献专精:针对科学论文 PDF 优化,通用文档 RAG 效果不如 RAGFlow/AnythingLLM 等通用引擎
- Python 3.11+ 要求:v5 起最低 Python 版本提升到 3.11
- 无 UI/无工作流编排:纯 Python 库 + CLI,无可视化界面(与 FastGPT/R2R 的关键区别)
- 无多用户/企业特性:单机库定位,不具备用户管理、权限控制、SSO
- 无知识图谱:不像 R2R 那样自动构建知识图谱
- 元数据 API 限流:大规模索引(100+ 论文)若不配置 Crossref/Semantic Scholar API Key 会遇到公共限流
- v5 兼容性断裂:v5 之前的 Docs 对象 pickle 文件不兼容,需重建索引
- 论文获取限制:Future House 内部的引用遍历等工具未开源,开源版需用户自己提供 PDF
- 与 LangChain/LlamaIndex 的关系:PaperQA 团队选择 framework-agnostic,PaperQA 可用 LlamaIndex/LangChain 重新实现,但它本身不再是框架
适用人群
- 科研人员和学者:需要对科学文献做高精度问答、文献综述自动化
- 生物医药研发团队:LitQA2 基准证明在生物学科研任务上超人表现
- 文献综述自动化:WikiCrow 式自动生成维基百科级别的科学综述
- 学术矛盾检测:ContraCrow 式检测已发表科学论文间的矛盾陈述,发现新假设
- 科研 AI 应用开发者:将 PaperQA2 作为 Python 库集成到科研辅助应用中
- 需要可溯源学术问答的团队:页级引用满足学术严谨性要求
- 本地优先的科研用户:论文不外出,本地索引
安装与部署
1. 环境要求
- Python 3.11+
- LLM API Key(OpenAI/Anthropic 等)或本地 llamafile 服务
- 大规模索引推荐:Crossref API Key + Semantic Scholar API Key
2. 安装
pip install paper-qa>=5
3. CLI 快速使用
# 进入含 PDF 论文的目录 cd ~/my_papers # 使用 pqa CLI 提问 pqa ask 'What manufacturing challenges are unique to bispecific antibodies?' # 第一次运行会: # 1. 索引本地 PDF 文件 # 2. 通过 Crossref 和 Semantic Scholar 获取元数据 # 3. 在索引上搜索 # 4. 分块证据上下文、排序 # 5. 生成带引用的答案 # 调整温度 pqa --temperature 0.5 ask 'What manufacturing challenges are unique to bispecific antibodies?' # 查看历史答案 pqa search -i 'answers' 'antibodies'
4. 配置 API Key
# LLM API Key(必需) export OPENAI_API_KEY=sk-... # 大规模索引推荐配置 export CROSSREF_API_KEY=your_crossref_key export SEMANTIC_SCHOLAR_API_KEY=your_s2_key # 使用本地模型(llamafile 示例) # 启动 llamafile 服务后,通过 LiteLLM 配置指向本地端点
5. Python 库调用
import paper_qa
from paper_qa import PaperQA2, Settings
# 配置
settings = Settings(
llm="gpt-4o",
temperature=0.0,
)
# 查询
answer = PaperQA2(
query="What manufacturing challenges are unique to bispecific antibodies?",
settings=settings,
)
print(answer.response)
# 带页级引用的答案
6. 本地模型配置
# 使用本地 Sentence Transformers 嵌入
from paper_qa import SentenceTransformerEmbedding
settings = Settings(
embedding_model=SentenceTransformerEmbedding("all-MiniLM-L6-v2"),
llm="local-model", # 通过 LiteLLM 指向本地 llamafile
)
7. 部署前必检清单
- 确认仓库位于
github.com/Future-House/paper-qa(官方) - 许可:Apache-2.0 ,商用科研场景友好
- 严格属于 RAG 分类,“科研文献高精度引用问答”垂直子类
- 最新版本:v5(即 PaperQA2);2025 年 12 月起改用 CalVer
- 技术栈:Python 3.11+ / LiteLLM / NumPy 向量库 / Crossref + Semantic Scholar
- 默认工作流:Paper Search → Gather Evidence → Generate Answer(Agentic 工具调用)
- 核心能力:页级引用、元数据自动获取、本地全文本搜索、Agentic 迭代细化
- 超人表现:LitQA2 基准超越 PhD/博士后生物学科研人员
- 无 UI/无多用户/无知识图谱——纯 Python 库 + CLI 定位
相关导航


Quivr
WeKnora

Cohere Coral

Onyx Cloud

RAGFlow
R2R

