产品精选73°

PageIndex 发布开源 PDF 索引引擎 PageIndex Flash

PageIndex 发布了一个完全本地运行、开源的 PDF 树状索引引擎「PageIndex Flash」@PageIndexAI PageIndex Flash 直接读取 PDF 自带的排版结构来...

精选理由

PageIndex Flash 让 PDF 检索又快又便宜,本地运行无需向量数据库,特别适合处理长专业文档。

PageIndex Flash 直接读取 PDF 自带排版结构构建层级目录树,无需视觉模型推断文档大纲。该引擎索引成本约 $0.001/页,1000 页教材索引一次约 1 美元多。基准测试显示,在 52 页文档中,全文喂入成本是树检索的 2.1 倍,420 页文档中为 16.6 倍。

原文 · shao__meng

PageIndex 发布了一个完全本地运行、开源的 PDF 树状索引引擎「PageIndex Flash」@PageIndexAI PageIndex Flash 直接读取 PDF 自带的排版结构来...

PageIndex 发布了一个完全本地运行、开源的 PDF 树状索引引擎「PageIndex Flash」 @PageIndexAI PageIndex Flash 直接读取 PDF 自带的排版结构来构建层级目录树,不让视觉模型从零推断文档大纲。这一改变使索引变得快、便宜且可预测,从而让 "推理式 RAG" 能够在本机、无向量数据库的条件下跑通全流程。 pageindex.ai/blog/pageindex… # 主流 RAG 做法的问题是什么? 主流 RAG 的做法是:把文档切成固定大小的 chunk → 向量化 → 按相似度召回。这条路径的根本局限: | 相似(similarity)≠ 相关(relevance) 在金融报告、法规、技术手册、教科书这类长专业文档中: · 真正回答问题的段落,措辞可能与查询完全不同; · 语义上"相近"的段落,可能与任务毫不相关; · 找到正确证据往往需要上下文、领域知识和多步推理。 PageIndex 的替代方案是模仿人类阅读方式:把文档组织成层级树(为 LLM 优化的目录),然后让 LLM 像翻目录一样在树中推理、定位到正确页面。流程分两个阶段: · Stage 1 — 建树:为文档生成包含标题、页码范围、摘要、嵌套子节的树索引; · Stage 2 — 搜树:LLM 在树上推理检索,读取证据,给出带页级引用的答案。 # PageIndex Flash 的核心创新 1. 用 PDF 自身的排版信息替代视觉模型推断 以前构建目录树需要模型"看"页面并推断结构,成本高、速度慢、结果不稳定。Flash 的关键假设是:文本型 PDF 已经携带了结构信息(文字层、标题元数据、排版层次),直接解析即可。索引模型不再需要"重建大纲",只需要为已定位的章节写摘要。 2. 索引模型与对话模型解耦 SDK 允许两者独立配置: · index 模型:生成节点摘要、优化树结构 · chat 模型:搜索树、判断相关性、阅读证据、生成答案 这带来两个实际好处: · 一次性索引成本极低,且不会拖累后续检索质量; · 换 chat 模型不需要重建索引。 3. 实测成本与速度 · 索引成本约 $0.001 / 页(使用 gpt-5.6-luna 作为 index 模型);一本 1000 页教材索引一次约 1 美元多,之后可服务所有提问。 · 基准文档从 9 页到 1098 页,索引耗时 约 13 秒到 4.5 分钟。 # 查询成本与准确率 基准设置:62 个 lookup 类问题,覆盖 34 份 PDF、共 1945 页,取自 MMLongBench-Doc-V2。所有答案都是正文中明确陈述的事实——因此答错代表检索或阅读失败,而非开放式推理分歧。这一设计让基准测的是"找得到、读得对",而不是模型的推理能力。 关键结论: · 同一模型内,提高 reasoning effort 形成清晰的准确率梯度,且成本水平相近; · 换更大的模型可以进一步推高上限,但每问成本通常上升一个数量级; · 由此得到一条实用的部署调优路径:先按预算选模型家族,再按精度要求调 reasoning effort。 树检索 vs. 全文喂入: · 52 页文档:全文喂入成本是树检索的 2.1×; · 420 页文档:16.6×; · 超过约 800 页:全文根本放不进上下文窗口。 # 明确的边界:扫描件与图像密集型 PDF 局限性:让 Flash 快的原因,也正是它的边界。 · 扫描页没有文字层和标题元数据,"它是文档的图像而非文档",Flash 无从解析; · 含义主要承载在图表、表格、示意图中的文件同样不适用。 这类文档官方推荐 PageIndex Cloud(先做 OCR 与图像理解,再建树),切换只需把 index="cloud" 并加一个 API key,其余代码不变。 # Agent 集成 PageIndex 的定位是嵌入你现有的 agent,不接管其控制流。本地与云端暴露相同接口,因此集成代码不随索引方式变化。 以 OpenAI Agents SDK 为例,客户端一次提供两样东西: · as_openai_tools() — 以 provider 原生格式返回树搜索工具; · agent_instructions() — 提供教模型"如何走树"的系统提示。 开发者无需自己写检索逻辑。同一客户端还支持 Anthropic SDK tool runner、Claude Agent SDK、LangChain、PydanticAI,并可导出为普通 Python 函数供其他框架使用。 💬 1 🔄 0 ❤️ 1 👀 180 📊 1 ⚡