模型精选

LlamaIndex 发布面向 AI Agent 的文档解析评测基准「ParseBench」

LlamaIndex 发布了一个面向 AI Agent 的文档解析评测基准「ParseBench」 @llama_index 100 种解析方法参与评测(vlm - 67、专用解析器 - 33),...

精选理由

LlamaIndex 这个团队做了个挺有意思的事,他们把 100 种文档解析方法都测了一遍,结果发现 LlamaParse 在图表处理上特别强,而且成本还低,0.38 美分一页就能拿到 80 多分,比很多大模型都划算。

LlamaIndex 发布了「ParseBench」,一个面向 AI Agent 的文档解析评测基准。该基准包含 100 种解析方法(VLM 67 种、专用解析器 33 种),基于 2000 页真实企业文档进行评测。评测维度包括表格结构、图表抽取、内容忠实度、格式语义和视觉定位。头部方法 LlamaParse 在图表抽取上表现突出,而 VLM 在视觉定位上存在明显短板。

原文 · shao__meng

LlamaIndex 发布了一个面向 AI Agent 的文档解析评测基准「ParseBench」 @llama_index 100 种解析方法参与评测(vlm - 67、专用解析器 - 33),...

LlamaIndex 发布了一个面向 AI Agent 的文档解析评测基准「ParseBench」 @llama_index 100 种解析方法参与评测(vlm - 67、专用解析器 - 33),2000 页真实企业文档(人工两轮校验),169011 条确定性规则,完全不用 LLM 当裁判,可复现。评测五个维度取无加权平均:表格结构、图表抽取、内容忠实度、格式语义、视觉定位。 parsebench.ai 榜单核心结论(100 个方法) · 头部被 LlamaParse 系垄断(Agentic Plus 90.2 领跑);第三方 Pulse(81.6)、anyformat(80.3)证明头部并非一家独有。 · Charts 是最大分水岭:20 多个方法归零,头部却达 88–94。大量方法总分平庸纯粹是图表拖垮的。 · Faithfulness 普遍 80+,纯文字抽取已是解决问题;差距在结构、语义、定位。 · Grounding 是 VLM 集体盲区,反而一些总分平庸的专用解析器有 75–80。要溯源就盯这一项,别看总分。 · 格局碎片化:VLM 内容强、定位崩;专用解析器布局强、图表常直接放弃。无一家全能。 · 性价比:LlamaParse Cost Effective 0.38¢ 拿 80.6,全场之最;GLM-5.3 Flash、Gemini 3 Flash 不到 1¢ 上 70;反面是 Fable 5.1,16¢/页总分反而更低。 Jerry Liu @jerryjliu0 we've evaluated 100+ models on doc parsing 🔥 from frontier VLMs, open-weight VLMs, OCR tools, and OSS parsers check out parsebench: parsebench.ai E 🔗 View Quoted Tweet 💬 0 🔄 1 ❤️ 1 👀 253 📊 1 ⚡