06:56Jerry Liu@jerryjliu0精选LlamaParse推出新的Agentic Plus抽取模式,面向100-500页长文档,可提取10k-100k个字段,并在FTX债权人矩阵测试中处理了75k字段、114页文档。配套发布的ExtractBench基准覆盖370份企业文档、4,869页、67种类型,评估了14套系统。测试显示,超过50页后商用VLM的召回率低于35%,主要因为静默截断列表。Agentic Plus在该基准上以95.6%的值准确率排名第一,成本不到最接近对手的三分之一。AI产品LlamaParseExtractBenchAgentic Plus1 个信源在谈事件专题推荐理由:LlamaParse新出的Agentic Plus能一次抽几万字段,长文档不丢行,成本还比同类低一大截。原文稍后读已读值得跟进有用关注 LlamaParse
05:57Jerry Liu@jerryjliu0精选ExtractBench是面向复杂企业文档提取的基准,包含370份文档、4869页和67种文档类型。它评估了14个系统,包括前沿VLM、编程智能体和专用提取API。结果显示,超过50页的文档中,商业VLM的召回率低于35%,主要问题是静默截断列表。LlamaParse新推出的Agentic Plus层级在基准上达到95.6%的值准确率,成本不到最接近竞争对手的三分之一。论文ExtractBenchLlamaParseAgentic Plus1 个信源在谈事件专题推荐理由:LlamaParse搞了个ExtractBench,测出来商业VLM处理长文档会漏数据;他们新出的Agentic Plus准确率95.6%,成本还低。做文档提取的可以看下。原文稍后读已读值得跟进有用关注 ExtractBench
17:46LlamaIndex@llama_index精选ExtractBench 基准包含 370 份企业文档和 14 个提取系统。最难的测试是长列表完整性,例如 26,725 行的未认领财产清单。前沿视觉语言模型在长文档上 F1 仅为 8.9%–35.8%,精度高但召回率大幅下降。LlamaIndex 的新方案 Agentic Plus 将长文档迭代处理,在长列表任务上达到 96.1% F1。AI模型ExtractBenchLlamaIndexAgentic Plus1 个信源在谈事件专题推荐理由:LlamaIndex 搞了个 ExtractBench,测了 14 个系统,发现长文档提取召回率很低。它家 Agentic Plus 能到 96.1%,比别的都稳。原文稍后读已读值得跟进有用关注 ExtractBench
00:57Jerry Liu@jerryjliu073°LlamaParse 团队发布 36 页 ArXiv 论文,介绍企业文档抽取基准 ExtractBench。该基准用 370 份企业文档、4869 页、67 种文档类型评估 14 套抽取系统。核心发现是:超过 50 页的长文档会让商业 VLM 召回率跌到 35% 以下,原因是静默截断表格行。ExtractBench 用价值准确率、空间溯源和单页成本等指标做确定性评测,不依赖 LLM 裁判。同时发布的 LlamaParse Agentic Plus 在榜单上取得 95.6% 价值准确率,成本不到最接近竞品的三分之一。论文ExtractBenchLlamaParseAgentic Plus1 个信源在谈事件专题推荐理由:LlamaParse 发布 ExtractBench:长文档让商业模型召回崩到 35%;自家 Agentic Plus 95.6% 登顶,成本更低。原文稍后读已读值得跟进有用关注 ExtractBench