10:40Jerry Liu@jerryjliu073°ExtractBench已在Kaggle上线,测试了5.6 Sol、OpenAI模型、Gemini 3 Flash和Opus 5等前沿模型在文档提取任务中的表现。该基准测试涵盖370个企业文档,涉及8个商业领域和67种文档类型,包括长记录列表、噪声扫描、手写和复杂表格等。LlamaParse作为专用提取工具,在价格/性能前沿提供基础引用功能。AI模型ExtractBench5.6 SolLlamaParse8 个信源在谈事件专题推荐理由:Llama团队发布了ExtractBench基准,测试了5.6 Sol等模型在复杂文档提取上的表现,还对比了LlamaParse等工具。原文稍后读已读值得跟进有用关注 ExtractBench
00:23LlamaIndex@llama_index73°ExtractBench基准测试已在Kaggle平台上线,专门测试文档提取能力。该基准测试涵盖8个商业领域的370份企业文档,包括67种文档类型。测试重点针对可能破坏下游代理和工作流程的文档,如长记录列表、噪声扫描、手写体和复杂表格。LlamaParse、Codex、Claude Code等工具参与了性能对比。论文ExtractBenchKaggleLlamaParse1 个信源在谈事件专题推荐理由:LlamaIndex在Kaggle上线了ExtractBench基准,测试370份企业文档的提取能力,看看各工具表现如何。原文稍后读已读值得跟进有用关注 ExtractBench
01:43Jerry Liu@jerryjliu0精选ExtractBench测试20多个模型在文档提取任务上的表现,Qwen 3.8模型表现最佳,GLM-5.3-flash和qwen 3.8 flash新版本也刚刚发布。测试结果基于统一F1的“价值准确性”指标,不包含视觉定位和置信度评分。论文ExtractBench文档提取模型测试10 个信源在谈事件专题推荐理由:ExtractBench最新测试了20多个模型,Qwen 3.8模型表现抢眼,新版本GLM-5.3-flash和qwen 3.8 flash也值得关注。原文稍后读已读值得跟进有用关注 ExtractBench
02:54LlamaIndex@llama_index精选ExtractBench在370个企业文档、67种文档类型和4,800多页面上评估了结构引导提取。LlamaIndex CTO Simon Suo将进行技术讲解,探讨提取难度、现有基准的不足以及成本与准确性的权衡。技巧ExtractBenchLlamaIndex文档提取API推荐理由:LlamaIndex CTO Simon Suo将分享ExtractBench的测试结果,了解企业文档提取API的优缺点。原文稍后读已读值得跟进有用关注 ExtractBench
00:08Jerry Liu@jerryjliu0精选78°LlamaIndex发布ExtractBench基准,专门评估文档提取的视觉定位能力。测试显示,通用视觉模型和编码智能体在返回证据时得分为零,而专用VLM文档工具LlamaParse表现领先。LlamaExtract Agentic Plus在页面级F1达84.9%,词级46.4%,长文档上保持87.1%,其他系统在长文档上跌至0%。基准要求字段值和引用都正确才算分,词级框IoU需达0.5。AI模型LlamaParseExtractBenchLlamaIndex1 个信源在谈事件专题推荐理由:做PDF智能体的话,这个基准和工具值得看。通用模型定位不行,LlamaParse能精确到词级框,长文档也不掉链子。原文稍后读已读值得跟进有用关注 LlamaParse
00:53LlamaIndex@llama_index精选ExtractBench对文档提取API的溯源能力进行了严格评测:字段的值及其引用必须同时正确才计分。结果显示,VLM和编码智能体完全不返回证据,两层得分均为零。在能返回框的系统中,最佳词级F1仍低于50%。某专用API在短文档上页面级F1为61.7%,长文档上直接降到0.0%。LlamaExtract Agentic Plus在页面级和词级分别达到84.9%和46.4%,长文档上仍保持87.1%。AI模型ExtractBenchLlamaExtract文档提取1 个信源在谈事件专题推荐理由:想用文档提取API?先看ExtractBench的溯源评测。多数工具给不出出处,LlamaExtract Agentic Plus在长文档上还挺得住。原文稍后读已读值得跟进有用关注 ExtractBench
06:56Jerry Liu@jerryjliu0精选LlamaParse推出新的Agentic Plus抽取模式,面向100-500页长文档,可提取10k-100k个字段,并在FTX债权人矩阵测试中处理了75k字段、114页文档。配套发布的ExtractBench基准覆盖370份企业文档、4,869页、67种类型,评估了14套系统。测试显示,超过50页后商用VLM的召回率低于35%,主要因为静默截断列表。Agentic Plus在该基准上以95.6%的值准确率排名第一,成本不到最接近对手的三分之一。AI产品LlamaParseExtractBenchAgentic Plus1 个信源在谈事件专题推荐理由:LlamaParse新出的Agentic Plus能一次抽几万字段,长文档不丢行,成本还比同类低一大截。原文稍后读已读值得跟进有用关注 LlamaParse
05:57Jerry Liu@jerryjliu0精选ExtractBench是面向复杂企业文档提取的基准,包含370份文档、4869页和67种文档类型。它评估了14个系统,包括前沿VLM、编程智能体和专用提取API。结果显示,超过50页的文档中,商业VLM的召回率低于35%,主要问题是静默截断列表。LlamaParse新推出的Agentic Plus层级在基准上达到95.6%的值准确率,成本不到最接近竞争对手的三分之一。论文ExtractBenchLlamaParseAgentic Plus1 个信源在谈事件专题推荐理由:LlamaParse搞了个ExtractBench,测出来商业VLM处理长文档会漏数据;他们新出的Agentic Plus准确率95.6%,成本还低。做文档提取的可以看下。原文稍后读已读值得跟进有用关注 ExtractBench
07:45Jerry Liu@jerryjliu0精选LlamaIndex本周发布文档提取基准ExtractBench,覆盖1950年代监管文件、手填税表、传真阈值化、复印件色调、传感器噪声及手机拍摄等真实场景。该基准测试了14个系统,发现各系统的感知盲区互不重叠。Codex在扫描和手写文档上准确率超过93%,但旋转页面跌至约80%。专用OCR API在旋转和手写上表现稳定,扫描场景只有81%。Gemini 3.5 Flash在扫描页上从88.6%降至71.1%。LlamaIndex的Agentic Plus是唯一无盲区的系统,在旋转、扫描、手写上的准确率分别为95.9%、93.9%、93.8%,波动仅2个百分点。AI模型ExtractBenchLlamaIndexCodex1 个信源在谈事件专题推荐理由:LlamaIndex做了个ExtractBench,测了14个文档提取系统,发现Codex和OCR各有短处,他们自己的Agentic Plus全场景最稳。原文稍后读已读值得跟进有用关注 ExtractBench
22:49LlamaIndex@llama_index精选ExtractBench测试了14个文档提取系统,使用1950年代监管文件、手填税表和手机拍摄等非数字化文档。Codex在扫描和手写场景准确率超93%,但处理旋转或纯图像页面时降至约80%。专用API表现相反,旋转和手写识别良好,扫描准确率为81%。Gemini 3.5 Flash从干净PDF的88.6%跌至扫描件的71.1%。LlamaIndex的Agentic Plus是唯一无盲区系统,在旋转、扫描和手写三项上分别达到95.9%、93.9%和93.8%。AI模型ExtractBenchCodexGemini 3.5 Flash1 个信源在谈事件专题推荐理由:LlamaIndex测了14个文档提取系统,Codex、Gemini在扫描件上都掉链子,只有Agentic Plus三项全在93%以上。原文稍后读已读值得跟进有用关注 ExtractBench
22:27Jerry Liu@jerryjliu082°LlamaIndex推出文档抽取引擎LlamaExtract Agentic Plus,在ExtractBench上达到95.6%的value accuracy。ExtractBench包含370份企业文档、4869页、67种文档类型,覆盖财务、能源、政府等领域。该基准发现,超过50页的长文档会让商业视觉语言模型的召回率跌破35%,原因是静默截断列表。LlamaExtract Agentic Plus定价约为Claude Code/Codex的25%-50%,每页成本低于最接近竞品的三分之一。AI产品LlamaExtractLlamaIndexExtractBench1 个信源在谈事件专题推荐理由:批量解析复杂企业文档?LlamaExtract比Claude Code便宜一半还更准,去LlamaParse体验。原文稍后读已读值得跟进有用关注 LlamaExtract
17:46LlamaIndex@llama_index精选ExtractBench 基准包含 370 份企业文档和 14 个提取系统。最难的测试是长列表完整性,例如 26,725 行的未认领财产清单。前沿视觉语言模型在长文档上 F1 仅为 8.9%–35.8%,精度高但召回率大幅下降。LlamaIndex 的新方案 Agentic Plus 将长文档迭代处理,在长列表任务上达到 96.1% F1。AI模型ExtractBenchLlamaIndexAgentic Plus1 个信源在谈事件专题推荐理由:LlamaIndex 搞了个 ExtractBench,测了 14 个系统,发现长文档提取召回率很低。它家 Agentic Plus 能到 96.1%,比别的都稳。原文稍后读已读值得跟进有用关注 ExtractBench
00:57Jerry Liu@jerryjliu073°LlamaParse 团队发布 36 页 ArXiv 论文,介绍企业文档抽取基准 ExtractBench。该基准用 370 份企业文档、4869 页、67 种文档类型评估 14 套抽取系统。核心发现是:超过 50 页的长文档会让商业 VLM 召回率跌到 35% 以下,原因是静默截断表格行。ExtractBench 用价值准确率、空间溯源和单页成本等指标做确定性评测,不依赖 LLM 裁判。同时发布的 LlamaParse Agentic Plus 在榜单上取得 95.6% 价值准确率,成本不到最接近竞品的三分之一。论文ExtractBenchLlamaParseAgentic Plus1 个信源在谈事件专题推荐理由:LlamaParse 发布 ExtractBench:长文档让商业模型召回崩到 35%;自家 Agentic Plus 95.6% 登顶,成本更低。原文稍后读已读值得跟进有用关注 ExtractBench
07:05Jerry Liu@jerryjliu0LlamaIndex推出ExtractBench,一个覆盖4869页、67种文档类型、8个真实领域的企业文档提取基准。该基准包含超过1k行的表格、嵌套表格、跨页表格、扫描件和手写文档等复杂情况。评测了14个系统,包括前沿VLM、编码智能体和专用提取API。关键发现是超过50页的文档中,商业VLM因静默列表截断导致召回率低于35%。同时发布LlamaParse新层级Agentic Plus,以95.6%的值准确率位居榜首,成本仅为最接近对手的三分之一。AI模型ExtractBenchLlamaIndexLlamaParse1 个信源在谈事件专题推荐理由:做文档提取的可以看看,LlamaIndex搞了个大基准,测了14个模型,发现长文档上大模型掉链子,还顺带出了个便宜又准的提取工具。原文稍后读已读值得跟进有用关注 ExtractBench
23:31Jerry Liu@jerryjliu0精选LlamaIndex 推出 ExtractBench,号称最全面的复杂企业文档信息提取基准。该基准测试了 14 个系统,包括前沿 VLM、编码智能体和专用提取 API,覆盖 370 份企业文档、4,869 页和 67 种文档类型。最大发现是超过 50 页的文档中,商业 VLM 因静默列表截断,召回率跌破 35%。ExtractBench 评估值准确率、长记录完整性、空间定位和每页成本,完全确定性且无需 LLM 评判。同时发布 LlamaParse 新层级 Agentic Plus,以 95.6% 值准确率位居榜首,成本仅为最接近对手的三分之一。AI模型ExtractBenchLlamaIndexLlamaParse1 个信源在谈事件专题推荐理由:LlamaIndex 搞了个提取基准,测了 14 个系统发现长文档上 VLM 会悄悄丢行,还顺带出了个便宜三倍的提取服务,搞文档处理的值得看看。原文稍后读已读值得跟进有用关注 ExtractBench
22:04LlamaIndex@llama_index精选LlamaIndex应用研究团队推出ExtractBench,号称最全面的企业复杂文档信息抽取基准。该基准测试了14个系统,包括前沿VLM、编程智能体和抽取API,覆盖370份企业文档、4869页和67种文档类型。评测完全确定性,不使用LLM作为裁判。最大发现是超过50页后,商业VLM的召回率跌破35%,精度虽高但会静默丢失大部分表格行。AI模型ExtractBenchLlamaIndex信息抽取1 个信源在谈事件专题推荐理由:做文档抽取的团队看过来,LlamaIndex 出了个新基准,测了14个系统在370份企业文档上的表现,发现超过50页商业模型召回率就崩了,赶紧看看你的抽取方案中招没。原文稍后读已读值得跟进有用关注 ExtractBench
11:19官方账号arXiv cs.AI@Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon SuoExtractBench是一个面向模式引导文档提取的新基准,评估集涵盖370份企业文档、4869页、8个业务领域和67种文档类型。该基准同时评测值准确性、记录完整性、来源可追溯性和成本,其中值F1对顺序不敏感。测试发现,商业VLM在短文档上表现良好,但在长文档上常截断记录列表;编码智能体准确率更高但成本明显更高。LlamaExtract Agentic Plus在三个指标上均排第一,成本仅为编码智能体的很小一部分。论文ExtractBenchLlamaExtract企业文档提取推荐理由:Llamaindex出的ExtractBench基准测文档提取。商业VLM长文档会截断,LlamaExtract Agentic Plus更准还更便宜。原文稍后读已读值得跟进有用关注 ExtractBench