00:53LlamaIndex@llama_index精选ExtractBench对文档提取API的溯源能力进行了严格评测:字段的值及其引用必须同时正确才计分。结果显示,VLM和编码智能体完全不返回证据,两层得分均为零。在能返回框的系统中,最佳词级F1仍低于50%。某专用API在短文档上页面级F1为61.7%,长文档上直接降到0.0%。LlamaExtract Agentic Plus在页面级和词级分别达到84.9%和46.4%,长文档上仍保持87.1%。AI模型ExtractBenchLlamaExtract文档提取1 个信源在谈事件专题推荐理由:想用文档提取API?先看ExtractBench的溯源评测。多数工具给不出出处,LlamaExtract Agentic Plus在长文档上还挺得住。原文稍后读已读值得跟进有用关注 ExtractBench
06:08Jerry Liu@jerryjliu0精选LlamaIndex发布LlamaExtract Agentic Plus模式,专为50页以上长文档设计,可提取10k-100k个字段,准确率超过94%。每个提取字段附带置信度分数和边界框,便于溯源。在ExtractBench基准测试中,该模式比Claude Code Opus 4.8和Codex GPT-5.6等通用编码智能体准确率高10-20%。测试案例包括一份FTX债权人矩阵,含75k个字段、共114页。AI产品LlamaExtractLlamaParse文档提取1 个信源在谈事件专题推荐理由:LlamaIndex给LlamaParse加了新模式,专门抽长文档里的海量字段,准确率比Claude Code和Codex高10-20%,每个字段还带出处。原文稍后读已读值得跟进有用关注 LlamaExtract
22:27Jerry Liu@jerryjliu082°LlamaIndex推出文档抽取引擎LlamaExtract Agentic Plus,在ExtractBench上达到95.6%的value accuracy。ExtractBench包含370份企业文档、4869页、67种文档类型,覆盖财务、能源、政府等领域。该基准发现,超过50页的长文档会让商业视觉语言模型的召回率跌破35%,原因是静默截断列表。LlamaExtract Agentic Plus定价约为Claude Code/Codex的25%-50%,每页成本低于最接近竞品的三分之一。AI产品LlamaExtractLlamaIndexExtractBench1 个信源在谈事件专题推荐理由:批量解析复杂企业文档?LlamaExtract比Claude Code便宜一半还更准,去LlamaParse体验。原文稍后读已读值得跟进有用关注 LlamaExtract
11:19官方账号arXiv cs.AI@Boyang Zhang, Adrian Lyjak, Eli Stewart, Zhaoqi Li, Simon SuoExtractBench是一个面向模式引导文档提取的新基准,评估集涵盖370份企业文档、4869页、8个业务领域和67种文档类型。该基准同时评测值准确性、记录完整性、来源可追溯性和成本,其中值F1对顺序不敏感。测试发现,商业VLM在短文档上表现良好,但在长文档上常截断记录列表;编码智能体准确率更高但成本明显更高。LlamaExtract Agentic Plus在三个指标上均排第一,成本仅为编码智能体的很小一部分。论文ExtractBenchLlamaExtract企业文档提取推荐理由:Llamaindex出的ExtractBench基准测文档提取。商业VLM长文档会截断,LlamaExtract Agentic Plus更准还更便宜。原文稍后读已读值得跟进有用关注 ExtractBench