10:40Jerry Liu@jerryjliu073°ExtractBench已在Kaggle上线,测试了5.6 Sol、OpenAI模型、Gemini 3 Flash和Opus 5等前沿模型在文档提取任务中的表现。该基准测试涵盖370个企业文档,涉及8个商业领域和67种文档类型,包括长记录列表、噪声扫描、手写和复杂表格等。LlamaParse作为专用提取工具,在价格/性能前沿提供基础引用功能。AI模型ExtractBench5.6 SolLlamaParse8 个信源在谈事件专题推荐理由:Llama团队发布了ExtractBench基准,测试了5.6 Sol等模型在复杂文档提取上的表现,还对比了LlamaParse等工具。原文稍后读已读值得跟进有用关注 ExtractBench
07:37Jerry Liu@jerryjliu0LlamaParse新增表单模式功能,可处理半结构化文档如表格。该模式无需预先定义精确schema,直接上传表格即可提取markdown和键值对。LlamaParse由LlamaIndex公司开发,专注于文档解析与结构化输出。AI产品LlamaParseLlamaIndex半结构化文档推荐理由:LlamaIndex新推表单模式,上传表格自动提取键值对,比传统OCR更省事。原文稍后读已读值得跟进有用关注 LlamaParse
00:23LlamaIndex@llama_index73°ExtractBench基准测试已在Kaggle平台上线,专门测试文档提取能力。该基准测试涵盖8个商业领域的370份企业文档,包括67种文档类型。测试重点针对可能破坏下游代理和工作流程的文档,如长记录列表、噪声扫描、手写体和复杂表格。LlamaParse、Codex、Claude Code等工具参与了性能对比。论文ExtractBenchKaggleLlamaParse1 个信源在谈事件专题推荐理由:LlamaIndex在Kaggle上线了ExtractBench基准,测试370份企业文档的提取能力,看看各工具表现如何。原文稍后读已读值得跟进有用关注 ExtractBench
10:03Jerry Liu@jerryjliu0精选专业OCR模型如LlamaParse能处理复杂文档,减少幻觉,使用微调VLM覆盖多种文档类型。开源VLM如Paddle、MinerU适合简单文档和基础视觉推理,但质量不稳定。免费开源库如liteparse仅作快速文本提取,不支持复杂推理,不适合检索使用。ParseBench已评测92种工具。AI产品OCRLlamaParseVLM推荐理由:Jerry Liu对比了三类OCR工具,专业模型处理复杂文档更可靠,免费工具可能丢失内容。原文稍后读已读值得跟进有用关注 OCR
01:59Jerry Liu@jerryjliu0LlamaIndex官方发布Claude连接器,支持解析复杂表格、图表和密集表单。该连接器可将文档转换为干净的结构化Markdown、JSON或HTML格式。用户可提取特定字段到自定义模式,支持文档集合搜索和分类分割。连接器已在Claude Connectors Directory上线。AI产品LlamaParseClaudeLlamaIndex推荐理由:LlamaIndex为Claude推出官方连接器,能高效处理复杂PDF和表格,比直接喂给模型更省成本且减少幻觉。原文稍后读已读值得跟进有用关注 LlamaParse
00:53LlamaIndex@llama_index精选LlamaParse已正式成为Claude平台的验证连接器。该连接器可将复杂PDF、表格和图表转换为结构化数据。用户可将其解析为Markdown、JSON或HTML格式。连接器还支持字段提取和文档集合搜索功能。AI产品LlamaParseClaude文档解析推荐理由:LlamaParse现在可以在Claude上使用,帮你处理那些乱七八糟的PDF表格,还能直接提取数据到你的系统里。原文稍后读已读值得跟进有用关注 LlamaParse
02:16Jerry Liu@jerryjliu0精选LlamaParse引入了原生智能体电子表格提取功能,可处理任意行列数的复杂表格。该功能通过调整的智能体引擎实现大规模模式引导提取,准确率极高。用户可在高级处理选项中开启"电子表格提取",将资产负债表等密集表格提取为结构化数据。AI产品LlamaParse电子表格提取智能体推荐理由:LlamaParse新增电子表格提取功能,能准确处理复杂表格结构,比传统OCR更适合电子表格格式。原文稍后读已读值得跟进有用关注 LlamaParse
22:06LlamaIndex@llama_indexLlamaParse平台新增原生电子表格提取功能,直接读取原始单元格数据而非将表格扁平化为文本。该功能支持.xlsx、.xls和.csv文件,已在agentic_plus层级的beta版本中可用。传统工具将电子表格视为PDF处理,会丢失表头、公式、合并单元格和隐藏行等重要结构信息。AI产品LlamaParse电子表格数据处理1 个信源在谈事件专题推荐理由:LlamaParse现在能直接读取Excel表格原始数据,不再丢失结构信息,比传统工具更准确处理电子表格。原文稍后读已读值得跟进有用关注 LlamaParse
21:55Jerry Liu@jerryjliu0精选LlamaParse平台新增原生智能体电子表格提取功能,可处理任意行列数的表格。该功能通过调整的智能引擎直接读取原始单元格,而非将表格扁平化为文本。目前已在agentic_plus层级的beta版本中可用,支持.xlsx、.xls和.csv文件格式。AI产品LlamaParse电子表格LlamaIndex1 个信源在谈事件专题推荐理由:LlamaParse上线原生电子表格提取,直接读取单元格数据而非文本转换,比传统方法更准确处理复杂表格。原文稍后读已读值得跟进有用关注 LlamaParse
17:01Jerry Liu@jerryjliu0精选LlamaParse针对企业文档提供精确解析,支持表单检测、字段识别和复选框标记。该技术能直接输出结构化信息,无需额外LLM提取步骤。精确边界框技术为各类文档提供可靠引用来源。LlamaParse在文档子类型上的准确率/成本表现优于前沿模型。AI产品LlamaParsePDF解析表单识别推荐理由:LlamaParse让PDF解析更精准,直接提取表单结构信息,比其他模型更省成本。原文稍后读已读值得跟进有用关注 LlamaParse
10:35Jerry Liu@jerryjliu0精选LlamaIndex发布文档提取基准测试,评估了多种系统,包括VLMs和LlamaParse,覆盖370个企业文档和67种文档类型。CTO和联合创始人Simon Suo将进行技术讲解,探讨提取难度、现有基准测试的不足以及成本与准确性的权衡。论文LlamaIndex文档提取基准测试推荐理由:LlamaIndex发布文档提取基准测试,全面评估多种系统,了解提取难度和成本与准确性的权衡,不容错过!原文稍后读已读值得跟进有用关注 LlamaIndex
06:45Jerry Liu@jerryjliu0LlamaParse 模型新增功能,可提取 Word 风格的文档修订记录与评论。该功能可将修订历史和变更信息作为结构化元数据,附加到解析后的 markdown 内容中。这让下游 AI 助手能获取文档的完整修订历史,而非仅最新的静态快照。AI模型LlamaParse文档修订markdown解析推荐理由:LlamaParse 新加文档修订跟踪功能,能把修订记录整理成结构化数据,和之前没这功能的工具不一样,现在能查历史修改啦。原文稍后读已读值得跟进有用关注 LlamaParse
00:17LlamaIndex@llama_index精选72°传统解析器常将修订痕迹视为噪音,导致被删除的条款被错误识别为有效文本。LlamaParse 现已支持处理文档的修订跟踪功能。该工具能输出文档最终状态的干净 Markdown,并提供包含作者、内容及位置的结构化修订数据。这项功能适用于处理合同、监管提交文件及政策草案中的红线修订。AI产品LlamaParseLlamaIndexRAG推荐理由:LlamaParse 新增识别修订痕迹功能,处理合同和法规文件时能准确区分删除内容。原文稍后读已读值得跟进有用关注 LlamaParse
00:08Jerry Liu@jerryjliu0精选78°LlamaIndex发布ExtractBench基准,专门评估文档提取的视觉定位能力。测试显示,通用视觉模型和编码智能体在返回证据时得分为零,而专用VLM文档工具LlamaParse表现领先。LlamaExtract Agentic Plus在页面级F1达84.9%,词级46.4%,长文档上保持87.1%,其他系统在长文档上跌至0%。基准要求字段值和引用都正确才算分,词级框IoU需达0.5。AI模型LlamaParseExtractBenchLlamaIndex1 个信源在谈事件专题推荐理由:做PDF智能体的话,这个基准和工具值得看。通用模型定位不行,LlamaParse能精确到词级框,长文档也不掉链子。原文稍后读已读值得跟进有用关注 LlamaParse
06:08Jerry Liu@jerryjliu0精选LlamaIndex发布LlamaExtract Agentic Plus模式,专为50页以上长文档设计,可提取10k-100k个字段,准确率超过94%。每个提取字段附带置信度分数和边界框,便于溯源。在ExtractBench基准测试中,该模式比Claude Code Opus 4.8和Codex GPT-5.6等通用编码智能体准确率高10-20%。测试案例包括一份FTX债权人矩阵,含75k个字段、共114页。AI产品LlamaExtractLlamaParse文档提取1 个信源在谈事件专题推荐理由:LlamaIndex给LlamaParse加了新模式,专门抽长文档里的海量字段,准确率比Claude Code和Codex高10-20%,每个字段还带出处。原文稍后读已读值得跟进有用关注 LlamaExtract
06:56Jerry Liu@jerryjliu0精选LlamaParse推出新的Agentic Plus抽取模式,面向100-500页长文档,可提取10k-100k个字段,并在FTX债权人矩阵测试中处理了75k字段、114页文档。配套发布的ExtractBench基准覆盖370份企业文档、4,869页、67种类型,评估了14套系统。测试显示,超过50页后商用VLM的召回率低于35%,主要因为静默截断列表。Agentic Plus在该基准上以95.6%的值准确率排名第一,成本不到最接近对手的三分之一。AI产品LlamaParseExtractBenchAgentic Plus1 个信源在谈事件专题推荐理由:LlamaParse新出的Agentic Plus能一次抽几万字段,长文档不丢行,成本还比同类低一大截。原文稍后读已读值得跟进有用关注 LlamaParse
05:57Jerry Liu@jerryjliu0精选ExtractBench是面向复杂企业文档提取的基准,包含370份文档、4869页和67种文档类型。它评估了14个系统,包括前沿VLM、编程智能体和专用提取API。结果显示,超过50页的文档中,商业VLM的召回率低于35%,主要问题是静默截断列表。LlamaParse新推出的Agentic Plus层级在基准上达到95.6%的值准确率,成本不到最接近竞争对手的三分之一。论文ExtractBenchLlamaParseAgentic Plus1 个信源在谈事件专题推荐理由:LlamaParse搞了个ExtractBench,测出来商业VLM处理长文档会漏数据;他们新出的Agentic Plus准确率95.6%,成本还低。做文档提取的可以看下。原文稍后读已读值得跟进有用关注 ExtractBench
17:49Jerry Liu@jerryjliu0LlamaParse 是 LlamaIndex 推出的文档提取工具。用户可通过 login.llamaindex.ai 注册使用。该消息由 Jerry Liu 通过 X 平台发布,获得 375 次浏览。AI产品LlamaParseLlamaIndex文档提取推荐理由:Jerry Liu 在推上邀请大家注册 LlamaParse,做文档提取用的,想试的直接点链接。原文稍后读已读值得跟进有用关注 LlamaParse
00:57Jerry Liu@jerryjliu073°LlamaParse 团队发布 36 页 ArXiv 论文,介绍企业文档抽取基准 ExtractBench。该基准用 370 份企业文档、4869 页、67 种文档类型评估 14 套抽取系统。核心发现是:超过 50 页的长文档会让商业 VLM 召回率跌到 35% 以下,原因是静默截断表格行。ExtractBench 用价值准确率、空间溯源和单页成本等指标做确定性评测,不依赖 LLM 裁判。同时发布的 LlamaParse Agentic Plus 在榜单上取得 95.6% 价值准确率,成本不到最接近竞品的三分之一。论文ExtractBenchLlamaParseAgentic Plus1 个信源在谈事件专题推荐理由:LlamaParse 发布 ExtractBench:长文档让商业模型召回崩到 35%;自家 Agentic Plus 95.6% 登顶,成本更低。原文稍后读已读值得跟进有用关注 ExtractBench
07:05Jerry Liu@jerryjliu0LlamaIndex推出ExtractBench,一个覆盖4869页、67种文档类型、8个真实领域的企业文档提取基准。该基准包含超过1k行的表格、嵌套表格、跨页表格、扫描件和手写文档等复杂情况。评测了14个系统,包括前沿VLM、编码智能体和专用提取API。关键发现是超过50页的文档中,商业VLM因静默列表截断导致召回率低于35%。同时发布LlamaParse新层级Agentic Plus,以95.6%的值准确率位居榜首,成本仅为最接近对手的三分之一。AI模型ExtractBenchLlamaIndexLlamaParse1 个信源在谈事件专题推荐理由:做文档提取的可以看看,LlamaIndex搞了个大基准,测了14个模型,发现长文档上大模型掉链子,还顺带出了个便宜又准的提取工具。原文稍后读已读值得跟进有用关注 ExtractBench
23:31Jerry Liu@jerryjliu0精选LlamaIndex 推出 ExtractBench,号称最全面的复杂企业文档信息提取基准。该基准测试了 14 个系统,包括前沿 VLM、编码智能体和专用提取 API,覆盖 370 份企业文档、4,869 页和 67 种文档类型。最大发现是超过 50 页的文档中,商业 VLM 因静默列表截断,召回率跌破 35%。ExtractBench 评估值准确率、长记录完整性、空间定位和每页成本,完全确定性且无需 LLM 评判。同时发布 LlamaParse 新层级 Agentic Plus,以 95.6% 值准确率位居榜首,成本仅为最接近对手的三分之一。AI模型ExtractBenchLlamaIndexLlamaParse1 个信源在谈事件专题推荐理由:LlamaIndex 搞了个提取基准,测了 14 个系统发现长文档上 VLM 会悄悄丢行,还顺带出了个便宜三倍的提取服务,搞文档处理的值得看看。原文稍后读已读值得跟进有用关注 ExtractBench
10:32Jerry Liu@jerryjliu0精选LlamaIndex CEO Jerry Liu称,Gemini 3 Flash是当前原始文档解析最强的前沿模型,但Flash系列涨价3倍,视觉识别能力停滞。GPT-5.5到5.6、Gemini 3.5 Flash到3.6 Flash、Opus 4.8到5的迭代均未提升文档理解基准。混合方案如LlamaParse结合专用VLM与文本引擎,表格和图表准确率提升15%。LlamaParse推出ParseBench评测框架,用户可在parsebench.ai配置自有文档测试。AI产品LlamaParseGemini 3 FlashOpenAI10 个信源在谈事件专题推荐理由:Jerry Liu说别急着用前沿模型做文档OCR,LlamaParse在表格图表上准确率涨了15%,还能自己搭ParseBench跑评测。原文稍后读已读值得跟进有用关注 LlamaParse
05:25Jerry Liu@jerryjliu0精选LiteParse 现在可在毫秒级从 PDF 中提取复选框状态、标注、矢量图形和词级边界框。它是目前功能最全的免费开源文档处理器,可接入编码智能体,提供源文档的上下文和引用回归。对于扫描页、多栏文本、表格等复杂文档,LiteParse 会通过内置路由器转向 VLM 方案(如 LlamaParse)。LiteParse 还输出复杂度信号,告诉用户哪些页面需要视觉模型处理。AI产品LiteParseLlamaIndexLlamaParse推荐理由:PDF 里的复选框、批注、矢量图,LiteParse 免费开源毫秒级提取,复杂页面自动转交 LlamaParse。原文稍后读已读值得跟进有用关注 LiteParse
01:13Jerry Liu@jerryjliu0精选LlamaParse推出表单自动提取功能,设置processing_options.forms='enrich'即可从复杂表单中提取全部字段与值,输出结构化JSON。该功能无需预定义schema,能自动检测每个表单键和对应值,未填写字段返回空白。同时支持识别复选框状态,并附带标准markdown输出。目前该功能以beta形式对所有付费计划开放。AI产品LlamaParseLlamaIndex表单解析推荐理由:LlamaParse现在能把W-2这类表单直接变成JSON,不用写schema,调一个参数就行,省掉一条解析管线。原文稍后读已读值得跟进有用关注 LlamaParse
02:47Jerry Liu@jerryjliu0精选LlamaIndex发布博客称,前沿模型在文档理解性能上趋于平缓,GPT-5.5到5.6、Gemini 3.5到3.6、Opus 4.8到5的视觉理解基准无明显提升。跨三个GPT世代,解析准确率仅提升约24点,而每页成本翻了4倍。LlamaParse通过代理模式和低成本模式,在密集表格和图表等复杂边界情况上超越了前沿模型。该公司表示,可将前沿模型蒸馏为参数效率更高的模型,以更低成本实现同等性能。AI产品LlamaParseLlamaIndexOCR推荐理由:LlamaIndex用数据反驳“OCR只是功能”,说LlamaParse比GPT等前沿模型更准更便宜,做文档解析的可以看看。原文稍后读已读值得跟进有用关注 LlamaParse
22:09LlamaIndex@llama_indexLlamaIndex发布LiteParse更新,无需视觉模型即可从PDF中提取表单字段值、勾选状态、注释、嵌入图像、矢量图形等结构化数据。处理速度达到每页毫秒级。对于需要模型处理的页面,LiteParse会输出复杂度信号,标记扫描页、多栏文本、表格和密集图形,帮助用户把解析任务路由到LlamaParse等工具。AI产品LiteParseLlamaIndexPDF解析推荐理由:LiteParse能直接读PDF勾选框和表单字段,毫秒级,还告诉你何时该用LlamaParse。原文稍后读已读值得跟进有用关注 LiteParse
06:18Jerry Liu@jerryjliu0LlamaIndex 发布 Parse Gateway,用 LiteParse 的 is_complex 功能逐页评估 PDF 复杂度。干净文本页由 LiteParse 免费进程内解析,扫描、表格、乱码和复杂图表页路由到 LlamaParse 更高层级。Parse Gateway 还提供 MCP 服务器,智能体可自行估算复杂度并选择解析层级。这样能避免为简单页面支付 LlamaParse 的价格,同时不牺牲复杂页面的解析准确率。AI产品Parse GatewayLlamaIndexLiteParse推荐理由:PDF 解析也可以按页挑工具了,简单页面免费,复杂页面才上 LlamaParse,省心又省钱。原文稍后读已读值得跟进有用关注 Parse Gateway
06:05Jerry Liu@jerryjliu0LlamaIndex 发布 Parse Gateway,基于 LiteParse 的 is_complex 功能逐页判断文档复杂度。简单文本页面路由到免费、快速的文本解析器;复杂页面(含扫描、表格、图表等)路由到 LlamaParse 的 agentic 或 agentic plus 模式。该方案取代了传统的一刀切管道,在降低解析成本的同时保持高准确率。Parse Gateway 代码已开源,并集成到 MCP 服务器供智能体自主调用。AI产品LlamaIndexParse GatewayLiteParse推荐理由:LlamaIndex 做的 Parse Gateway 能根据每页复杂度自动选解析模式,简单页免费处理,复杂页用高级版,省成本又不牺牲准确率。原文稍后读已读值得跟进有用关注 LlamaIndex
02:03Jerry Liu@jerryjliu0LlamaIndex 旗下的文档解析工具 LlamaParse 推出了官方批量解析体验。用户不再需要逐个文件调用 API,而是可以一次性创建包含最多 10000 个文件的批次。新功能提供了专用 UI 界面,支持审计整个批次、查看失败任务并浏览完整结果集。这提升了可靠性和代码可维护性,用户无需再自行编写异步服务来调用 API。该功能已在所有付费计划中可用。AI产品LlamaParseLlamaIndex文档解析推荐理由:LlamaParse 现在可以直接在 UI 里批量解析一万个文件,不用再写脚本了,查错和看结果都很方便。原文稍后读已读值得跟进有用关注 LlamaParse
01:17LlamaIndex@llama_indexLlamaIndex 在 LlamaParse UI 中新增批量解析功能,用户无需编写代码即可一次性解析或提取最多 10,000 个文件。只需指定文件夹即可开始,所有付费计划用户均可使用。该功能将原本需要编写 API 脚本的工作简化为一个按钮操作。AI产品LlamaIndexLlamaParse批量解析推荐理由:LlamaIndex 把批量解析做成了 UI 按钮,不用写脚本,最多一次处理1万个文件,省时省力。原文稍后读已读值得跟进有用关注 LlamaIndex
02:05Jerry Liu@jerryjliu071°Opus 5系统卡PDF共193页,包含大量标签和未标注图表。LlamaParse在agentic模式下每页1.25美分,agentic plus模式下5.6美分,解析各类线图和柱状图准确率接近100%。相比之下,Opus 5自身解析图表准确率下降20-30%,成本每页8美分至33美分以上。LlamaParse生成的机器可读数据可直接喂给下游系统。AI产品LlamaParseOpus 5Claude10 个信源在谈事件专题推荐理由:LlamaParse解析PDF图表又快又准,比用Opus 5自己解析便宜好几倍,还更靠谱。原文稍后读已读值得跟进有用关注 LlamaParse
07:56Jerry Liu@jerryjliu0精选Opus 5在ParseBench文档理解基准上总体与Opus 4.8持平,在密集表格上差几分,在图表和视觉定位上略好。Gemini 3.6 Flash在表格上更优,图表略差,价格是Opus 5的一半。LlamaParse agentic在所有方面(包括表格)表现更好,价格仅为Opus 5的1/6。作者建议Opus 5适合编码和知识工作,但每页8美分且OCR平均,不适合大规模文档解析。AI模型Opus 5ParseBenchGemini 3.6 Flash10 个信源在谈事件专题推荐理由:Opus 5文档理解还行,但别拿它批处理PDF——每页8美分,效果不如便宜很多的Gemini Flash和LlamaParse。编码和知识工作倒挺香。原文稍后读已读值得跟进有用关注 Opus 5
14:14Jerry Liu@jerryjliu0LlamaParse 成功解析了一篇关于 Dinitz-Garg-Goemans 猜想的数学论文 PDF,该猜想已被证明为假,这是一个存在约 30 年的图论问题。论文中展示了图形(图例中 fractional flow cost 为 58,任何不可分流的流量(容量违规 ≤15)成本至少为 60)。该结果来源于与 GPT 5.6 Pro 的对话。LlamaParse 展示了将复杂学术 PDF 转为可解析文本的能力。AI产品LlamaParseLlamaIndexPDF解析推荐理由:LlamaParse 连这种数学猜想论文的 PDF 都能解析,试试用它读你手头那些难搞的论文?原文稍后读已读值得跟进有用关注 LlamaParse
02:21Jerry Liu@jerryjliu0精选LlamaParse 改进了文档解析中的边界框功能,现在支持区域级、行级和单词级三层边界框。用户可以根据需求选择不同粒度来对文本进行溯源,例如审计发票中的具体数字或定位研究报告中的图表。该功能已在 LlamaParse 云端服务中可用。AI产品LlamaParseLlamaIndex文档解析推荐理由:LlamaParse 更新了文档解析的边界框,支持按区域、行、单词定位文本,方便审计和研究场景。原文稍后读已读值得跟进有用关注 LlamaParse
01:42Jerry Liu@jerryjliu0精选LlamaParse 推出了四个文档检索端点:混合搜索(grep + vector search)、文件 grep(支持正则)、文件 find 和文件 read。这些端点旨在提升代理在非结构化文档上的检索质量。团队持续实验不同组合,以找到最高检索效果的方案。同时强调构建生产级检索系统需要调优分块、同步、重排序、工具 API 设计等工程细节。AI产品LlamaParse文档检索混合搜索推荐理由:LlamaParse 刚把搜索工具升级了,能同时用 grep 和向量搜索,还支持文件查找和读取。做文档检索的人可以试试这新接口。原文稍后读已读值得跟进有用关注 LlamaParse
07:47Jerry Liu@jerryjliu0精选LlamaIndex 团队在旧金山举办全员线下会议,宣布向 AI 智能体文档基础设施方向演进。其基准 ParseBench 已包含 2000+ 企业页面,约 80 个解决方案通过验证,每月下载量达 1.5 万。轻量解析器 liteparse 在约 2 个月内收获 11.5k+ GitHub 星星。LlamaParse 推出 agentic 和 cost-effective 两种模式,定义了基于 VLM 的 OCR 解决方案的帕累托前沿。团队计划在 Q3 大幅提升 ParseBench 的垂直领域数据集和任务覆盖范围。AI产品LlamaIndexLlamaParseliteparse推荐理由:LlamaIndex 团队发了几款文档解析工具的进展和基准数据,特别是 liteparse 两个月就冲到 1.1 万星,很能打。原文稍后读已读值得跟进有用关注 LlamaIndex
06:19Jerry Liu@jerryjliu0精选LlamaIndex 本周与一家全球公司会面后,加速成为 AI 代理的文档基础设施。ParseBench 基准已覆盖 2000+ 企业页面,验证约 80 个解决方案,每月 15k 次下载,在 HuggingFace 和 Kaggle 可用。LlamaParse 的 agentic 和成本效益模式直接定义 VLM 基 OCR 解决方案的帕累托前沿,每天改进复杂表格、图表、字体和布局。免费解析器 liteparse 在约 2 个月内获得 11.5k+ GitHub 星标。AI产品LlamaIndexParseBenchLlamaParse推荐理由:LlamaIndex 在文档处理上发力,ParseBench 基准和 LlamaParse 实用,liteparse 免费且明星增长快。原文稍后读已读值得跟进有用关注 LlamaIndex
01:46Jerry Liu@jerryjliu0LlamaParse 发布 Conversational Extract 功能,用户可通过自然语言对话定义文档提取字段,无需手写 JSON Schema。用户上传参考文档后,AI agent 自动推断 schema,支持对话交互调整。系统可在规模达 100 万以上的文档上运行提取,为每个字段返回 bounding boxes、引用和置信度分数。AI产品LlamaParseLlamaIndex文档提取推荐理由:LlamaParse 出了新功能,跟聊天一样定义要提取什么字段,不用再手写 JSON schema 了,还能一键跑百万级文档,带引用和置信度。原文稍后读已读值得跟进有用关注 LlamaParse
06:24LlamaIndex@llama_indexLlamaIndex 发布 LlamaParse 的新功能 Conversational Extract,用户只需上传文档,AI agent 即可自动生成 JSON Schema。支持通过对话进行修改,也提供模板直接使用。该功能替代了手动编写提取 schema 的流程,目前已在 cloud.llamaindex.ai 上线。AI产品LlamaIndexLlamaParseConversational Extract推荐理由:LlamaIndex 刚上线了一个新功能,你不用再手写 JSON Schema 了,上传文档或者聊几句就能自动生成提取模板,太方便了。原文稍后读已读值得跟进有用关注 LlamaIndex
06:15Jerry Liu@jerryjliu0Jerry Liu指出,并非所有任务都需要前沿智能(如5.6 Sol xhigh),每个任务都存在最优模型+配置组合。LlamaIndex团队投资大量研究构建自动路由、微调布局模型和专门处理表格、图表、手写等模型。这些研究使LlamaParse成为文档处理服务领域在准确率、成本和延迟的帕累托前沿上最优的选择。他强调初创公司构建专业化、领域特定的工作流程仍有巨大空间。AI产品LlamaParseLlamaIndex文档OCR推荐理由:Jerry Liu分享文档处理思路,LlamaParse针对表格、图表等优化,比通用模型更准更快,值得做文档处理的团队看看。原文稍后读已读值得跟进有用关注 LlamaParse