00:33Jerry Liu@jerryjliu0Fable 5.1在ParseBench基准测试中表现优于前代Fable 5。ParseBench包含2000多份来自金融、法律、保险等领域的真实世界文档。Fable 5.1在表格忠实度、内容忠实度、格式、图表和视觉定位等指标上全面领先。它是近期少数在文档OCR性能上实现模型代际提升的前沿模型之一。AI模型FableFable 5.1ParseBench推荐理由:Fable 5.1在文档解析任务上超越前代,但单独使用成本较高,每页15美分,比LlamaParse贵10-15倍。原文稍后读已读值得跟进有用关注 Fable
10:03Jerry Liu@jerryjliu0精选专业OCR模型如LlamaParse能处理复杂文档,减少幻觉,使用微调VLM覆盖多种文档类型。开源VLM如Paddle、MinerU适合简单文档和基础视觉推理,但质量不稳定。免费开源库如liteparse仅作快速文本提取,不支持复杂推理,不适合检索使用。ParseBench已评测92种工具。AI产品OCRLlamaParseVLM推荐理由:Jerry Liu对比了三类OCR工具,专业模型处理复杂文档更可靠,免费工具可能丢失内容。原文稍后读已读值得跟进有用关注 OCR
01:25Jerry Liu@jerryjliu0Perplexity博客发布新工具ParseBench,用于评估模型解析能力,提供详细基准数据,支持多种模型和任务。AI模型PerplexityParseBench模型解析推荐理由:Perplexity发布了ParseBench,可以评估模型解析能力,是了解模型性能的好工具。原文稍后读已读值得跟进有用关注 Perplexity
03:18Jerry Liu@jerryjliu0精选In schema-guided complex document extraction, coding agents like Claude Code and Codex serve as cost-effective baselines for longer documents, offering similar accuracy to specialized OCR tools. On short documents, specialized OCR tools are more cost-efficient. Coding agents excel in long documents by leveraging various tools and prompt caching, though they may be less efficient for shorter texts compared to specialized extractors. Learn more in the ParseBench paper.论文文档提取编码代理复杂文档推荐理由:想了解文档提取新方法的朋友,这篇论文探讨了编码代理在复杂文档提取中的表现,值得一读。它比较了不同工具在长文档和短文档中的表现,揭示了编码代理的优势和局限性。原文稍后读已读值得跟进有用关注 文档提取
07:56Jerry Liu@jerryjliu0精选Opus 5在ParseBench文档理解基准上总体与Opus 4.8持平,在密集表格上差几分,在图表和视觉定位上略好。Gemini 3.6 Flash在表格上更优,图表略差,价格是Opus 5的一半。LlamaParse agentic在所有方面(包括表格)表现更好,价格仅为Opus 5的1/6。作者建议Opus 5适合编码和知识工作,但每页8美分且OCR平均,不适合大规模文档解析。AI模型Opus 5ParseBenchGemini 3.6 Flash10 个信源在谈事件专题推荐理由:Opus 5文档理解还行,但别拿它批处理PDF——每页8美分,效果不如便宜很多的Gemini Flash和LlamaParse。编码和知识工作倒挺香。原文稍后读已读值得跟进有用关注 Opus 5
10:12Jerry Liu@jerryjliu0精选对比 Gemini 3.6 Flash 与 Gemini 3.5 Flash Lite 在文档理解上的表现,参照 Gemini 3.5 Flash 和 Gemini 3.1 Flash Lite。3.6 Flash 在图表理解上下降 14%,3.5 Flash Lite 在布局检测提升 11% 但表格倒退约 12%。总体显示后续版本侧重编码与推理,视觉认知能力持平。数据来源 ParseBench。AI模型Gemini 3.6 FlashGemini 3.5 Flash Lite文档理解10 个信源在谈事件专题推荐理由:看看新版 Gemini 在文档理解上表现如何:3.6 Flash 图表降了,3.5 Flash Lite 布局好但表格差,整体视觉变化不大值你关注。原文稍后读已读值得跟进有用关注 Gemini 3.6 Flash
07:47Jerry Liu@jerryjliu0精选LlamaIndex 团队在旧金山举办全员线下会议,宣布向 AI 智能体文档基础设施方向演进。其基准 ParseBench 已包含 2000+ 企业页面,约 80 个解决方案通过验证,每月下载量达 1.5 万。轻量解析器 liteparse 在约 2 个月内收获 11.5k+ GitHub 星星。LlamaParse 推出 agentic 和 cost-effective 两种模式,定义了基于 VLM 的 OCR 解决方案的帕累托前沿。团队计划在 Q3 大幅提升 ParseBench 的垂直领域数据集和任务覆盖范围。AI产品LlamaIndexLlamaParseliteparse推荐理由:LlamaIndex 团队发了几款文档解析工具的进展和基准数据,特别是 liteparse 两个月就冲到 1.1 万星,很能打。原文稍后读已读值得跟进有用关注 LlamaIndex
06:19Jerry Liu@jerryjliu0精选LlamaIndex 本周与一家全球公司会面后,加速成为 AI 代理的文档基础设施。ParseBench 基准已覆盖 2000+ 企业页面,验证约 80 个解决方案,每月 15k 次下载,在 HuggingFace 和 Kaggle 可用。LlamaParse 的 agentic 和成本效益模式直接定义 VLM 基 OCR 解决方案的帕累托前沿,每天改进复杂表格、图表、字体和布局。免费解析器 liteparse 在约 2 个月内获得 11.5k+ GitHub 星标。AI产品LlamaIndexParseBenchLlamaParse推荐理由:LlamaIndex 在文档处理上发力,ParseBench 基准和 LlamaParse 实用,liteparse 免费且明星增长快。原文稍后读已读值得跟进有用关注 LlamaIndex
11:59LlamaIndex@llama_index88°OpenAI今日发布GPT 5.6系列模型。Llama Index在ParseBench基准上进行测试,评估文档理解能力。新模型在阅读文本和表格方面表现优异,但在图表和布局上仍有困难。Luna版本比Sol版本便宜约6倍,但性能下降微小,表明增加推理token不一定改善视觉理解。AI模型GPT 5.6OpenAIParseBench10 个信源在谈事件专题推荐理由:OpenAI刚发了GPT 5.6,Llama Index实测:读文字表格很强,看图表还差点意思。便宜6倍的Luna版性价比很香。原文稍后读已读值得跟进有用关注 GPT 5.6
07:50Jerry Liu@jerryjliu0精选OpenAI 发布 GPT-5.6 Sol 和 Luna 两个版本。在 ParseBench 上全面测试文档理解,GPT-5.6 Sol 在表格、文本、图表、布局等指标上与 GPT-5.5 性能持平。模型擅长读取文本和表格,但依旧在图表转录和布局边界框提取上表现不佳。Luna 成本仅为 Sol 的 1/6,在所有度量上只有轻微下降。AI模型GPT-5.6OpenAIParseBench10 个信源在谈事件专题推荐理由:OpenAI 新 GPT-5.6 文档理解跑分出炉,Sol 没提升但 Luna 便宜六倍,值得看具体差距。原文稍后读已读值得跟进有用关注 GPT-5.6
08:26Jerry Liu@jerryjliu0精选Jerry Liu 发布了 Mistral OCR 在 ParseBench 上的更新结果。该模型的总体得分超过了 GPT-5.5,仅略低于 Gemini 3.1 Pro。在内容忠实度、语义格式和视觉定位方面表现优秀,在表格处理上表现一般,图表能力有限。这些结果展示了该价格区间内模型的竞争力。AI模型Mistral OCRGPT-5.5Gemini 3.1 Pro推荐理由:Mistral OCR 在 ParseBench 上打败了 GPT-5.5,离 Gemini 3.1 Pro 也不远,价格还便宜,做文档解析很值。原文稍后读已读值得跟进有用关注 Mistral OCR
01:18Jerry Liu@jerryjliu0精选Mistral OCR 在 ParseBench 上与多个前沿和开源权重模型进行对比测试。它在语义格式化方面表现突出,能准确处理删除线、上下标、标题层级和链接。在内容忠实度(阅读顺序、幻觉、遗漏)和视觉定位(边界框)上也具有竞争力。表格处理能力一般,几乎没有图表能力。其价格明显低于 Azure Doc Intelligence 和 AWS Textract 等 OCR 服务商。AI模型Mistral OCRParseBenchOCR推荐理由:Mistral OCR 在 ParseBench 上语义格式化很强,价格还比 Azure/AWS 便宜,适合做高质量 OCR 又不愿花大价钱的场景。原文稍后读已读值得跟进有用关注 Mistral OCR
01:30Jerry Liu@jerryjliu0精选LiteParse v2.1是一个纯代码的Markdown文档解析器,不使用任何VLM或AI/OCR模型。在ParseBench基准上,它超越了Qwen 3.5-9B和GLM-OCR。但在密集视觉输出上仍落后于Gemma 4和PaddleOCR-VL。对于文字/表格密集的文档,差距显著缩小。它是目前最快且完全开源免费的解析器(Apache 2.0),支持CLI/Rust/Node/Python/WASM。AI产品LiteParse文档解析ParseBench2 个信源在谈事件专题推荐理由:LiteParse v2.1用纯代码搞定Markdown解析,比很多VLM还准,文字表格多的文档尤其好用,速度飞快还免费开源,赶紧去试试。原文稍后读已读值得跟进有用关注 LiteParse
11:10Jerry Liu@jerryjliu0精选LlamaIndex 创始人 Jerry Liu 在 X 上发布了对 Claude Fable 5 的 ParseBench 基准测试结果。该模型在推理密集型任务(如 SWE-Bench Pro、FrontierCode)上表现卓越,但在文档理解任务上仅与 Gemini 3 Flash 相当,而 token 成本却高出 10-15 倍。有趣的是,模型自身似乎也意识到这一点,在被问及最不喜欢的任务时,它表示不喜欢“请求完全明确、答案完全已知”的任务,暗示其表现不佳部分源于“懒惰”和缺乏意愿。尽管在内容忠实度(90.02%)和语义格式化(72.62%)上领先,但整体仍远逊于专业 OCR 提供商。AI模型Claude Fable 5文档理解ParseBench10 个信源在谈事件专题推荐理由:做文档解析或 RAG 的团队注意了——Claude Fable 5 在推理上很强,但文档理解性价比不如 Gemini 3 Flash,甚至不如专业 OCR 服务。如果你在选模型做文档处理,这篇评测能帮你省下 10 倍 token 成本,值得点开对比。原文稍后读已读值得跟进有用关注 Claude Fable 5
10:50LlamaIndex@llama_index精选LlamaIndex 在 ParseBench 上测试了 Anthropic Fable 5 模型的文档理解能力。结果显示,Fable 5 在内容忠实度上达到 90.02%,领先于 Gemini 3 Flash 的 86.19% 和 GPT-5.5 的 86.81%。在语义格式化方面,Fable 5 以 72.62% 的成绩领先对手超过 12 个百分点。这两个指标是评估前沿模型文档理解能力的关键。尽管 Fable 5 表现突出,但测试也表明在解锁文档理解方面仍有提升空间。AI模型AnthropicFable 5文档理解10 个信源在谈事件专题推荐理由:做文档解析、信息提取或 RAG 应用的团队,这个测试直接告诉你哪个模型更靠谱——Fable 5 在忠实原文和保留格式上明显领先,值得在项目中优先试一下。原文稍后读已读值得跟进有用关注 Anthropic
00:51Jerry Liu@jerryjliu0LlamaIndex 团队在 CVPR 2026 上发布了 ParseBench,这是一个针对视觉语言模型(VLM)的文档理解基准测试。该基准包含 2000 页真实企业文档,评估模型在表格、图表、视觉定位、语义格式和内容忠实度等方面的能力。核心目标是衡量模型是否能正确语义理解文档,而不只是过拟合基准。团队指出,当前前沿模型多针对编程、数学和科学推理优化,缺乏精确的视觉理解能力,ParseBench 旨在推动这一领域的进步。相关论文和网站已公开。论文ParseBench文档理解基准测试推荐理由:做文档解析或 RAG 系统的开发者终于有了一个贴近真实业务场景的评估工具——ParseBench 用 2000 页企业文档测试 VLM 的语义理解能力,比现有基准更贴近实际需求,值得关注并尝试。原文稍后读已读值得跟进有用关注 ParseBench
12:40LlamaIndex@llama_index精选LlamaIndex 今日发布了 LlamaParse Opus 4.8 版本,并公布了 ParseBench 评测结果。新版本在表格解析、语义格式和布局方面有轻微提升,但在图表解析和内容忠实度上出现小幅退步。同时,每页价格略有上涨。团队表示,在教 LLM 像人类一样阅读文档方面仍有大量优化空间。LlamaParse 依然是 AI 智能体最佳的文档摄取 API。AI产品LlamaParse文档解析ParseBench推荐理由:做文档解析或构建 AI 智能体的开发者,可以看看 ParseBench 的详细数据,评估是否值得升级。原文稍后读已读值得跟进有用关注 LlamaParse
12:07Jerry Liu@jerryjliu0LlamaIndex 对 Opus 4.8 进行了全面的文档理解基准测试,并与 Opus 4.7 对比。结果显示,Opus 4.8 在表格、语义格式和布局方面略有提升,但在图表和内容忠实度方面出现轻微退化。这表明 Opus 4.8 并未针对视觉文档理解进行专门的后训练。完整结果已发布在 ParseBench 上。LlamaIndex 指出,让 LLM 像人类一样阅读文档仍有大量改进空间,而 LlamaParse 仍是 AI 智能体最佳的文档摄取 API。AI模型Opus 4.8文档理解基准测试6 个信源在谈事件专题推荐理由:做文档解析或 RAG 应用的团队,Opus 4.8 的表格能力提升值得关注,但内容忠实度下降可能影响关键业务,建议先跑一遍 ParseBench 再决定是否升级。原文稍后读已读值得跟进有用关注 Opus 4.8
16:08Jerry Liu@jerryjliu0精选INF 发布了两个新的开放权重模型 Infinity-Parser2-Pro (35B) 和 Infinity-Parser2-Flash (2B),在 Hugging Face 的 ParseBench 文档理解榜单上排名第一。这两个模型通过一个包含 500 万多样本的综合合成数据引擎和一种新型联合强化学习算法训练,能够同时优化文档解析、元素解析、图表解析等多个复杂任务。ParseBench 是一个专门测试真实企业文档语义理解的开放基准,涵盖表格、图表、语义格式等指标。这意味着开发者现在可以免费使用这些模型来提升文档处理能力。AI模型文档理解开放权重模型INF推荐理由:做文档解析、企业数据提取的团队可以直接用这两个模型替代商业 API,2B 的 Flash 版本适合轻量部署,35B 的 Pro 版本适合高精度场景,建议去 ParseBench 看看具体指标。原文稍后读已读值得跟进有用关注 文档理解