17:43官方账号arXiv cs.AI@Saman Marandi, Yu-Shu Hu, Mohammad Modarres该研究提出利用检索增强生成和大语言模型,从系统描述中自动构建动态主逻辑模型,并表示为知识图谱(KG-DML)。方法沿DML层级进行定向检索,保留功能依赖和显式逻辑关系,支持故障向上传播和向下依赖追踪。验证应用于一座退役沸水反应堆的低压冷却剂注入系统,重复运行结果一致。多级评估覆盖各层精度、召回率、逻辑门一致性与结构完整性,证明自动化构建可将技术文档转为可用于诊断和可靠性分析的可执行功能模型。论文DML知识图谱RAG推荐理由:这篇论文讲怎么用RAG和LLM把技术文档自动变成知识图谱,用在反应堆诊断上,跑得还稳,搞可靠性的可以看看。原文稍后读已读值得跟进有用关注 DML
22:05官方一手AWS Machine Learning Blog@Astrid Bowser, Alex Savage Nick Heap精选OneAdvanced是一家英国企业软件提供商,在AWS上构建了英国主权AI平台。他们通过Amazon SageMaker AI自托管Llama 4 Maverick和Llama Guard 4模型,并使用pgvector搭建RAG管道。基于Strands Agents SDK在Amazon ECS上部署了超过50个AI智能体。该平台确保数据留在英国境内,满足主权要求。AI产品OneAdvancedLlama 4 MaverickAWS1 个信源在谈事件专题推荐理由:看看英国公司怎么在AWS上自托管Llama 4,搞了50多个智能体,数据不出境,适合有合规需求的人参考。原文稍后读已读值得跟进有用关注 OneAdvanced
04:34官方账号LangChain@LangChainAI丰田基于LangChain的Deep Agents构建了研发GPT,帮助员工用单一命令搜索多年的涂装、座椅和制造研究。该系统整合了分散的研发文档,提升了内部知识检索效率。丰田的案例展示了Deep Agents在企业级RAG场景中的实际应用。AI产品Deep Agents丰田LangChain推荐理由:丰田用Deep Agents做了个内部研发GPT,一条命令搜遍多年涂装座椅研究,企业知识库可以这么搞。原文稍后读已读值得跟进有用关注 Deep Agents
23:58Weaviate@weaviate_io精选Weaviate在Search Mode中引入effort参数,允许用户在medium、high、ultrahigh三档间选择,以权衡输出质量与计算成本。ultrahigh档在BRIGHT基准的5个子集上平均nDCG@10达到X,比medium提升Y,比混合搜索提升Z。该功能旨在让开发者根据应用需求灵活调整推理资源。AI产品WeaviateSearch ModeBRIGHT推荐理由:Weaviate给搜索模式加了effort档位,想省算力就选medium,要质量就上ultrahigh,BRIGHT基准上提升明显,做RAG的可以试试。原文稍后读已读值得跟进有用关注 Weaviate
11:26官方账号arXiv cs.AI@Ghanshyam Verma, Simanta Sarkar, Devishree Pillai, Hotaka Shiokawa, Yourong Xu, Fiona Veazey, Peter Hubbert, Hui Su, Paul BuitelaarKGCaRe是一种混合方法,结合神经检索与符号推理,通过多提示提取策略从文档构建知识图谱并存入图数据库,同时将文档嵌入向量库。它采用LLM引导的迭代图遍历提取相关三元组,并在初始遍历不足时利用线索实体再次遍历。在Mistral、Mixtral、GPT-3.5和GPT-4o等多个LLM上,KGCaRe在两个复杂条件问答数据集上持续优于Vanilla LLM、Vanilla RAG、Think-on-Graph等基线。该方法已公开软件管道。论文KGCaRe知识图谱RAG推荐理由:KGCaRe把知识图谱和RAG结合,复杂条件问答比普通RAG更准,多个模型上都赢了,代码也开源了。原文稍后读已读值得跟进有用关注 KGCaRe
10:51官方一手arXiv: OpenAI@Jack Stark, Srinath Saikrishnan, Vikram Seenivasan, Bernie Boscoe, Andrew Lizarraga, Tuan DoAquiLLM是一个开源的模块化RAG-LLM框架,使用开放权重模型,旨在帮助研究团队捕获隐性知识。该框架针对专有商业AI系统在透明度、可复现性和隐私方面的不足而设计。最新版本引入了本地嵌入与重排序、多模态能力、OpenAI兼容推理接口、语义与情景记忆及技能支持等增强功能。这些改进基于与天体物理学家和环境研究者的讨论,使AI系统更贴合科研实践。论文AquiLLMRAG开源模型10 个信源在谈事件专题推荐理由:科研团队想用AI又不放心商业闭源?AquiLLM开源、用开放权重模型,还能本地跑嵌入和重排序,专为捕获隐性知识设计,值得看看。原文稍后读已读值得跟进有用关注 AquiLLM
10:48官方一手arXiv: DeepSeek@David M. Markowitz, Timothy R. Levine该研究构建了7个基于主流欺骗理论的RAG模型,在5个公开数据集、700条陈述上测试,涉及gpt-4o、claude-sonnet-4-6、ollama/llama3、deepseek-v4-flash四个大模型,共生成39,200次欺骗判断。RAG模型准确率54.5%,基线模型54.6%,两者无显著差异,均与人类水平相当。RAG模型(57.0%)比基线模型(59.7%)更少出现真实性偏差,但效应量很小。不同理论对准确率影响不大,但对响应偏差影响显著,从可验证性方法的32.2%到真相默认理论的88.1%。论文RAG欺骗检测gpt-4o7 个信源在谈事件专题推荐理由:想看看AI能不能识破谎言?这篇论文用4个模型做了近4万次测试,结论是准确率跟人差不多,但不同理论引导下AI的倾向差异很大。原文稍后读已读值得跟进有用关注 RAG
10:40官方一手arXiv: DeepSeek@Fengrong Wan, Chengcan Wu, Ningtao LyuSodaMem是一种为长期对话LLM智能体设计的记忆框架,通过提取带来源证据的FactEvents,并记录提及时间、发生时间和有效性,构建时间图。在LongMemEval-S基准上,SodaMem达到92.8%的准确率(464/500),每次查询平均成本约0.00161美元,使用deepseek-v4-flash模型。相比扁平RAG日记和Markdown日志,SodaMem更擅长处理时效性、来源和有序时间推理。其代码已在GitHub开源。论文SodaMemLongMemEval-S时间图记忆推荐理由:做长期记忆的智能体开发者可以看看,SodaMem用图结构加证据链,在LongMemEval-S上准确率92.8%,成本还低,比普通RAG日记靠谱。原文稍后读已读值得跟进有用关注 SodaMem
06:04Fireworks AI@FireworksAI_HQMongoDB 旗下 Voyage AI 的模型现已原生运行在 Fireworks 推理平台上。Fireworks 宣称自己是 Voyage AI 合作的第一家也是唯一一家专用推理平台。用户可在同一平台完成 Embed、检索、Rerank 和生成,并与自有开源模型并行使用。AI产品Voyage AIFireworksMongoDB推荐理由:Voyage AI的embedding和rerank模型现在Fireworks直接能跑,还能和你的开源模型放一起,检索全流程一个平台搞定。原文稍后读已读值得跟进有用关注 Voyage AI
11:16官方账号arXiv cs.AI@Afreen Alam, Evgenija Popchanovska, Ana Gjorgjevikj, Maryan Rizinski, Lubomir T. Chitkushev, Irena Vodenska, Dimitar Trajanov论文提出用LLM辅助的RAG管道分析21个开源AI安全工具,将其能力映射到MIT AI风险分类的32个子类。三名评审的评估显示中等一致性(Fleiss' Kappa = 0.509)。结果显示工具集中在技术和运营控制,而治理、法律和金融控制几乎空白。多数投票后映射协议F1分数达75.5%。论文开源工具AI安全RAG推荐理由:把21个开源AI安全工具对照MIT风险分类,发现都堆在技术防护,法律金融没人管。做治理的值得翻翻。原文稍后读已读值得跟进有用关注 开源工具
11:14官方账号arXiv cs.AI@Mohammad Amanlou, Parham Abed Azad, Farbod Davoodi, Mostafa Masumi, Behnam Bahrak, Abdol-Hossein VahabiePsychoAgent是一个面向LLM智能体的认知架构,将事实记忆与情感记忆分离,并通过冲突感知执行控制器整合。在三个受控冲突场景中,完整架构检索冲突关键记忆的得分达0.933,优于语义情感基线的0.500和单记忆RAG的0.667,仅付出少量语义相似度代价。5名盲评者评估了27个输出,经评分者内标准化后,完整架构的平均分最高(+0.22 SD),但校正后的两两差异未达显著。三天的示例轨迹展示了持续情感、离线记忆重组和选择性记忆加权。研究支持情感敏感检索作为模拟人类冲突效应的可检查机制。论文PsychoAgentLLM智能体情感记忆推荐理由:这篇论文给LLM智能体加了情感记忆模块,在冲突场景下找关键记忆比普通RAG强不少,做Agent记忆方向的朋友可以看看。原文稍后读已读值得跟进有用关注 PsychoAgent
11:03官方账号arXiv cs.LG@Gyuwan Kim, Cheoneum Park, Tao YangCoinRAG是一种针对长上下文检索增强生成(RAG)的KV缓存复用优化方法,通过两阶段检索识别查询相关的语义单元,并组合复用其切片KV表示,避免处理冗长检索上下文。在LongBench多跳问答任务上,CoinRAG相比基线实现了新的帕累托前沿,在标准快速预填充延迟预算下平均F1相对提升5.3%,同时显著降低运营成本。该方法将粗粒度块级缓存细化为语义碎块级,减少了信息冗余与噪声。论文CoinRAGRAGKV缓存推荐理由:想给RAG省算力又不想掉精度?CoinRAG把检索结果拆成小碎块做缓存复用,LongBench上F1平均提了5.3%,值得一看。原文稍后读已读值得跟进有用关注 CoinRAG
05:25Latent.Space@latentspacepod精选Harvey与EngramLab开源了一个包含1亿+token的合成律所数据集,覆盖46个客户、250多个虚拟事项,约1万份文件。该环境用于评测智能体能否像资深律师一样检索和理解事务所过往工作。联合创始人Dan Biderman指出,像“今年哪些并购交易未完成”这类问题无法靠RAG搜索,因为不存在“未完成”的记录,必须逐案阅读文件。数据集是Harvey迈向深度理解律所工作流的第一步。AI模型HarveyEngramLab合成数据推荐理由:Harvey开源了个合成律所数据集,专测AI Agent处理法律检索的硬问题,比单纯RAG更狠。原文稍后读已读值得跟进有用关注 Harvey
02:03Milvus@milvusio精选当AI Agent给出糟糕回答时,问题往往不在模型而在检索层。向量搜索结果受嵌入、索引类型、量化、元数据过滤等因素影响。IVF、HNSW、DiskANN各有不同权衡,量化提升速度与存储但需检查召回率。Simon Hearne的演讲演示了如何可视化向量搜索,类似SQL的EXPLAIN。调试时建议直接追踪recall@k、观察分数分布、监控过滤命中率。技巧Milvus向量检索RAG推荐理由:Milvus 团队分享:Agent 答错先查检索层,用 EXPLAIN 思路可视化向量搜索,讲 IVF/HNSW/DiskANN 取舍,搞 RAG 的值得看。原文稍后读已读值得跟进有用关注 Milvus
12:02官方账号arXiv cs.AI@Sagar Tamang, Ayush Vyas, Tabarakul Hazarika论文提出READ(Reliable Embedding-free Agentic Document-search),用三种确定性操作——归一化词法搜索、结构导航、有界跨度读取——替代传统Top-K嵌入检索。在780页政府财务报告上,86.8%的内容行是表格行,数值单位依赖上方中位数13行的表头,导致分块经常切断数字与其单位的关联。READ在51个验证问题上达到58.8%准确率,而密集检索仅15.7%(p_Holm=2×10^-5)。控制实验显示,使用Top-K工具的同款智能体只能达到27.5%,说明增益来自接口而非迭代。作者也报告BM25与READ在统计上无差异,因此结果区分的是嵌入型与非嵌入型检索,而非智能体与词法检索。论文READRAG智能体推荐理由:论文提出READ,在780页财务报告上准确率58.8%,比向量检索的15.7%高出一大截,每次检索还能当成审计轨迹回放。原文稍后读已读值得跟进有用关注 READ
10:41官方账号arXiv cs.LG@Fardin Afdideh, Fernando Seoane, Farhad Abtahi一项新综述系统梳理了大模型后训练适配技术,提出按机制、目标、数据需求、持久性、结构范围、模型类型六个维度分类。该分类法区分了微调、检索增强、提示等常被混用的概念,并梳理了技术间的继承、取代、混合与分层关系。研究者认为这套统一词汇可用于技术文档、模型变更追踪和AI治理分析。论文还指出评估、可复现性、遗忘、多模态适配等开放挑战。论文微调RAGAI治理推荐理由:Arxiv上这篇综述把微调、RAG、对齐这些概念理清了,还给了六个维度的分类框架,做AI治理和模型管理的人可以拿来当参考。原文稍后读已读值得跟进有用关注 微调
10:22官方账号arXiv cs.LG@Yixiong Xiao, Congxi Xiao, Jingbo ZhouTS-RAG提出将检索增强生成(RAG)应用于时间序列预测,通过设计专门的参考标记来融合输入序列与检索到的相似序列。该方法旨在解决传统时序模型数据规模小、参数少、生成能力不足的问题。在多个真实世界预测基准上,TS-RAG取得了持续的最优性能。实验表明,参考标记能更有效地捕获复杂的时间动态特征。论文TS-RAGRAG时间序列预测推荐理由:TS-RAG把RAG用在时间序列预测上,用参考标记融合相似序列,多个基准拿SOTA,做预测的可以看看。原文稍后读已读值得跟进有用关注 TS-RAG
07:17IT之家(博客/媒体)英伟达在2026年黑帽大会上宣布开源cuFile API及其底层存储软件栈。cuFile是GPUDirect Storage技术的接口组件,2021年7月随CUDA Toolkit 11.4发布。该技术通过DMA让NVMe等存储设备直接向GPU传数据,绕过主内存中转,延迟可低至毫秒级。这能缓解AI推理中GPU因等待数据而闲置的“GPU饥饿”问题,也有助于RAG和智能体AI快速读取大型数据集。英伟达还发布了覆盖40家存储与闪存厂商的Storage-Next倡议。AI产品英伟达cuFileGPUDirect Storage推荐理由:英伟达把cuFile开源了,SSD能直接给GPU喂数据,游戏和AI推理都不容易卡了,搞存储的可以看看。原文稍后读已读值得跟进有用关注 英伟达
00:41Milvus@milvusio精选Milvus 3.0 推出 lake-native External Collection,让向量可直接查询数据湖中的数据。新增 grouping、faceting、sorting、aggregation 等结构化查询能力,向量不再孤立存储。开发者可以让 Milvus 更贴近现有数据系统,但需要权衡召回率、延迟、过滤和成本。官方开放 Office Hours,提供 20 分钟一对一架构咨询。AI产品Milvus向量数据库混合检索推荐理由:Milvus 3.0 把向量检索和结构化查询揉一起了,还支持直接查数据湖,玩 RAG 的可以看看。原文稍后读已读值得跟进有用关注 Milvus
12:21官方账号arXiv cs.AI@Ayoub Kirouane, Christos Petrocheilos该研究将NVIDIA的Nemotron检索栈端到端适配为现代希腊语,覆盖法律、能源、金融和医疗等专业领域。在65,773个希腊语检索对上微调后,Nemotron 1B嵌入模型的nDCG@10从0.362提升至0.835,显著超过未适配版本。研究还通过LoRA微调Nemotron 30B-A3B混合专家阅读器,使答案正确率从29.4%升至66.9%,并改善了忠实度和引用质量。作者发布了希腊语RAG基准HERA,这是首个大规模希腊语检索增强生成基准。论文NemotronHERARAG3 个信源在谈事件专题推荐理由:NVIDIA的Nemotron终于能处理希腊语了,微调后检索效果大幅提升,还新出了个HERA基准,搞多语言RAG的可以看看。原文稍后读已读值得跟进有用关注 Nemotron
11:47官方账号arXiv cs.LG@Blessed Guda, Kayley Sze, Carlee Joe-WongMultiPathFormer将每个收发链路表示为连续路径令牌的有序序列,采用自回归下一路径预测进行预训练。它引入环境RAG机制和首路径码本,使时延和功率等路径统计估计提升最高59%。模型在27个环境中预训练,可迁移到未见用户,经场景微调后在新环境中优于从零训练。在下游任务中,MultiPathFormer实现5.57米平均定位误差、0.914前3波束准确率、0.994视距分类准确率和0.561信道估计NMSE,全面超越现有基于信道的模型。AI模型MultiPathFormer无线基础模型RAG推荐理由:想做无线信道估计或波束预测的可以看看,它用路径预测代替传统掩码重建,环境RAG让延迟估计直接涨59%,效果比现有模型好。原文稍后读已读值得跟进有用关注 MultiPathFormer
09:21官方一手arXiv: OpenAI@A A Talha Talukder, Omar Alam, Akramul Azim论文提出一种面向嵌入式C软件的函数复用检测RAG流程,用注释、调用图和README增强函数表示,并集成8种嵌入模型与4个硬件兼容性验证器。在6个开源项目的184个函数、4815对候选上测试,SonarQube作为复用过滤器的假阳性率达93.6%,其中83.5%的失败源于静态分析无法发现的硬件环境不匹配。人工核验40对被拒的复用函数对后,验证器准确率为97.5%。诊断变体显示主要失败类别差异显著(McNemar卡方=294.0,p<0.001)。论文RAGSonarQubeGraphCodeBERT推荐理由:复用嵌入式函数前,先看看这篇:RAG加硬件校验,SonarQube假阳性率93.6%,能帮你避免硬件不兼容的坑。原文稍后读已读值得跟进有用关注 RAG
01:01Qdrant@qdrant_engine精选FutureAGI的Rishabh与Dylan Couzon将直播演示RAG智能体的调试与优化。内容覆盖嵌入迁移、去重、重排序和评估,以衡量对检索质量的实际影响。直播时间为欧洲中部时间18:30(太平洋时间9:30)。观众可在luma.com/future-pq6q免费注册。技巧RAG智能体嵌入迁移推荐理由:明天有个免费直播,FutureAGI的Rishabh现场调RAG智能体,讲嵌入迁移和重排序怎么影响检索效果,有时间的可以去看看。原文稍后读已读值得跟进有用关注 RAG
03:03官方一手AWS Machine Learning Blog@Anuj JauhariAmazon Bedrock宣布Web Search功能正式可用(GA),这是一个服务端内置工具,可将模型响应接地到当前网络知识。该功能无需接入第三方供应商或编排外部API,也无需额外的安全审查。用户可通过OpenAI Responses API启用此工具。文章还介绍了如何开始使用Web Search on Amazon Bedrock。AI产品Amazon BedrockWeb SearchAI安全10 个信源在谈事件专题推荐理由:AWS把联网搜索直接做进了Bedrock,不用再接第三方API,用OpenAI Responses API就能启用,做RAG的可以看看。原文稍后读已读值得跟进有用关注 Amazon Bedrock
12:03官方账号arXiv cs.LG@Anusha Madan Gopal, Aras Pirbadian, Kristofor D. Carlson, M Anthony Lewis, Jonathan Tapson精选论文提出PRECOG,把语料库离线预编码为SSM隐藏状态,查询时将最优状态直接注入,省去RAG的上下文重新读取。在带192KB隐藏状态的1.2B参数TENNs-LLM上,PRECOG将prefill延迟从约27秒降到6毫秒以下,约4500倍加速,并保持与上下文RAG相当的答案质量。配套的SMC用认知域聚类构建层级持久记忆,支持保真度/存储调节和O(1)会话初始化。该机制依赖SSM固定长度、与位置无关的循环状态,Transformer的KV缓存因位置纠缠且随上下文线性增长而无法实现。论文PRECOGTENNs-LLMRAG推荐理由:论文把RAG预填充从27秒压到6毫秒,1.2B模型在边缘也能交互式检索,Transformer做不了。原文稍后读已读值得跟进有用关注 PRECOG
09:23官方一手arXiv: DeepSeek@Qunhui ZhangAiFlow是一种Token原生响应式编排模型,将Provider增量归一化为Context<T>事件并通过有向流图传播。每个节点由Node Guardian管理,声明并执行队列上限、并发、排序、溢出策略与重试规则。微基准测试基于DeepSeek轨迹回放(30次)并与LangGraph基线对比,结果显示AiFlow不改变模型TTFT,但将应用TTFPT降低70.9%-94.7%。运行时队列深度也控制在声明边界内,较无界策略减少93.7%-96.5%的MaxQ。实现代码通过FIT Framework仓库公开提供。论文AiFlowLangGraphRAG推荐理由:AiFlow将LLM输出按token流式编排,实测应用延迟比LangGraph降70.9%-94.7%,队列占用也大幅减小。原文稍后读已读值得跟进有用关注 AiFlow
23:55Jina AI@JinaAI_Jina AI 发布了 v3.5 reranker 重排序模型。官方博客和 arXiv 论文提供了技术细节。模型权重已在 Hugging Face 平台开放。AI模型Jina AIv3.5重排序推荐理由:Jina AI 出了 v3.5 重排序模型,博客、论文和权重都公开了,做 RAG 的可以去看看。原文稍后读已读值得跟进有用关注 Jina AI
23:53Jina AI@JinaAI_精选Jina AI发布重排序模型jina-reranker-v3.5,公布其在四个基准上质量与参数大小的对比结果。jina-reranker-v3.5在全部四个基准中都位于帕累托前沿,意味着没有已评测模型比它参数更小且效果更好。该模型在保持较小体积的同时达到了领先的重排序质量。AI模型jina-reranker-v3.5Jina AI重排序推荐理由:Jina AI发了个新重排模型v3.5,四个基准全是同质量里参数最小的,没有对手更小还更强。搞RAG的应该关注。原文稍后读已读值得跟进有用关注 jina-reranker-v3.5
02:40Rowan Cheung@rowancheungJonathan Sharp把与老板的每次一对一会议记录变成了可搜索的知识库。现在他可以直接问AI,老板会对任何问题作何反应。这个工作流来自Ther Rundown社区分享,核心是让会议历史成为AI的参考上下文。技巧The RundownRAG知识库推荐理由:Jonathan Sharp把跟老板的会议记录变成AI知识库,随时能问“老板会怎么回答”,相当于给自己配了个老板模拟器。原文稍后读已读值得跟进有用关注 The Rundown
00:15Milvus@milvusio82°向量数据库Milvus 3.0正式发布,主打湖原生向量检索。新版本通过External Collections支持直接查询对象存储中的Parquet、Vortex格式数据,以及Lance、Iceberg等开放表格式。Loon Storage v3优化了S3对象存储上的点读取性能,快照与Spark DataSource V2让批处理和回填更稳定。检索引擎新增ORDER BY、聚合和分面搜索,StructArray与SINDI增强了多向量和稀疏混合检索能力。AI产品MilvusRAG智能体推荐理由:Milvus 3.0把向量检索直接做到数据所在的湖上,不用来回搬数据,搞RAG和Agent的可以试试。原文稍后读已读值得跟进有用关注 Milvus
00:03Fireworks AI@FireworksAI_HQFireworks 展示了如何用对比微调将 Qwen3-Embedding-8B 适配到特定领域,成本不到 10 美元。文章给出 3 个实验,其中最好成绩 nDCG 提升 36%。作者强调,检索不到文档的重排器无法生效,RAG 也会漏掉失败案例。完整步骤和结果见 Fireworks 官方博客。技巧Qwen3-Embedding-8BFireworks微调推荐理由:Fireworks 用不到 10 美元教会你微调 Qwen3-Embedding-8B,三个实验最高 nDCG 涨 36%,做 RAG 的值得看。原文稍后读已读值得跟进有用关注 Qwen3-Embedding-8B
23:53Qdrant@qdrant_engine8月6日,Qdrant与FutureAGI将联合举办一场RAG-agent调试直播。活动中会现场构建并诊断一个RAG agent,定位质量下滑的环节。演示如何无停机迁移到新的embedding模型,并清理重复和碎片化的chunks。还会添加late interaction重排序,并对比每次优化前后的评估分数。技巧RAGQdrantFutureAGI推荐理由:Qdrant和FutureAGI要直播修一个RAG agent,现场看每一步改动对效果的影响,还会演示换embedding模型和加rerank。想学RAG调优可以直接围观。原文稍后读已读值得跟进有用关注 RAG
12:56官方账号arXiv cs.AI@Jiacheng Tao, Qingyun Sun, Haonan Yuan, Ziwei Zhang, Jianxin LiDualG-MRAG 提出将宏观推理图与微观匹配图解耦,分别负责全局拓扑路由和局部证据验证。该框架通过 GNN 检索器实现查询驱动的消息传递,并利用动态规划解码从前向传播中提取推理路径。在证据召回和复杂问答准确率上,DualG-MRAG 超过现有基线。论文DualG-MRAGGNN多模态RAG推荐理由:多模态RAG老是丢细节?DualG-MRAG用双图分工解决,召回更准、复杂QA更强。原文稍后读已读值得跟进有用关注 DualG-MRAG
09:56官方一手arXiv: Anthropic@Musa Shams精选LayerRAG-Bench覆盖8个企业领域、240个任务和9种故障场景,在来自OpenAI、Anthropic和Gemini的9个模型上生成38,880条任务级记录。schema规范化将schema漂移成功率从0.000提升到0.913,但无法修复过期证据、缺失工具输出、权限拒绝和错误会话上下文。仅基于groundedness的评估在过期证据和错误会话下产生大量假阳性。该基准支持按层评估原则:可靠性干预应只对其目标层生效,而非视为通用修复。论文LayerRAG-BenchRAG智能体10 个信源在谈事件专题推荐理由:论文推出了LayerRAG-Bench,用8个领域240个任务测智能体RAG的可靠性陷阱。它告诉你schema规范化只解决一类问题,别指望一个补丁包治百病。原文稍后读已读值得跟进有用关注 LayerRAG-Bench
22:44Milvus@milvusio72°Milvus 3.0 今日发布,是该项目历史上最大的架构更新。新版本引入湖原生基础设施,支持直接索引 Parquet、Lance、Iceberg 等格式的数据,无需 ETL。新的 Loon 存储引擎将 ANN 搜索后的点读 I/O 从 9.4 MB 降至 0.07 MB。检索引擎新增服务端 ORDER BY、聚合和分面搜索,支持 StructArray 以原生容纳 ColBERT 和 ColPali 模型。SINDI + BM25 压缩使稀疏索引缩小约 3 倍,QPS 提升约 10 倍。AI产品MilvusMilvus 3.0向量数据库推荐理由:Milvus 3.0 今天上线了,不用再为向量数据库单独备份数据,直接查湖里的文件,检索性能还更强。原文稍后读已读值得跟进有用关注 Milvus
12:19官方账号arXiv cs.AI@Rajat Sainju, Dariusz Jarosz, Hairong Shang, Michael Prince, Ryan M. Aydelott, Mathew J. Cherukara, Yine Sun, Michael D. BorlandAPS-RAG是部署在先进光子源(APS)的检索增强生成平台,融合了密集、稀疏和知识图谱三个检索通道,并引入纠正性代理循环与MCP工具层。它在50道题的APS-Bench评估中,完整Agentic GraphRAG版本达到70.3%的严格关键点召回率,超过BM25基线63.8%。移除交叉编码器重排序器后召回率下降32.8%,表明其对答案质量贡献显著。开源和闭源LLM的最终答案合成性能也被对比。该平台及其评估方法已开源,可迁移到其他大型科学仪器。AI模型APS-RAGRAG智能体推荐理由:APS团队搞了个能检索几十年知识库的RAG系统,把BM25的63.8%准确率提到了70.3%。交叉编码器是关键,去掉掉32.8%得分。科学设施运维AI神助攻,代码和基准都开源了。原文稍后读已读值得跟进有用关注 APS-RAG
00:27官方一手AWS Machine Learning Blog@Dhananjay Karanjkar传统RAG在处理跨数百文档的分析任务时效果有限。AWS提出了任务感知知识压缩(TAKC),将整个知识库预压缩为任务特定表示,并在多个保真度级别缓存。系统根据查询路由到合适的层级。该方法已提供开源实现,可部署在AWS上。AI模型RAGTAKCAWS推荐理由:AWS搞了个新方法TAKC,能把知识库压缩成不同精度的缓存,让AI跨文档分析更快更准,比传统RAG强多了。原文稍后读已读值得跟进有用关注 RAG
00:00Milvus@milvusioMilvus团队指出,2026年embedding模型选择更依赖数据形态而非排行榜。对于文本知识库,Qwen3 Embedding、Jina v5 text、BGE-M3、OpenAI text-embedding-3、Voyage、Cohere等密集embedding值得测试。对于PDF、图片、截图、音频、视频,推荐Gemini Embedding 2、Jina v5 omni、Cohere Embed 4、Qwen3-VL-Embedding、Voyage Multimodal等模型。长文档可用Voyage context-4进行上下文化片段嵌入。复杂布局可考虑ColPali风格的多向量检索。基准如MTEB、MMEB、ViDoRe可辅助筛选,但最终验证需用自己的文档和查询。Milvus 2.6新增Text Embedding Function,将嵌入管道移入数据库层。技巧MilvusQwen3 EmbeddingJina v55 个信源在谈事件专题推荐理由:Milvus团队写的实战指南,告诉你不同数据该用哪个embedding模型,还捎带介绍了Milvus 2.6的新功能。原文稍后读已读值得跟进有用关注 Milvus
17:27Dify@dify_aiDify 将于 2026 年 9 月 10 日在东京举办 IF Con Tokyo 2026 大会,这是由 LangGenius K.K. 主办的年度会议。大会免费开放但需提前注册,地点在东京 Convention Hall。参会者将分享如何使用 Dify 构建生产级 agentic workflows 的真实案例和实现方法。去年首届活动座无虚席,今年预计吸引更多团队交流 RAG 和智能体应用经验。行业DifyIF Con Tokyo 2026智能体工作流推荐理由:Dify 搞了个用户大会在东京,今年 9 月 10 号免费参加。能听到别人用 Dify 做智能体工作流的真实案例,想学实战经验的别错过。原文稍后读已读值得跟进有用关注 Dify
00:46Weaviate@weaviate_io精选Weaviate发布的视频指出,更大的上下文窗口无法解决有问题的Agentic RAG管道。长上下文会引入矛盾信息、掩埋相关工具并导致后续输入被忽略。视频将生产级Agentic RAG拆分为5个系统:查询增强(翻译模糊或多部分输入)、检索(选择平衡精度与上下文的块策略)、记忆(分离短期上下文与长期记忆)、工具(提供清晰描述和schema)和代理(决策编排层)。每个环节都需精心设计上下文工程,而非仅靠扩大窗口。技巧WeaviateRAG智能体推荐理由:Weaviate出了个视频,把Agentic RAG拆成5个系统讲透了,不是吹大窗口,而是教你怎么控制上下文,推荐搞RAG的人看看。原文稍后读已读值得跟进有用关注 Weaviate