21:43Qdrant@qdrant_engine精选Hugging Face 发布了包含 12 万个查询的检索基准。该基准涵盖密集检索、稀疏检索和过滤搜索三种类型。基准测试针对生产环境实际运行情况,而非合成数据集上的召回率指标。AI产品Hugging Face检索基准密集检索推荐理由:Hugging Face 推出了 12 万查询的检索基准,覆盖多种检索方式,比传统合成数据测试更贴近实际生产环境。原文稍后读已读值得跟进有用关注 Hugging Face
00:28Milvus@milvusio精选Milvus 3.0在向量检索基础上加入更多库内处理能力,支持ORDER BY对过滤结果和ANN候选排序。查询侧聚合提供count、sum、avg、min、max,并按标量字段分组。搜索聚合支持分面检索,返回分桶计数、聚合统计和每桶Top-N样本,但分面计数基于ANN结果故为近似值。新增StructArray让单个实体可包含多个向量与结构化元素,适配文档块、视频帧和ColBERT等交互式模型。稀疏检索增强包括压缩版BM25索引和面向SPLADE学习型稀疏向量的SINDI算法。AI产品Milvus 3.0Milvus稀疏检索推荐理由:Milvus 3.0把排序、聚合、分面、多向量检索都做进引擎,应用端少写不少逻辑,做RAG的值得看看。原文稍后读已读值得跟进有用关注 Milvus 3.0
12:54官方账号arXiv cs.AI@Tingyu Song, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Zhijie Nie, Yilun Zhao, Shu WuUEmbed是首个解码器-only的多模态嵌入模型,能在一次前向传播中同时生成稀疏词级和稠密向量表示。该模型通过在输入后追加N个可学习特殊token,并将词表划分为N个不相交子集,实现两类嵌入的统一输出。UEmbed公开了2B、4B、9B三个规模版本,其中UEmbed-9B在MMEB-v2基准上达到稠密71.8、稀疏71.0的成绩,优于同训练数据规模的多模态嵌入模型RzenEmbed。在BEIR基准上,UEmbed与强稀疏和稠密基线保持竞争力,并验证了在效率与智能体应用上的实用性。AI模型UEmbed多模态稀疏检索推荐理由:想用一个模型同时搞定稀疏检索和稠密检索?UEmbed把两件事合成了一次前向,9B在MMEB-v2上分数还挺能打,多模态输入也支持。原文稍后读已读值得跟进有用关注 UEmbed