8月28日
15:54
15:51
8月27日
15:09
10:18
10:18官方账号arXiv cs.LG@Ye Shen, Yuting Zheng, Dun Pei, Zijian Chen, Wenlong Zhang, Qi Jia, Guangtao Zhai
SciMIF是一个新的基准,旨在评估多模态大型语言模型在遵循复杂科学指令方面的能力。通过分析5个代表性科学学科的22个不同任务,提出包含10个约束组的全面分类法。实验发现,不同科学学科间存在显著性能差异,化学对当前MLLMs更具挑战性。SciMIF填补了评估科学领域多模态指令遵循的空白,为MLLMs在严格科学应用中的未来改进奠定基础。数据与代码将在GitHub上发布。
推荐理由:SciMIF基准为评估MLLMs在科学领域的指令遵循能力提供了新工具,揭示了不同学科间的性能差异,对科学研究和MLLMs发展具有重要意义。
09:45
09:45IT之家博客/媒体
小鹏汽车发布图灵AI第三颗芯片,支持跨域融合、多模态、大模型;座舱语音架构重构,实现智能控制。2024年8月流片成功,算力可达100%极致利用,累计出货量超20万片,预计全年出货量近100万片。

推荐理由:小鹏汽车升级图灵AI芯片,实现更智能的车载体验,算力提升,出货量增长迅速,值得关注。
08:28
08:28官方账号Simon Willison’s Weblog博客/媒体
精选
Qwen 推出多模态 MoE 模型 Qwen3.8-Flash-Next,拥有 125B tokens,性能提升显著。模型在 DGX Spark 上运行,已尝试 72.5GB 和 78.9GB 版本,其中 UD-Q2_K_XL 版本表现最佳。
事件专题

推荐理由:Qwen 推出全新多模态 MoE 模型,性能卓越,值得一试。与 Qwen4 架构相似,适合探索多模态应用。
02:21
01:50
01:39
01:39官方账号Google AI@GoogleAI
88°
GoogleAI发布Gemini 3.5 Transcribe,精准智能语音转文字模型,支持85+语言,自动过滤填充词,格式化语音,与屏幕上下文配对执行语音命令。视频展示其将混乱语音输入和本地文件转换为电子邮件草稿的功能。
事件专题

推荐理由:GoogleAI发布全新Gemini 3.5 Transcribe,语音转文字更智能,支持多种语言,自动优化,比传统模型更强大。
00:54
00:54官方账号阿里通义 Qwen@Alibaba_Qwen
72°
QwenCloud推出Qwen3.8-Flash多模态MoE模型,基于Qwen4架构,参数125B,成本效率高,支持1M上下文扩展。Qwen3.8-Flash-Next权重已开放,支持GDN+QSA混合注意力机制。API定价0.16/1M输入令牌和0.47/1M输出令牌。
事件专题

推荐理由:想体验成本效益高的多模态模型?试试Qwen3.8-Flash,它基于Qwen4架构,参数庞大,支持1M上下文扩展,API定价低至0.16/1M输入令牌!
00:22
8月26日
23:17
23:04
23:04Paul Couvert@itsPaulAi
Z.ai推出GLM-5.3-Flash,输入成本仅$0.15,输出收益达$0.50,缓存输入仅需$0.03。该模型支持多模态,拥有1M-token的上下文窗口,320B-A18B模型,开源MIT许可。此前以Ox Alpha形式预览,现全面支持中国AI芯片。
事件专题

推荐理由:Z.ai推出的GLM-5.3-Flash模型性能卓越,价格亲民,是大多数任务和项目的首选。
22:44
22:28
19:13
17:14
14:58
10:41
10:41官方账号arXiv cs.LG@Andreas Hochlehnert, Marianna Nezhurina, Mehdi Cherti, Andrej Radonjic, Thaddäus Wiedemer, Christoph Schuhmann, Romain Beaumont, Wieland Brendel, Bernhard Schölkopf, A. Sophia Koepke, Jenia Jitsev, Matthias Bethge
LAION-BVD是一个包含1.3亿个平台特定视频URL的大型开放视频数据集,下载了8000万视频,总时长达1000万小时。该数据集旨在跨视频、音频和图像模态进行多模态预训练,并在视频-文本和音频-文本基准测试中取得竞争优势。此外,还探索了视频帧作为图像-文本数据的替代来源,并发布了LAION-BVD以供研究社区使用。
推荐理由:LAION-BVD发布了,这是一个包含1.3亿小时视频的开放数据集,可用于多模态预训练,对于研究者和开发者来说是个宝库。和其它视频数据集相比,它提供了更多的视频和更长的时长,对于提升模型性能大有裨益。
10:01
09:48
09:48elvis@omarsar0
精选
A paper discusses the impact of harnesses on agent benchmark scores, revealing significant variance caused by harness configurations. The study compares three frontier models across 100 tasks, showing harness-induced variance is 7.8x larger than model-induced variance. The authors propose a Harness Card for structured disclosure. Paper available at arxiv.org/abs/2605.23950.

推荐理由:This paper reveals the hidden influence of harnesses on AI model scores, offering a new perspective on leaderboard comparisons. It's a must-read for those interested in understanding the true performance of AI models.
8月25日
05:04
00:19
00:19lmarena.ai@lmarena_ai
72°
@Alibaba_Qwen的Qwen3.8-27B在Code Arena WebDev类别中排名第九,参数量27B,超越Qwen3.7-Plus,支持262K原生上下文,可扩展至1M。Qwen3.8-2.4T-A95B(Max级)的开放权重也已发布。
事件专题

推荐理由:@Alibaba_Qwen发布了Qwen3.8-27B,参数量小但性能出色,适合构建轻量级应用和智能体,值得尝试!
8月24日
10:13
10:13官方一手Pandaily@contact@pandaily.com (Pandaily)
精选72°
BOCOM International 分析称,Moonshot AI 的 Kimi K3 模型,拥有 2.8 万亿参数,原生多模态,1 万个令牌窗口,位于成本与能力帕累托前沿,仅次顶级封闭模型,同时大幅降低每项任务成本。
事件专题

推荐理由:Kimi K3 模型,参数量高达 2.8 万亿,多模态,成本能力前沿,值得一看!
05:34
8月23日
17:59
17:59官方一手歸藏(guizang.ai)@op7418
Ox Alpha 模型、DeepSeek V4 Flash、Vision EXP 模型和 Claude Fable 5 模型进行对比,Claude Fable 5 在排版细节和色散处理上表现更佳;Ox Alpha 模型在多模态和代码能力上表现出色,可还原 3D 玻璃材质质感。
事件专题

推荐理由:看看 Claude Fable 5 在排版和色散处理上的优势,以及 Ox Alpha 模型的多模态和代码能力,和其它模型有何不同。
17:13
14:10
8月22日
14:58
05:03
03:38
03:38官方账号Decoder@Matthias Bastian
Deepseek推出V4-Flash-Vision-Exp,一个实验性多模态模型,为V4-Flash的文本能力添加图像理解。在公司自己的多模态智能体基准测试中,其性能接近Opus 4.8,有时甚至超越它。

推荐理由:Deepseek新推出的V4-Flash-Vision-Exp模型,将图像理解能力与文本处理结合,在多模态智能体基准测试中表现优异,与Opus 4.8不相上下,值得一试。
00:03
8月21日
22:05