#多模态
Qwen3.8-Max在视觉榜单冲到第二,只比Claude Fable 5低13分,想看看国产视觉模型底子的可以关注。
MiniMax 把能处理多模态上下文的视频模型直接开源了,最长生成 15 秒 2K 带立体声的视频,比一般文生视频强在能看懂图片、音频和视频混合输入。
试试看这个新基准,FriendBench测AI能不能从20秒对话看出两人是不是熟人。最强模型和人类打了个平手,但AI有偏见:拿不准就说是陌生人。
Onton发布了搜索模型Ontology 1,90条查询上precision@10到0.630,压过Google Shopping和Amazon,而且只用了1%索引数据。做搜索的可以看看。
NVIDIA搞了个Spatial-IQ基准,把数箱子拆成九个子任务,Qwen2.5-VL练完后准确率从2.9%飙到62.6%,但离人类82.1%还远。
Runway 出了 Gen-4.5,视频生成更听指令了,还能保持前后镜头一致,现在 OpenRouter 上就能直接调。
MiniMax H3 8 月 3 日开源,能做 15 秒 2K 音视频,价格只有主流模型的 1/3,看看合不合用。
Cia0用MiniMax H3加Midjourney V8.2做了个动画版UI作品集,H3能一次生成音频、文字和角色锁定,比SD2省事多了。
想把纯图片的Incidents1M变成图文对?这篇用Qwen3.5做生成和验证,10万条描述加自动打分,干活靠谱。
Google DeepMind 发了 Gemini Robotics 2 和推理模型 ER 2,让机器人能自行规划、纠错、多机协作,适合关注机器人智能的朋友。
Thinking Machines 出了个 Inkling-Small,276B 参数量但只激活 12B,能处理音频和图像,性能不打折,适合拿来微调玩。