#多模态
Thinking Machines出了个真开源的多模态模型Inkling,41B参数能和GPT-5.6 Sol掰手腕,还准备出12B小版,赶紧试试。
Thinking Machines开源了975B参数的MoE模型Inkling,支持多模态和64K/256K长上下文,还能在Tinker上微调,值得试试。
Thinking Machines 刚发了 Inkling,一个开源的多模态推理模型,能处理文本、图像、音频,还给了完整权重可以微调,NVFP4 检查点直接下。
小米的 MiMo 模型正式备案了,端侧大模型覆盖语言、多模态、语音多种能力,还计划砸 600 亿搞 AI,快来看看他们的布局。
阿里新模型Qwen-Audio-3.0-Realtime能实时语音对话、调用工具、感知情绪,语音指令和综合排名都超过了GPT-Realtime-2。
想要自动生成带精确几何图形的数学题?FormalAnalyticGeo 用 CDL 形式语言和 SDF 渲染,造出了 7000+ 带标注的解析几何题目,误差不到 1%。
他们挑战了多模态情感模型必须大的假设,用知识蒸馏搞出<1B的Light-MER,9个基准超了大模型还更快,做部署的可以看看。
PrismML搞了个Bonsai 27B,在手机上就能跑27B多模态模型,压缩到3.9GB性能还能保留90%,挺牛的,还开源了,可以试试。
手机能跑 27B 模型了?PrismML 的 Bonsai 27B 实际做到了——体积最小 3.9GB,速度还不慢,开源免费。想本地用大模型又嫌大的可以看。
Salesforce AI Research 发布了 E-VQA 任务和 ST-Evidence 基准,解决了视频问答无法验证视觉证据的问题。如果你想理解视频模型真正“看到”了什么,这篇论文值得一读。
想提升音频模型对语气、情感等非语义信息的识别?试试IAAN,在不重训模型的情况下,通过对编码器内部特定神经元做微调就能显著提分,多模型实测有效。
Google 的新模型 Gemini 3.5 本周就要来了,内部测试居然超过了 GPT-5.6 和 Fable 5,比前代 Pro 版强不少。
这篇论文发现VLM其实知道个数但说不准,用内部探测+自纠正就能白嫖15%精度提升,不调参数,挺实用。
这篇论文发现,把文档当图片直接预训练,比先转成纯文本再训练效果更好,感兴趣的可以看看实验细节。
这篇论文用新数据集CSB系统地测了十年间视觉语言模型的进化,发现最新模型在复杂社交场景上已经跟人类顶级描述差不多准了,只有空间依赖错误还没完全解决。
ALICE用聚合蒸馏把8个专家模型塞进一个骨干,在96个病理任务上拿了最佳平均分,还开源了代码。
这篇论文提出了SAGEAgent,它能像医生一样判断该给病人做哪些检查,在几乎不掉准确率的前提下把检查负担砍掉一半多,挺实用的。
这篇论文发了TSAI-MetaFraud数据集,把行为、交易和图数据合在一起,专门做元界欺诈检测,搞多模态研究的可以看看。
这篇论文用最优传输做分布对齐来对抗扰动,不用改模型结构,挺实用的思路。
这两天AI圈太热闹了,OpenAI、SpaceXAI、Meta一口气发了6个新模型,包括GPT-5.6和Grok 4.5,值得一看。
Dify 刚上了 GPT-5.6,还把插件换成 Responses API,跑复杂 Agent 更稳了,赶紧更新用起来。
今天AI圈炸了,一口气四个新模型/产品:GPT-5.6、Grok 4.5、Seedream 5 Pro、GPT-Live语音,每个都有具体数字和对比,值得快速了解。