#多模态
英伟达开源微调工具 AutoModel 现在也能调图像视频模型了,提供现成 LoRA 脚本,省去写分布式训练的麻烦。
阿里发了 Wan-Streamer v0.2,视频电话延迟才 550ms,画质从模糊到高清,还能边听边看边回应,挺有意思。
Kimi 新模型 K3 跑分赢了 Opus 4.8 和 GPT-5.5,2.8 万亿参数还带百万上下文,解码快到飞起,技术细节值得细看。
谷歌给 Vids 加了数字分身,上传自拍和录音就能生成自己出镜的 AI 视频,还能用 Gemini Omni 改背景调光线,比 HeyGen 更方便。
新基准 MM-IssueLoc 专门测模型到底有没有用截图这类视觉证据,而不是全靠文本猜。当前最强系统得分才三十多,说明视觉定位远没解决。
Kimi 发了 K3 开源模型,2.8T 参数加上百万上下文,在编程评测里甚至超过了 Claude 和 GPT,做智能体特别合适。
这篇论文用49道题测了Gemini、GPT-4等6个模型对科学图表的理解力,发现Gemini最强但人类平均还是更高,开源模型差距明显,想了解模型真实视觉推理能力可以一读。
新论文用语义感知对比学习解决医学影像的假阴性问题,在脑肿瘤分类上AUC涨了22.6%,值得搞多模态医疗AI的人看看。
Inkling 是 Thinking Machines Lab 的新多模态 MoE 模型,同时支持文本、图像、音频输入,还能控制推理计算量,效率很高。
Kimi搞了个2.8万亿参数的开源模型K3,性能追平GPT-5.6 Sol和Claude Fable 5,不过价格也上去了,中国AI要涨钱了。
Meta 新模型 Muse Spark 1.1 上架 OpenRouter,输入才 $1.25/M,还支持多模态,做智能体很划算,美国开发者快试试。
Thinking Machines 出的 Inkling 开放权重模型在多模态推理和多个基准上表现不错,是美国目前排名最高的开放模型,不妨试试它的推理效果。
Mira Murati 的新实验室发布了 Inkling,975B 参数的 Apache-2.0 多模态开源模型,专门为微调设计,想折腾的开发者可以试试。
thinkymachines开源了一个超大MoE模型Inkling,总参975B但只激活41B,还支持1M上下文和图文音频理解,已经可以在SGLang上跑了,想玩大模型的朋友可以试试。
Dify 和 AMD 办比赛了!3 万美元奖金,还能免费用 AMD 显卡搞智能体、多模态或物理 AI,想练手的快去报名。
前OpenAI CTO Mira Murati的初创公司推出了9750亿参数的开放权重模型Inkling,性能领先美国同类但不及中国领先模型,适合做微调基础,价格明确。
Thinky发了首个模型Inkling,975B参数开源,Apache 2.0协议,据说是美国开源最强。关注开源大模型可以看看。
Mira Murati 新公司出了开源多模态模型,近 1T 参数但只激活 41B,支持 1M 上下文,还能自己微调,值得试试。
Thinking Machines 发了 Inkling,一个能看图文听音频的推理模型,而且权重全开放,能自己微调,还能在 Playground 试玩。
Mira Murati团队开源了多模态模型Inkling,975B参数,比Nemotron和Kimi K2.5强,指令遵循甚至超Claude,值得一试。
Inkling 让你能控制模型思考深度,975B 参数但只激活 41B,适合做定制化基础模型。
Thinky Machines 开源了 975B MoE 多模态模型 Inkling,Apache 2.0 随便用,适合微调,直接在 Fireworks 上跑。
Thinking Machines 出了个新模型 Inkling,能同时处理文字、图片和音频,还在 Agent Arena 上测了长期任务能力。现在能免费下载权重自己微调,可以试试。