葡萄牙政府新搞了个葡语开源大模型AMALIA,9B参数就能理解文本、图像和声音,年底还要出22B带智能体,搞葡语相关任务可以试试。
#多模态
这位博主分享了Codex和Claude Code在实际使用中的差异,点出Codex用户多但内部编码Claude Code更受欢迎,还聊了多模态模型的潜力,挺接地气的。
Google 出了个便宜好用的视频生成模型 Gemini Omni Flash,直接用自然语言改视频,快去 AI Studio 试试。
这篇论文的方法很实在,用多模态搜索加整体判断,在ARC-AGI-2上做到了72.9%,比GPT-5.2 Pro高了将近19个点,代码还开源了。
Google DeepMind 的新模型 Gemini Omni Flash 能边聊天边剪视频,还能把文字和图片直接变成视频操作,很实用。现在在 Google AI Studio 就能试。
Google把Nano Banana 2 Lite和Omni Flash串起来,先4秒出图再直出动画,比主流模型快且便宜。创意迭代更爽。
Google发了两个新模型:Nano Banana 2 Lite图像模型更快更省钱,还有Gemini Omni Flash能做视频生成和编辑,今天就能在API上用了。
MiniMax 在上海电影节上正式发布了 Hub 平台,还展示了用 AI 一个月拍出电影的成果,想看 AI 视频工具怎么落地影视创作可以了解下。
DeepMind 让 Nano Banana 和 Gemini Omni 能配合干活了,先画图后动画,还能连续改三次,挺实用。
Anthropic 发布了更智能的 Sonnet 5,能在 Agent Arena 里自主用浏览器和终端干活,比几个月前的大模型还强。
Google今天发了两个新API:一个4秒生图才3分4,另一个能边聊边改视频,价格和Veo 3.1一样。
Empero AI 开源的 Qwythos 9B 把 Qwen3.5 和 Claude 思维链结合,1M 上下文加 Function Calling,量化后 5.2GB 的推理模型,低配机器也能跑。
这篇论文提出了BrainJanus,一个能双向翻译脑信号与图像、文本的统一模型,在零样本和生物可解释性上突破传统方法。
这篇论文找到了一种聪明的方法:先快速扫一遍图像找出可能的目标区域,再只对这几个区域做多模态融合,省了很多计算。适合想做轻量级多模态目标检测的人读。
用 Nova 2 Lite 做粗提取,Claude Sonnet 4.6 做精准匹配,文档数字化省心又省钱。
Step 3.7 Flash 开源多模态推理模型刚上线 DeepInfra,支持私有部署,适合智能体编程和视觉任务,开发者可以试试。
微软 MAI-Image-2.5 图像生成排第2、编辑排第3,还能把雨窗变清晰,想用去 Foundry API 或 OpenRouter 试试。
StepFun 的新模型 Step 3.7 Flash 上线 ZenMux,多模态且快,还能免费用一个月,想试试的别错过。
Jasper Research 放出了 MONET 数据集,有 1 亿多张图,免费商用,还能用 nano-t2i 在单卡上训练模型,做文生图的值得试试。
他们搞了个新架构,让机器人能自己协调API、物联网和物理动作,干活出错还能自己恢复,20个任务里成功率都比之前高,而且省钱省token。
看看这个团队对Physical AGI的看法,他们提出了3+1个必要条件,还做了颠球计数的演示,强调端侧运行和统一多模态大脑。
这篇论文用TriViewBench测了18个多模态模型,发现它们都在多视图推理上崩得厉害,CoT也救不了。想了解当前MLLM的结构推理极限,可以看看。
这篇论文用Facet-Probe测试了18个主流多模态大模型,发现它们对输入顺序都很敏感,最好的模型也错13.4%,提醒我们模型可靠性还不是想象中那么好。
Cola刚发了Seed 2.1 Pro,说是多模态最强,coding和agent比2.0强不少,想试试去colaos.ai就行。