做艺术标注的可以看:ArtAnno用LLM智能体挖隐含语义,还把标注经验回传给AI,双向增强。
#多模态
想学怎么用Claude Code for web处理带截图的复杂任务?Simon直接把他用的提示词贴出来了,照着试就行。
Video-DR 让 AI 边看视频边上网核实信息,35B 参数干翻 Claude-4.5-Sonnet,还开源了,值得试试。
这篇论文做了个急诊分诊模型,数据残缺时也能给预测打个置信分,拿不准就推迟判断,还用MIMIC-IV-ED实测过,挺实在的。
EcoFrame不用微调,靠熵和注意力决定该看哪些帧,在长视频任务上比BOLT准还快1.85倍,代码已开源。
阿里新出的Qwen-Image-3.0-Pro,生成文字特别清晰,能处理超长提示,一张图0.04美元起,做海报、试卷都合适。
阿里新出的Qwen3.8-Max看图写网页排第二,只比第一的Claude Opus 5少39分,挺牛的。
把双手比框的视频丢给Gemini Omni Flash,它能把框内重绘成AI动画,GitHub上有源码,动手试试看。
黑森林家的 FLUX 3 Video 上 OpenRouter 了,一个模型能生成视频、音频、图像还能做动作预测,想试试直接调 API 就行。
Black Forest Labs出了FLUX 3 Video,能生成20秒1080p带原生音频的视频,还能多帧图生视频,在Replicate上就能试。
Kimi K3和DeepSeek V4现在走了两条路:一个搞原生多模态,一个纯文本硬扛。长任务里能不能看懂画面,差距会越来越大。
想用一个模型同时搞定稀疏检索和稠密检索?UEmbed把两件事合成了一次前向,9B在MMEB-v2上分数还挺能打,多模态输入也支持。
阿里把 2.4T 参数的 Qwen3.8 Max 放 OpenRouter 了,下周开源,长时程编码和多模态智能体都能用,想体验可以直接去跑。
这篇论文用1,600个人类写的幻觉样本对比了18,400个模型生成的样本,发现人类样本更稳定、更好控制,以后测幻觉不用老换模型了。
论文把机器遗忘做到属性级:让模型忘掉指定属性,但保留同一人的其他信息。CLRP不用重训练,在多种多模态模型上都有效。
商汤开源了新多模态模型,8B参数就能生成4K图,编辑效果还追上闭源大厂,想玩图像生成的可以试试。