全部动态
富士通新架构PHOTON在多查询任务上比Transformer快475倍,1.2B小模型实测,省内存省GPU。
Google 把屏幕操控塞进了 Gemini 3.5 Flash,OSWorld 得分和 GPT-5.5 差不多。开发者直接用 API 就能做自动化,很实在。
月之暗面想和OpenAI、Google、Anthropic掰手腕,B端业务起来了,还开源了编程模型K2.7 Code,token省30%。
谷歌把 Gemini 3.5 Pro 推迟到 7 月,就是为了打磨长文本和智能体能力,看看能不能追上 OpenAI 和 Anthropic。
Gradium发了两个实时语音翻译模型,准确率和速度都超过了GPT的实时翻译,还能选声音和克隆,做多语言交流很实用。
Moonshot AI的Kimi K2.7 Code不走寻常路,不写新代码而专注复刻现有产品行为,和Copilot那套完全不一样,值得搞AI编码的人关注。
UC San Diego搞了个新方法DFlash,用扩散模型直接生成整段token,比自回归快几倍,Qwen3-8B上6倍加速,Blackwell上15倍,还开源了检查点,搞推理加速的可以看看。
Anthropic的Mythos模型能快速找到政府机密系统漏洞,而且只用了几个小时,不是几个星期。想了解最新AI安全测试成果的可以看看。
阿里千问发布的这个Qwen-AgentWorld模型,能模拟智能体在七个领域的交互环境,还能当环境模拟器或智能体基础模型,挺有意思的。
Mistral新出的OCR 4能自己部署,支持170种语言,还带边界框和置信度分数,识别效果领先,做文档处理很合适。
Mistral 出了 OCR 4,能提取带边界框和置信度的结构化内容,方便直接用于 RAG 和搜索,支持170种语言还自托管,很实用。
OpenAI 新出的 GPT-5.5-Cyber 专攻网络安全,能自动修补漏洞,基准测试里已经跑赢了 Anthropic 的 Mythos。
网易新开源Confucius4-TTS,3秒克隆你的声音,还能用这个声音说14种外语没口音,全开源随便用,做配音超方便。
百度搞了个Unlimited-OCR,用Constant KV Cache解决长文档识别,缓存不爆炸,性能还最强,适合处理几百页的合同或文献。
OpenAI新出的网络安全大模型GPT-5.5-Cyber挺猛,CyberGym跑分超了Claude Mythos 5,安全团队可以关注一下。
日本 Sakana AI 搞了个 Fugu 系统,能自动选最好的模型干活,Fugu Ultra 在某些测试上比 Anthropic Fable 5 还强,值得看看。
字节跳动新视频模型 Seedance 2.5 能直接生成 30 秒长视频,还支持 50 个全模态素材输入,马上 7 月就能用上了。周星驰经典片段也能用 AI 二次创作,挺有意思。
字节新出的豆包Seed 2.1 Pro和Turbo,专门优化编程、智能体和多模态任务,Pro适合高难度场景,Turbo便宜且效率高,很适合接项目用。
Sakana AI 搞了个 Fugu 编排模型,能自动在多个前沿 LLM 之间切换最优选择,在编码和推理基准上表现很突出。