字节跳动大模型嵌入企业工作流,日token调用量180万亿,年增10倍,重塑消费市场。
OpenAI 怕 Astra 模型搞网络攻击,故意放慢开发,还搞了个 30 分钟报警系统。
Cartesia 新出的 Sonic-3.6 语音模型延迟很低,还拿了两个第一。
宾州州立大学研究者给Qwen3.5-9B加了个模块,能让AI压缩上下文时少丢用户指令,保留超90%限制,比原来83%好多了。
赛昉发布了服务器级RISC-V CPU IP,性能对标Cortex-A78,支持256核扩展,适合关注国产芯片和HPC的朋友看看。
共生知行让宇树机器人自己开卡丁车,手眼脚协同,直接感知控制模型,值得一看。
哈佛和MIT搞了个能模拟83亿人的AI系统,测试一致性91.5%,比一般模拟靠谱多了,开源了可以看看。
Anthropic悄悄透露了下一代模型Model 2,比现在的Claude Mythos 5更强,虽然提升不大,但值得关注。
骁龙X2 Elite Extreme跑分超AMD、Intel同代,AI差距更大。买Win本可关注。
港大和KAI的SMASH 2.0让两台人形机器人自主打完11分制乒乓球,8月22日在北京首秀。
字节和清华出的新系统,用强化学习让模型自己写CUDA,KernelBench上Seed1.6有74%通过率,能超编译器。
27B的小模型追平了GPT-5.6和GLM-5.2,参数还小几十倍,值得看看。
英伟达的新开源模型,30B MoE 但只跑 3B 活跃参数,放在 SageMaker 上直接部署,专为智能体高频调用设计,吞吐量翻 4 倍,适合跑大批量任务的人。
阿里刚发了AI音乐模型HappyShrimp 1.0,你把情绪或故事用大白话写进去,它就能生成一首完整的歌,比那些只认风格标签的工具更懂人话。
这个新模型能同时生成24帧视频和48kHz立体声,比之前无声的世界模型多了一路声音,而且马上开源,可以自己跑一跑。
这周Arena盲测榜变化大,Anthropic新Claude扎堆屠榜,国产kimi-k3-max在代码和前端都紧咬前排,看看具体分数吧。
阿里自家的新语音模型,ASR、TTS、实时对话都拿了全球第一,现在API直接能用。做语音应用的话值得试试。
刘强东直接开源了京东全栈AI,EgoLive和JoyAI都能拿到,物流机器人已经用上了。
这篇文章说AI数学强在记性好而不是脑子好,用上下文窗口碾压人类工作记忆,角度挺新鲜。
农业AI也卷起来了,丰菽2.0把大豆的基因组、文献、病害数据全揉一块,能帮你做亲本筛选和表型分析,做育种研究的可以看看。
阿里新出的Qwen 3.8 27B开源模型本地可跑还带视觉,但默认爱钻牛角尖。关掉推理后同样的活从21分钟变2分钟,值得折腾。
小红书开源了dots3-note preview,华为当天就完成昇腾适配,280B参数全模态模型现在就能在Atlas上跑。
顶级密码学家Matthew Green说,AI补洞太快,警察的黑客工具快没用了,而且后续可能更麻烦,读读这个有启发。
国家超算互联网上线了 DeepSeek V4 Pro 和 Harness,部署开发一站式,性能对标 Claude Fable 5,国产算力党可以关注。
阿里开源模型Qwen下载量冲到全球第一,衍生模型数是Meta的2.6倍,看Hugging Face报告细节。
这模型用普通显卡就能跑出Opus级能力,跑分还压过Claude,推理可调挺实用。
至知研究院的新方法拆权重就能解释大模型,数据成本不到1%,比训练替代网络省太多了。
Moonshot AI 出了个新测试 PerceptionBench,专门查 AI 的“眼神”。结果最强模型 GPT-5.6 Sol 准确率也不到 60%,而且很多错是从看图时就错了。
国产超算平台直接上线 DeepSeek V4 Pro 正式版,还能一键部署和二次开发,Harness 框架也开源了,搞智能体开发的朋友可以看看。
智谱发布GLM-5.3,编程能力比上代强50%,登顶多个开源基准,荣耀YOYO Claw已接入,两周后开源可关注。
智谱的GLM-5.3开源模型编程能力比GLM-5.2强一半,写代码的可以试试,据说是目前最强开源编程模型。
阿里开源了Qwen 3.8,270亿参数比Qwen 3.7 Plus更强,原生支持26.2万token上下文,做本地和智能体应用可以看看。
Meta把开源模型Glimmer放出来了,能自己下载跑,不像自家Muse Spark只能走API。扎克伯格还发了封信说AI该人人可用。
阿里把 27B 这个最受欢迎的尺寸开源了,编程办公比 Plus 还强,还能控制思考深度省算力,适合自己部署玩。
一个神经外科医生借 GPT-5.6 证明了 Crouzeix 猜想,数学家集体震惊。完整提示词和代码都开源了,可以看看。
Kog这家法国创业公司说,都说GPU跑智能体任务不行,其实是个误会,他们正深挖推理性能,跟主流唱反调。
智谱发了GLM-5.3,说是开源编码模型里最强的,后训练提升50%,还帮找出了2436个漏洞,权重两周后开源,可以关注下。
GLM-5.3刚发布,编码接近Fable 5,还揪出40年老bug,开源安全模型也拿第一。
X Square Robot用简单夹爪一小时分拣1816个包裹,还拿Figure AI的数字当基准,结果超了45%,挺实在的。
VUI Labs的Luna-TTS登顶语音评测榜,延迟才41.6毫秒,比ElevenLabs还快,搞语音合成的该看看。