全部动态
SafeEvolve通过策略协同进化提升AI智能体安全性,在降低有害响应的同时保持性能,比现有方法更有效。
工厂智能体如何通过子网络选择在有限硬件上高效运行,实测功耗仅1.3-5瓦。
DKL解决了RAG检索失败时的问题,比RAFT和PA-RAG方法更高效,还能保持指令模型的指令跟随能力。
这篇论文教你如何检测黑盒大模型的幻觉,有4种方法可选,无需监督标签也能用。
斯坦福团队新论文提出Web Agent世界模型新训练方法,在WebArena基准上表现更好。
PARSER方法通过输出重要性指标优化MoE模型压缩,在相同内存减少下提升模型精度。
研究将LLM与本体排序器融合,提升罕见病诊断准确率,同时保留可追溯的证据链。
FUSE框架首次系统评估了12个商业LLM的危险能力,发现模型间存在显著差异,新模型知识增强但安全提升有限。
HiPoly框架能从实验数据直接预测聚合物性质并设计可持续替代品,比传统方法更高效准确。
新DA协议让模型自己决定关注哪部分内容,大幅减少计算量,Gemma和Qwen模型效果显著。
这篇论文分析了AI如何影响人类创造力,提出混合团队表现优于单一团队,探讨了AI与人类创意互补的可能性。
MIT团队发布文明VI智能体基准测试,揭示AI在长期规划中的监控和执行缺陷。
UTP-Bench用真实数据测试GPT-5等模型,发现它们在时间缓冲、延迟感知和人群敏感规划方面与人类计划差距明显。
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步! 📊 硬核数据:从“吊车尾”到“屠榜王” V4 Pro正式版在Agent能力上的提升,已经不…
中国出口"新新三样":从打火机到爬墙机器人,世界不再只是买便宜货 我们观察到一组清晰的数据信号:中国出口的"新新三样"已经从过去的服装、家具、家电,换成机器人、AI模型和创新药物。这不是产业升级的修辞游戏,而是发生在澳大利亚和巴西的实证样…
Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索…
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器 我们观察到 DeepSeek-V4-Flash-0731 在站内 rawitems 与 items 数据流中高频出现。需要先声明一个基本口径:截至本文撰写时,Dee…
Claude Opus 5 上线 Genspark:价格仅为 Fable 5 一半,智能旗鼓相当 发布机构:Genspark 宣布时间:2025年(基于推文发布时间) 可用平台:genspark.ai 涉及模型:Claude Opus 5…
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档