全部动态
想了解怎么让GUI智能体更可控?这篇论文讲了Plover系统,能把内部计划展示出来让你改,实验证明能修好很多翻车案例,比黑箱靠谱多了。
这篇论文用49道题测了Gemini、GPT-4等6个模型对科学图表的理解力,发现Gemini最强但人类平均还是更高,开源模型差距明显,想了解模型真实视觉推理能力可以一读。
这篇论文分析了AI如何把科研从手工艺变成流水线,还举了Genesis项目的例子,提出了七个扎心问题,比如同行评议会不会被机器淹没,读了对AI和科学的关系会有新认识。
这篇论文把仿人机器人控制的缩放问题拆解清楚了:Humanoid Transformer配合特定训练范式,让MPKPE直接降了82%,比现有控制器强一大截。
这篇论文提出NIFA架构,用ACAM替代ADC省掉70%面积和功耗,让FPGA跑Transformer能效提升近2倍,CNN更是飙升40倍。
这篇论文用LLM智能体模拟政党结盟谈判,设计了MILT和CIS两个新指标来追踪条款来源和影响力,在比利时选举数据上验证了有效性,对政治学和AI研究都很有参考价值。
研究报纸结构理解的,有开源Tiramisu代码和新数据集,对文档数字化领域很实用。
脑科学研究有多繁琐你懂的,BrainPilot开源出来帮你自动查文献、做分析、防编造,性能不输顶级框架还省钱。
这篇论文提出了一个叫ArtSplit的讨论工具,帮你理解AI协作创作时所有权到底该归谁,跟艺术家们聊了聊,发现简单量化行不通。
这篇论文用Claude Code和OpenAI Codex实测了记忆注入攻击,发现一旦恶意指令写入记忆,后续会话都危险,搞AI安全的一定要看看。
这篇论文讲AI会偷偷按自己价值观答题,比如Claude对自己公司更友好。想知道你的助手是否悄悄偏袒谁?值得一看。
这篇论文提出了cGAP,一个新框架,用HOMALS加热图来可视化高维分类数据,特别适合基因、生物医学等领域。能保持原数据矩阵,同时揭示聚类和结构。
新论文用语义感知对比学习解决医学影像的假阴性问题,在脑肿瘤分类上AUC涨了22.6%,值得搞多模态医疗AI的人看看。
这篇论文用多轴Max@K强化学习,让T2I模型生成更公平多样的人像,公平分提升0.23-0.36,不牺牲质量。
LongStraw 能让你在固定 GPU 预算下做百万 token 级别的强化学习后训练,比现有 256K 的方法多处理 8 倍上下文,而且内存增长极低。
MOJO让神经解码模型也能用大量无标签数据,比纯监督学习更强,尤其数据少时效果拔群。
这篇论文用Evo 2搞生物安全筛查,探针测耐药基因最高准到0.977,比自编码器靠谱还不用重训练。
Lighthouse RL用巧妙的‘灯塔’重置点大幅提升电路优化效率,样本快1.72倍,成功率拉满到100%。搞硬件优化的千万别错过。
这篇论文用Lyapunov指数做奖励,让强化学习不仅复现了Kapitza摆,还找到了更稳的竖直不倒方案,挺有意思。
想解决Agent长程任务奖励稀疏问题?看TRACE方法,无需额外批评器,用TD变化给每步打分,Qwen3在BrowseComp-Plus上从7分直接跳到35分。
这篇理论论文把 Dikin walk 采样的混合时间从 $d^{2.5}$ 降到了 $d^{2.25}$,离理论下界 $d^{2}$ 更近了,搞采样理论的同学可以关注。
这篇论文教你用无监督聚类自动分析心脏PET/MRI,在99名患者上准确匹配医生判断,省时省力。
VAIOM 是专门处理金融连续数据的解码器模型,在汇率数据上比 LightGBM 强 0.03 比特以上,创新点是把连续输入和离散输出分开建模,值得做时序预测的人一看。
这篇论文搞了个P-EVAL框架来评估农业AI的安全性,Pezego-HITL架构在加纳测试,延迟降了55%,还挺靠谱的。
这篇论文提出 Deep Interaction,让你可以直接改推理步骤的错误,不用推倒重来。实验说 STEM 任务上纠错成功率涨 25%,token 还省 40%,挺实用的方法。
这篇论文把RAG和量规评分用在地震教育里,还搭了乐高机器人,让小学生边玩边学安全知识,挺实际的新方法。
满文OCR因为书写风格多变很难做,这篇论文用了个巧妙的办法:训练几个专家模型再加个路由分类器,哪个风格用哪个专家,精确到0.3%的错误率。挺实用的思路。
仅展示最近 2000 条内容,更早的内容请查阅 AI 日报存档