想给图像或视频扩散模型做低位量化?OrbitQuant不需要每换一个模型或任务就重跑校准,FLUX.1、Wan 2.1上表现都很能打,W2A4也有可用效果。
想看看AI智能体怎么自己迭代策略吗?EvoPolicyGym这个新基准让GPT-5.5跑了16个强化学习环境,全部拿到前两名。
想搞权重空间分析的可以看看,这篇用动态图编码推理过程,在 INR 分类上直接提了 10 个点,挺实在的。
TiRex-2是首个同时支持多变量流式预测和已知未来协变量的时间序列基础模型,零样本刷新GIFT-Eval和fev-bench榜单,每步计算量不变。做在线时序预测的朋友可以看看。
ZO-Act用激活信息锁定关键子空间,让零阶微调更稳定,在Llama-3和OPT-13B上都比旧方法强,适合显存受限的场景。
SynLaD同时搞定分子设计和合成路线,比以往只顾一头的模型更实用。
这篇论文搞了个GSRQ新量化方法,1-bit下比VQLLM准22个点,专门解决KV缓存压缩时的方向丢失问题。
Theoria 能审计 AI 回答的每一步推理,HLE 上精度 91.4%,比纯 LLM 评判更可追溯,专治隐藏前提和伪造引用。
如果你关注机器人组装,FurnitureVLA用VLA模型把仿真成功率从48%拉到80%,还能在真机上跑。它处理长程任务的方式很巧妙,值得看看。
DiscoPER能自己挖掘数据规律,在生态基准上检出率接近90%,比传统因果方法好用多了。
想找一种不用数据增强的时间序列自监督方法?LeNEPA用下一个潜在预测取代传统对比学习,在跨数据集表现更稳,学习速度也快一倍。
LUNA 不用传统的 LBS 蒙皮,直接用图片或关键点驱动3D角色,效果真实还能自动适配新角色,动画师和研究者可以试试。
Fork-Think让LLM推理更省钱省时间——先找准关键点再思考,token少用30%,速度快57%,效果还不输并行方法。
ITSPACE用闭式更新直接优化Bures-Wasserstein距离,在协方差对齐任务上比梯度下降快得多,适合资源受限的域适应场景。
想让人形机器人自己学会拿东西?VLK用48,000条合成轨迹模拟真实场景,直接在Unitree G1上跑通了导航和运输,省掉人工标注的苦力。
LeVo 2 发布了一个能生成完整歌曲的模型,通过分层建模和美学引导训练,歌唱质量和可控性都比开源方案强,已经逼近商业系统水平。
35B的模型干翻万亿参数?Agents-A1用长视野扩展和智能体框架做到,基准全面领先,值得看看怎么训练的。
要预测股票涨跌?这篇论文搞了个自适应 Transformer,把95个金融指标分成11组,根据市场风向调整注意力,还省了15%的算力。
DreamForge-World 0.1 Preview让你在消费级显卡上实时操控世界模拟,支持键盘鼠标,15 FPS流畅运行,比那些需要超算的模型亲民多了。
科学家们搞了个新基准NMO,专门用来测试分子优化算法在纳米技术上的表现,直接用量子模拟打分,结果发现之前的先进方法还不如简单方法好用。
这个新基准EMPATH专测情感支持聊天机器人的安全漏洞,用AI模拟求助者进行多语言多轮对话,发现主流模型评分虚高且不稳定,值得一做。
这篇论文给掩码扩散模型加了重新掩码机制,像有个纠错开关,Sudoku和QM9上效果很好,值得做推理优化的读者看看。
想用Transformer预测城市网络流量?这个PEHT用LoRA大幅减少参数,还能融合拥堵数据,实测精度超过现有方法。
不用多相机,单视频就能重建多个物体怎么动,还能人工纠正错误。HAT-4D这个框架开源了,做Embodied AI的数据生成很方便。
多智能体容易各说各话?LLawCo让它们自己学会“必要时说话”“等待伙伴”,在PARTNR-Dialog和TDW-MAT上成功率都涨了4-7个百分点,挺实在的。
这篇论文提出了CPAgents,用三个智能体自动组合心脏影像特征,相比传统方法在56/72测试中拿第一。适合关心AI辅助医学研究的读者。
他们提出了 TRL,让强模型和弱模型组队推理,强模型学会写弱模型能看懂的推理过程。训练 Qwen3-4B 后,单打能力不降,协作能力更强。
想让模型在不同参考图下都稳定分割?试试 CG-ICS,用概念推理代替简单视觉匹配,SAM3 和 MLLM 帮你搞定。
BashCoder-R1用三阶段训练让AI写bash脚本更稳更可解释,在BashBench上比DeepSeek-V3.2完整率高出一大截。
E-TTS团队搞了个新框架,不用重新训练就把机器人操作成功率在模拟中提33%,真实场景提26%,挺实用的。
他们搞了个新架构,让机器人能自己协调API、物联网和物理动作,干活出错还能自己恢复,20个任务里成功率都比之前高,而且省钱省token。
模拟硬件跑生成模型能耗低两数量级,AIS框架在MNIST上FID仅27.6,比之前好3-4倍,适合低功耗场景。
DeepSeek-V4新出的HyperDFlash框架,用门控缩减和蒸馏让推测解码提速,比MTP和DFlash都厉害。
想看你用的LLM在核工程上有多靠谱?NuclearQAv2用1240道硬核题测出模型的定量推理短板,比通用基准更实在。
新框架FORCE让机器人学动作更快更稳,成功率飙升79%,比现有RL方法还快32.5%,不用人插手。
SpeechEQ搞了个新基准,测AI在对话里能不能听懂语气和情绪,发现模型靠文字猜情绪,安全对齐后还变傻了。想做真情感AI的必看。
这篇论文说,RL后训练时顺便就能得到一个免费的好信号,不用再费劲训练奖励模型,在好几个测试里都比专门训练的效果还好。做智能体训练的一定得看看。
InvestPhilBench揭示了AI在投资程序推理上的真实水平:Claude虽高分,但程序推理准确率仅0.77。别只看总分。
想用小型模型搞定各种优化问题?MiniOpt用3B参数就做到了不错的效果,而且代码开源随便玩。
想从单张图生成高质量3D模型?FLUX3D用扩散对齐稀疏表示解决了细节丢失问题,效果比现有方法好一截,值得搞3D生成的看看。