想提升音频模型的逻辑推理?这个框架用文本教师蒸馏,在MMSU等基准上效果拔群,比纯音频训练强很多。
TTEL能定位推理错误,只重算出错部分,省近一半计算量。Qwen3-8B在编程测试上成绩亮眼,值得关注。
GS-Agent把多个AI智能体和物理引擎连起来,你只要说句话就能生成带物理模拟的4D场景,液体、物体碰撞都能搞定,做内容创作或模拟都省力。
PATS用动态训练支架帮弱策略少犯错,ALFWorld和WebShop上最高提升18.6%,而且部署时没负担。
想测LLM的长对话记忆力?RUMBA这个俄语基准能细粒度诊断模型在时间推理上的强项和短板。
PG-KINN用Petrov-Galerkin方法结合KAN,在多个力学难题上精度超过PIKAN和MLP,值得做计算力学的人试试。
这篇论文提出了iPANN和fPANN,用区间和模糊集处理本构建模中的不确定性,能包围噪声观测,还能把不确定性传到有限元仿真里。
这篇论文用有限体积残差训练图网络,省了标注数据,效果还比有监督好,做热流体模拟的可以看看。
这篇论文用专家聚合让贝叶斯在线学习自适应,无需事先设定学习率或先验,实验还证明能自动跟踪最强专家。
想用 AI 辅助康复评分又怕黑盒?PhaseAware 精度高(RMSE 降 88.9%),还能给出运动阶段和身体部位的敏感线索,方便医生审查边界案例。
PIER解决了嵌入检索可能忽略物理过程一致性的问题,在356个湖泊数据上验证了水温和溶氧预测的显著提升。
这篇论文提出了PoTRE,用四个不同角色的智能体协作推理,在HLE上拿了新SOTA,而且比单纯堆参数的模型更省计算量。
Solar Open 2 发了,250B MoE 模型,1M token 超长上下文,专门跑复杂智能体任务。MMLU-Pro 和 LiveCodeBench 都领先,韩语能力还特别强,比 DeepSeek-V4-Pro 小很多但性能接近。
想看看AI在基因组监测上多不靠谱?新基准BioSecBench-Surveillance测了16个模型,最好才一半正确,细节值得细读。
想测试病理AI能不能像医生一样在超大图片里找病灶?这个基准专门考这个,结果发现定位能力还很弱。
如果厌倦了RLVR微调慢慢跑,试试ISO:只用1/3的训练步数就能达到同等效果,Qwen3-8B上实测有效,代码开源。
VirtualSet让LLM不用冒SQL幻觉的风险,改天用类型安全的set表达式,BIRD上准确率反超4个百分点,写操作还能拦截瞎编的数据输入。
研究者发布了两个轻量级病理AI模型,GigaPath-Flash在切片分析上几乎不输十亿参数大模型,速度快50倍;GigaTIME-Flash还能直接预测肿瘤微环境,速度更快又省显存。开源可用,做病理和免疫研究很实用。
O-VAD不用训练就能检测工业视频异常,跟踪对象状态变化,比传统方法更准。
部署多模态模型时延迟高吞吐低?FlashRT 让智能体自动优化,实测延时降 70 倍,吞吐升 3.6 倍,AMD 平台效果尤其猛。
IBM 发的新框架 ClouDens,用图神经网络做云系统异常检测,在真实数据集上比 GRU 模型更准更早,适合做运维监控的朋友看看。
这篇论文分析了评分RL中信号丢失的普遍问题(57%样本受影响),并提出CriPO自蒸馏方法,在医学和科学基准上效果更好且训练更快。
想做可靠的科学生成?SFC框架让模型一边写一边用共形预测校验事实,结果比DeepSeek和GPT-4都准,还能少犯73%的科学错误。
这篇论文把LLM当推理引擎,把知识存进显式数据库DaoQL,反事实推理比GPT-4o单独强49个百分点,适合做高精度场景的参考。
不用为每个图数据集调参了,Node4All一个模型跑25个基准排名第5,还支持one-shot学习。
这个新方法把强化学习和知识蒸馏结合在一起,解决了RL和OPD各自的短板,跨家族蒸馏效果尤其好。
你要是做免疫组库时间序列分析,这个模型把神经ODE和Transformer揉在一起,能处理克隆动态和复发,比静态模型强。
这个框架用扩散模型做公里级天气预测,垂直风误差不到3%,比传统方法快很多,做精细化气象预报的朋友可以看看。
这篇论文的PUMA框架能实时诊断大模型推理时是有效思考还是绕圈子,在1.5B到32B模型上准确率更高且更省计算,推荐给关心推理效率的朋友。
一篇论文提出VLA-ReID方法,专门解决蜜蜂等高度相似物体跟踪中的身份切换问题,不用额外标注就把重识别精度拉高了一大截。
想看最强的AI在实时观察任务上有多弱吗?ActiveVision让GPT-5.5和Claude Fable 5原形毕露,人类碾压它们。
想看看AI能不能做商业案例分析?这个新基准直接给模型打分,结果挺有参考价值。
研究者发布了Loopie循环Transformer,用更少活跃参数在IMO和IPhO拿到金牌,比普通模型强很多。
MeanFlowNFT让平均速度生成器也能用上强化学习,4步生成效果比50步的RL模型还好,值得试。
NeuronSoup用遗传算法进化共享神经元图,不依赖反向传播,在MNIST上达到85.9%准确率,模型只有115KB,适合探索非梯度训练的新路子。
NVIDIA发布了RoboTTT,能把机器人策略的上下文窗口做到8000步,看懂人类演示后直接模仿,长任务完成率比单步模型高87%。想了解机器人怎么学更长历史可以看这个。
一种新的Transformer改进:只改中间20%的层加个循环机制,就能让模型推理更持久,而且可以直接改装现有模型不用从头训。
临床医生亲自设计的AI安全测试,能精准定位模型在哪类医疗错误上出问题,搞医疗AI的必看。
Qwen3-8B长上下文微调显存不够?HGA方案在16GB卡上跑16384令牌,比密集训练省显存还快一点,代码正在路上。
OpenAI的o4-mini做大学物理题整体准,但看图题就露馅了,准确率从96%掉到79%。