论文
一篇体系结构论文,做了个跨主机的总线互连,64 卡系统上把 RoCE 的延迟砍一半,跑 DeepSeek R1 快 30%-80%,做 AI 集群的你看看。
拿 Gemma、Llama、DeepSeek 三个模型做了个挺狠的测试:简单题模型根本不看自己的推理,难题上错误会一路传到底,这对做 CoT 监控的人是个警告。
拿 2267 份真实英国基金申请,让 Gemma 3 27B 和 DeepSeek R1 等六个开源模型打分,跟人类审稿人比相关系数,结论是初筛能用、终审不行。
这篇论文挺反常识的:不用任何权重、靠 Mandelbrot 分形坐标做语言决策,延迟只有 7ms 还能跑在单片机上,可以看看它怎么绕开 LLM 的。
一篇教 RL 生成 SVG 的论文:把每条指令拆成 6 项评分细则当奖励,不需要标注数据,效果追平 DeepSeek-V3,做生成任务奖励设计的可以看看。
这篇论文造了个很较真的基准:不看智能体能不能把指标刷上去,只看它交付的模型到底行不行,连"训练了但没学到东西"这种静默失败都能抓住,四个前沿模型全被拉出来和人类工程师对比。
NGRC 用更少数据就能从 Lorenz 系统一个变量推出另外两个,比传统 RC 省时省算力,还在真实 ENSO 气候数据上跑通了
标注对齐数据不用整段重写,定位到第一个错 token 改掉让模型接着生成,实验里中位时间省 52%,还附了 Panda-CVL 数据集。
Google开源了RRSI:给自动进化智能体harness的方法加正则化,分布外基准还能涨4.7分,还省30%的token。
机械臂规划的新论文:跳过 3D 重建,直接从 RGB 图像学势场做 6-DoF 轨迹规划,UR10 上全起点零碰撞。
把蛋白质注释当文本生成任务来解,用 QLoRA 微调 3B 的 Ministral 3,还让 GPT 当策展人打分,思路挺新鲜。