论文
这个系统解决了企业用AI时最头疼的问题——不知道效果好不好,能不能用。它不是简单测试模型能力,而是模拟真实工作流,给出具体的数据和决策标准。
朋友,这是篇挺有意思的论文,研究的是临床预测中 VLM 模型如何利用 ECG 数据。他们发现模型虽然能处理多模态信息,但可能没真正用到 ECG,然后提出了一种叫视觉提示词调优的方法来解决这个问题。
这篇论文挺有意思的,专门研究大模型如何理解中文网络热词,比如“yyds”这种,还做了个专门的基准测试,对做跨语言AI或者安全相关的研究应该挺有参考价值。
这是关于如何让AI绘画在普通电脑上流畅运行的技术,作者做了三件事:一是用嵌入翻译器减少模型大小,二是提供了一套优化流程,三是做出了一个能秒级出图的编辑器,和之前需要专业显卡的方案不同。
这篇论文介绍了一种叫 RegKT 的新技术,专门用来提升知识追踪模型的性能,让它在处理教育数据时更稳定,不容易过拟合,同时还能保持模型的可解释性,对做教育应用的开发者可能有帮助。
这个 PARTS 框架挺有意思,就是针对机器人执行长时程任务时,那些容易卡壳的关键步骤,用强化学习去专门训练,效果比单纯用预训练策略好很多,而且需要的人类操作也少。
这个研究很实用,它告诉你别只看模型在基准测试上的分数,因为换一个数据集或者换一种提问方式,结果可能就大不一样了,比如健康对照组换成非结核病对照组,模型的准确率就会下降。
朋友,有个新模型叫 GraphSkillEvo,它用图结构来优化大语言模型的技能,效果比之前的 SkillOpt 好一些,在 GPT-5.4-nano 上提升了 4.01%。
朋友,TrialAtlas 这个多智能体系统挺有意思的,专门帮药企做临床试验设计,能从文献和监管历史里学习经验,比 OpenAI 和 Gemini 的效果都好,值得看看。
想了解游戏开发中 AI 生成软件的性能?这个新基准测试集 GameASG-Bench 很有用,它有 47 个具体任务和详细的实验数据,能帮你判断不同模型的效果。
想了解如何用开源工具优化 AMD XDNA NPU 上大模型的性能,这篇论文用 FlashAttention 做了详细案例,对比了不同设计,还给出了具体优化策略。