5月14日
13:26
13:26官方账号arXiv cs.LG@Tara Bogavelli, Gabrielle Gauthier Melançon, Katrina Stankiewicz, Oluwanifemi Bamgbose, Fanny Riols, Hoang H. Nguyen, Raghav Mehndiratta, Lindsay Devon Brin, Joseph Marinier, Hari Subramani, Anil Madamala, Sridhar Krishna Nemala, Srinivas Sunkara
精选
EVA-Bench 是一个全新的端到端评估框架,专门用于测试语音智能体(Voice Agents)在真实对话场景中的表现。它解决了现有基准无法同时模拟动态对话和全面衡量语音特有失败模式的问题。框架包含 213 个企业级场景,并引入两个复合指标:EVA-A(准确性)和 EVA-X(体验),分别评估任务完成度、忠实度、语音保真度以及对话流畅性、简洁性和轮次时机。在 12 个系统上的测试显示,没有系统能同时在两个指标上超过 0.5,且峰值性能与可靠性能差距显著。该框架已开源,为语音智能体的标准化评估提供了新工具。
推荐理由:做语音智能体或对话系统的团队终于有了一个能同时测准确性和体验感的基准——EVA-Bench 覆盖了企业场景和噪声鲁棒性,直接帮你对比不同架构的优劣,建议点开看看具体指标设计。
10:56
10:56官方账号Simon Willison’s Weblog博客/媒体
Datasette 项目正式推出官方博客,用于发布一系列即将到来的新功能公告。该博客由 OpenAI Codex desktop 构建,利用了其 Markdown 会话记录导出功能,展示了 AI 辅助编程在网站搭建中的实际应用。博客的构建过程已公开在 GitHub 上,供开发者参考。
事件专题

推荐理由:Datasette 用户和 AI 编程爱好者可以看看这个博客的构建过程——用 Codex 直接生成网站,省去了手动搭建的繁琐,值得一试。
00:33
5月13日
12:33