Hugging Face分享了他们如何用GPT-4和GitHub Actions把库发布从两个月一次提速到每周一次,还保留了人工把关,挺实用的经验。
全部动态
想知道LLM为什么在导航任务中迷路吗?这个基准把问题拆成三个层级,告诉你59%的锅在交叉口选择,39%在局部感知,方向判断几乎不犯错。对做空间推理的开发者非常有用。
OpenAI 联手 Trail of Bits 和 HackerOne,用 Codex Security 帮开源项目快速修漏洞,人工把关,靠谱。
日本AI公司Sakana AI搞了个新系统叫Fugu,能让不同模型一起干活,不用只靠一家供应商。效果还跟Anthropic的Fable 5差不多,值得看看怎么做到的。
OpenAI 出了个新基准 LifeSciBench,专门测 AI 做生命科学研究的能力,比一般问答难多了,能看出模型哪里不行。
马斯克又出手了,SpaceX 花600亿买下 Cursor 团队,直接帮 xAI 对抗 OpenAI 和 Anthropic。
想知道AI能不能像人一样在危险场景下抓住关键区域?这篇论文用GPT-4o、Gemini Pro等模型做了对比,发现它们不靠眼动训练数据就能大致预测人类注视点。
这篇论文用GPT-4o和DeepSeek-chat做实验,发现AI自我评估时策略偏好会崩坏,还跨模态传染,数字很硬核,搞多模态和智能体的值得看。
这项研究揭示了LLM在立场检测中的系统性错误模式,对做NLP评估和模型优化的团队有直接参考价值——SICI指数可以帮你快速识别模型在哪些样本上会失效,建议做立场检测或模型鲁棒性研究的点开看看。
声音克隆技术正在模糊真实与合成的边界,法律界和AI从业者都需要了解现有保护框架的不足。这篇文章梳理了三种法律路径的适用性,做AI产品合规或研究人格权保护的读者值得一读。
Anthropic 新旗舰模型 Mythos 今晚发布,做 AI 应用开发或模型对比的团队可以第一时间关注,看看它能否在推理和代码任务上超越 GPT-4。
手机智能体开发者终于有了能测试个性化能力的基准——iOSWorld要求模型理解用户身份与历史,而非仅执行孤立指令,做移动端AI Agent的团队值得关注。
Browser Use 用 Rust 重写后,解决了旧版预定义动作空间导致模型失败不知原因的痛点,做浏览器自动化或 AI 代理的开发者可以直接升级体验更可靠的执行。
AI 推理成本断崖式下跌正在重塑行业格局,做 AI 应用或基础设施的团队值得关注——路由策略能直接省下 80% 成本,建议尽早布局。
这款模型解决了实时语音交互中“等待录音结束”的痛点,做语音助手或实时翻译的开发者可以直接在 GitHub 上试玩,体验每 0.4 秒的决策能力。