主要来源Teortaxes
查看原文事件专题 ·单一信源
GeneralityLabs Exploit Bench测试结果
GeneralityLabs在Exploit Bench基准测试中表现出对harness参数的高度敏感性。V4.1 Flash版本性能弱于5.3 Flash版本,在Claude Code中表现最佳,Codex排名第二。Exploit Bench默认基准使用类似Python while循环的原始实现。
当前结论
GeneralityLabs公布Exploit Bench测试结果,V4.1 Flash性能下降,Claude Code超越Codex。
2 个信源67° AI 热度最后更新 2026/10/3 01:32:00
证据链
2 个信源相关来源 1DeepLearning.AI
查看原文冲突核查
现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。