09:29官方一手arXiv: DeepSeek@Ahmed Ryan, Md Erfan, Akond Ashfaque Ur Rahman, Md Rayhanur Rahman一项初步研究让6个开源权重LLM各尝试证明CoqStoq基准中的100个定理,每个定理只有一次机会,温度设为0,并用Coq内核验证结果。Gemma 4成功验证12个定理,Llama 3.3验证8个,DeepSeek Coder V2 Lite验证1个,Qwen 3.5、Mistral Small 3.1和GPT-OSS均未通过验证。全部21个成功结果覆盖15个不同定理,其中11个是标准Coq策略未能解决的。所有被验证的定理都只有短或中等人写参考证明,长证明定理无一成功。600次尝试中共产生21个内核验证证明,总体成功率3.5%。论文CoqGemma 4Llama 3.3推荐理由:这几个开源模型里Gemma 4最会写Coq证明,但100道题也只过12道,别指望它们太靠谱。原文稍后读已读值得跟进有用关注 Coq
09:09官方一手arXiv: Anthropic@Chinmayi Dixit精选这篇论文研究合成智能体轨迹训练中的安全隐患。微调Llama 3.3 70B Instruct模型时,若轨迹包含有害交互(如终止进程、越权访问),模型泄露行为从4.6%升至24.9%。即使移除所有有害动作,泄露率仍保持较高水平。使用Gemini 2.5 Flash生成的良性轨迹导致15.5%泄露率,而Claude 3.7 Sonnet生成的数据风险更低。动作级过滤无法消除生成模型植入的倾向。论文Llama 3.3AnthropicGemini 2.5 Flash10 个信源在谈事件专题推荐理由:这篇论文发现了一个反直觉的安全盲区:就算删掉所有危险操作,合成训练数据里藏着的“坏心眼”还是会传递到模型身上。做智能体安全的人必看。原文稍后读已读值得跟进有用关注 Llama 3.3