18:01官方一手arXiv: DeepSeek@Fei Ding精选73°DeepSeek-V4-Flash模型在SWE-bench Verified基准测试中,通过两层索引分离全局路由与局部实体焦点,实现了零预构建实体关系边条件下的95.6%成功率。研究提出了一种仅实体的外部接口,在推理过程中实现任务条件关系物化。基础、单层和双层条件分别达到92.1%、94.2%和95.6%的成功率。论文DeepSeek-V4-FlashSWE-bench代码推理4 个信源在谈事件专题推荐理由:DeepSeek团队提出千图假说,解决大型代码库推理问题,无需预构建关系图就能达到95.6%成功率。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Flash
12:08官方账号arXiv cs.LG@Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon HanOn-Policy Delta Distillation (OPD²) 引入delta信号,定义为教师模型与其未经推理指令微调的基础模型之间的差异。该方法在数学、科学和代码推理基准上一致优于传统on-policy蒸馏。实验表明,仅需短期后训练即可使推理LLM达到强性能。代码已在GitHub开源。论文OPD²蒸馏推理模型推荐理由:这篇论文用老师模型和基础模型的差值做蒸馏信号,比直接模仿老师更强,数学代码推理都更好,训练时间还短。原文稍后读已读值得跟进有用关注 OPD²
09:31官方一手arXiv: DeepSeek@Siyue Chen, Yifu Guo, Yuquan Lu, Zishan Xu, Jiaye Lin, Jianbo Lin, Siyu Zhang, Cheng Yang, Junxin Li, Yujia Li, Yu Huo, Ruixuan Wang该论文提出了LLM代码推理的内部生命周期概念:模型先在早期层中酝酿答案,使其线性可解,然后在后期层分化为四种解析结果——已解析、过度处理、错误解析、未解析。研究对Qwen、Llama、DeepSeek三个架构的16个模型进行了6类代码推理任务的层析探针和上下文剥离解码(CSD)实验。结果显示已解析平均仅41.5%,且函数调用任务中,调用深度从1层增至3层时已解析率从61.1%骤降至2.5%。所有模型的酝酿持续时长稳定在24%-42%,但解析成功率随模型能力和规模变化。论文代码推理QwenLlama推荐理由:这篇论文用层析探针找到了LLM做代码推理时“酝酿”到“解析”的秘密,发现即便准确率相近,内部失败模式也截然不同,值得想理解推理本质的人读。原文稍后读已读值得跟进有用关注 代码推理
08:41IT之家(博客/媒体)88°Anthropic 的最强模型 Claude Mythos 预览版在 Claude Code 和 Claude Security 中短暂出现后被撤下,暗示即将公开上线。该模型定位为面向计算机安全任务的前沿模型,相比 Opus 4.7 在代码推理和自主执行方面显著提升。Anthropic 此前警告 Mythos 能自动开发专业级网络攻击手段,因此迟迟未全面开放。同时,Anthropic 推进名为 Glasswing 的项目,联合其他公司保护关键软件系统,已使用 Mythos Preview 帮助 50 家组织。这一动态表明 Anthropic 在平衡模型能力与安全风险后,可能准备向更广泛用户开放。AI模型AnthropicClaude Mythos推理模型10 个信源在谈事件专题推荐理由:Anthropic 最强模型 Mythos 即将公开,做安全研究和代码自动化的开发者值得关注——它既能大幅提升效率,也带来新的安全挑战,建议提前了解其能力边界。原文稍后读已读值得跟进有用关注 Anthropic