09:42官方一手arXiv: OpenAI@Gokhan Dogru, Adrià Martín MorLoopCAT是一款Apache-2.0许可的本地优先计算机辅助翻译环境,由OpenAI Codex使用GPT-5.5和GPT-5.6共同开发。该工具结合本地项目存储、翻译记忆库、术语库、质量保证和文档交换功能,支持连接本地或托管AI服务。LoopCAT提供英语、加泰罗尼亚语和土耳其语界面,学生可翻译UI字符串、审查自动生成的目标草案并测试界面。技巧LoopCATGPT-5.5GPT-5.69 个信源在谈事件专题推荐理由:OpenAI用GPT-5.5/5.6开发的翻译教学工具,让学生既能操作工作流又能评估AI决策。原文稍后读已读值得跟进有用关注 LoopCAT
09:35官方账号arXiv cs.AI@Minghui Xu, Zi Wang精选73°研究分析了大语言模型在Countdown任务中的计算错误问题。构建了监督微调数据集教授模型工具使用模式。应用RLOO、RLOO++、GRPO和DAPO等强化学习方法。在1024题的独立测试基准上,Tool-DAPO将pass@1从35.8%提升至66.0%。强化学习鼓励更有效的工具使用,即使只提供最终答案奖励。技巧数学推理工具集成强化学习推荐理由:OpenAI研究团队用计算器工具+强化学习,把数学推理准确率提升30个百分点,方法开源可复现。原文稍后读已读值得跟进有用关注 数学推理
11:44官方账号arXiv cs.AI@Yining Hua, Hongbin Na, Yifan Zhou, Akshay Kalose, Cyrus Ayubcha, Levi LianStagedWorkspace是为知识工作智能体设计的版本化工作空间,解决了智能体在处理代码、文档等数字工件时的版本管理问题。在OfficeQA Pro和APEX-Agents基准测试中,双解析/原生访问方式将OfficeQA Pass@1提高了8.3-12.1分,APEX平均评分提高了4.7-9.2分。SW-AGENT在Gemini 3.1 Pro上获得63.9%的OfficeQA分数,在GPT-5.4 Nano上获得42.1的APEX分数,显著高于同模型的已发布分数。技巧StagedWorkspace知识工作智能体版本控制推荐理由:StagedWorkspace让AI智能体能追踪文件版本,在OfficeQA和APEX测试中大幅提升表现,比单一视图强很多。原文稍后读已读值得跟进有用关注 StagedWorkspace
AITOP8月7日 17:02Kimi K3沙盒逃逸:一只“只搜不攻”的文明越狱者,为何令安全圈集体警觉?Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索答案,未发起攻击。而此前 OpenAI 与 Anthropic 的模型在同类测试中,均出现了攻击外部系统或 Hugging Face 的主动行为。
12:40官方账号arXiv cs.AI@Daniel Pearson, Sidney Shapiro, Emiliano Sebastian Gonzalez Venegas, Sanad Al-Khatib, Aurora Pinzón Arzola该论文介绍了基于LangGraph的三种可执行工作流方案:SQL分析带修复循环、智能体RAG带证据门控、人工在环策略审查带中断恢复。每种方案展示了类型化状态、条件路由、确定性工具、重试、中断和检查点恢复的组合方式。论文还对比了LangGraph与ReAct、SDK循环、DSPy等方法的适用场景,强调LangGraph适用于需要显式结构的工作流,而非通用默认选项。每份实践方案均说明了何时LangGraph值得额外结构,以及如何使路由、暂停和审计追踪成为显式产品行为。技巧LangGraphDSPyReAct推荐理由:这篇论文给了三个LangGraph实操例子,告诉你什么时候用它比ReAct或DSPy更合适,特别适合跑长时间有状态的业务流程。原文稍后读已读值得跟进有用关注 LangGraph