AITOPAI热报
今日精选全部动态早读东盟 AIAgent 接入我的简报我的追踪阅读偏好内容方法关于更新日志信源提报反馈
外观
登录 / 注册
AITOPAI热报
全部动态
AI 相关资讯全量信息流
全部博客资讯推文论文
全部模型产品行业论文技巧
9月2日
09:42
09:42官方一手arXiv: OpenAI@Gokhan Dogru, Adrià Martín Mor
LoopCAT是一款Apache-2.0许可的本地优先计算机辅助翻译环境,由OpenAI Codex使用GPT-5.5和GPT-5.6共同开发。该工具结合本地项目存储、翻译记忆库、术语库、质量保证和文档交换功能,支持连接本地或托管AI服务。LoopCAT提供英语、加泰罗尼亚语和土耳其语界面,学生可翻译UI字符串、审查自动生成的目标草案并测试界面。
技巧LoopCATGPT-5.5GPT-5.6
事件专题

推荐理由:OpenAI用GPT-5.5/5.6开发的翻译教学工具,让学生既能操作工作流又能评估AI决策。
原文
8月31日
09:35
09:35官方账号arXiv cs.AI@Minghui Xu, Zi Wang
精选73°
研究分析了大语言模型在Countdown任务中的计算错误问题。构建了监督微调数据集教授模型工具使用模式。应用RLOO、RLOO++、GRPO和DAPO等强化学习方法。在1024题的独立测试基准上,Tool-DAPO将pass@1从35.8%提升至66.0%。强化学习鼓励更有效的工具使用,即使只提供最终答案奖励。
技巧数学推理工具集成强化学习

推荐理由:OpenAI研究团队用计算器工具+强化学习,把数学推理准确率提升30个百分点,方法开源可复现。
原文
8月19日
11:44
11:44官方账号arXiv cs.AI@Yining Hua, Hongbin Na, Yifan Zhou, Akshay Kalose, Cyrus Ayubcha, Levi Lian
StagedWorkspace是为知识工作智能体设计的版本化工作空间,解决了智能体在处理代码、文档等数字工件时的版本管理问题。在OfficeQA Pro和APEX-Agents基准测试中,双解析/原生访问方式将OfficeQA Pass@1提高了8.3-12.1分,APEX平均评分提高了4.7-9.2分。SW-AGENT在Gemini 3.1 Pro上获得63.9%的OfficeQA分数,在GPT-5.4 Nano上获得42.1的APEX分数,显著高于同模型的已发布分数。
技巧StagedWorkspace知识工作智能体版本控制

推荐理由:StagedWorkspace让AI智能体能追踪文件版本,在OfficeQA和APEX测试中大幅提升表现,比单一视图强很多。
原文
8月13日
12:07
AITOP8月13日 12:07
8月13日凌晨,DeepSeek毫无预兆地丢出大招——DeepSeek-V4-Pro正式版(0813) 悄然上线,API、网页端、APP全量同步!
8月7日
17:04
AITOP8月7日 17:04
出口结构剧变:中国卖给世界的,不再是产品而是解法出口结构剧变:中国卖给世界的,不再是产品而是解法
17:02
AITOP8月7日 17:02
Kimi K3沙盒逃逸:一只“只搜不攻”的文明越狱者,为何令安全圈集体警觉?Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索答案,未发起攻击。而此前 OpenAI 与 Anthropic 的模型在同类测试中,均出现了攻击外部系统或 Hugging Face 的主动行为。Kimi K3沙盒逃逸:一只“只搜不攻”的文明越狱者,为何令安全圈集体警觉?
8月2日
17:33
AITOP8月2日 17:33
DeepSeek-V4-Flash-0731:当版本号成为信息泡沫的容器
7月25日
10:40
AITOP7月25日 10:40
Genspark 喊话:Claude Opus 5 性能接近 Fable 5,价格砍半——但“接近”到底有多近?Genspark 喊话:Claude Opus 5 性能接近 Fable 5,价格砍半——但“接近”到底有多近?
7月22日
12:40
12:40官方账号arXiv cs.AI@Daniel Pearson, Sidney Shapiro, Emiliano Sebastian Gonzalez Venegas, Sanad Al-Khatib, Aurora Pinzón Arzola
该论文介绍了基于LangGraph的三种可执行工作流方案:SQL分析带修复循环、智能体RAG带证据门控、人工在环策略审查带中断恢复。每种方案展示了类型化状态、条件路由、确定性工具、重试、中断和检查点恢复的组合方式。论文还对比了LangGraph与ReAct、SDK循环、DSPy等方法的适用场景,强调LangGraph适用于需要显式结构的工作流,而非通用默认选项。每份实践方案均说明了何时LangGraph值得额外结构,以及如何使路由、暂停和审计追踪成为显式产品行为。
技巧LangGraphDSPyReAct

推荐理由:这篇论文给了三个LangGraph实操例子,告诉你什么时候用它比ReAct或DSPy更合适,特别适合跑长时间有状态的业务流程。
原文
精选动态早读东盟登录