21:31Ate-a-Pi@svpinoOracle 在 AI 领域发力,其 26ai 版本实现了多项突破性功能。用户可以直接在数据库中运行大语言模型和嵌入模型,无需将数据发送到外部。数据库支持混合向量搜索(语义+关键词),并引入 JSON 关系二元性视图,兼顾关系模型的稳定性和 JSON 的灵活性。内置代码生成工具可辅助编写 SQL。这些特性让 Oracle 从传统企业级数据库转型为 AI 原生平台。AI产品OracleAI 数据库向量搜索推荐理由:数据库内直接运行 LLM 和嵌入模型,解决了数据隐私和传输延迟痛点,做企业级 AI 应用的开发者可以直接在 Oracle 中实现智能搜索和生成,省去额外架构。原文稍后读已读值得跟进有用关注 Oracle
10:07官方一手arXiv: DeepSeek@Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang精选论文提出Digit Entropy Loss(DEL),一种用于大语言模型(LLM)数值学习的新损失函数。现有方法如Number Token Loss和Discretized Distance Loss分别导致数字分布过尖锐或过平坦,而DEL通过将无监督熵优化改造为有监督形式,并摒弃数值距离项,解决了这一问题。DEL支持整数、小数和小数点,将学习目标从单个数字扩展到浮点数域。在CodeLlama、Mistral、DeepSeek和Qwen-2.5等四个代表性LLM上的七个数学推理基准测试中,DEL在预测准确性和数值距离上均优于现有方法。论文数值学习损失函数数学推理推荐理由:数值预测是数学推理和代码生成的基础能力,DEL直接改进了LLM对数字的学习效果。做数学推理或代码生成模型训练的团队,值得关注这个新损失函数,它简单有效且开源可用。原文稍后读已读值得跟进有用关注 数值学习
10:51官方一手arXiv: DeepSeek@Ali Mohammadi Esfahani, Nafiseh Kahani, Samuel A. Ajila精选研究人员提出一个基于强化学习的框架,将提示词优化建模为序列决策问题。PPO代理通过混合动作空间(直接生成、遗传变异、语义重写)迭代改进提示词,并利用单元测试反馈的奖励信号驱动优化。在MBPP+、HumanEval+和APPS基准上,使用CodeT5+、CodeLLaMA和DeepSeek-Coder作为冻结代码生成器,PPO代理在MBPP+的500任务测试集上分别达到57.58%、64.80%和85.50%的严格Pass@1,优于EPiC、Reflexion和随机混合方法。软Pass@1分别达到67.90%、73.10%和88.20%。结果表明,带形状奖励的强化学习能显著提升LLM代码生成的功能正确性。论文提示词优化强化学习代码生成推荐理由:做LLM代码生成或提示词工程的开发者,这个框架直接解决了提示词敏感性问题——用RL自动优化提示词,比手动调参高效得多,建议关注其混合动作空间和奖励设计。原文稍后读已读值得跟进有用关注 提示词优化
03:04IT之家(博客/媒体)76°在2026谷歌I/O大会上,谷歌宣布推出专为科研设计的Gemini模型——Gemini for Science。该模型能够追踪最新论文、将研究目标转化为可执行代码,并生成新的科学假设。谷歌还提及了模拟人工智能的未来方向,计划模拟更复杂的系统甚至虚拟细胞。目前,谷歌已有多个项目处于临床前阶段,涵盖免疫疾病和癌症,旨在加速药物发现过程。AI产品Gemini科研助手论文追踪推荐理由:科研人员终于有了AI助手来追踪论文和写实验代码,做生物医药或材料科学的团队可以直接用Gemini for Science加速研究,建议点开看看具体怎么用。原文稍后读已读值得跟进有用关注 Gemini
14:22官方账号arXiv cs.AI@Xuying Ning, Katherine Tieu, Dongqi Fu, Tianxin Wei, Zihao Li, Yuanchen Bei, Jiaru Zou, Mengting Ai, Zhining Liu, Ting-Wei Li, Lingjie Chen, Yanjun Zhao, Ke Yang, Bingxuan Li, Cheng Qian, Gaotang Li, Xiao Lin, Zhichen Zeng, Ruizhong Qiu, Sirui Chen, Yifan Sun, Xiyuan Yang, Ruida Wang, Rui Pan, Chenyuan Yang, Dylan Zhang, Liri Fang, Zikun Cui, Yang Cao, Pan Chen, Dorothy Sun, Ren Chen, Mahesh Srinivasan, Nipun Mathur, Yinglong Xia, Hong Li, Hong Yan, Pan Lu, Lingming Zhang, Tong Zhang, Hanghang Tong, Jingrui He精选72°本文提出“代码即智能体框架”概念,认为代码不仅是输出,更是智能体推理、行动、环境建模和执行验证的操作基础。论文从三个层次系统梳理:框架接口(代码连接推理与行动)、框架机制(规划、记忆、工具使用与反馈控制)、框架扩展(单智能体到多智能体协作)。覆盖编程助手、GUI/OS自动化、具身智能、科学发现、DevOps等应用场景,并指出评估、验证、状态共享等开放挑战。该视角为构建可执行、可验证、有状态的AI智能体系统提供了统一路线图。论文智能体代码生成框架/架构推荐理由:这篇综述把代码在智能体系统中的角色从“输出”提升到了“基础设施”层面,做智能体框架设计或工具链开发的团队值得一读,能帮你理清当前方法的脉络和未来方向。原文稍后读已读值得跟进有用关注 智能体
10:13官方账号arXiv cs.AI@Shuyin Ouyang, Zhaozhi Qian, Faroq AL-Tam, Muhammad AL-Qurishi, Jie M. Zhang精选该论文系统研究了扩散语言模型在代码生成中的强化学习后训练,重点探索了三种维度:奖励设计、提示条件采样和任务难度。研究发现,静态检查作为无需执行的奖励信号,在HumanEval上使DiffuCoder从53.9提升至67.1,在LiveCodeBench上从14.9提升至15.5,同时减少9.4%的推理时间。中等程度的AST提示在困难任务上最有效,而奖励设计的最佳选择依赖于任务难度:相似度奖励在简单子集上更优,静态检查在困难子集上更可靠。这些发现表明,奖励设计和训练指导显著影响扩散RL在代码生成中的表现。论文代码生成强化学习扩散模型推荐理由:做代码生成模型训练的团队会发现,静态检查奖励比执行测试更高效且能避免能力悬崖,建议在困难任务上优先采用。原文稍后读已读值得跟进有用关注 代码生成
11:39IT之家(博客/媒体)腾讯云宣布自研 AI 设计智能体平台 Ardot 正式公测,支持通过一句话快速生成可编辑的 App 页面、官网、海报、插画、PPT 等设计稿。该平台能调用团队业务组件库,确保设计符合规范,并可直接导入 Figma 文件保留原有布局。Ardot 对代码友好,设计稿可一键转代码,兼容 CodeBuddy、Cursor、Claude Code 等 MCP IDE。此外,平台还提供多人在线协作、实时评论、版本对比等功能,微信小程序即将上线。AI产品AI 设计设计稿生成代码生成5 个信源在谈事件专题推荐理由:设计团队终于有了一个能直接对接开发的 AI 工具——Ardot 把「一句话出设计稿」和「一键转代码」打通了,做 UI/UX 的设计师和前端开发者可以省掉大量重复沟通和手动还原的时间,建议试试。原文稍后读已读值得跟进有用关注 AI 设计
23:28Viking@vikingmute有用户反映 GPT-5.5 近期表现变差,甚至出现删除无关代码等严重问题。OpenAI 的 Codex 团队已公开回应,确认收到相关报告并正在调查,但尚未得出明确结论,系统状态正常。这一事件引发社区对模型稳定性与透明度的讨论,部分用户猜测可能很快会有 usage reset 或修复更新。AI产品GPT-5.5降智OpenAI10 个信源在谈事件专题推荐理由:GPT-5.5 降智直接影响日常使用体验,尤其是依赖它写代码的开发者,建议关注后续修复进展,避免在关键任务中踩坑。原文稍后读已读值得跟进有用关注 GPT-5.5
06:17官方一手OpenAI Blog(博客/媒体)OpenAI发布了与NVIDIA工程师和研究人员的合作案例,展示了Codex结合GPT-5.5如何帮助团队构建生产系统并将研究想法快速转化为可运行的实验。该工具显著提升了代码生成和实验迭代效率。这表明AI辅助开发正从原型阶段进入规模化生产应用。AI产品编程助手代码生成NVIDIA10 个信源在谈事件专题推荐理由:典型案例揭示了AI编程助手在大型企业研发流程中的实际应用价值,对评估AI辅助工具在工业界的落地效果有参考意义。原文稍后读已读值得跟进有用关注 编程助手
00:33官方一手Anthropic: Engineering(资讯)78°Anthropic公开了其工程博客页面,汇集了从2024年12月到2026年4月期间的数十篇技术文章。内容涵盖Claude Code质量报告、多智能体系统设计、代码执行与MCP、长时运行应用开发、Agent技能与工具使用等核心主题。这些文章深入介绍了Anthropic在可靠AI系统构建、智能体评估、安全自动化等方面的工程实践与经验教训。行业智能体Claude CodeMCP/工具10 个信源在谈事件专题推荐理由:该博客合集是Anthropic工程团队多年实战经验的系统沉淀,对于从事AI agent开发、代码生成工具优化和可靠系统设计的从业者具有直接参考价值。原文稍后读已读值得跟进有用关注 智能体
19:11官方一手arXiv: DeepSeek@Weilin He, Arindam Sharma, Cristina David该研究针对LLM代码生成缺乏正确性保证的问题,提出了一种基于语义距离的不确定性估计方法。与传统样本估计仅度量输出是否一致不同,新方法衡量候选程序执行行为的差异程度。在LiveCodeBench、MBPP等基准测试上,该方法在Python、Java、C++语言上均优于现有基线,且无需访问模型内部或调用LLM作为裁判,运行时间减少48%-79%。研究首次引入分类法厘清不确定性估计的设计维度,填补了语义感知估计这一空白。论文代码生成不确定性估计语义距离推荐理由:该工作为LLM代码生成提供了更实用的不确定性估计方案,在效率与效果上均取得显著提升,对提升代码生成系统的可靠性和安全性具有实践指导意义。原文稍后读已读值得跟进有用关注 代码生成
19:11官方一手arXiv: DeepSeek@Joanna Szych, Anne Schwerk该论文提出了一种树状折叠评估方法,用于评估LLM生成代码的正确性、质量和可用性。研究者基于一个复杂的计算机科学项目构建了正确性基准,并结合代码质量验证和开发者结构化审查。他们用该方法评估了GPT-4.1、DeepSeek-V3-0324和Claude Opus 4三个模型,发现开发者审查能揭示代码生产就绪状态等标准基准无法捕获的洞察。这表明仅靠正确性测试不足以全面评估LLM代码生成能力。论文代码生成评估基准GPT-4.1推荐理由:该研究为LLM代码生成评估提供了更全面的方法论,强调了开发者反馈的重要性,对模型选择和改进实践具有参考价值。原文稍后读已读值得跟进有用关注 代码生成
19:11官方账号arXiv cs.AI@Haozhe Zhang, Kaichen Liu, Miaomiao Chen, Lei Li, Shaojie Yang, Cheng Peng, Hanjie Chen研究者推出BenchCAD,一个统一的基准测试,用于评估多模态大语言模型在工业CAD代码生成上的能力。该基准包含17,900个可执行的CadQuery程序,涵盖106个工业零件系列,如锥齿轮、压缩弹簧和麻花钻。通过视觉问答、图像到代码生成等任务,BenchCAD测试模型在感知、参数抽象和可执行程序合成方面的综合能力。实验显示,当前前沿模型能恢复大致几何形状,但在精确参数和工业设计操作上常失败,如用简单拉伸替代扫掠、放样等关键操作。论文代码生成多模态模型CAD/设计推荐理由:该基准揭示了现有模型在工业级CAD生成上的显著不足,为模型优化和工业自动化提供了明确的评估标准。原文稍后读已读值得跟进有用关注 代码生成
22:15官方账号François Chollet@fcholletKeras创始人François Chollet在X平台发文指出,智能体编程本质上是一种机器学习形式。他认为生成的代码应被视为黑盒产物,其行为和泛化能力需要通过经验评估来管理,就像对待任何机器学习模型一样。这一观点挑战了将代码自动生成视为传统编程延伸的普遍看法,强调开发者需要关注评估而不是审查代码本身。论文智能体代码生成MCP/工具推荐理由:本文提醒开发者,Agentic coding(智能体编程)的输出应作为黑盒模型进行经验评估,这对当前AI辅助编码的工程实践具有指导意义。原文稍后读已读值得跟进有用关注 智能体