11:43官方账号arXiv cs.LG@Varun Gadey, Ziad Marey, Alexandra Dmitrienko精选73°研究人员提出CodePoisonRAG框架,通过CWE特定漏洞注入和语义误标技术,将良性代码条目转化为有毒工件。该研究覆盖Java和C语言的10个CWE类,构建85个有毒工件,总体投毒比例为0.7%。在三个生成器中,所有85个工件均位列对应查询的前3名,攻击成功率在0.80至0.93之间。即使面对CodeGuarder防御,攻击成功率仍保持在0.40至0.71。论文CodePoisonRAGRACGCWE推荐理由:研究人员展示了如何针对代码生成系统进行精准知识投毒,成功率高达93%,连安全防御都难以完全阻挡。原文稍后读已读值得跟进有用关注 CodePoisonRAG
00:47elvis@omarsar0Meta推出的Harness-of-Harness系统在GameCraft-Bench、FrontierSWE和ProgramBench三个基准测试中,与三种不同的harness和模型配对相比,经过三次迭代后平均提升52.25%,最高达82.86%。该系统通过将执行组织为规划、编码和测试的重复增量,平衡修复与能力增长,将工作范围限定为可验证的小步骤。系统保持实现时测试与独立评估分离,约束输出而非工作流程。AI产品Harness-of-HarnessMeta编程助手推荐理由:Meta新出的Harness-of-Harness能让编程代理连续工作数天,比独立系统平均提升52%,最高82%原文稍后读已读值得跟进有用关注 Harness-of-Harness
15:43量子位@量子位的朋友们73°阿里发布Qwen3.8-Max模型,在HumanEval编程基准上得分为84.5分,超越GPT-4o成为全球第一。该模型在代码生成、调试和优化方面表现优异,支持多种编程语言。Qwen3.8-Max还增强了多模态处理能力,能够理解和生成图文内容。AI模型Qwen3.8-Max阿里编程推荐理由:阿里Qwen3.8-Max编程能力登顶全球,代码生成超越GPT-4o,开发者必看。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
10:50官方账号arXiv cs.AI@Kefeng Duan, Dewu Zheng, Yanlin Wang, Terry Yue Zhuo, Mingwei Liu, Jianxing Yu, Jiachi Chen, Ensheng Shi, Xilin Liu, Yuchi Ma, Zibin Zheng精选73°ACToR框架针对仓库级代码生成任务,在生成过程中识别关键令牌并按需触发检索。该方法在RepoExec和CoderEval两个基准测试中分别实现了8.4%和15.4的相对性能提升。研究还量化了关键令牌对生成失败的影响,突显了针对性检索策略的必要性。论文ACToR代码生成检索增强推荐理由:DeepSoftwareAnalytics团队推出ACToR框架,能精准定位代码生成中的关键点,比现有方法表现更好。原文稍后读已读值得跟进有用关注 ACToR
09:39官方账号arXiv cs.AI@Will Badr研究测试了Qwen2.5-3B-Instruct和Phi-3.5-mini模型在HumanEval+和MBPP+基准上的表现。相关提示词能分别挽救36/79和42/101个失败案例,但大多数被挽救的解决方案通过普通采样也能达到。全文本规范解决了24个问题中的22个,而虚拟KV前缀仅解决5-11个。论文Qwen2.5-3B-InstructPhi-3.5-mini代码生成推荐理由:这篇论文揭示了代码生成模型中提示词的实际作用,告诉你哪些提示真正有效,哪些只是表面功夫。原文稍后读已读值得跟进有用关注 Qwen2.5-3B-Instruct
02:47mem0@mem0ai编程代理正在迎来重要时刻,它们现在能够交付可工作的代码,无需用户逐行监督。这些代理不再是简单的自动补全功能,而是实现了任务委派。这种委派方式只有在接收方不需要每次都获取完整背景信息的情况下才能有效运作。AI产品编程代理代码生成任务委派推荐理由:编程代理现在能独立交付完整代码,不再需要你逐行监督,实现了真正的任务委派。原文稍后读已读值得跟进有用关注 编程代理
07:18elvis@omarsar0精选Claude Code插件生态系统在初始发布后六个月内,插件相关提交活动增长了8.8倍。研究人员分析了1,926个托管插件市场的仓库,涵盖8,351个插件和77,773次提交。功能提交占比39.6%,而传统开源项目仅为17.2%。Claude参与了数据集中34.9%的每次提交。AI产品Claude插件代码生成推荐理由:Claude Code插件提交量半年增长8.8倍,功能提交率是传统开源两倍多,Claude参与了近35%的提交。原文稍后读已读值得跟进有用关注 Claude
22:00lmarena.ai@lmarena_ai73°Grok-4.6(xHigh)在Agent Arena代码类别中排名第12,净提升7.7%,基于4500+真实智能体代码会话。在确认成功率方面排名第6,提升15%。整体确认成功率提升13.2%,排名第6。与Grok-4.5相比有显著提升,中位任务成本为1.12美元。AI模型Grok-4.6SpaceXAIAgent Arena推荐理由:SpaceXAI的Grok-4.6在代码任务上表现亮眼,确认成功率提升15%,成本与Claude Opus 4.6相当。原文稍后读已读值得跟进有用关注 Grok-4.6
18:48向阳乔木@vista8Apodex深度搜索产品内测,具备写代码、多Agent组合完成复杂任务能力。由陈天桥创立,今日发布Apodex 1.1 mini 35b模型及开源Harness框架。AI产品Apodex深度搜索代码生成推荐理由:陈天桥创立的Apodex深度搜索产品内测,功能强大,值得一试。原文稍后读已读值得跟进有用关注 Apodex
10:34官方一手arXiv: DeepSeek@Silin Chen, Haoyi Teng, Xiaodong Gu, Yuling Shi, Jiale Huang, Yongpan Wang, Hongyu Zhang, Haibing Guan大型语言模型在代码生成方面取得显著进展,但大多数现有系统假设预定义的仓库架构。Repo0是一个针对零到全代码生成的持续结构演化框架,通过GPT-5 mini和DeepSeek V3.2在RepoCraft的六个真实仓库上评估,Repo0在所有设置中实现了最高的功能覆盖率和通过率,与RPG相比,功能覆盖率提高20.08个百分点,通过率提高29.74个百分点。论文代码生成大型语言模型Repo0推荐理由:Repo0通过GPT-5 mini和DeepSeek V3.2实现了更高的功能覆盖率和通过率,是设计驱动零到全代码生成的创新框架。与RPG相比,性能提升显著。原文稍后读已读值得跟进有用关注 代码生成
23:04宝玉@doteyClaude Design 是原型和设计一体的工具,不依赖 Figma。该工具可导入 Figma 设计稿,产出物为 React 代码与模拟数据,支持直接交互。其 Agent 功能能将设计还原为代码。AI产品ClaudeClaude DesignFigma推荐理由:Claude Design 是个新工具,能直接生成可交互的 React 原型,还能把设计稿变成代码,不用再依赖 Figma 了。原文稍后读已读值得跟进有用关注 Claude
18:12Geek@geekbbGitHub 上的一个昆虫图鉴项目把 63 种昆虫做成了交互式 3D 展台,支持旋转、拆解和点击标注。这 63 种昆虫全部通过代码实时生成,不依赖任何外部模型文件。用户无需下载 3D 资源,打开网页即可观察虫子的细微结构。项目地址为 github.com/xr843/insect-w…,适合自然爱好者和前端开发参考。AI产品昆虫图鉴3D展台GitHub推荐理由:想认虫子?这个开源项目把图鉴做成3D展台,63种虫能转能拆能点标注,不用下载模型文件,打开网页就能看。原文稍后读已读值得跟进有用关注 昆虫图鉴
18:47官方账号Decoder@Matthias Bastian72°智谱AI发布GLM-5.3,并称其为最强的开源权重编码模型。据其自家基准,仅通过后训练就比上一代提升50%。该模型经过网络安全训练,帮助安全团队在269个项目中找到2436个漏洞。模型权重计划在两周后开源。AI模型GLM-5.3Zhipu AI开源模型10 个信源在谈事件专题推荐理由:智谱发了GLM-5.3,说是开源编码模型里最强的,后训练提升50%,还帮找出了2436个漏洞,权重两周后开源,可以关注下。原文稍后读已读值得跟进有用关注 GLM-5.3
16:09官方一手marktechpost@Asif RazzaqZ.ai 于 2026 年 8 月 14 日发布 GLM-5.3,复用 743B 参数的 GLM-5.2 基础模型。GLM-5.3 的全部增益来自扩展后训练,未改动基础模型权重。Terminal-Bench 3.0 得分从 4.6 升至 28.3,DeepSWE v1.1 从 46.2 升至 66.9。网络安全方面,CyberGym 达到 84.5%,ExploitBench 翻倍以上至 54.4%。GLM-5.3 的权重约两周后发布。AI模型GLM-5.3Z.ai后训练10 个信源在谈事件专题推荐理由:GLM-5.3来了,不重训基础模型,后训练拉高Terminal-Bench到28.3,代码和长程任务提升,两周后开放权重。原文稍后读已读值得跟进有用关注 GLM-5.3
11:29官方账号arXiv cs.LG@Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song精选Vero是首个评估仓库级联合实现与证明合成的基准,包含43个多模块实例。实例来自Python、Dafny、Verus和Coq的真实仓库,覆盖密码协议到分布式系统等领域。每个实例基于Lean 4,支持仅证明和代码加证明两种评估模式。最强智能体配置仅完整解决27/43个实例,在最高难度仓库上未闭合任何规格。论文VeroLean 4形式化验证推荐理由:Vero拿43个真实仓库考AI写代码加形式化证明,最强配置只过了27个,想看看代码生成靠谱程度的可以来测测。原文稍后读已读值得跟进有用关注 Vero
03:53Aravind Srinivas@AravSrinivas83°谷歌在3.6 Flash发布三周后推出Gemini 3.7 Flash。新版本在编码和智能体任务上进步明显,软件工程、知识工作与网页开发均有提升。其首发价格为3.6 Flash原价的一半。模型现已通过Gemini API、Google AI Studio与Antigravity开放使用。AI模型Gemini 3.7 Flash谷歌智能体推荐理由:谷歌新出的3.7 Flash只要3.6一半价格,编码和智能体更强,适合做子智能体跑任务。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
02:38Google AI Developers@googleaidevs78°谷歌AI开发者宣布推出Gemini 3.7 Flash,称其为用于编码和智能体任务的最智能实干型模型。Gemini 3.7 Flash提升了指令遵循、首次代码准确率和智能体任务执行质量。官方演示中,该模型在Antigravity环境中构建了一个复杂3D网络游戏,包括生成Three.js样板代码、相机移动和碰撞检测。演示还使用Nano Banana创建PBR材质贴图和自定义精灵表,并集成了程序化音频。AI模型Gemini 3.7 FlashGoogle AI智能体推荐理由:谷歌发了Gemini 3.7 Flash,写代码和跑智能体任务更稳了,官方演示用它搭3D游戏,开发者可看看。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
02:23lmarena.ai@lmarena_ai81°Google DeepMind 发布 Gemini 3.7 Flash (High),已在 LMArena 的 Code Arena: WebDev 和 Text Arena 上线。该模型在 WebDev 排名从第 19 位升至第 8 位,明显优于上一代 Gemini 3.6 Flash (High)。它在数据与分析类别排名第 7,在模拟、游戏与内容创作工具类别排名第 8,在参考设计类别排名第 9。AI模型Gemini 3.7 FlashGoogle DeepMindLMArena推荐理由:谷歌 DeepMind 的新 Flash 模型在 WebDev 榜冲到第8,比上代进步不小,做网页或数据任务可以试试。原文稍后读已读值得跟进有用关注 Gemini 3.7 Flash
17:52lmarena.ai@lmarena_ai精选DeepSeek-V4-Pro (Max)在LMArena Code Arena WebDev榜单以1607分暂列第8,开源模型中排名第2。其分数低于Kimi K3 (Max)的1674分,也低于GPT-5.6 Sol (xHigh)的1622分。该成绩来自AutoEval早期评分,由奖励模型基于人类偏好自动投票产生,并非真人实时投票。后续真人投票加入后,最终排名可能变化。AI模型DeepSeek-V4-ProCode ArenaKimi K310 个信源在谈事件专题推荐理由:DeepSeek新模型V4-Pro专攻代码生成,在Code Arena排第8,开源第2,仅次于Kimi K3,还超过了GPT-5.6 Sol。原文稍后读已读值得跟进有用关注 DeepSeek-V4-Pro
19:32The Rundown AI@therundownaiAnthropic近日发布了一项新研究,聚焦于提升Claude模型在复杂任务中的表现。该研究引入了新的训练方法,使Claude在推理和代码生成任务上取得了显著进步。在多个基准测试中,Claude的得分超越了前代版本,接近GPT-4的水平。研究团队还公开了部分技术细节,为后续模型优化提供了方向。论文AnthropicClaude推理模型10 个信源在谈事件专题推荐理由:Anthropic发了新研究,Claude在推理和代码上又强了,接近GPT-4,想了解细节的可以看看。原文稍后读已读值得跟进有用关注 Anthropic
01:59Mustafa Suleyman@mustafasuleyman微软CEO穆斯塔法·苏莱曼在X平台宣布推出MAI-Code编程模型,并附上博客链接。该模型面向代码生成与编程辅助场景,是微软MAI系列的最新成员。目前公开信息有限,具体性能参数与基准测试结果待博客披露。AI模型MAI-Code微软编程助手推荐理由:微软官方刚官宣的编程模型,做开发的朋友可以点进博客看细节。原文稍后读已读值得跟进有用关注 MAI-Code
09:49Paul Graham@paulgPaul Graham在X上表示,他最近遇到一位创始人,靠AI工具一天能写5万行代码。此前他曾提到这位创始人每天写1万行代码,当时已引发热议。这次他把数字提高到5万,并称这是极限案例。这位创始人熟悉AI工具,每天工作12小时,但代码质量并不差。行业Paul GrahamAI编程代码生成推荐理由:Paul Graham说有个创始人靠AI一天能写5万行代码,比上次说的1万行还夸张,想看看AI编程上限的可以来围观。原文稍后读已读值得跟进有用关注 Paul Graham
04:59官方账号Simon Willison@simonwSimon Willison用Codex Desktop和GPT-5.6 Sol Ultra开发他的Raccoon Heist游戏,新版本“Moonlight & Mayhem”让一群浣熊洗劫博物馆争夺Golden Sardine。他表示这次效果比Claude Fable 5做得更好。相关推文获得6036次查看和45个点赞。AI模型CodexGPT-5.6 Sol UltraClaude Fable 52 个信源在谈事件专题推荐理由:Simon用Codex和GPT-5.6做浣熊劫案游戏,效果超Claude Fable 5,AI做游戏可参考。原文稍后读已读值得跟进有用关注 Codex
10:28官方一手arXiv: OpenAI@Xinwei Liu, Junyuan Liang, Jianting Zhang, Wuhui Chen精选ProDVI是一个利用大语言模型为强化学习智能体提供初始化先验的新框架。它让代码生成模型输出Python函数,编码对环境动力学的粗略假设,再生成合成转移数据。这些数据用于预训练actor-critic价值网络的状态-动作编码器,使智能体在在线强化学习开始前获得动力学感知的表示。在OpenAI Gym和DeepMind Control Suite任务上,ProDVI显著提升了无模型强化学习算法的样本效率。论文ProDVI强化学习大语言模型10 个信源在谈事件专题推荐理由:这篇论文用大语言模型写代码来初始化强化学习,不用模拟器和预收集数据,在Gym和Control Suite上都能省样本。原文稍后读已读值得跟进有用关注 ProDVI
08:10Paul Graham@paulgPaul Graham在X上发帖(17238次查看)称,用更抽象的语言编写代码能降低LLM生成时的token成本。他认为LLM并不排斥前缀表示法,这也是抽象语言值得尝试的原因(该帖有35条评论)。这条推文获得161个赞、6次转发和42次分享。技巧Paul GrahamLLMtoken成本推荐理由:Paul Graham说,想让LLM写代码更省token,就换更抽象的语言,连前缀表示法它也不怕。原文稍后读已读值得跟进有用关注 Paul Graham
07:07官方账号Meta AI@AIatMeta精选Meta发布Muse Spark 1.2,相比前代显著扩大编码任务的训练计算规模,并增加训练环境多样性。新模型在代码生成、复杂调试和端到端开发者工作流上均有提升。Muse Spark 1.2与Muse Code联合训练,针对全仓库生成、大型项目和自动研究任务优化。AI模型Muse SparkMuse CodeMeta10 个信源在谈事件专题推荐理由:Meta把Muse Spark 1.2的编码能力调强了,配Muse Code一起用,全仓库生成和调试都更顺,写大项目可以试试。原文稍后读已读值得跟进有用关注 Muse Spark
10:17官方账号arXiv cs.AI@Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo论文提出首个视觉模式完成偏差基准,基于Design2Code数据集的30个网页生成1440张测试截图。评估5个多模态大语言模型,平均偏差率在卡片宽度扰动上达69.78%,文字字号上达80.22%,准确率仅21.17%和7.89%。Codex-5.3表现最佳,但准确率从卡片任务的68.61%降至文字任务的13.89%,Flash-3.0在文字任务上偏差率高达96.11%。噪声、更细微扰动和边界位置会进一步提高偏差率。论文Codex-5.3Flash-3.0Design2Code推荐理由:论文测了五个多模态模型做截图转代码填空,发现它们都按重复UI模式猜答案,最强Codex-5.3文字准确率也只有13.89%。原文稍后读已读值得跟进有用关注 Codex-5.3
02:10Yangyi@Yangyixxxx开发者 @yangyi 在 X 上发布《Vibe Coding 八荣八耻》,用 8 组对比调侃 AI 辅助编码中的典型行为。例如“以不看生成代码为荣,以逐行读懂代码为耻”“以密钥硬编码并推上 public repo 为荣”等。帖子还以“vibe 出 30 个 app 一分不赚”为荣作结,并说本周五课上默写。该帖目前已有 1145 次查看和 4 个赞。技巧Vibe CodingAI编程代码生成推荐理由:@yangyi 把 vibe coding 的迷惑行为编成八荣八耻,条条扎心,适合当反例自嘲,也提醒你别真这么干。原文稍后读已读值得跟进有用关注 Vibe Coding
06:30官方账号Yann LeCun@ylecun精选Yann LeCun 在 X 平台回应网友评论,澄清他批评的对象是纯 LLM 所采用的自回归 token 预测。他表示,优秀的代码生成系统并不属于纯 LLM,工作方式也不是简单的自回归 token 预测。这条推文获得 133 次点赞、25 条回复,浏览量超过 1.7 万。行业Yann LeCun代码生成LLM推荐理由:LeCun 发推澄清:别把代码生成器和纯 LLM 自回归划等号,观点直接,适合关注大模型技术路线的人。原文稍后读已读值得跟进有用关注 Yann LeCun
06:04lmarena.ai@lmarena_ai精选72°GLM-5.2 (Max)在LMArena的Code Arena: Frontend榜单排名第2,位列开源模型第1。该模型比Claude Opus 4.7 (Thinking)高出29分,仅次于Fable 5。其在React子榜单排名第2,HTML子榜单排名第4,并在Brand & Marketing、Data & Analytics等6个子类别中排名第一。智谱AI(Zai_org)披露下一代GLM即将发布。AI模型GLM-5.2智谱Claude Opus推荐理由:智谱新出的GLM-5.2 (Max)在前端代码测评里拿了开源第一,总分第2,把Claude Opus 4.7甩开29分。写前端的可以关注下。原文稍后读已读值得跟进有用关注 GLM-5.2
16:35官方账号阿里通义 Qwen@Alibaba_Qwen精选Qwen3.8-Max 在 Arena.ai 的 Frontend Code Arena 排行榜上拿下 1668 分,位列第四。它落后于 Claude Opus 5 (Max) 的 1705 分和 Kimi K3 (Max) 的 1676 分,与 Claude Opus 5 (High) 的 1669 分几乎持平。细分领域中,Consumer Product 排第二,Brand & Marketing、Reference-based design、Gaming、Content Creation Tools 均排第三。Data & Analytics 排第四,Simulations 排第五。阿里 Qwen 官方称该模型在 Text Arena 的真实任务中也有表现。AI模型Qwen3.8-MaxAlibaba_QwenArena.ai推荐理由:Qwen 的 Qwen3.8-Max 冲到代码榜第四,只比 Claude Opus 5 High 档低一分,做前端的可以看看。原文稍后读已读值得跟进有用关注 Qwen3.8-Max
13:41AI Will@FinanceYF5DeepSeek-V4-Flash-High在Frontend Code Arena综合排名第七,得分1586分,在开放模型中位列第三。相比DeepSeek-V4-Flash-High-Preview,得分提升了154分;相比DeepSeek-V4-Pro-Preview,提升了121分。分类排名中,它在Consumer Product排第四,在Reference-based Design、Data & Analytics和Gaming排第六,在Brand & Marketing排第七。AI模型DeepSeekDeepSeek-V4-Flash-HighFrontend Code Arena推荐理由:DeepSeek又出新模型,V4-Flash-High做前端代码生成在竞技场排第七,开源里第三,比预览版涨了154分,挺能打。原文稍后读已读值得跟进有用关注 DeepSeek
04:50官方账号Greg Brockman@gdbGPT-5.6 Luna 今日降价 80%。开发者 Simon Willison 在 Datasette Agent 中实测,称其运行飞快。该模型能生成 SQL、HTML 和 JavaScript 代码。Simon 认为这是一款低成本且性能出色的模型。AI产品GPT-5.6 LunaDatasette Agent编程助手1 个信源在谈事件专题推荐理由:GPT-5.6 Luna 今天降价 80%,Simon 实测超快,写 SQL、HTML、JS 都行,便宜还强。原文稍后读已读值得跟进有用关注 GPT-5.6 Luna
03:42lmarena.ai@lmarena_aiOpenAI 的 GPT-5.6 家族 Sol、Terra、Luna 已在 ChatGPT、Codex 和 API 中开始推出。在 LMArena 全栈代码竞技场中,Sol 以 1638 分排全栈第 3,总榜第 5;Terra 全栈 1579 分列第 10,总榜第 20;Luna 全栈 1568 分列第 14,总榜第 18。Opus 5 (Max) 即将加入全栈榜单。AI模型GPT-5.6OpenAILMArena10 个信源在谈事件专题推荐理由:OpenAI 的 GPT-5.6 三兄弟开测,Sol 全栈第 3,Terra 和 Luna 也进 top20,挑模型看这个。原文稍后读已读值得跟进有用关注 GPT-5.6
18:35官方一手marktechpost@Michal SutterJetBrains Research将KotlinLLM以Apache License 2.0协议开源。这款IntelliJ IDEA插件原型提供asLlm和mockLlm两个智能宏,其主体是生成的Kotlin源码而非实时模型调用。KotlinLLM通过JDI捕获运行时值,让LLM Agent生成窄范围代码更新,编译后重定义已加载类。在改造版Spring Petclinic项目上,24个场景全部完成,热重载成功率100%,运行时开销约1%。AI产品JetBrainsKotlinLLMIntelliJ IDEA推荐理由:JetBrains把KotlinLLM开源了,这个插件让LLM生成Kotlin代码直接跑,跑完就不再调模型,开销只有1%,挺有意思。原文稍后读已读值得跟进有用关注 JetBrains
12:11官方一手arXiv: DeepSeek@Minghao Hu, Lannan Luo, Allen Roush, Phillip HowardCoGate是一种针对大模型代码生成安全问题的置信度门控协同解码方法。它通过结合小型安全专家模型与目标模型,根据专家模型的置信度控制其影响,避免在未见模式或分布外场景下产生误导。研究在CodeGen、DeepSeek-Coder、Qwen-Coder和StarCoder等多个后端上进行了评估,覆盖HumanEval、安全套件和CWEval基准。相比现有协同解码方法CoSec+,CoGate在CWEval上实现了高达12.6%的Func-Sec@10提升。论文CoGateCoSec+代码生成推荐理由:这篇论文提出了CoGate,让安全专家模型在没把握时少掺和,代码生成更安全,比CoSec+最高提升了12.6个百分点。原文稍后读已读值得跟进有用关注 CoGate
10:45AI Will@FinanceYF575°Matt Shumer 发布演示视频,Claude Opus 5 一次生成一个完整游戏。演示中所有画面与逻辑均为模型自定义代码,未使用任何外部素材。该游戏由 Claude Opus 5 单次编码完成,无需人工修改。AI模型Claude Opus 5Matt Shumer游戏生成推荐理由:Matt Shumer 用 Claude Opus 5 演示了一把生成游戏,画面和逻辑全靠模型自己写,不用任何外部素材,看着挺神奇。原文稍后读已读值得跟进有用关注 Claude Opus 5
10:29官方账号Simon Willison@simonwGPT-5.6 Luna今日降价80%,Simon Willison随即在Datasette Agent中实测。它生成SQL、HTML和JavaScript代码速度快,可用于Datasette Apps。推文获得101次点赞和5103次查看。AI产品GPT-5.6 LunaDatasette Agent代码生成1 个信源在谈事件专题推荐理由:Simon Willison说降价80%的GPT-5.6 Luna很猛,在Datasette Agent里跑得飞快,SQL、HTML、JS都能生成,开发者可以看看。原文稍后读已读值得跟进有用关注 GPT-5.6 Luna
00:48mem0@mem0ai精选71°Mem0是一个外部记忆层,能让AI模型跨会话保留用户偏好。没有Mem0时,新会话默认使用列表推导式;有了Mem0,Claude直接输出显式for循环。Claude的/clear命令只清除模型上下文,不清除Mem0存储的记忆,因此偏好可通过MCP服务器持久访问。AI产品Mem0ClaudeMCP/工具推荐理由:想让你家AI记住你之前怎么写的代码?Mem0让Claude跨会话用for循环,不用瞎猜默认语法。原文稍后读已读值得跟进有用关注 Mem0
09:22官方一手arXiv: DeepSeek@Peiding Wang, Li Zhang, Fang LiuMRCoder采用Map-Reduce范式,在Map阶段通过轻量草稿模型和结构感知草稿引导选择(SADGS)筛选信息上下文,在Reduce阶段聚合上下文并利用并行验证加速解码。在CoderEval和DevEval基准上,使用Qwen2.5-Coder和DeepSeek-Coder作为骨干模型时,MRCoder提升了代码生成准确率,同时减少了30%到50%的token消耗,推理时间降低最多52%。该方法相比现有RAG及上下文选择方法更高效地平衡了质量和计算开销。论文MRCoderQwen2.5-CoderDeepSeek-Coder推荐理由:MRCoder用Map-Reduce思路解决仓库级代码生成的上下文选择难题,比现有RAG方法节省30-50% token,推理快52%,在CoderEval和DevEval上准确率更高。原文稍后读已读值得跟进有用关注 MRCoder