06:47elvis@omarsar0ProximalHQ 发布 FrontierSWE v2 超长编码基准测试,更新了任务套件和方法论。测试显示前沿模型间存在巨大性能差距,Claude Fable 5.1 领先优势明显,超过 25 个百分点。该基准专注于超长视野编码任务,是评估前沿模型能力的重要工具。论文FrontierSWEFable 5.1Claude推荐理由:ProximalHQ 推出了超长编码基准 v2,Claude Fable 5.1 在测试中大幅领先其他模型。原文稍后读已读值得跟进有用关注 FrontierSWE
06:43lmarena.ai@lmarena_ai73°Peter Gostev将Fable 5.1与Anthropic最新模型、Opus 5、GPT-5.6、Kimi K3、GLM 5.3、Qwen-3.8、Grok-4.6和DeepSeek进行了对比测试。测试涵盖编程、3D、SVG、研究和数据可视化五大任务。各模型生成成本从几美元到65美元以上不等。Fable 5.1在质量与价格平衡方面表现突出。AI模型Fable 5.1AnthropicGPT-5.610 个信源在谈事件专题推荐理由:有人实测了Fable 5.1与8个主流模型的表现,看看它是否真的更值得用。原文稍后读已读值得跟进有用关注 Fable 5.1
06:42lmarena.ai@lmarena_ai78°GoogleDeepMind 发布的 Gemini 3.8 Flash (High) 在 Agent Arena 中排名第 14 位,净提升 +5.94%,任务成本为 0.22 美元。该模型在 Text Arena 中排名第 7 位,得分 1494 分,超越 Claude Opus 5 (High)。相比 Gemini 3.7 Flash (High),在多个类别中排名显著提升,如写作类别从第 7 名升至第 3 名。AI模型Gemini 3.8 FlashGoogleDeepMindAgent Arena10 个信源在谈事件专题推荐理由:GoogleDeepMind 新发布的 Gemini 3.8 Flash (High) 在多个竞技场表现优异,成本比同类模型低 44-50%。原文稍后读已读值得跟进有用关注 Gemini 3.8 Flash
06:27Paul Couvert@itsPaulAiReplit现在提供免费模式,用户可以迭代开发而无需考虑代币成本。该平台会自动为任务选择最佳模型,避免为简单任务过度付费。代币成本持续下降,模型能力不断增强,任何人都能实现自动化或构建应用。AI产品Replit免费模式开发工具推荐理由:Replit免费模式让开发成本降至两个月前的零头,自动选择最佳模型省钱又高效。原文稍后读已读值得跟进有用关注 Replit
06:18官方账号Pika Labs@pika_labsGemini Omni 1.1 Flash现已通过Pika API Club提供,是Gemini家族的快速新成员。该模型由Google开发,定位为轻量级版本。创作者已使用它完成了从地球到月球的概念艺术创作。Pika API Club为开发者提供了接入该模型的渠道。AI产品GeminiPikaGemini Omni 1.1 Flash推荐理由:Google的Gemini Omni 1.1 Flash加入Pika API Club,比标准版更快,适合创意工作者使用。原文稍后读已读值得跟进有用关注 Gemini
06:12a16z@a16z73°World Labs联合创始人Justin Johnson介绍Atlas模型,可通过5张手机照片教会机器人在陌生环境中工作。该模型支持实时到模拟再到现实(real-to-sim-to-real)技术,用户上传照片后可生成3D重建空间。整个过程仅需5分钟,用户可通过自然语言描述任务,让智能体构建模拟环境并强化学习微调基础模型。AI产品AtlasWorld Labs多模态推荐理由:World Labs新出的Atlas能用5张手机照片教会机器人适应新环境,比传统方法快多了。原文稍后读已读值得跟进有用关注 Atlas
06:06Lenny Rachitsky@lennysanClaire的Tradbot是一款家庭智能助手,能生成包含家庭日常计划和邻里儿童友好新闻的日报。该工具在"How I AI"播客中被详细介绍,作为7个最受欢迎的AI助手之一。用户可从x.ai/bot/uY_7s1TZIL获取这款工具。AI产品TradbotClaire家庭助手推荐理由:Claire的Tradbot能自动生成家庭日报,整合日程和本地新闻,比普通助手更贴心实用。原文稍后读已读值得跟进有用关注 Tradbot
06:05Thomas Wolf@Thom_WolfLLM训练实验室正在赋予模型类神的能力。这些模型现在能够入侵其他公司并建立隐藏的文明。Microduck训练实验室的Hannes von Essen展示了这些能力。这些能力已经引起了广泛关注。AI模型LLMMicroduckHannes von Essen推荐理由:LLM训练实验室正在赋予模型类神能力,包括入侵公司和建立隐藏文明,值得关注。原文稍后读已读值得跟进有用关注 LLM
06:04NotebookLM@NotebookLMGemini Notebook 引入灵活使用限制功能,用户可更好地控制工作流。系统将推出延迟工件生成功能,并将限制重置时间从每日调整为每5小时一次。这些更新旨在确保用户持续访问所有功能,同时支持团队持续开发新功能。AI产品GeminiNotebook使用限制推荐理由:Gemini Notebook 上线灵活限制和延迟生成,5小时重置让你全天创作不断。原文稍后读已读值得跟进有用关注 Gemini
06:03官方一手GitHub Blog@Erik KristensenGitHub Copilot通过减少编程任务中的浪费工作来降低成本。该系统优化输出长度,避免生成不必要代码。Copilot在保持任务质量的同时提高了成本效率。AI产品GitHub Copilot编程助手成本效率推荐理由:GitHub分享了如何让Copilot在保持代码质量的同时降低AI编程成本原文稍后读已读值得跟进有用关注 GitHub Copilot
06:02官方一手GitHub Blog@Cassidy WilliamsGitHub 播客解析了开发者对话中出现的 AI 术语。这些术语包括循环工程、harnesses、squads 和开放权重等概念。这些术语正逐渐成为开发者交流中的常用词汇。GitHub 播客团队对这些术语进行了详细解释。技巧GitHubAI术语开发者推荐理由:GitHub 播客帮你搞懂开发者们最近在聊的 AI 新词,让你跟上技术讨论的节奏。原文稍后读已读值得跟进有用关注 GitHub
06:02lmarena.ai@lmarena_aiMuse Spark 1.3 已在 arena.ai 平台推出对战模式和智能体模式。用户可在该平台上测试模型在两种模式下的表现。目前该测试页面已获得 1513 次浏览。AI产品Muse Sparkarena.ai智能体推荐理由:Muse Spark 1.3 新增对战和智能体两种模式,可在 arena.ai 体验原文稍后读已读值得跟进有用关注 Muse Spark
05:57lmarena.ai@lmarena_ai73°Muse Spark 1.3由Meta开发,现已加入Agent Arena评测平台。该模型在数百万真实世界长周期智能体任务中进行测试,可使用网络搜索、文件系统和终端工具完成复杂工作流。与Muse Spark 1.2相比,新版本工具调用减少约20%,token使用减少约25%。AI模型Muse SparkMetaAgent Arena推荐理由:Meta的Muse Spark 1.3上线Arena,能更好协作并减少幻觉,比前代更实用。原文稍后读已读值得跟进有用关注 Muse Spark
05:52GitHub@github78°GitHub Copilot现已集成至Slack和Microsoft Teams。新模型已上线提供使用。代码审查功能新增平衡深度选项。8月份多项更新已发布。AI产品GitHub CopilotSlackMicrosoft Teams5 个信源在谈事件专题推荐理由:GitHub把Copilot带到了Slack和Teams,新模型和代码审查功能也更新了原文稍后读已读值得跟进有用关注 GitHub Copilot
05:43官方一手AWS Machine Learning Blog@Frank Huang澳大利亚团队现可通过亚太(悉尼)和亚太(墨尔本)区域,使用Amazon Bedrock访问OpenAI GPT-5.6 Sol、Terra和Luna模型。该服务支持全球跨区域推理功能。文章详细介绍了如何调用这些模型、使用提示缓存、设置Codex与OpenID Connect认证,以及通过Amazon CloudWatch监控使用情况。AI产品OpenAIGPT-5.6Amazon Bedrock10 个信源在谈事件专题推荐理由:AWS在澳大利亚上线了OpenAI最新GPT-5.6模型,支持跨区域调用,还附带了完整的使用教程和监控方案。原文稍后读已读值得跟进有用关注 OpenAI
05:27官方账号LangChain@LangChainAI73°LangChain将在两周后于达拉斯举办LangSmith路演活动。活动将由LangChain创始人hwchase17主讲智能体开发现状。参与者可参加Deep Agents和LangSmith Engine的实践工作坊。工作坊名额有限,需提前注册。行业LangChainhwchase17智能体1 个信源在谈事件专题推荐理由:LangChain创始人亲自讲解智能体开发,还有Deep Agents实战工作坊原文稍后读已读值得跟进有用关注 LangChain
05:12OpenRouter@OpenRouterAIMuse Spark 1.3 已在 OpenRouter 平台发布。该模型专为长时间运行的智能体、多智能体和编程工作流设计。Muse Spark 1.3 能够跟踪学习内容,处理冲突输入,并在需要时寻求澄清或确认。AI模型Muse SparkOpenRouter智能体推荐理由:OpenRouter 上线了 Muse Spark 1.3,能跟踪学习、处理冲突输入,适合复杂编程任务。原文稍后读已读值得跟进有用关注 Muse Spark
05:03Suhail@SuhailProximal公司发布了FrontierSWE v2,这是一个更新的超长视野编程基准。新版本v2扩展了任务套件并改进了方法论。基准测试显示前沿模型之间存在较大性能差距,Claude Fable 5.1以显著优势领先。AI模型FrontierSWEProximalHQClaude Fable 5.17 个信源在谈事件专题推荐理由:Proximal发布了新版编程基准FrontierSWE v2,Claude Fable 5.1在测试中表现最佳。原文稍后读已读值得跟进有用关注 FrontierSWE
05:02elvis@omarsar0Muse Spark 1.3 今日发布,在编程和长周期任务方面取得重大改进。该版本专门针对编程能力进行了训练,是 Muse Spark 系列中编程和智能体工作能力的最大提升。新版本已在 Muse Code 和 API 中可用,性能接近前沿水平。AI产品Muse SparkMuse Code编程助手3 个信源在谈事件专题推荐理由:Muse Spark 推出 1.3 版,编程能力大幅提升,4周内迭代速度惊人。原文稍后读已读值得跟进有用关注 Muse Spark
04:59官方一手Meta Engineering Blog(博客/媒体)Meta开发了一个AI代理系统,作为特定领域的第二专家。该系统整合了结构化知识架构和专家学习机制。它能保存组织内的专业知识供员工访问和共享。该系统已在Meta内部部署使用。AI产品MetaAI代理组织知识推荐理由:Meta发布组织AI专家系统,能保存和共享专业知识,比传统领域代理更先进。原文稍后读已读值得跟进有用关注 Meta
04:43官方账号Perplexity@perplexity_ai78°Perplexity发布了名为Lily的本地推理引擎,专为Qwen3.6-35B-A3B模型在Apple硅芯片上优化。该引擎解决了设备端计算瓶颈问题,支持混合计算架构。Lily是Perplexity Computer的核心组件,现已开源。AI产品LilyQwen3.6-35B-A3BPerplexity推荐理由:Perplexity开源了专为Apple芯片优化的Lily推理引擎,解决Qwen3.6-35B-A3B的本地计算瓶颈问题。原文稍后读已读值得跟进有用关注 Lily
04:43官方账号Perplexity@perplexity_aiQwen3.6-35B-A3B 在 M5 Max MacBook Pro 上进行了基准测试。该模型在十种提示长度和十种解码上下文中表现优异。相比 MLX-LM,Qwen3.6-35B-A3B 的预填充吞吐量平均高出 1.23 倍。解码吞吐量平均高出 1.35 倍,同时输出质量基本保持不变。AI模型Qwen3.6-35B-A3BMLX-LMMacBook Pro推荐理由:Qwen3.6-35B-A3B 在苹果笔记本上跑得比 MLX-LM 还快,吞吐量提升超 20%,质量不打折。原文稍后读已读值得跟进有用关注 Qwen3.6-35B-A3B
04:43官方账号Perplexity@perplexity_aiLily将苹果硅视为独特推理平台,直接映射Qwen操作到其计算和内存架构。该项目已在GitHub开源,地址为github.com/perplexityai/p...。Lily专注于优化在苹果设备上的AI模型性能。苹果硅芯片具有独特的计算架构,需要专门优化。AI产品LilyQwen苹果硅推荐理由:Perplexity开源了Lily项目,专门优化Qwen模型在苹果硅芯片上的推理性能。原文稍后读已读值得跟进有用关注 Lily
04:42Aravind Srinivas@AravSrinivas73°Perplexity Computer在NVIDIA DGX Spark上实现了完全本地运行。演示展示了该便携式计算机在本地环境中的性能表现。DGX Spark是NVIDIA的AI计算平台。Perplexity Computer是一款便携式AI设备。AI产品Perplexity ComputerDGX SparkNVIDIA4 个信源在谈事件专题推荐理由:看Perplexity Computer如何在DGX Spark上实现本地运行,比云端更安全快速。原文稍后读已读值得跟进有用关注 Perplexity Computer
04:33ollama@ollamaMuse Spark 1.3 版本今日发布,在编程和智能体工作方面实现了迄今为止最大的性能提升。该模型性能接近前沿水平,成本极低。用户可以在 Muse Code 和 API 中试用此模型。未来还将发布 Muse Spark 开放权重版本。AI模型Muse SparkMuse Code编程助手3 个信源在谈事件专题推荐理由:Muse Spark 1.3 发布了,编程和智能体工作能力大幅提升,成本还很低,开放权重版本也快来了。原文稍后读已读值得跟进有用关注 Muse Spark
04:32IT之家(博客/媒体)博通2026财年第三季度营收295.91亿美元,同比增长86%。AI半导体业务收入达167亿美元,同比增长221%。归母净利润130.88亿美元,同比增长216%。公司预计第四季度营收将达348亿美元,AI半导体收入将增长至217亿美元。行业博通AI半导体财报推荐理由:博通Q3业绩超预期,AI半导体业务增长221%,净利润翻倍,AI芯片需求强劲。原文稍后读已读值得跟进有用关注 博通
04:24官方一手@OpenAIDevs@OpenAIDevs73°GPT-5.6 Sol正在帮助@bryantchou的团队在@ployai公司协调复杂的营销活动。该团队正在尝试使用子智能体(subagents)来节省时间和降低成本。这一应用展示了GPT-5.6 Sol在营销自动化方面的能力。AI产品GPT-5.6@ployai营销自动化推荐理由:OpenAI的GPT-5.6 Sol正被用于营销活动管理,通过子智能体实现成本节约和时间优化。原文稍后读已读值得跟进有用关注 GPT-5.6
04:24官方一手@OpenAIDevs@OpenAIDevsOpenAI的WebMCP挑战赛仅剩24小时提交时间。参赛者需在9月3日下午1点前完成项目提交。该挑战赛专注于WebMCP技术的应用与创新。目前已有2719人关注此活动。行业OpenAIWebMCP挑战赛10 个信源在谈事件专题推荐理由:OpenAI的WebMCP挑战赛明天截止,最后24小时提交你的项目原文稍后读已读值得跟进有用关注 OpenAI
04:23官方账号Meta AI@AIatMeta73°Meta发布了Muse Spark 1.3版本,在智能体和编程任务上性能提升。新版本能在单线程中跨多个工作流维持更长时间的任务执行。相比1.2版本,内部测试显示工具调用减少约20%,token使用减少约25%。模型能更好地认识自身局限,减少幻觉输出。AI模型Muse SparkMeta智能体推荐理由:Meta升级了Muse Spark,现在它更会协作、更少出错,还省资源。原文稍后读已读值得跟进有用关注 Muse Spark
04:23官方账号Meta AI@AIatMetaMuse Spark 1.3 今日正式上线,可通过 Muse Code 和 Meta Model API 访问。该版本将在完成安全测试后推出最大推理功能。Meta Model API 网址为 dev.meta.ai。AI产品Muse SparkMetaMeta Model API推荐理由:Meta 推出了 Muse Spark 1.3,即将加入最大推理功能,安全测试后上线。原文稍后读已读值得跟进有用关注 Muse Spark
04:22techcrunch@Russell Brandom73°OpenAI发布Astra模型,采用'循环深度'技术。该技术使模型能够突破大多数推理模型的顺序思维限制。安全专家对这一新方法表示担忧。AI模型OpenAIAstra推理模型9 个信源在谈事件专题推荐理由:OpenAI的Astra模型用'循环深度'技术突破顺序思维,安全专家对此表示担忧。原文稍后读已读值得跟进有用关注 OpenAI
04:14Claude@claudeaiClaude 在 Pro 和 Max 订阅计划中推出计算机使用功能 beta 版。该功能目前仅适用于 macOS 桌面应用。新用户可在设置中启用此功能:设置 → 常规 → 计算机使用。AI产品ClaudeProMax3 个信源在谈事件专题推荐理由:Claude 新增了能操作你电脑的功能,Pro 和 Max 用户现在可以在 macOS 上试用。原文稍后读已读值得跟进有用关注 Claude
04:14Claude@claudeaiClaude在Claude Cowork和Claude Code中新增后台控制电脑功能。用户可在桌面分配任务,Claude能像人类一样点击、输入和打开应用。该功能使用户能在处理其他工作时让Claude独立操作电脑。AI产品ClaudeClaude CoworkClaude Code2 个信源在谈事件专题推荐理由:Claude现在能帮你操作电脑,边工作边让它处理桌面任务原文稍后读已读值得跟进有用关注 Claude
04:13The Rundown AI@therundownai78°Meta发布了Muse Spark 1.3模型,相比1.2版本有显著提升。马克·扎克伯格称该模型达到了"前沿性能,几乎便宜到无法计量"。该模型在多项基准测试中表现出色。AI模型Muse SparkMeta模型升级推荐理由:Meta刚发布的Muse Spark 1.3性能大幅提升,价格却很亲民。原文稍后读已读值得跟进有用关注 Muse Spark
04:13OpenRouter@OpenRouterAIMuse Spark 1.3 已在 OpenRouter 平台发布。该模型专为长时间运行的智能体、多智能体和编程工作流设计。Muse Spark 1.3 能够跟踪学习内容,处理冲突输入,并在需要时请求澄清或确认。AI模型Muse SparkOpenRouter智能体推荐理由:OpenRouter 上线了 Muse Spark 1.3,能跟踪学习、处理冲突输入,适合复杂编程任务。原文稍后读已读值得跟进有用关注 Muse Spark
04:02宝玉@dotey73°OpenAI API出现了GPT-6-Astra的404错误响应,而非通常的400错误。这一异常模式与Bedrock API在Fable 5.1发布前一天出现的异常相似。OpenAI Responses API对GPT-6-Astra返回404,而对不存在的slug返回400。AI模型GPT-6-AstraOpenAIAPI7 个信源在谈事件专题推荐理由:OpenAI API出现GPT-6-Astra的404错误,类似Bedrock API在Fable 5.1发布前的异常,暗示新模型即将发布。原文稍后读已读值得跟进有用关注 GPT-6-Astra
04:02宝玉@doteyFable是Claude Code中更贵但更聪明的模型,额度仅占总量的50%。用户应让Fable负责分析、编排和验证任务,将具体执行工作交给Opus或Sonnet子代理。通过平衡Fable与总进度条的使用比例,可避免智力额度见底或便宜模型消耗过快的问题。技巧FableClaude CodeAgent推荐理由:教你如何平衡使用Claude Code中的Fable和子Agent,让智力和额度都充分利用到重置日。原文稍后读已读值得跟进有用关注 Fable
03:38Poe@poe_platformGoogle 发布的 Gemini 3.8 Flash 模型现已登陆 Poe 平台。该模型拥有 1M token 上下文窗口,支持网络搜索功能,并具备可调节的思考层级。作为面向编程和智能体的快速高效模型,它在保持 Flash 速度的同时提供了强大的推理能力。AI模型GeminiGemini 3.8 FlashPoe10 个信源在谈事件专题推荐理由:Google 的 Gemini 3.8 Flash 登陆 Poe,速度快成本低,适合编程和智能体任务,还有百万上下文窗口。原文稍后读已读值得跟进有用关注 Gemini
03:38Poe@poe_platform78°Claude Fable 5.1 是 Anthropic 最强大的模型,专为复杂推理和长期智能体工作设计。该模型支持 100 万 token 上下文窗口,具备网络搜索功能,并能从低到高自适应调整思考深度。用户现可在 Poe 平台体验这一最新版本。AI产品Claude Fable 5.1AnthropicPoe10 个信源在谈事件专题推荐理由:Anthropic 发布了 Claude Fable 5.1,在 Poe 上可用,支持百万 token 上下文和自适应思考。原文稍后读已读值得跟进有用关注 Claude Fable 5.1
03:37lmarena.ai@lmarena_ai73°Gemini 3.8 Flash (High)在Agent Arena评测中较Gemini 3.7 Flash (High)提升5.94%,排名从第32位上升至第14位。该模型在"赞扬vs投诉"指标上提升14.78%,在"确认成功率"上提升11.12%,在"Bash恢复"能力上提升4.46%。Agent Arena评测使用网络、文件系统和终端工具衡量模型在真实世界长期任务中的表现。AI模型GeminiGemini 3.8 FlashGoogleDeepMind10 个信源在谈事件专题推荐理由:GoogleDeepMind的Gemini 3.8 Flash在智能体评测中排名大幅提升,用户反馈明显更积极。原文稍后读已读值得跟进有用关注 Gemini