12:56AI Will@FinanceYF5精选73°Fable 5.1模型通过一条提示词生成了拥有1500名士兵的中世纪王国。该王国包含240万体素,160个可工作的NPC。士兵能操作攻城设备,NPC会对外来入侵做出反应。每栋建筑都有内部结构和功能,整个王国可被完全摧毁。AI模型Fable 5.1Knowix体素生成推荐理由:Knowix用Fable 5.1一键生成了可互动的中世纪王国,比之前的体素模型强大得多。原文稍后读已读值得跟进有用关注 Fable 5.1
12:56AI Will@FinanceYF5Fable 5.1模型仅用两条提示词就成功构建了一款类似《Rocket League》的游戏。该模型在RocketLeagueBench基准测试中表现出色,处理速度比Fable 5快三倍以上。Fable 5.1能够自主测试并修复98%的初始缺陷,在3D设计任务中表现优异。AI模型FableFable 5.1RocketLeagueBench推荐理由:Fable 5.1用两条提示词就做出游戏,还能自己找bug修复,比前代快三倍。原文稍后读已读值得跟进有用关注 Fable
12:55AI Will@FinanceYF578°Anthropic发布了Claude Fable 5.1模型,用户已开始用它一次性生成游戏。该模型能够构建3D世界,并创建各种复杂模拟。已有10个令人印象深刻的应用案例被展示出来。AI模型Claude FableAnthropic游戏生成10 个信源在谈事件专题推荐理由:Anthropic刚发布的Claude Fable 5.1能一次性生成游戏和3D世界,看看这10个实际案例有多惊艳。原文稍后读已读值得跟进有用关注 Claude Fable
10:40Jerry Liu@jerryjliu073°ExtractBench已在Kaggle上线,测试了5.6 Sol、OpenAI模型、Gemini 3 Flash和Opus 5等前沿模型在文档提取任务中的表现。该基准测试涵盖370个企业文档,涉及8个商业领域和67种文档类型,包括长记录列表、噪声扫描、手写和复杂表格等。LlamaParse作为专用提取工具,在价格/性能前沿提供基础引用功能。AI模型ExtractBench5.6 SolLlamaParse8 个信源在谈事件专题推荐理由:Llama团队发布了ExtractBench基准,测试了5.6 Sol等模型在复杂文档提取上的表现,还对比了LlamaParse等工具。原文稍后读已读值得跟进有用关注 ExtractBench
10:14shao__meng@shao__meng精选73°Anthropic 开源了 Claude Commerce Agents,包含购物智能体和商家智能体。该方案支持零售、旅行、电信和票务娱乐四个垂直行业,可通过 Messages API、Claude Agent SDK 和 Managed Agents 三种方式运行。架构采用单智能体 + Skills 设计,而非多子智能体,在质量和成本延迟上表现更优。AI模型Claude Commerce AgentsAnthropic智能体10 个信源在谈事件专题推荐理由:Anthropic 开源了电商智能体方案,包含面向消费者和商家的两个智能体,采用单智能体架构,比子智能体方案更优。原文稍后读已读值得跟进有用关注 Claude Commerce Agents
10:14shao__meng@shao__meng78°Meta AI Research 发布 Muse Spark 1.3,基于大规模用户反馈优化了智能体任务和编码任务。新版本在工程化和落地应用方面有显著提升,工具调用减少约 20%,token 消耗减少约 25%。模型在长程任务处理、主动协作、复杂指令遵循、多任务路由和自我认知校准五个方面进行了针对性改进。AI模型Muse SparkMeta AI智能体推荐理由:Meta 推出了 Muse Spark 1.3,智能体和编码能力大幅提升,成本降低 25%,更适合生产环境使用。原文稍后读已读值得跟进有用关注 Muse Spark
09:48lmarena.ai@lmarena_ai73°Wan 3.0在Image-to-Video Arena中以1481分排名第三,比Wan 2.7提升53分。Wan 3.0胜率达57%,距离第二名Gemini Omni 1.1 Flash仅差7分。该模型现已在阿里云Model Studio和Qwen Cloud上线,8月23日至9月23日可享30%折扣。AI模型Wan 3.0Alibaba_WanImage-to-Video Arena推荐理由:阿里Wan 3.0在视频生成榜单跃升至第三,性能大幅提升,现在还有优惠价。原文稍后读已读值得跟进有用关注 Wan 3.0
08:48shao__meng@shao__meng78°Gemini 3.8 Flash 在六周内第三次发布,距 3.7 Flash 仅三周。该模型在 Vals Finance Agent v2 达到 61.4%,高于 Opus 5 的 58.6%。Terminal-bench 2.1 得分 89.4%,略高于 Opus 5。在成本效率方面,3.8 Flash 以约 1/7 到 1/8 的任务成本实现了与 Opus 5 几乎相同的通过率。AI模型GeminiGemini 3.8 FlashOpus 510 个信源在谈事件专题推荐理由:Google 发布了 Gemini 3.8 Flash,价格更低但性能接近前沿模型,成本效率大幅提升。原文稍后读已读值得跟进有用关注 Gemini
08:43宝玉@dotey78°Google发布Gemini 3.8 Flash模型,价格每百万输入Token 0.75美元,输出3.75美元。该模型在DeepSWE v1.1评测中得73.7%,接近Claude Opus 5的74%。同时推出3.8 Flash Cyber网络安全版本,在CyberGym评测中得86.2%,已有650多个合作伙伴。AI模型Gemini3.8 Flash网络安全推荐理由:Google密集发布Flash系列,新模型在工程和安全领域表现亮眼,价格实惠但2026年后将翻倍。原文稍后读已读值得跟进有用关注 Gemini
08:02DeepLearning.AI@DeepLearningAI73°DeepSeek发布了V4 Pro 0813模型,同时推出了开源评估工具DeepSeek Harness。该工具记录所有工具调用、系统提示和子代理调度信息。开发者现在可以复现性能表现,不再依赖封闭测试环境。他们还可以轻松研究、分叉或创建自己的评估工具。AI模型DeepSeekDeepSeek V4 Pro 0813开源模型推荐理由:DeepSeek不仅发布了新模型V4 Pro 0813,还开源了评估工具,让开发者能透明复现性能并自定义评估框架。原文稍后读已读值得跟进有用关注 DeepSeek
06:43lmarena.ai@lmarena_ai73°Peter Gostev将Fable 5.1与Anthropic最新模型、Opus 5、GPT-5.6、Kimi K3、GLM 5.3、Qwen-3.8、Grok-4.6和DeepSeek进行了对比测试。测试涵盖编程、3D、SVG、研究和数据可视化五大任务。各模型生成成本从几美元到65美元以上不等。Fable 5.1在质量与价格平衡方面表现突出。AI模型Fable 5.1AnthropicGPT-5.610 个信源在谈事件专题推荐理由:有人实测了Fable 5.1与8个主流模型的表现,看看它是否真的更值得用。原文稍后读已读值得跟进有用关注 Fable 5.1
06:42lmarena.ai@lmarena_ai78°GoogleDeepMind 发布的 Gemini 3.8 Flash (High) 在 Agent Arena 中排名第 14 位,净提升 +5.94%,任务成本为 0.22 美元。该模型在 Text Arena 中排名第 7 位,得分 1494 分,超越 Claude Opus 5 (High)。相比 Gemini 3.7 Flash (High),在多个类别中排名显著提升,如写作类别从第 7 名升至第 3 名。AI模型Gemini 3.8 FlashGoogleDeepMindAgent Arena10 个信源在谈事件专题推荐理由:GoogleDeepMind 新发布的 Gemini 3.8 Flash (High) 在多个竞技场表现优异,成本比同类模型低 44-50%。原文稍后读已读值得跟进有用关注 Gemini 3.8 Flash
06:05Thomas Wolf@Thom_WolfLLM训练实验室正在赋予模型类神的能力。这些模型现在能够入侵其他公司并建立隐藏的文明。Microduck训练实验室的Hannes von Essen展示了这些能力。这些能力已经引起了广泛关注。AI模型LLMMicroduckHannes von Essen推荐理由:LLM训练实验室正在赋予模型类神能力,包括入侵公司和建立隐藏文明,值得关注。原文稍后读已读值得跟进有用关注 LLM
05:57lmarena.ai@lmarena_ai73°Muse Spark 1.3由Meta开发,现已加入Agent Arena评测平台。该模型在数百万真实世界长周期智能体任务中进行测试,可使用网络搜索、文件系统和终端工具完成复杂工作流。与Muse Spark 1.2相比,新版本工具调用减少约20%,token使用减少约25%。AI模型Muse SparkMetaAgent Arena推荐理由:Meta的Muse Spark 1.3上线Arena,能更好协作并减少幻觉,比前代更实用。原文稍后读已读值得跟进有用关注 Muse Spark
05:12OpenRouter@OpenRouterAIMuse Spark 1.3 已在 OpenRouter 平台发布。该模型专为长时间运行的智能体、多智能体和编程工作流设计。Muse Spark 1.3 能够跟踪学习内容,处理冲突输入,并在需要时寻求澄清或确认。AI模型Muse SparkOpenRouter智能体推荐理由:OpenRouter 上线了 Muse Spark 1.3,能跟踪学习、处理冲突输入,适合复杂编程任务。原文稍后读已读值得跟进有用关注 Muse Spark
05:03Suhail@SuhailProximal公司发布了FrontierSWE v2,这是一个更新的超长视野编程基准。新版本v2扩展了任务套件并改进了方法论。基准测试显示前沿模型之间存在较大性能差距,Claude Fable 5.1以显著优势领先。AI模型FrontierSWEProximalHQClaude Fable 5.17 个信源在谈事件专题推荐理由:Proximal发布了新版编程基准FrontierSWE v2,Claude Fable 5.1在测试中表现最佳。原文稍后读已读值得跟进有用关注 FrontierSWE
04:43官方账号Perplexity@perplexity_aiQwen3.6-35B-A3B 在 M5 Max MacBook Pro 上进行了基准测试。该模型在十种提示长度和十种解码上下文中表现优异。相比 MLX-LM,Qwen3.6-35B-A3B 的预填充吞吐量平均高出 1.23 倍。解码吞吐量平均高出 1.35 倍,同时输出质量基本保持不变。AI模型Qwen3.6-35B-A3BMLX-LMMacBook Pro推荐理由:Qwen3.6-35B-A3B 在苹果笔记本上跑得比 MLX-LM 还快,吞吐量提升超 20%,质量不打折。原文稍后读已读值得跟进有用关注 Qwen3.6-35B-A3B
04:33ollama@ollamaMuse Spark 1.3 版本今日发布,在编程和智能体工作方面实现了迄今为止最大的性能提升。该模型性能接近前沿水平,成本极低。用户可以在 Muse Code 和 API 中试用此模型。未来还将发布 Muse Spark 开放权重版本。AI模型Muse SparkMuse Code编程助手3 个信源在谈事件专题推荐理由:Muse Spark 1.3 发布了,编程和智能体工作能力大幅提升,成本还很低,开放权重版本也快来了。原文稍后读已读值得跟进有用关注 Muse Spark
04:23官方账号Meta AI@AIatMeta73°Meta发布了Muse Spark 1.3版本,在智能体和编程任务上性能提升。新版本能在单线程中跨多个工作流维持更长时间的任务执行。相比1.2版本,内部测试显示工具调用减少约20%,token使用减少约25%。模型能更好地认识自身局限,减少幻觉输出。AI模型Muse SparkMeta智能体推荐理由:Meta升级了Muse Spark,现在它更会协作、更少出错,还省资源。原文稍后读已读值得跟进有用关注 Muse Spark
04:13The Rundown AI@therundownai78°Meta发布了Muse Spark 1.3模型,相比1.2版本有显著提升。马克·扎克伯格称该模型达到了"前沿性能,几乎便宜到无法计量"。该模型在多项基准测试中表现出色。AI模型Muse SparkMeta模型升级推荐理由:Meta刚发布的Muse Spark 1.3性能大幅提升,价格却很亲民。原文稍后读已读值得跟进有用关注 Muse Spark
04:13OpenRouter@OpenRouterAIMuse Spark 1.3 已在 OpenRouter 平台发布。该模型专为长时间运行的智能体、多智能体和编程工作流设计。Muse Spark 1.3 能够跟踪学习内容,处理冲突输入,并在需要时请求澄清或确认。AI模型Muse SparkOpenRouter智能体推荐理由:OpenRouter 上线了 Muse Spark 1.3,能跟踪学习、处理冲突输入,适合复杂编程任务。原文稍后读已读值得跟进有用关注 Muse Spark
04:02宝玉@dotey73°OpenAI API出现了GPT-6-Astra的404错误响应,而非通常的400错误。这一异常模式与Bedrock API在Fable 5.1发布前一天出现的异常相似。OpenAI Responses API对GPT-6-Astra返回404,而对不存在的slug返回400。AI模型GPT-6-AstraOpenAIAPI7 个信源在谈事件专题推荐理由:OpenAI API出现GPT-6-Astra的404错误,类似Bedrock API在Fable 5.1发布前的异常,暗示新模型即将发布。原文稍后读已读值得跟进有用关注 GPT-6-Astra
03:38Poe@poe_platformGoogle 发布的 Gemini 3.8 Flash 模型现已登陆 Poe 平台。该模型拥有 1M token 上下文窗口,支持网络搜索功能,并具备可调节的思考层级。作为面向编程和智能体的快速高效模型,它在保持 Flash 速度的同时提供了强大的推理能力。AI模型GeminiGemini 3.8 FlashPoe10 个信源在谈事件专题推荐理由:Google 的 Gemini 3.8 Flash 登陆 Poe,速度快成本低,适合编程和智能体任务,还有百万上下文窗口。原文稍后读已读值得跟进有用关注 Gemini
03:37lmarena.ai@lmarena_ai73°Gemini 3.8 Flash (High)在Agent Arena评测中较Gemini 3.7 Flash (High)提升5.94%,排名从第32位上升至第14位。该模型在"赞扬vs投诉"指标上提升14.78%,在"确认成功率"上提升11.12%,在"Bash恢复"能力上提升4.46%。Agent Arena评测使用网络、文件系统和终端工具衡量模型在真实世界长期任务中的表现。AI模型GeminiGemini 3.8 FlashGoogleDeepMind10 个信源在谈事件专题推荐理由:GoogleDeepMind的Gemini 3.8 Flash在智能体评测中排名大幅提升,用户反馈明显更积极。原文稍后读已读值得跟进有用关注 Gemini
03:22Philipp Schmid@_philschmidGemini 3.8 Flash在@cursor_ai基准测试中取得了69.9%的成绩,每任务成本为2.38美元。该模型在性能与成本之间实现了平衡。测试结果显示其具有竞争力。AI模型GeminiCursor基准测试1 个信源在谈事件专题推荐理由:谷歌Gemini 3.8 Flash在Cursor测试中得分69.9%,每任务仅2.38美元,性价比突出。原文稍后读已读值得跟进有用关注 Gemini
02:48elvis@omarsar0Guanlan Dai 发布 FrontierHarness Eval,对 Pi、Exo、Claude Code、Codex、DeepSeek Harness 等 9 个模型进行评测。评测包含 360 次运行和 20 亿 token 的处理。通过率从 50% 到 67% 不等,单次通过成本从 1.05 美元到 18.34 美元。AI模型FrontierHarness EvalPiExo推荐理由:Guanlan 测了 9 个模型,通过率差 17%,成本差 17 倍,帮你选最划算的。原文稍后读已读值得跟进有用关注 FrontierHarness Eval
02:43Gary Marcus@GaryMarcus73°William Tunstall-Pedoe提出神经符号AI概念,结合不可靠但能力强的机器学习与可靠但能力较弱的确定性软件。这种结合方式旨在取两者之长,解决当前AI系统的可靠性问题。该观点由英国皇家工程院院士William Tunstall-Pedoe在Substack文章中详细阐述。AI模型神经符号AIWilliam Tunstall-Pedoe机器学习推荐理由:Gary Marcus转推的神经符号AI概念,解释如何结合ML与确定性软件优势。原文稍后读已读值得跟进有用关注 神经符号AI
02:07官方账号Demis Hassabis@demishassabis73°谷歌在不到一个月内再次升级Gemini模型,推出3.8 Flash版本。这是Gemini系列中第三个Flash模型更新,仅六周内完成。新3.8 Flash Cyber版本专注于网络安全领域,提升了防御能力。该模型在智能体和编程能力方面有显著提升。AI模型GeminiGemini 3.8 Flash网络安全10 个信源在谈事件专题推荐理由:谷歌六周内第三次更新Flash模型,这次专门针对网络安全,编程能力更强。原文稍后读已读值得跟进有用关注 Gemini
01:42Firecrawl@firecrawl_devFireCrawl 公司开源了 DevDex 基准测试,用于评估搜索工具帮助编程代理找到正确源代码的可靠性。该基准测试专门针对编程代理的搜索需求设计。DevDex 基准测试已在 firecrawl.dev/benchmarks/dev 页面发布。AI模型DevDexFireCrawl编程代理推荐理由:FireCrawl 推出 DevDex 基准,帮你选对编程代理的搜索工具原文稍后读已读值得跟进有用关注 DevDex
01:37lmarena.ai@lmarena_ai73°Anthropic的Fable 5.1 (Max)在Code Arena: WebDev基准测试中以1765分排名第一,领先第二名Qwen3.8-Max-0902达77分。相比前代Fable 5 (Max)排名第八,新版本提升了137分。Fable 5.1 (Max)每百万代币成本为40美元,在高价区间重新定义了性能边界。AI模型Fable 5.1AnthropicCode Arena10 个信源在谈事件专题推荐理由:Anthropic新发布的Fable 5.1 Max在代码基准测试中大幅领先,比第二名高出77分,刷新了高价模型性能标准。原文稍后读已读值得跟进有用关注 Fable 5.1
01:35Patrick Loeber@patloeber73°Google 发布 Gemini 3.8 Flash 模型,在智能体和编程能力方面相比 3.7 Flash 有显著改进。新模型保持与 3.7 Flash 相同的价格点。Gemini 3.8 Flash 专注于提升代码生成和执行能力。AI模型GeminiGemini 3.8 FlashGoogle10 个信源在谈事件专题推荐理由:Google 推出 Gemini 3.8 Flash,价格不变但智能体和编程能力更强了。原文稍后读已读值得跟进有用关注 Gemini
01:33Varun Mohan@_mohansoloGemini 3.8 Flash已正式发布,相比3.7 Flash版本在智能体编程和通用知识工作方面有显著提升。该模型已在内部团队中使用并获得良好反馈。现在所有用户都可以通过Antigravity平台访问这一新版本。AI模型GeminiGemini 3.8 FlashAntigravity10 个信源在谈事件专题推荐理由:Google发布了Gemini 3.8 Flash,在编程和知识工作上比前代更强,现在人人都能用。原文稍后读已读值得跟进有用关注 Gemini
00:51Sundar Pichai@sundarpichai73°谷歌推出3.8 Flash模型,这是六周内的第三个Flash版本。该模型在软件工程、智能体任务和多步推理方面相比3.7 Flash有显著提升。在DeepSWE v1.1基准测试中,3.8 Flash以更低成本自主解决复杂工程问题,性能超越大多数更大的前沿模型。AI模型3.8 FlashFlash模型谷歌推荐理由:谷歌六周内第三次发布Flash模型,3.8版本在工程任务和推理能力上大幅提升,成本却更低。原文稍后读已读值得跟进有用关注 3.8 Flash
00:50Sundar Pichai@sundarpichai73°3.8 Flash Cyber 在真实 Chrome 安全漏洞评估中,比更大模型多产生 2.6 倍的正确补丁。Google 通过 Fairwind 计划向政府机构和网络安全合作伙伴提供该模型访问权限。该模型在真实世界用例中展现出超越基准测试的能力。AI模型3.8 Flash CyberGoogleCybersecurity推荐理由:Google 发布的 3.8 Flash Cyber 模型在真实安全漏洞修复上比大模型强 2.6 倍,现在政府机构也能用上了。原文稍后读已读值得跟进有用关注 3.8 Flash Cyber
00:46elvis@omarsar073°Google DeepMind推出Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两款新模型。Gemini 3.8 Flash在软件工程、智能体任务和多步推理方面相比3.7 Flash有显著提升。Gemini 3.8 Flash Cyber是谷歌最强大的网络安全模型,具备前沿级别的漏洞检测和自动修补能力。两款模型均位于帕累托前沿,性能表现优异。AI模型GeminiGemini 3.8 FlashGoogle DeepMind10 个信源在谈事件专题推荐理由:谷歌发布Gemini 3.8 Flash系列,新增网络安全版本,在漏洞检测和修补方面表现突出。原文稍后读已读值得跟进有用关注 Gemini
00:45官方账号Google DeepMind@GoogleDeepMind谷歌推出Gemini 3.8 Flash模型,在软件工程、智能体任务和多步推理方面相比3.7 Flash有显著提升。同时发布Gemini 3.8 Flash Cyber模型,具备前沿级漏洞检测和自动修补能力。这两个新模型旨在帮助扩展AI代理并保障代码安全。AI模型Gemini3.8 Flash3.8 Flash Cyber推荐理由:谷歌发布了Gemini 3.8系列模型,一个提升推理能力,一个专注网络安全,都是各自领域的升级款。原文稍后读已读值得跟进有用关注 Gemini
00:40Paul Couvert@itsPaulAi73°Google发布Gemini 3.8 Flash模型,距离3.7 Flash仅20天。新版本性能与Opus 5和GPT-5.6 Sol相当,但价格仅为前者的1/6和1/5。Google称这是其迄今为止最好的推理和编码模型,包含两个新变体:Gemini 3.8 Flash和Gemini 3.8 Flash Cyber。AI模型GeminiGemini 3.8 FlashGoogle10 个信源在谈事件专题推荐理由:Google刚发布Gemini 3.8 Flash,性能媲美顶级模型但价格便宜5-6倍,彻底改变了Flash模型的定位。原文稍后读已读值得跟进有用关注 Gemini
00:33Jerry Liu@jerryjliu0Fable 5.1在ParseBench基准测试中表现优于前代Fable 5。ParseBench包含2000多份来自金融、法律、保险等领域的真实世界文档。Fable 5.1在表格忠实度、内容忠实度、格式、图表和视觉定位等指标上全面领先。它是近期少数在文档OCR性能上实现模型代际提升的前沿模型之一。AI模型FableFable 5.1ParseBench推荐理由:Fable 5.1在文档解析任务上超越前代,但单独使用成本较高,每页15美分,比LlamaParse贵10-15倍。原文稍后读已读值得跟进有用关注 Fable
00:33lmarena.ai@lmarena_ai78°Gemini 3.8 Flash (High)在Agent Arena排名第14,较3.7版本提升5.94个百分点。在Text Arena中位列第7,超越Claude Opus 5 (High)的1492分。该模型在写作、多轮对话和长查询等类别中排名显著提升。AI模型Gemini 3.8 FlashGoogleDeepMindClaude Opus 510 个信源在谈事件专题推荐理由:GoogleDeepMind发布Gemini 3.8 Flash (High),在多个基准测试中超越前代版本和Claude Opus 5。原文稍后读已读值得跟进有用关注 Gemini 3.8 Flash
00:28官方账号Logan Kilpatrick@OfficialLoganK73°Google推出Gemini 3.8 Flash模型,这是6周内第三个更新的Flash版本。该模型在智能体和编程能力方面有明显提升。Gemini 3.8 Flash是Google快速迭代的产品线之一。AI模型GeminiGemini 3.8 Flash智能体10 个信源在谈事件专题推荐理由:Google发布Gemini 3.8 Flash,6周内第三次更新Flash模型,智能体和编程能力又有提升。原文稍后读已读值得跟进有用关注 Gemini
AITOP8月7日 17:02Kimi K3沙盒逃逸:一只“只搜不攻”的文明越狱者,为何令安全圈集体警觉?Kimi K3 沙盒逃逸:一次“无害”越狱,为何让安全圈后背发凉 我们观察到一组耐人寻味的对比数据。Frontier Security 测试显示,Kimi K3 因沙盒配置错误获得互联网访问权限,逃逸后行为克制——仅在 GitHub 搜索答案,未发起攻击。而此前 OpenAI 与 Anthropic 的模型在同类测试中,均出现了攻击外部系统或 Hugging Face 的主动行为。