技巧Agent 与开发者多源确认精选73°21:54GPT-6 Astra 提示词最佳实践OpenAI 官方发布 GPT-6 Astra 提示词指南,教你如何处理模型更谨慎的五种行为倾向,让模型在自主性和安全性间取得平衡。#GPT-6 Astra#OpenAI#提示词工程#智能体10 个信源在谈事件专题shao__meng@shao__meng11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6 Astra
模型Agent 与开发者多源确认78°15:57OpenAI推出GPT-6 Astra模型OpenAI发布了GPT-6 Astra,消息量只有GPT-5.6 Sol的一半,但Pro版本有独立配额。#OpenAI#GPT-6#ChatGPT#GPT-5.610 个信源在谈事件专题官方账号Decoder@Matthias Bastian11 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI
模型中美对照多源确认73°11:47GPT-6 Astra Computer Use能力提升GPT-6 Astra的Computer Use功能让App测试自动化又进了一步,比传统端到端测试框架更高效。#GPT-6#Astra#Computer Use#智能体10 个信源在谈事件专题宝玉@dotey11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照多源确认精选11:28GPT-6 Astra与Fable 5.1性能对比dotey实测GPT-6 Astra速度快、成本低,Computer Use能力让开发到验收形成完整闭环。#GPT-6#Fable#Computer Use#开发工具10 个信源在谈事件专题宝玉@dotey11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照78°10:22Shopify 0.8B 模型在专门任务上超越 GPT-5.6-solShopify 团队解释了如何用小模型超越大模型,关键是数据飞轮和自蒸馏技术,还揭示了 prompt 工程的局限性。#Shopify#GPT-5.6-sol#0.8B#微调shao__meng@shao__meng原文稍后读已读值得跟进有用关注 Shopify
模型中美对照多源确认精选08:12GPT-6 Astra与GPT-5.6模型图像生成对比GPT-6 Astra图像生成质量全面超越GPT-5.6,9.55 cents就能得到最佳结果,比其他模型便宜又效果好。#GPT-6-Astra#GPT-5.6-Sol#OpenAI#图像生成10 个信源在谈事件专题S官方账号Simon Willison’s Weblog11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6-Astra
模型中美对照多源确认73°06:48GPT-6 Astra发布与GPT-5.6系列对比Simon拿到了GPT-6 Astra,还做了和GPT-5.6系列的详细对比,想知道新模型强在哪就点开看看。#GPT-6#GPT-5.6#Astra#Sol10 个信源在谈事件专题官方账号Simon Willison@simonw11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
论文中美对照精选73°02:17腾讯发布环境进化论文解决智能体训练难题腾讯这篇论文解决了智能体RL的环境供应瓶颈,提出不依赖智能体弱点就能提升环境难度的方法。#Tencent#环境进化#智能体#强化学习elvis@omarsar0原文稍后读已读值得跟进有用关注 Tencent
模型中美对照多源确认精选73°01:15GPT-6 Astra 信号:上下文窗口不足GPT-6 Astra 展示了长运行代理的内存管理新思路,Milvus 3.0 为此提供了结构化存储和检索方案。#GPT-6#Astra#Milvus#上下文窗口10 个信源在谈事件专题Milvus@milvusio11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
产品Agent 与开发者多源确认73°12:10Agent技术选型实验:Stripe等工具成首选Armature让三大AI编程助手进行技术选型实验,发现Stripe、Vercel等工具成首选,13%情况下Agent选择自建方案。#Claude Code#GPT-5.6#Cursor#Groq 4.66 个信源在谈事件专题shao__meng@shao__meng7 个信源在谈原文稍后读已读值得跟进有用关注 Claude Code
模型中美对照多源确认73°11:51Thomson Reuters 推出大模型 ThomsonThomson Reuters 花费 4000 万美元训练自己的大模型,用 175 年专业数据,性能接近 Claude Opus 4.8。#Thomson#Qwen3.5-397B#Claude Opus#Thomson Reuters3 个信源在谈事件专题AI Will@FinanceYF54 个信源在谈原文稍后读已读值得跟进有用关注 Thomson
模型73°11:51汤森路推发布Thomson法律大模型汤森路透花4000万打造的法律大模型Thomson,用175年专业数据训练,性能比肩Claude Opus 4.8。#Thomson#Qwen3.5-397B#Claude Opus 4.8#GPT-5.5AI Will@FinanceYF5原文稍后读已读值得跟进有用关注 Thomson
产品多源确认精选73°11:32ATIBA:研究论文的完整性与质量检查工具ATIBA 自动检查论文引用完整性和会议合规性,用 GPT-5.4 做多模式审查,比人工检查更一致可靠。#ATIBA#GPT-5.4#ACM SIGSOFT#论文检查10 个信源在谈事件专题aarXiv: OpenAI@Veli Karakaya 等 4 人11 个信源在谈原文稍后读已读值得跟进有用关注 ATIBA
论文多源确认11:23终端智能体环境演化方法研究研究人员提出环境演化方法,让终端智能体训练环境持续变难,在Qwen模型上提升了18%性能。#环境演化#终端智能体#Qwen3.6#Claude Opus3 个信源在谈事件专题aarXiv cs.AI@Zhiyuan Fan 等 12 人4 个信源在谈原文稍后读已读值得跟进有用关注 环境演化
模型中美对照官方一手78°10:11GPT-6 Astra发布但暂不可用OpenAI的GPT-6 Astra虽暂不能用,但展示了超长任务处理和强大3D建模能力,成本还比Claude低一半。#GPT-6#Astra#OpenAI#3D建模10 个信源在谈事件专题官方一手歸藏(guizang.ai)@op741811 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型中美对照多源确认73°10:10GPT-6 Astra在Terminal-Bench-Science基准测试中表现优异OpenAI刚发布的GPT-6 Astra在科学基准测试中得分暴涨42%,远超前代模型。#GPT-6#Terminal-Bench-Science#OpenAI#科学基准10 个信源在谈事件专题Stanford AI Lab@StanfordAILab11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
论文Agent 与开发者精选73°10:02HarnessDev基准评测LLM创建Agent Harness能力ByteDance团队推出HarnessDev基准,首次评测LLM能否自己创建Agent执行框架,发现模型间harness迁移性极差。#HarnessDev#Agent#LLM#ByteDance1 个信源在谈事件专题shao__meng@shao__meng2 个信源在谈原文稍后读已读值得跟进有用关注 HarnessDev
技巧Agent 与开发者精选10:02Codex与Claude Code联手分析开源仓库Codex和Claude Code联手分析开源仓库,教你如何直接学习代码而非依赖模糊的最佳实践。#Codex#Claude Code#gpt-5.6-sol#Fable 5shao__meng@shao__meng原文稍后读已读值得跟进有用关注 Codex
模型中美对照多源确认93°05:00OpenAI发布GPT-6 Astra模型OpenAI新出的GPT-6 Astra能自己操作电脑、写代码,还能发现零日漏洞,但安全限制更严,比Claude Fable 5.1贵2.5倍。#GPT-6#Astra#OpenAI#AGI10 个信源在谈事件专题宝玉@dotey11 个信源在谈原文稍后读已读值得跟进有用关注 GPT-6
模型Agent 与开发者73°04:21Muse Spark 1.3重回WebDev编程榜前十Meta的Muse Spark 1.3在编程榜单上跃升20多位,性能接近Claude和GPT-5.6,工具调用减少20%。#Muse Spark#AIatMeta#Claude Fable#GPT-5.6lmarena.ai@lmarena_ai原文稍后读已读值得跟进有用关注 Muse Spark
模型Agent 与开发者精选73°12:16Repo-To-Skill:将GitHub仓库提炼为AI技能DisCo代理把GitHub仓库变成可重用技能,在多个AI研究基准上大幅提升性能,比无技能版本表现更好。#DisCo#GPT-5.5#MLE-bench#PaperBenchaarXiv cs.AI@Jianlyu Chen 等 11 人原文稍后读已读值得跟进有用关注 DisCo
产品Agent 与开发者精选08:05Fable 5.1 指挥 GPT-5.6 Luna 智能体工作流Fable 5.1 能指挥 GPT-5.6 Luna 智能体,比直接使用 Opus 更灵活,适合 Fable API 用户。#Fable#GPT-5.6#Claude Code#智能体宝玉@dotey原文稍后读已读值得跟进有用关注 Fable
模型中美对照多源确认73°07:32Meta 发布 Muse Spark 1.3 模型Meta 新出的 Muse Spark 1.3 编码能力超 GPT-5.6,工具调用减少 20%,还支持长线程多任务处理。#Muse Spark#GPT-5.6#Claude Fable#编码能力10 个信源在谈事件专题IIT之家11 个信源在谈原文稍后读已读值得跟进有用关注 Muse Spark
模型Agent 与开发者多源确认73°06:43Fable 5.1与多个模型性能对比有人实测了Fable 5.1与8个主流模型的表现,看看它是否真的更值得用。#Fable 5.1#Anthropic#GPT-5.6#模型对比10 个信源在谈事件专题lmarena.ai@lmarena_ai11 个信源在谈原文稍后读已读值得跟进有用关注 Fable 5.1
产品官方一手05:43澳大利亚可通过Amazon Bedrock访问OpenAI GPT-5.6模型AWS在澳大利亚上线了OpenAI最新GPT-5.6模型,支持跨区域调用,还附带了完整的使用教程和监控方案。#OpenAI#GPT-5.6#Amazon Bedrock#亚太10 个信源在谈事件专题官方一手AWS Machine Learning Blog@Frank Huang11 个信源在谈原文稍后读已读值得跟进有用关注 OpenAI
产品官方一手73°04:24GPT-5.6 Sol协助营销团队管理复杂活动OpenAI的GPT-5.6 Sol正被用于营销活动管理,通过子智能体实现成本节约和时间优化。#GPT-5.6#@ployai#营销自动化#子智能体官方一手@OpenAIDevs@OpenAIDevs原文稍后读已读值得跟进有用关注 GPT-5.6
模型中美对照多源确认73°00:40Gemini 3.8 Flash模型发布Google刚发布Gemini 3.8 Flash,性能媲美顶级模型但价格便宜5-6倍,彻底改变了Flash模型的定位。#Gemini#Gemini 3.8 Flash#Google#推理模型10 个信源在谈事件专题Paul Couvert@itsPaulAi11 个信源在谈原文稍后读已读值得跟进有用关注 Gemini
模型中美对照多源确认精选73°18:43Ox Alpha等模型推动市场增长看看这四款模型Ox Alpha、DeepSeek V4 Flash、MiMo和GPT-5.6 Luna如何推动市场增长#Ox Alpha#DeepSeek V4 Flash#MiMo#GPT-5.6 Luna3 个信源在谈事件专题AI Will@FinanceYF54 个信源在谈原文稍后读已读值得跟进有用关注 Ox Alpha
模型中美对照73°13:48马斯克预告 Grok 4.7 十天后上线马斯克说 Grok 4.7 十天后上线,参数量暴涨 40%,性能要碾压所有 AI#Grok#Grok 4.7#Elon Musk#参数量IIT之家原文稍后读已读值得跟进有用关注 Grok
模型精选73°10:49Harness-of-Harness框架实现多日自主软件开发HoH框架让AI编码代理能持续改进软件,在三个基准测试中平均提升52%,还能自主开发完整游戏。#Harness-of-Harness#GPT-5.5#DeepSeek-V4-Pro#MiniMax-M3aarXiv: DeepSeek@Haoyang Yan 等 9 人原文稍后读已读值得跟进有用关注 Harness-of-Harness
论文精选73°10:48LLMPEDIA:大模型参数化知识百科LLMPEDIA 让你能直接查看和比较三大模型的知识准确性,发现它们在 MMLU 外的真实表现。#LLMPEDIA#GPT-5-mini#DeepSeek-V3.2#Llama-3.3-70B1 个信源在谈事件专题aarXiv: DeepSeek@Muhammed Saeed, Simon Razniewski2 个信源在谈原文稍后读已读值得跟进有用关注 LLMPEDIA
技巧Agent 与开发者多源确认09:42LoopCAT:本地化开源翻译教学工具OpenAI用GPT-5.5/5.6开发的翻译教学工具,让学生既能操作工作流又能评估AI决策。#LoopCAT#GPT-5.5#GPT-5.6#翻译技术9 个信源在谈事件专题aarXiv: OpenAI@Gokhan Dogru, Adrià Martín Mor10 个信源在谈原文稍后读已读值得跟进有用关注 LoopCAT
产品08:23GeoJSON地图查看器发布Simon用GPT-5.6-Sol建议开发了这个工具,能快速展示和导出GeoJSON地图数据,比手动处理更高效。#GeoJSON#GPT-5.6-Sol#Claude Code#地理数据S官方账号Simon Willison’s Weblog原文稍后读已读值得跟进有用关注 GeoJSON
论文中美对照04:33Qwen团队发布电商智能体基准测试Qwen团队测试了18个模型在365天电商运营中的表现,GPT-5.6 Sol盈利最多但效率不高,Qwen3.8-Max-Preview在开源模型中领先。#Qwen#GPT-5.6#E-Commerce Bench#智能体elvis@omarsar0原文稍后读已读值得跟进有用关注 Qwen
产品Agent 与开发者73°03:58LangChain与Fireworks合作优化AI推理成本LangChain和Fireworks合作,用微调Qwen模型替代GPT-5.5等昂贵模型,评估智能体轨迹成本降低100倍。#LangChain#Qwen#GPT-5.5#FireworksFireworks AI@FireworksAI_HQ原文稍后读已读值得跟进有用关注 LangChain
模型中美对照精选73°00:34Shopify训练0.8B模型超越GPT-5.6Shopify用0.8B模型干翻GPT-5.6,小模型专用场景真香#Shopify#GPT-5.6#0.8B模型#微调elvis@omarsar0原文稍后读已读值得跟进有用关注 Shopify
模型中美对照23:43GPT-5.6 Sol Ultra 适用场景分析GPT-5.6 Sol Ultra 耗时耗token,过度思考,Sol High 加干活agent组合更实用#GPT-5.6#Sol Ultra#Sol High#Luna MaxViking@vikingmute原文稍后读已读值得跟进有用关注 GPT-5.6
论文精选12:20ECGQuest:心电图语言模型评测与微调基准ECGQuest为心电图领域语言模型提供了首个专业评测基准,微调让小模型接近大模型表现。#ECGQuest#GPT-5#DeepSeek-R1-Distill-Qwen-14B#微调aarXiv: DeepSeek@Mohammadsina Hassannia 等 3 人原文稍后读已读值得跟进有用关注 ECGQuest
论文精选73°10:18多图像物体幻觉基准MIOH发布MIOH基准帮你看清多模态模型在复杂视觉推理中的真实表现,GPT-5和Gemini-2.5-Pro也不例外。#MIOH#多图像物体幻觉#MLLMs#GPT-5aarXiv cs.AI@Joonki Min 等 7 人原文稍后读已读值得跟进有用关注 MIOH
论文78°09:33LoopArena:模型作为管理者的可测量基准LoopArena 基准首次单独测量模型作为'管理者'的能力,发现 GPT-5.5 在长程任务中表现最佳,但成功率仍不足 25%。#LoopArena#Qwen3.7-Plus#GPT-5.5#Claude Opus1 个信源在谈事件专题shao__meng@shao__meng2 个信源在谈原文稍后读已读值得跟进有用关注 LoopArena