16:09AI Will@FinanceYF582°Marc Andreessen 在长达3小时的 Rogan 播客中表示,AGI 已在约3个月前随着 GPT-5.5、Claude 4.6、Gemini 3 和 Grok 4.3 的到来而实现。他声称顶级模型在多数话题上优于他能联系的世界级专家,但未公开验证数据。他提到医生已在诊室用 ChatGPT 输入症状,以及硅谷顶级 AI 程序员年薪达 5000 万美元。他还分享了绕过 AI 拒绝回答的技巧,如声称自己在写小说。行业AndreessenRoganGPT-5.5推荐理由:Andreessen 在 Rogan 播客里聊了3小时,17条干货,包括AGI已到来、用AI看病、年赚5000万的AI程序员等,观点很猛但记得自己验证。原文稍后读已读值得跟进有用关注 Andreessen
11:30官方账号arXiv cs.AI@Koyar Afrasyab一项研究评估了证据充分性提示对临床语言模型的影响,使用Real-POCQi、HealthBench和MedRBench基准,测试GPT-5.5、Claude Opus 4.8、Gemini 3.5 Flash和Grok 4.3四个模型。结果显示,不安全过度自信从49.3%降至24.7%,但效果幅度依赖于评判模型:主要评判模型GPT-5.4-nano显示24.7个百分点的降低,而Claude Sonnet 5则只有13.1个百分点。安全增益伴随有用性成本,正确诊断率从80.3%降至50.3%,对Gemini影响较大(-58个百分点)。盲法临床医生审查指出主要评判模型灵敏度高(1.00)但特异性低(0.55)。论文GPT-5.5Claude Opus 4.8Gemini 3.5 Flash推荐理由:这篇论文揭示了AI安全评判的一个关键陷阱:安全增益可能只是评判模型的偏好,不是真实改进。告诉你为什么不能只看一个评判指标。原文稍后读已读值得跟进有用关注 GPT-5.5
08:39Notion@NotionHQ72°Notion 宣布在其 Agent 和 Custom Agents 中集成两个新模型:Grok 4.3 和 Grok Build 0.1。这意味着用户可以在 Notion 的智能助手功能中直接使用这些模型,提升自动化任务和内容生成的能力。Grok 4.3 是 xAI 的最新推理模型,而 Grok Build 0.1 可能专注于代码或构建任务。这一更新让 Notion 用户无需切换平台即可获得更强的 AI 能力,尤其适合需要高效处理文档和项目的团队。AI产品NotionGrok 4.3Grok Build 0.11 个信源在谈事件专题推荐理由:Notion 用户现在可以直接在 Agent 里调用 Grok 4.3 和 Build 0.1,做自动化任务和内容生成更顺手,建议试试看能不能提升你的工作流效率。原文稍后读已读值得跟进有用关注 Notion
13:36官方账号xAI@xaixAI 发布了 Grok 4.3 模型,已在其 API 上可用。该模型在代理工具调用和指令遵循方面领先 @ArtificialAnlys 排行榜,并在 @ValsAI 的企业领域(如判例法和公司金融)中排名第一。Grok 4.3 支持 100 万 token 上下文窗口,输入价格为每百万 token 1.25 美元,输出价格为 2.50 美元。开发者可以立即创建 API 密钥开始使用。AI模型Grok 4.3xAI推理模型推荐理由:Grok 4.3 在代理工具调用和企业场景(如法律、金融)中表现突出,做智能体或企业级应用的开发者可以直接用 API 体验,性价比也不错。原文稍后读已读值得跟进有用关注 Grok 4.3