Nous Research 给 Hermes Agent 加了 Bot Mode,每个机器人有独立记忆和技能,还能固定模型,现在桌面版默认开启,玩开源代理的可以试试。
#智能体
StateM 不改模型权重,光靠升级执行系统就把 GPT-5.6 在终端测试的准确率拉到 95.3%,成本只要 15 美元,值得看看它的思路。
这篇论文搞了个CHIVE自动找模型意外行为,结果发现现有可解释性技术对预测反事实行为没啥用,但用来训练数据倒挺能泛化,值得做可解释性的人看看。
华硕的RTX Spark笔记本首批被抢光,主打1 PFLOPS本地AI算力,能跑1200亿参数模型,适合创作者和AI玩家。
长任务乱?HyMem分层隔离上下文,用DeepSeek-V4在GAIA上比最强基线高6.1个百分点。
想知道代码、工作、聊天分别谁最强?Agent Arena 新榜单给出答案:GPT 5.6 和 Claude Opus 5 各领风骚。
Fish Audio 把语音生成和转录做成了 MCP,接进 Claude、Cursor 这些智能体里,不用改工作流就能用。
Monday 的 Sidekick 能边干活边迭代,比如分析 CSV、画地图,靠 LangSmith 沙盒隔离环境,看他们怎么做的。
英伟达的新开源模型,30B MoE 但只跑 3B 活跃参数,放在 SageMaker 上直接部署,专为智能体高频调用设计,吞吐量翻 4 倍,适合跑大批量任务的人。
yetone 开源了 Cumora,把 AI 拉进 Slack 式群聊当同事,还能接本地 Claude Code,想玩多智能体协作的可以试试。
LangChain和AWS搞了个AgentCore Payments,智能体调用付费API时自动付钱,不用你手动处理402,花钱记录还进LangSmith,方便查账。
Amodei 出来回应质疑,Grok Bot 能跨应用操作,医生用 ChatGPT 解了 22 年数学题——今天这几条 AI 新闻都有干货。