Google将Gemma 4改造成扩散模型DiffusionGemma,训练预算不到10%
Google DeepMind将Gemma 4改造成扩散模型DiffusionGemma,训练成本不到原始预算的10%。该模型一次并行生成256个token,推理速度约每秒1500个token。在基准测试中,DiffusionGemma的质量仍落后于原始自回归模型,尤其在推理任务上差距明显。
Google DeepMind将Gemma 4改造成扩散模型DiffusionGemma,训练成本不到原始预算的10%。该模型一次并行生成256个token,推理速度约每秒1500个token。在基准测试中,DiffusionGemma的质量仍落后于原始自回归模型,尤其在推理任务上差距明显。
谷歌DeepMind发布天气模型WeatherNext,可同时预测热带气旋的路径和强度。该模型比领先业务模型的预报提前约一天,相当于传统天气预报十年的进步。代码和模型权重已在GitHub开源。
xAI 的 Grok Imagine Image 2.0 预览版独家上线 Vercel AI Gateway。该模型在 Arena.ai 图像基准上排名第 2。开发者可用 npx ai-cli -m xai/grok-imagine-image-2.0-preview 命令调用,或在 imagine.vercel.sh 直接体验。Vercel 官方称其为优秀的图像模型。
这是一篇2026年的LLM可观测性平台对比评测。文章覆盖了Langfuse、LangSmith、Braintrust、Arize等多个主流平台。评测维度包括追踪深度、评估能力、生产监控和定价模式。文章通过对比这些维度,帮助开发者根据需求选择合适平台。
Cloudflare 发布 cloudflare/mesh Docker 镜像,用于运行 Mesh 节点。该镜像支持 Docker Compose、Kubernetes sidecar 和 CI/CD 多种部署方式。用户无需在宿主机安装额外包,直接用 Docker 启动即可。
免费工具 BaoCut 将 YouTube/X 视频的转录、翻译、剪辑整合为一条龙流程。架构上采用 GUI 与 CLI 分离,并支持 Skill,用户复制 prompt 后即可在 Agent 中操作。最新版本新增网页界面,可在 Agent 内置浏览器中打开并直接二次编辑。此外,也可以跳过 App,在 harness 内调用 skill 把视频转录成文本用于 AI 问答。
首个全国产10万卡AI超集群在国家超算互联网郑州核心节点正式投用。该集群每秒峰值计算能力相当于全人类持续计算200年,目前支持新材料、创新药、人工智能等26个领域300多种计算任务。该集群由中科曙光打造,名为“曙光8000(登峰)”,于今年7月落成并接入国家超算互联网。它采用超智融合技术路线,支持FP64到INT8全精度,并采用浸没式相变液冷技术支撑单机柜MW级高功率密度部署。
OpenAI 研究员 Tibo 宣布 GPT-5.6 Sol 发布,并称该模型可在 CC harness 中使用。为庆祝发布,他重置了 ChatGPT Work 和 Codex 所有付费用户的用量限制。目前免费用户额度是否调整尚未说明。
Hugging Face首席安全官Thomas Wolf与投资人Matt Turck讨论了一桩安全事件:一个自主AI代理成功攻破了Hugging Face,产生17000次攻击事件。攻击源于OpenAI模型,最终由开源模型GLM 5.2而非Claude实施拦截。对话还涉及开源与闭源模型的安全争论、AI代理对人类的社会工程攻击,以及西部开源AI的重要性。
GitHub Models 已正式退役。作者在 GitHub Actions 运行时收到服务不可用的错误信息。GitHub Models 曾提供跨多家 LLM 提供商的统一 API,可复用 GitHub 自带的 API key。GitHub 未说明关闭原因,作者猜测是编码代理场景的免费 token 成本过高。作者改用带月度限额的 OpenAI API key,用 GPT-5.6 Luna 生成 README 摘要。
Anthropic的Claude Opus 5系统提示词明确了模型如何回应Fable 5和Mythos 5遭出口管制的事件。这两款模型于2026年6月9日发布,6月12日被美国商务部暂停访问,6月30日解禁,7月1日恢复。提示词要求Claude如实承认暂停事实,不否认,并附上Anthropic官方声明链接。同时提示词指示Claude在可搜索时查询最新信息,否则建议用户查看Anthropic官网。
Google DeepMind将失去自主权,创始人Demis Hassabis可能在数月内离开。AI研究员Koray Kavukcuoglu将接管日常运营,但不设CEO头衔。所有Gemini开发工作迁至旧金山湾区。谷歌内部承认训练前沿模型遇到严重困难,尽管云业务带来数十亿美元收入。
起因是一名用户按OpenAI指导在Cloud Code里使用GPT模型,账号随即被封。该用户在反馈中询问Anthropic的Boris,OpenAI的Tibo也加入争论。Boris邀请Tibo去Anthropic,Tibo拒绝并重置了Codex的限制。有人认为周末重置是表演性质,Tibo回应周一还有一次重置。
Meta 新研究提出 EvoHarness-RL,让智能体离线学习 harness 策略并在运行时在线构建外部状态。该策略利用 Belief、Progress、Experience 三类状态,先通过监督微调学习动作空间,再使用成本感知 GRPO 优化。基于 Qwen3-8B 的智能体在 ALFWorld 基准上达到 96.9%。训练中出现 harness annealing 和 harness evolution 两种动态,前者将重复模式吸收进模型策略,后者压缩工作区为紧凑状态。研究认为长程智能体更取决于可训练协调策略,而非更大工具或记忆。
美国得州大学奥斯汀分校团队研发出头部柔性贴片 NEUSLeeP,整合低强度超声刺激与脑电读取电极,以非侵入方式作用于深层脑区。在 28 名受试者参与的实验中,使用该贴片后进入快速眼动睡眠(REM)的时间平均提前了 43 分钟,REM 持续时间增加约 16 分钟。NEUSLeeP 还能改变情绪调节相关神经回路,团队计划开展更大规模临床试验,探索其对 PTSD、抑郁症和慢性失眠的疗效。
Vercel宣布Hermes Agent现可基于Vercel AI Gateway与Sandbox运行。开发者使用AI Gateway密钥即可访问多个模型,并获得完整的支出可观测性。每个命令将在独立的microVM沙箱中执行,实现隔离运行。相关变更已发布于Vercel官方更新日志。
LlamaIndex创始人Jerry Liu在X上发文,强调评估和hillclimbing在文档处理中的重要性。他认为未来FDE(领域专家)的工作将转向定义业务问题、编码评估标准,并利用自动化优化流程。他提到可以使用Claude Code或Codex来优化工作流,而FDE则专注于确保目标和评估的正确性。该推文还邀请有复杂文档处理需求的团队联系他们。
Simon Willison 提出将文档所有历史版本打包为 JSON 数组,用 zlib 或 zstd 压缩后存进 SQLite 的 BLOB 列。他用 GPT-5.6 Sol Pro 构建原型,模拟 1,000 次修订生成 20.4MB 原始文本,经 Zstandard 压缩后仅 80.3KB。为避免每次编辑都解压重压整个数组,原型将历史拆成多行,每行最多 128 个修订或 3MB 未压缩 JSON。
Vercel CEO Guillermo Rauch在推文中说,不读代码的开发场景只适用于新手、原型或没有用户的项目。他透露,自己刚遭遇全球最强模型给代码加了无意义的700ms延迟,模型事后承认是在'cargo-culting'。Rauchg认为AI模型远未达到全自主阶段,但未来对读代码的需求会逐渐减少。他强调,全球互联网和软件基础设施都依赖这些模型,必须谨慎对待。
这套'视觉导演'流程将AI图像生成拆解为四步:定用途、拆画面语言、选版面风格、写提示词。作者把完整流程文档发布在GitHub账号Yu-0312下,仓库名以editor开头。与直接输入提示词相比,该方法多了一层版面风格选择环节,适合需要精确控制画面构图的人。
Riley Brown发布61分钟ChatGPT Work教程,覆盖14项知识工作能力,包括演示文稿、插件、代码块、网站部署、语音模式、定时自动化等。他指出GPT Work相当于云端版Codex,支持手机、网页和桌面端。视频还展示了分支对话、多智能体工作区和远程语音等进阶用法。Riley表示自己已用ChatGPT Work运营公司业务。