李飞飞团队发布世界模型Atlas
李飞飞的World Labs发布了新世界模型Atlas,能从单张图片生成完整3D场景。Atlas支持三大任务:生成最长1分钟1440p的视频,重建3D场景效果超过专业模型,以及时空仿真。模型能将多张图像整合到共享空间上下文中,理解时间演变规律。
李飞飞的World Labs发布了新世界模型Atlas,能从单张图片生成完整3D场景。Atlas支持三大任务:生成最长1分钟1440p的视频,重建3D场景效果超过专业模型,以及时空仿真。模型能将多张图像整合到共享空间上下文中,理解时间演变规律。
Meta Superintelligence Labs本周发布Muse Voice Transcribe模型,将语音识别、说话人分离和端点检测三个功能整合为一个自回归模型。该模型专为实时流式语音处理设计,解决了传统语音系统中多个模型交接带来的延迟和故障点问题。Muse Voice Transcribe通过单一模型完成三项任务,提高了语音处理的效率和可靠性。
科大讯飞全资子公司发布并开源了Spark X2.5-4B和X2.5-1.7B模型。这两款模型原生支持高达100万token的上下文长度。它们是首批支持如此长上下文的边缘模型。这些模型专为设备端AI设计。
World Labs由AI研究员李飞飞联合创立,推出Atlas模型。该模型仅需几张照片即可生成、重建和模拟3D场景。Atlas在3D空间中锚定所有输入,而非处理为平面序列。公司称其性能超过专业模型。Atlas还能在模拟中生成机器人训练数据。
OpenAI将即将发布的Astra模型评为首个具备'关键'网络能力的系统。该公司计划通过监控思维链来控制该模型。然而,这种监控已被证明是模型真实决策的不可靠反映。据报告,Astra的新架构将更多思维过程推向不可读区域。随着能力提升,安全网可能正在变弱。
Google于2026年9月2日发布Gemini 3.8 Flash和Gemini 3.8 Flash Cyber两款模型。两款模型基于相同的基础智能,通过安全缓解措施而非模型大小进行区分。Gemini 3.8 Flash定价为每100万代币0.75美元和3.75美元,截至2026年12月31日为 introductory 价格。Flash Cyber在CWE-Bench基准测试中达到47.2%的pass@1成绩,仅通过Fairwind计划向经过验证的防御者开放。
Anthropic于2026年9月1日推出企业前沿防护系统(EFS),该架构将监控数据存储在客户自己的云账户中,而非Anthropic的服务器上。系统保持自动化检测并由Anthropic运行,而数据保管、加密密钥和标记审查则由客户控制。EFS是与超过100家企业共同开发的,将于今年秋季分阶段推出。
NVIDIA发布了Switchyard,一个Apache-2.0许可的Rust代理和库,用于LLM流量处理。该工具可将请求解码为提供商中立类型,使用直通、随机、LLM分类器或阶段路由器算法进行路由,并将响应转换回客户端格式。Switchyard支持Claude Code或Codex CLI在vLLM、NIM或Ollama上运行无需修改。目前项目处于预alpha阶段,不适合生产环境使用。
Qwen 开源了 zg (zvec-grep) 工具,整合了 ripgrep、BM25 和向量搜索三种技术。该工具采用 Apache 2.0 许可证,提供统一的搜索接口。它支持从自然语言描述直接定位到精确代码行,无需切换工具。工具包含小型 MCP 接口、设备端嵌入目录和本地内容与远程模型间的授权机制。
Meta开发了一个AI代理系统,作为特定领域的第二专家。该系统整合了结构化知识架构和专家学习机制。它能保存组织内的专业知识供员工访问和共享。该系统已在Meta内部部署使用。
GaryMarcus紧急提醒,OpenAI新技术降低了思维链(Chain of Thought)的可监控性。2025年论文《思维链可监控性:AI安全的新脆弱机遇》指出,CoT监控虽不完美但仍有价值。作者包括YoshuaBengio等知名研究者,建议模型开发者考虑开发决策对CoT可监控性的影响。牺牲可监控性换取性能提升可能增加未来危险事件风险。
谷歌供应链基础设施高级总监Nikhil Cherian透露,AI产业已从算力受限转变为内存受限。在单台AI服务器中,高性能内存成本占比高达约75%。谷歌拆解退役服务器回收DDR4内存模组,通过专用硬件转接卡使其能接入新型AI服务器。谷歌还优化底层函数库、模型架构和KV缓存压缩算法,降低单位算力内存开销。
阿里巴巴乌兰察布数据中心利用廉价可再生能源和低延迟优势,成为中国AI计算的重要枢纽。该数据中心到北京的延迟约为4毫秒。内蒙古的这座偏远城市正成为中国AI计算的中心。
OpenAI的WebMCP挑战赛仅剩24小时提交时间。参赛者需在9月3日下午1点前完成项目提交。该挑战赛专注于WebMCP技术的应用与创新。目前已有2719人关注此活动。
惠然微电子在CSEAC 2026展会上发布14nm研发级和22nm量产级12英寸晶圆CD-SEM eMILO-FW300设备。该设备向下兼容22nm大规模量产、向上支撑14nm前沿工艺研发,是国内首台打通"研发+量产"双场景的高端CD量测设备。公司还推出光掩模版关键尺寸量测设备Mask CD-SEM eMILO-FR7,填补国产高端掩模量测设备空白。AI-电子束量测技术平台RMS补齐国产设备在算法与数据处理端的短板,实现从硬件到软件的自主可控。
研究人员发现,攻击者可通过单个重建提示词,从OpenAI和Google的六种图像编辑模型中获取无法可靠解码水印的输出。研究评估了三种水印方案和1800个重建结果,发现OpenAI模型在有效载荷干扰方面表现最强,而Nano Banana 2显示DwtDct在高保真重建下仍然脆弱。提示词消融实验表明,无需特定的移除指令即可实现有效载荷干扰,这主要是由重建路径而非攻击性措辞引起的。
字节跳动Seed团队提出HarnessDev方法,不再评估模型完成任务的表现,而是评估其构建的智能体框架。该框架从弱种子和少量案例开始,构建完整执行系统,再通过下游反馈改进。实验涵盖6个创作者LLM、4个领域和2207个保留下游实例。结果显示,生成的框架在代码和搜索研究方面落后于成熟的人工工程参考,但在写作和机器学习实验方面与之相当或更优。
蚂蚁集团推出统一宽表系统OmniTable,论文获评VLDB 2026工业赛道最佳论文。该系统可处理35PB语料,数据清洗效率提升5.6倍。OmniTable解决了大模型训练数据预处理难题,大幅降低了人工清洗成本。
ExtractBench基准测试已在Kaggle平台上线,专门测试文档提取能力。该基准测试涵盖8个商业领域的370份企业文档,包括67种文档类型。测试重点针对可能破坏下游代理和工作流程的文档,如长记录列表、噪声扫描、手写体和复杂表格。LlamaParse、Codex、Claude Code等工具参与了性能对比。
ProximalHQ 发布 FrontierSWE v2 超长编码基准测试,更新了任务套件和方法论。测试显示前沿模型间存在巨大性能差距,Claude Fable 5.1 领先优势明显,超过 25 个百分点。该基准专注于超长视野编码任务,是评估前沿模型能力的重要工具。
全球经纪商使用Amazon Bedrock AgentCore构建自动化架构文档流水线。该系统可分析.NET代码库并生成架构图。通过Amazon Bedrock Knowledge Bases和AWS CodePipeline维护可搜索文档。
Uber全体员工使用的Agent产品周活从2026年2月到8月中旬增长7倍,周请求量增长9.4倍。总AI支出趋于稳定,单次会话成本较峰值大降52%。超过70%的Pull Request被归因于本地或云端Agent,工程师建立了3,600多个覆盖软件开发生命周期的Agent Skill,每天执行超过30,000次。
FDE(Forward Deployed Engineer)是结合软件工程与客户解决方案的复合角色。他们需在客户混乱环境中部署AI/软件产品,面临5类真实障碍:与遗留系统集成、安全合规、部署可靠性、证明商业价值和可传承性。12个项目覆盖这些挑战,分为4个成长阶段:技术基础、企业门槛、运营成熟度和软技能与商业能力。
Harness工程是AI工程师的重要技能。通过构建基础代理循环、系统提示和工具调用功能,任何人都能创建强大的AI工具链。理解系统提示、缓存和有效工具调用等底层细节是关键。这些技能可轻松迁移到更成熟的生产级工具链中。
Fable 5.1系统提示相比Fable 5主要更新了内容限制条款。新版本明确禁止模型复制歌曲歌词,避免绘制受版权保护的角色。这些变化反映了AI内容安全管理的最新要求。