7月22日
02:57
02:57官方账号NVIDIA AI@NVIDIAAI
NVIDIA AI在Nemotron Labs视频中展示,对Nemotron模型进行微调前,应先用LangChain调整评估harness(测试框架)。该方法可确保微调过程更有效,避免浪费资源。视频详细演示了如何配置LangChain评估流程。
事件专题

推荐理由:NVIDIA教你怎么用LangChain先调好评估工具再调模型,很实用的小技巧,省时间少踩坑。
00:37
00:37官方一手marktechpost@Sana Hassan
本文介绍NVIDIA srt-slurm框架,使用srtctl将YAML声明式配置转换为可重复的SLURM基准工作流。在Google Colab中配置集群并运行内置与自定义配方。通过参数扫描和Pareto分析,建模分离预填充(prefill)和解码(decode)部署的性能权衡。
事件专题

推荐理由:想搞分布式LLM基准测试?NVIDIA这个srt-slurm框架让你用YAML写配置,一键跑SLURM,还能做参数扫描和Pareto分析,超实用。
7月21日
16:39
16:39官方一手marktechpost@Asif Razzaq
72°
NVIDIA 推出 Cosmos 3 Edge,一个 4B 参数的开放世界模型,专为设备端运行设计。该模型可帮助机器人和视觉 AI 代理理解环境、实时推理并本地生成动作。Cosmos 3 系列此前已于 2026 年 5 月 31 日在 GTC Taipei 发布 Cosmos 3 Nano(16B)和 Cosmos 3 Super(64B)。
事件专题

推荐理由:NVIDIA 把 40 亿参数的开放世界模型塞进设备端,机器人不用联网就能自己理解环境、推理并执行动作,适合边缘部署场景。
11:57
11:57官方账号arXiv cs.LG@Krish Agarwal, Zhuoming Chen, Yanyuan Qin, Zhenyu Gu, Atri Rudra, Beidi Chen
FlashRT 是一个引导编码智能体优化实时多模态应用部署的框架,将简单参考实现转化为多 GPU 部署。在 NVIDIA B200 GPU 上,FlashRT 将视频世界模型和多模态 LLM 的延迟降低达 70 倍,吞吐量提升 2.8 倍。在 AMD MI355X GPU 上,延迟降低持平,吞吐量提升达 3.6 倍。针对 Qwen3-Omni 文本到音频推理,FlashRT 在 AMD MI355X 上比专家 vLLM-Omni 实现减少 65% 响应延迟。
事件专题

推荐理由:部署多模态模型时延迟高吞吐低?FlashRT 让智能体自动优化,实测延时降 70 倍,吞吐升 3.6 倍,AMD 平台效果尤其猛。
04:21
04:21官方账号NVIDIA AI@NVIDIAAI
Poolside的Laguna模型现已可在NVIDIA DGX Spark上本地运行。DGX Spark是NVIDIA推出的桌面级AI超级计算机。这使得Laguna模型能够在个人设备上进行高效推理,无需依赖云服务。具体性能指标尚未公布。
事件专题

推荐理由:Poolside把Laguna模型放进了NVIDIA的DGX Spark小盒子,以后本地跑代码生成模型更方便了。
00:28
00:28官方账号NVIDIA AI@NVIDIAAI
NVIDIA 宣布完全开源 Cosmos 3 Edge 模型,包含完整的模型权重、后训练配方和代码。该模型已在 Hugging Face 平台上线,用户可自由下载使用。这是 NVIDIA 边缘 AI 系列的最新开源版本。
事件专题

推荐理由:NVIDIA 把 Cosmos 3 Edge 完全开源了,模型权重和训练代码都在 Hugging Face 上,直接就能拿下来玩。
00:27
00:27官方账号NVIDIA AI@NVIDIAAI
77°
NVIDIA 推出 Cosmos 3 Edge,一个拥有 4B 参数的开源世界模型。该模型包含一个基于 Nemotron 的 2B 参数量推理器,可在 DGX Spark、NVIDIA Jetson 等设备上本地运行。它主要服务于机器人学习、自动驾驶场景理解和智能基础设施的视觉 AI 推理。
事件专题

推荐理由:NVIDIA 开源了一个能在边缘设备上跑的世界模型 Cosmos 3 Edge,4B 参数加 2B 推理器,机器人、自动驾驶都能用,Jetson 上就能跑。
7月17日
11:23
11:23官方账号Nous Research@NousResearch
NousResearch与NVIDIA、Stripe联合举办了加速商业黑客马拉松,要求参赛者构建能赚钱、花钱并运行实际操作的智能体。共收到292份高质量提交。经过与NVIDIA和Stripe的共同评审,最终确定了获胜者。
事件专题

推荐理由:NVIDIA和Stripe赞助的黑客马拉松,292个参赛项目角逐能自动赚钱花钱的AI智能体,看看胜者有什么亮点。
00:41
00:41官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA 发布了 Nemotron 3 Embed 8B 模型。该模型在 RTEB 基准测试中取得总体第一,RTEB 评估真实世界任务的检索准确度。更好的检索能力为智能体提供更相关的上下文,有助于提升响应准确性。
事件专题

推荐理由:NVIDIA 新出的 8B 嵌入模型,RTEB 排名第一,检索能力强,适合做 RAG 和智能体。
00:40
00:40官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA官方展示了如何借助TAO Agent Skills在一天内对Cosmos 3模型进行后训练。该流程通过TAO平台的自定义能力,让用户快速将预训练模型适配到新场景。无需从头训练,显著降低时间与资源成本。
事件专题

推荐理由:想快速定制Cosmos 3?NVIDIA的TAO Agent Skills教你一天搞定后训练,适合开发者上手。
00:07
00:07官方账号LangChain@LangChainAI
精选
该视频演示了如何通过 Baseten 结合 Deep Agents Code 部署 NVIDIA Nemotron 3 Ultra 模型。该模型拥有550B参数,推理速度可达每秒300 tokens。视频还展示了构建终端智能体,支持技能调用、子智能体及 MCP 协议。全程通过 LangSmith 进行追踪调试。
事件专题

推荐理由:想跑Nemotron 3 Ultra?这个视频手把手教你用Baseten部署,还演示了带MCP的终端智能体,挺实用的。
7月16日
16:22
16:22IT之家博客/媒体
81°
NVIDIA与Noetra合作基于DSX平台打造一座140MW国家物理AI工厂,采用Vera Rubin NVL72机架,部署13750块Vera CPU和27500块Rubin GPU。该工厂支持T级模型训练,为日本FRONTia项目提供算力基础。预训练权重将与NVIDIA的Nemotron、Cosmos等开源模型一同提供给日本开发者和企业。
事件专题

推荐理由:NVIDIA帮日本建国家级AI工厂,140MW算力、Vera Rubin GPU、T级训练,开源模型全给当地开发者,这波很实在。
10:38
10:38官方账号arXiv cs.AI@Tam Nguyen, Hung Nguyen, Robert Ogburn
该论文提出一个AI加速的端到端框架,覆盖知识获取、内容开发、审核、教学与评估五个阶段。美国国家会计委员会已批准基于该框架的继续教育学分项目。3名学习者借助该框架在短时间内通过NVIDIA认证专家考试。框架的知识库还生成了1267条多智能体AI系统风险项数据集,验证了有效性。
事件专题

推荐理由:这个框架把AI用在职业培训全流程,5个阶段都提速,已经帮人通过NVIDIA认证考试,还有美国会计委员会背书,挺靠谱。
03:00
03:00官方账号NVIDIA AI@NVIDIAAI
精选
Thinking Machines 推出开源模型 Inkling,支持文本、图像和音频三模态推理。模型基于 NVIDIA GB300 NVL72 训练,NVFP4 检查点已在 Hugging Face 开放下载。官方提供完整权重,并支持通过 Tinker 平台进行微调,用户也可在 Inkling Playground 直接体验。
事件专题

推荐理由:Thinking Machines 刚发了 Inkling,一个开源的多模态推理模型,能处理文本、图像、音频,还给了完整权重可以微调,NVFP4 检查点直接下。
02:33
7月15日
02:45
02:45官方账号NVIDIA AI@NVIDIAAI
Nemotron Labs 发布了一个教程,讲解如何利用 Agent Skills 运行强化学习自动研究。该教程面向开发者,展示如何构建和部署智能体以自动执行 RL 实验。它可能涉及 NVIDIA 的 Nemotron 框架和特定工具链。具体步骤包括环境配置、技能组合和实验管理。
事件专题

推荐理由:想用强化学习自动跑实验?Nemotron Labs 出了个教程,手把手教你用 Agent Skills 搭建智能体,省心省力。
01:27
01:27官方账号NVIDIA AI@NVIDIAAI
精选
零样本模型漏检了一个可见交通信号。用 LoRA 对 Cosmos 3 Nano 进行后训练后,WTS 验证准确率从 54.41% 提升到 87.14%。结合 NVIDIA TAO AutoML,准确率进一步达到 93.35%。整个微调流程在一天内完成。
事件专题

推荐理由:NVIDIA 用 LoRA 微调小模型 Cosmos 3 Nano 做交通信号识别,准确率从 54% 蹿到 93%,一天内搞定,效果很猛。
00:35
00:35官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA 展示一个编码智能体,利用 NeMo RL 和 NeMo Gym 框架,在有限时间内自主构建训练环境并指导 Qwen3-VL-2B 视觉模型学习数彩色星星。模型准确率从 25% 跃升至 96.9%。智能体还能主动提出下一项实验方案,研究员全程仅进行方向性指导。
事件专题

推荐理由:NVIDIA 让智能体自己搭环境教模型,Qwen3-VL-2B 准确率从 25% 飙到 96.9%,还能自动想下一步实验,挺有意思。
7月14日
13:55
13:55官方账号vLLM@vllm_project
精选
NVIDIA NeMo 团队发布了新的智能体优先强化学习框架 Molt,采用 vLLM(基于 Ray)作为 rollout 引擎。vLLM 支持快速异步服务,最高可扩展至 1T 级 MoE 规模,且易于集成,让上层的强化学习核心保持小巧和可修改。
事件专题

推荐理由:vLLM 被 NVIDIA 新框架 Molt 选为 rollout 主力,支持 1T 级 MoE 规模,想搞强化学习可以试试这套组合。
07:15
07:15官方账号NVIDIA AI@NVIDIAAI
精选
NVIDIA发布“AI Model Co-Design”系列文章,首篇探讨模型维度与GPU性能的关联。文章指出,调整模型维度(如宽度、深度)能直接影响GPU的计算效率。通过合理设计,可提升系统吞吐量和单用户响应速度。该系列旨在推动模型与硬件的协同优化。
事件专题

推荐理由:NVIDIA新系列讲模型和硬件怎么配合更高效,首篇教你调维度来榨干GPU性能,部署AI服务的人值得一看。
7月13日
11:15
11:15官方账号Together AI@togethercompute
Together AI联合NVIDIA和Lyra Labs,在ICML 2025会议上主办一场炉边谈话,由Tri Dao主持。活动主题聚焦AI研究与基础设施的未来发展。会议将于ICML期间举行,需RSVP参与。
事件专题

推荐理由:Tri Dao带队,Together AI、NVIDIA和Lyra Labs一起聊AI研究走向,ICML现场限定,想去的赶紧RSVP。
11:00
11:00官方账号Together AI@togethercompute
NVIDIA的开放模型Nemotron 3 Ultra在Together AI上线后迅速获得社区青睐。该模型在OpenRouter平台上的处理量在几天内达到每天350亿token。这反映了社区对快速、高效且可定制开放模型的积极支持。Nemotron 3 Ultra是一款完全可定制的开放模型,由NVIDIA开发。
事件专题

推荐理由:NVIDIA刚推的Nemotron 3 Ultra在Together AI上火了,几天就在OpenRouter冲到每天350亿token用量,社区超爱这种又快又省又好改的开放模型。
7月11日