事件专题 · 多源确认

大公司重视AI推理速度

OpenAI展示GPT 5.6 Sol每秒处理750个token。Google发布Gemini 3.7 Flash平均每秒330个token。Nvidia推出Nemotron 3.5 Lightning并配备NeMo Switchyard动态步进路由技术。更快的吞吐量和更低的延迟可减轻开发者上下文切换负担。这些模型支持实时智能体工作流。

当前结论

OpenAI、Google和Nvidia都在竞相提升AI模型推理速度,各有不同技术方案。

11 个信源73° AI 热度最后更新 2026/9/1 18:46:34

证据链

相关来源 10Simon Willison’s Weblog
查看原文

冲突核查

现有去重数据只说明这些来源讨论同一事件,不代表立场相同。当前没有结构化的支持或反驳证据,不自动推断冲突。

查看资讯详情