DFlash是一种在大模型生成场景下用于优化推理效率的技术,处于生成式人工智能技术发展的前沿阵地,致力于在大模型处理长文本等复杂任务时提升性能表现。近年来伴随大模型参数规模持续增长,该技术在长文本生成、多模态融合等方向的应用成为行业热点,为解决大模型推理成本高的问题提供创新思路。
DFlash
general · 首次出现 2026-05-22 · 最近出现 2026-08-31 · 累计提及 41
综述
相关报道
10 条在档- 块状生成中的信息下限与模型差距研究arXiv cs.LG
- Qwen 3.8-Max上线Modal,完整1M上下文窗口阿里通义 Qwen
- DARTree:用自回归草稿树实现推测性扩散解码arXiv cs.LG
- NVIDIA发布Nemotron 3.5 Lightning,面向长时智能体执行AI Will
- Meta发布Muse Glimmer:30B开源智能体模型,单消费级GPU可运行marktechpost
- SGLang 首发支持 Muse Glimmer,RTX 5090 上 230 tok/sNVIDIA AI
- 腾讯混元开源AngelSpec投机解码框架,DFly实现1.98-2.40倍加速Hunyuan
- thinkymachines开源Inkling:975B总参/41B激活MoE,1M上下文多模态LMSYS Org (SGLang)
- vLLM v0.25.0发布:Model Runner V2默认,新增统一流解析引擎vLLM
- DeepSeek开源DSpark推测解码框架,加速V4生成60-85%marktechpost