SelFusion: Self-distillation for Diffusion Language Models
扩散语言模型的自蒸馏新方法登上ACL 2026,生成效率与质量或迎来新突破。
arXiv:2608.22898v1 Announce Type: new Abstract: Diffusion language models (DLMs) alleviate the inherent latency bottleneck of autoregressive (AR) larg…
扩散语言模型的自蒸馏新方法登上ACL 2026,生成效率与质量或迎来新突破。
arXiv:2608.22898v1 Announce Type: new Abstract: Diffusion language models (DLMs) alleviate the inherent latency bottleneck of autoregressive (AR) larg…
直击扩散语言模型预训练与生成阶段的不匹配痛点,提出改进方法,值得算法研究者细读。
arXiv:2608.09424v1 Announce Type: new Abstract: Autoregressive language models align training and use: generation conditions on a clean prompt, and tr…
扩散LLM自由排序承诺反而成推理软肋,揭秘答案先行的失败机制
arXiv:2608.05687v1 Announce Type: cross Abstract: Masked diffusion language models (dLLMs) can commit tokens in any order -- a freedom marketed as the…
扩散语言模型遇冷?dOPSD让它在自蒸馏中越学越强,生成质量突破新高度。
arXiv:2607.04428v1 Announce Type: cross Abstract: Diffusion large language models (dLLMs) generate text by iteratively denoising a masked sequence, of…
英伟达开源全新TwoTower模型,双塔架构分离上下文与去噪,性能飙升2.42倍,质量仅降1.3%。
IT之家 7 月 3 日消息,英伟达昨日(7 月 2 日)发布博文,宣布推出 Nemotron-Labs-TwoTower,是一种基于预训练自回归骨干网络的离散扩散语言模型, 致力于解决大模型 Token 生成速度瓶颈。 在开源方面,该模型以开源权重形式在 Huggingface 平台发布,授权协议…
扩散语言模型跨界图学习,文本属性图建模迎来新范式,值得关注的技术突破。
arXiv:2606.31166v1 Announce Type: cross Abstract: Text-attributed graphs (TAGs), where each node carries a natural language description, require model…
块扩散语言模型新突破:无需训练的自推测解码,兼顾质量与速度,少步数下比标准方法更稳健。
arXiv:2603.25702v2 Announce Type: replace Abstract: Block-diffusion language models offer a promising path toward faster-than-autoregressive generatio…
探索将自蒸馏技术从自回归模型迁移至扩散LLM,突破传统方法限制,为后训练提供新思路。
arXiv:2606.18195v1 Announce Type: new Abstract: On-policy self-distillation (OPSD) has proven effective for post-training large language models (LLMs)…
扩散语言模型借助残差上下文实现并行多token解码,突破自回归限制,大幅提升文本生成效率
arXiv:2601.22954v2 Announce Type: replace-cross Abstract: Diffusion Large Language Models (dLLMs) have emerged as a promising alternative to purely au…
提出预测预填充方法,让扩散语言模型高效处理超长上下文,解码速度显著提升。
arXiv:2606.10537v1 Announce Type: new Abstract: Diffusion large language models (dLLMs) re-encode the entire prefix at every denoising step, causing r…
扩散语言模型推理加速新方案,通过共享前缀KV缓存显著提升效率,结构简洁效果亮眼。
arXiv:2606.07571v1 Announce Type: new Abstract: Key-value (KV) caching for shared prefixes is essential for high-throughput large language model (LLM)…
基于注意力机制的扩散语言模型采样器,突破传统采样效率瓶颈,推动文本生成质量提升。
arXiv:2604.08564v2 Announce Type: replace Abstract: Auto-regressive models (ARMs) have established a dominant paradigm in language modeling. However, …
结合联合嵌入预测与掩码扩散,提出全新语言模型预训练架构
arXiv:2606.00091v1 Announce Type: cross Abstract: Joint Embedding Predictive Architectures (JEPAs) have reshaped self-supervised representation learni…
扩散语言模型也能像自回归模型一样用推测解码加速推理,方法简单高效,代码已开源。
arXiv:2606.02544v1 Announce Type: cross Abstract: Diffusion large language models (dLLMs) have recently emerged as a promising alternative to autoregr…
利用逆蒸馏技术加速扩散语言模型,实现更快的文本生成推理,同时保持生成质量
arXiv:2602.19066v2 Announce Type: replace Abstract: Diffusion Language Models (DLMs) have recently achieved strong results in text generation. However…
时空并行解码+置信外推,大幅提升扩散语言模型推理效率,架构创新值得深挖。
arXiv:2605.30753v1 Announce Type: new Abstract: Diffusion-based large language models (dLLMs) support parallel text generation via iterative denoising…
动态分块技术让扩散语言模型根据内容自动划分块,取代固定位置分块,增强语义连贯性,提升生成效率。
arXiv:2605.15676v1 Announce Type: new Abstract: Block discrete diffusion language models factorize a sequence autoregressively over fixed-size positio…
新型扩散语言模型并行解码方法DMax,通过自精炼机制减少误差累积,实现高并行度高质量生成。
arXiv:2604.08302v3 Announce Type: replace-cross Abstract: We present DMax, a new paradigm for efficient diffusion language models (dLLMs). It mitigate…
扩散语言模型遇上强化学习,熵引导步骤选择与逐步优势破局后训练难题。
arXiv:2603.12554v2 Announce Type: replace-cross Abstract: Reinforcement learning (RL) has been effective for post-training autoregressive (AR) languag…