gg2

连续扩散语言模型

已归档 —— 这条已轮出今日牌堆,完整内容在此保留。

一句话看懂

扩散语言模型通过细化完整草稿而非逐词生成文本来生成内容。它们可与自回归大语言模型相媲美,Google、NVIDIA 和 Inception Labs 已相继发布相关成果。

背景

扩散语言模型(DLM)是 GPT 等自回归模型的替代方案。它们不按从左到右的顺序生成文本,而是从粗略草稿开始,并行迭代细化所有位置,从而实现纠错和更快的生成。2024 年,它们已能与自回归模型竞争;到 2026 年,Google、NVIDIA 和 Inception Labs 等主要实验室已发布扩散大语言模型。

来龙去脉

  1. 2024扩散模型在语言生成质量上已能与自回归模型竞争。
  2. 2026年5月字节跳动开源了连续潜在空间扩散语言模型 Cola DLM。
  3. 2026年6月Google DeepMind 首次发布了扩散文本模型 Diffusion Gemma,并公开了开源权重。
  4. 2026年8月到 2026 年,扩散大语言模型已成为现实,Mercury 2(Inception Labs)、Gemma Diffusion(Google)和 Nemotron Diffusion(NVIDIA)相继发布。

各方怎么说

支持
扩散语言模型具有纠错、并行生成和双向上下文等优势,使其成为自回归模型之外一个有前景的替代方案。
谨慎
该综述指出,扩散语言模型仍不如图像扩散成熟,在似然估计和解码方面仍有未解决的问题,且采样在计算上仍然昂贵。

来源

打开 App 看今天的解读 gg2 —— App Store 免费下载