将文本生成图像模型的训练速度提升 3.6 倍
Training Text-to-Image Models 3.6× Faster

原始链接: https://www.linum.ai/field-notes/jit-ddt

本摘要概述了 **JiT-DDT** 的开发过程,这是一种旨在克服潜在扩散模型(LDM)效率瓶颈的新型生成式图像架构。 **问题所在:** 传统的 LDM 依赖 VAE 进行压缩,但这些模型达到了经验极限(16x16),进一步压缩会导致图像质量下降。当使用标准的 v-prediction 时,高分辨率生成还会受到“维度灾难”的困扰,使得扩散变换器(DiT)难以从高维输入中学习。 **解决方案:** 作者使用一种通过“激进分块”(aggressive patchification)实现的统一“像素空间”模型取代了 VAE。通过将 v-prediction 切换为 **x-prediction**,该模型避免了拟合高维噪声,从而能够利用 32x32 的压缩率。为了解决此类模型常见的精细细节丢失问题,他们引入了 **JiT-DDT (解耦扩散变换器)**,将 DiT 拆分为结构编码器和细节导向解码器。 **结果:** JiT-DDT 取得了显著进展:其训练速度比 Linum v2 基准快 3.6 倍,同时生成的像素多出 4 倍。通过细化器和专门的噪声调度等架构改进,该模型在风格保真度和光影效果方面均优于其前身。

这篇 Hacker News 帖子记录了 Linum.ai 的作者与其他用户关于其近期声称的“训练文生图模型速度提升 3.6 倍且成本降低”的讨论。 作者解释称,效率提升主要得益于注意力序列长度减少了 4 倍。除训练成本外,讨论还转向了“自回归扩散”的技术优势。虽然作者对自回归扩散相较于传统扩散的内在性能优势存疑,但他们强调了一个关键好处:利用大型语言模型(LLM)。通过基于 LLM 构建,模型可以进行“思考”、自我评估并迭代编辑图像,从而确保更高的质量和准确性。 参与者还探讨了架构的细节,提到了如 MAR(掩码自回归建模)等论文,并讨论了通过重用隐藏状态实现“思考”或在线学习的可能性。作者确认,3.6 倍的训练效率提升直接转化为 3.6 倍的成本降低,并预计推理成本也将有所节省,但目前尚未量化。
相关文章

原文
联系我们 contact @ memedata.com