潜空间建模已成为扩散 Transformer(DiT)的标准范式。然而,它依赖于一个两阶段的流程,其中预训练的自编码器会引入有损重建,导致误差累积并阻碍联合优化。为了解决这些问题,我们提出了 PixelDiT,一个单阶段、端到端的模型,它消除了对自编码器的需求,并直接在像素空间中学习扩散过程。PixelDiT 采用了一种全 Transformer 的架构,以双层设计为特征:一个负责捕获全局语义的补丁级 DiT,以及一个负责细化纹理细节的像素级 DiT,从而在保留精细细节的同时实现对像素空间扩散模型的高效训练。我们的分析表明,有效的像素级 token 建模是像素扩散成功的关键。PixelDiT 在 ImageNet 256×256 上达到了 1.61 FID,以显著优势超越了现有的像素生成模型。我们进一步将 PixelDiT 扩展到文生图生成任务,并在像素空间中直接以 1024² 分辨率进行预训练。它在 GenEval 上取得了 0.74,在 DPG-bench 上取得了 83.5,接近最佳的潜扩散模型。
文章来源:CVPR 2026
论文题目:PixelDiT: Pixel Diffusion Transformers for Image Generation
论文作者:Yongsheng Yu, Wei Xiong, Weili Nie, Yichen Sheng, Shiqiu Liu and Jiebo Luo
工作单位:NVIDIA, University of Rochester
原文链接:https://arxiv.org/abs/2511.20645
内容整理:彭梓甜
前言与动机:为什么要回到像素空间?
当前,潜空间扩散模型是主流。它分为两步:先用VAE将图像压缩到隐空间,再在该空间中进行去噪生成。
这种方法虽然节省了计算资源,但有两个根本性缺陷:
- 有损重建瓶颈:VAE的压缩是有损的,它会不可逆地丢失高频细节。即使扩散模型再强大,最终生成的图像质量也会被VAE的重建质量所“封顶”。
- 优化目标不一致:VAE的“重建”目标与下游的“生成”目标存在偏差,这种不匹配会导致累积误差,限制了模型的联合优化潜力。
为了解决这些问题,作者重回“像素空间”这个最初的战场。但这里的挑战巨大:直接在H×W个像素上做自注意力,其计算复杂度是O(N²),这导致了对高分辨率图像建模时,计算开销难以承受。
核心挑战:像素级Token建模
论文指出,实现实用的像素空间扩散,其核心挑战在于 “像素级Token建模 (Pixel-Level Token Modeling)” 。这指的是模型需要能够捕捉每个像素间的密集交互和高频细节。这与传统粗粒度“语义”Patch Token的处理方式截然不同。
- 一种方式是“粗粒度”建模(如大Patch大小),虽能节省计算,但会严重削弱对细节的建模能力。
- 另一种是“近像素粒度”建模(如小Patch),虽能保留细节,但全局注意力的计算量会随序列长度呈平方级增长,导致训练和采样成本极高。
因此,PixelDiT的使命就是找到一种高效的像素建模机制,既能捕捉全局语义,又能进行高效的逐像素更新。
方法:PixelDiT — 双层级架构的新范式
PixelDiT采用了一个单体、端到端、全Transformer的架构,直接在像素空间进行训练和采样。其核心是 “双层级 (Dual-Level)” 设计。

- Patch级路径 (Patch-Level Pathway):负责捕获全局语义。它将图像打成
p x p的非重叠Patch(p=16),形成短序列,通过标准的DiT Block进行长距离自注意力建模。这一层专注于理解“画了什么”。 - 像素级路径 (Pixel-Level Pathway):负责细化局部纹理。它由专门的像素Transformer (PiT) Block组成,对每个像素进行密集的建模。这一层专注于“怎么画得逼真”。
要使这种设计有效,作者提出了两项关键技术:
关键创新一:像素级自适应层归一化
传统的AdaLN将同一个调制参数广播给一个Patch内的所有像素,无法捕捉像素间的细微变化。PixelDiT提出了像素级AdaLN (Pixel-wise AdaLN),它为每个像素独立生成缩放(Scale)、平移(Shift)和门控(Gate)参数。

具体地,它通过一个线性投影Φ,将每个Patch对应的语义Token(来自Patch级路径)扩展为一组逐像素的调制向量,使得每个像素的更新都受到其所属区域的全局语义指导,但又保留了独立的局部特征。
关键创新二:像素Token压缩机制
这是解决计算瓶颈的关键。如果像素级路径直接对所有像素计算全局注意力,复杂度是O((H*W)²),完全不可行。因此,PixelDiT引入了一个“压缩-注意力-扩展”的流水线。
- 压缩 (Compress):在每个Patch内,用一个线性层
C将p²个像素Token压缩成一个“紧凑的Patch Token”。 - 注意力 (Attention):只对这些压缩后的
L = (H/p) * (W/p)个Token进行全局注意力。 - 扩展 (Expand):注意力计算完成后,再用另一个线性层
E将其解压缩回p²个像素Token。
这带来了256倍 (p=16) 的序列长度缩减。更重要的是,这种压缩是可学习的,且由于存在残差连接,高频信息可以通过学习的扩展层绕过这个“像素Token瓶颈”,从而不会损失细微细节。
实验结果:全面超越,逼近SOTA
类条件图像生成

- 对像素级模型的碾压:PixelDiT-XL仅用320个epoch就达到了1.61 FID,大幅超越了所有现有的像素级模型(如PixelFlow-XL的1.98、PixNerd-XL的1.93、EPG的2.04)。
- 快速收敛:仅训练80个epoch(2.36 FID)就已超越经典的像素扩散模型ADM-U(4.59 FID)。
- 逼近潜空间模型:其性能已经非常接近Repa、DDT等顶尖潜空间模型,证明了在无需VAE的情况下,纯像素级扩散模型也能达到顶尖水平。

文生图生成

- PixelDiT-T2I在GenEval上达到了0.74,在DPG-bench上达到了83.5,远超其他像素级模型(PixNerd, PixelFlow),并接近FLUX, DALL-E 3等顶级潜空间模型。
- 效率优秀:在1024×1024分辨率下,其生成速度(0.33 samples/s)与潜空间模型相当,证明了双层级架构的高效性。
细节保留:图像编辑任务的优势
在编辑任务中,潜空间模型(SD3, FLUX)在处理背景中的“场景文字”时,由于VAE的压缩失真,编辑后文字严重变形。而PixelDiT直接在像素空间操作,完美避免了VAE重建伪影,不仅正确修改了主体(自行车变摩托车),还完好地保留了墙上的文字细节。这展示了像素空间模型在细节敏感任务上的巨大潜力。

核心组件消融

从基准的Vanilla DiT/16(9.84 FID)开始,逐步加入核心组件:
- 加入双层级架构+Token压缩,FID降至3.50。
- 最后加入像素级AdaLN,FID大幅提升至2.36(80 epoch)和1.61(320 epoch)。这清晰地证明了每个组件的重要性。
总结与展望
PixelDiT的工作,其核心贡献可以总结为以下几点:
- 提出了PixelDiT:一种单体、端到端的全Transformer像素空间扩散模型,彻底摆脱了对预训练自编码器(VAE)的依赖。
- 揭示了关键因素:指出高效的像素级Token建模是实用化像素空间扩散的关键,并提出了双层级DiT架构来解耦全局语义和局部纹理的学习。
- 提出了两项关键技术:像素级AdaLN 和 像素Token压缩,使高效的密集逐像素建模成为可能。
- 取得了SOTA性能:在ImageNet和文生图任务上,大幅超越现有像素空间模型,并逼近顶尖潜空间模型,展示了像素空间方法的巨大潜力。
作者在结论中强调,阻碍像素空间扩散的屏障,并非表示空间本身,而是缺乏高效的像素建模架构。PixelDiT的成功,为未来端到端、无VAE的生成模型研究开辟了新的道路,尤其在高保真图像编辑和细节保留等任务上,具有不可替代的优势。
虽然像素空间模型的计算成本仍然高于潜空间方法,但PixelDiT已经显著缩小了这一差距。我们有理由期待,未来将会有更多工作以此为基础,探索像素生成的新范式。
版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。