图像压缩的核心目标是在尽可能低的码率下保留尽可能高的视觉质量。近年来,学习式图像压缩方法在客观指标和主观感知质量上取得了显著进展,但在极低码率场景下仍面临明显挑战:传统率失真优化方法容易产生过度平滑、纹理缺失和结构模糊;而基于生成模型的方法虽然能够生成更自然的视觉细节,却可能与原图产生语义或结构偏差,导致重建结果“好看但不够像”。针对上述问题,本文提出了一种面向超低码率图像压缩的残差引导框架 ResULIC。该方法将压缩后的潜在特征、文本语义信息和扩散生成模型统一到一个协同框架中,并重点解决两个问题:一是如何在文本与压缩特征之间去除冗余语义信息,二是如何让扩散模型的生成过程与不同压缩码率自适应匹配。为此,文章提出了语义残差编码(Semantic Residual Coding, SRC)和压缩感知扩散模型(Compression-aware Diffusion Model, CDM)两个核心模块。
文章来源:ICML 2025
论文题目:Ultra Lowrate Image Compression with Semantic Residual Coding and Compression-aware Diffusion
文章作者:Anle Ke, Xu Zhang, Tong Chen, Ming Lu, Chao Zhou, Jiawen Gu, Zhan Ma
论文链接:https://arxiv.org/abs/2505.08281
内容整理:梁盈
简介

学习式图像压缩通常通过神经网络将图像映射到紧凑的潜在表示,再通过熵编码降低传输码率。与 JPEG、VVC 等传统编码器相比,神经压缩方法能够更灵活地优化率失真性能。然而,当码率下降到极低水平时,仅依靠潜在特征往往难以完整保留图像中的结构、纹理和语义信息,重建图像容易出现细节丢失、边缘模糊以及物体结构不稳定等问题。
为提升低码率下的主观质量,近年来研究者开始引入 GAN、扩散模型以及多模态大模型。生成模型能够借助强大的图像先验补全缺失细节,使重建结果更加自然。特别是扩散模型在图像生成和图像复原任务中表现突出,因此逐渐被用于超低码率图像压缩。然而,扩散式压缩方法也存在一个关键问题:生成模型擅长“合理生成”,但压缩任务要求“忠实重建”。如果条件信息不足,模型可能生成与原图语义相近但细节不一致的内容。
现有多模态压缩方法通常会同时传输图像潜在特征和文本描述,让文本为扩散模型提供语义指导。但这种方式存在信息冗余:压缩潜在特征中已经包含部分结构和语义,若再传输完整文本描述,会在极低码率下造成额外比特浪费。另一方面,如果完全依赖解码端模型自动生成文本,又难以恢复原图中已经被压缩过程丢失的细节。
本文的核心思想是:不传输完整语义,而只传输“语义残差”。也就是说,模型先分析原图与压缩后初步重建图之间的语义差异,再只编码那些压缩潜在特征没有保留下来的信息。这样既减少文本码率开销,又能让扩散模型获得关键补充信息。
本文的主要贡献如下:
- 提出 ResULIC 框架,将潜在特征压缩、语义残差编码和扩散式重建统一起来,实现超低码率下兼顾感知真实度与重建一致性的图像压缩。
- 提出语义残差编码 SRC,通过多模态大模型提取原图与压缩重建图之间的语义差异,避免完整文本描述带来的冗余比特开销。
- 提出感知保真优化 Pfo,通过可微提示词优化进一步提升文本条件与目标图像之间的一致性。
- 提出压缩感知扩散模型 CDM,将压缩码率与扩散时间步进行自适应匹配,在提升重建质量的同时显著减少扩散采样步数。
- 在 CLIC-2020 等数据集上的实验表明,ResULIC 相比现有扩散式超低码率压缩方法取得更优表现;相较 PerCo,在 LPIPS 和 FID 指标上分别实现 80.7% 和 66.3% 的 BD-rate 节省。
方法
整体框架
ResULIC 的整体流程可以分为三个部分:特征压缩器、语义残差编码模块和压缩感知扩散模型。给定原始图像 (x),特征压缩器首先将其映射到潜在空间并进行压缩,得到压缩潜在特征 (z_c)。该特征经过解码后得到一个初步重建图像 (x’),其中保留了一部分结构和语义信息,但在极低码率下仍会损失大量细节。
随后,语义残差编码模块同时观察原图 (x) 和初步重建图 (x’),提取二者之间的语义差异。与直接生成完整 caption 不同,该模块关注的是“原图中存在、但压缩重建图中缺失或错误的内容”。最终得到的语义残差文本会被编码为 token 索引,与压缩潜在特征共同作为扩散模型的条件输入。
最后,CDM 根据当前码率自适应选择合适的扩散时间步,并利用压缩潜在残差信息引导反向采样,生成最终重建图像 (x_r)。这种设计使模型不再从纯随机噪声开始重建,而是从与压缩退化程度相匹配的状态开始采样,从而减少不必要的生成不确定性。
语义残差编码 SRC

SRC 的目标是降低文本条件中的冗余信息。传统多模态压缩方法通常会对原图生成完整文本描述,例如“一个红色甜甜圈放在桌面上”。但如果压缩潜在特征已经保留了“甜甜圈”“桌面”等主要结构,那么继续传输这些信息就会浪费比特。
本文采用语义残差检索(Semantic residual retrieval, Srr)来解决这一问题。具体而言,模型分别对原图和压缩初步重建图生成语义描述,然后利用大语言模型比较二者差异,输出压缩结果中缺失或错误的语义信息。例如,当初步重建图已经保留了主体物体,但颜色、文字、局部纹理或细小物体出现偏差时,Srr 会倾向于只保留这些差异信息。
这种机制具有明显的码率自适应性:当潜在特征码率较高时,图像本身已经携带较多信息,需要传输的语义残差更少;当码率较低时,潜在特征丢失的信息更多,语义残差文本会承担更多补充作用。
感知保真优化 Pfo
尽管多模态大模型生成的文本能够提供语义指导,但自然语言描述往往不够精确,难以完整约束图像中的局部纹理、形状和空间关系。因此,本文进一步提出感知保真优化(Perceptual fidelity optimization, Pfo),用于搜索更适合当前压缩框架的文本提示。
Pfo 的思路类似离散提示词优化:先将文本 token 映射到 CLIP 词表对应的嵌入空间,再通过可微优化寻找能够提升重建一致性的 token 表达。优化目标不仅考虑扩散模型的去噪损失,也结合图像与文本之间的感知一致性约束。最终得到的提示词仍然以离散 token 形式保存,因此可以被编码和传输。
此外,文章还提出了基于 token index 的文本编码方式,用索引编码替代传统字符级压缩,从而进一步降低文本码率。这一点对超低码率压缩尤其重要,因为在 0.01 bpp 附近,任何额外文本开销都会显著影响整体率失真表现。
压缩感知扩散模型 CDM

扩散模型的标准采样通常从高斯噪声开始,再经过多步去噪生成图像。但在图像压缩任务中,解码端并非一无所知:压缩潜在特征已经提供了关于原图的结构、轮廓和部分纹理信息。因此,如果仍从纯随机噪声开始采样,不仅效率低,也会引入不必要的随机性。
本文观察到,压缩退化程度与扩散加噪程度具有内在对应关系:码率越低,压缩特征保留的信息越少,更接近扩散过程中的高噪声状态;码率越高,压缩特征保留的信息越多,更适合从较低噪声时间步开始恢复。因此,CDM 根据不同码率选择不同的扩散起点,使扩散过程与压缩强度对齐。
这种设计带来两个好处。首先,它提升了重建一致性,因为扩散模型从与压缩退化相匹配的状态开始恢复,而不是盲目生成。其次,它显著降低了解码复杂度。实验中,ResULIC 可以使用 3 到 4 个去噪步完成重建,而不需要传统扩散采样中常见的几十步过程。
实验
实验设置
本文使用 Stable Diffusion v2.1 作为基础扩散模型,并使用 GPT-4o 提取图像描述与语义残差信息。评估数据集包括 CLIC-2020,附录中还进一步测试了 Kodak、DIV2K、Tecnick 和 MS-COCO 等数据集。
评价指标覆盖多个维度:PSNR 和 MS-SSIM 用于衡量传统失真;LPIPS 和 DISTS 更关注感知保真度;FID 和 KID 用于衡量重建图像分布与真实图像分布之间的感知真实度。对比方法包括传统编码器 VTM、GAN-based 方法 HiFiC 和 MS-ILLM,以及扩散式压缩方法 Text-sketch、DiffEIC、CDC 和 PerCo。
主结果

实验结果表明,ResULIC 在感知真实度和感知保真度方面均优于现有方法。尤其是在 FID、KID、DISTS 和 LPIPS 等指标上,ResULIC 在超低码率区域表现突出。相比扩散式方法 PerCo,ResULIC 在 LPIPS 和 FID 上分别实现 80.7% 和 66.3% 的 BD-rate 节省,说明其能够在更低码率下达到相近甚至更优的视觉质量。
从视觉结果来看,ResULIC 在极低码率下能够更好地保留主体结构、文字细节、手部形状和局部纹理。相比之下,部分生成式压缩方法虽然生成结果自然,但会出现内容偏移或细节幻觉;而传统压缩方法则更容易产生模糊和纹理损失。
消融实验
文章进一步验证了各个模块的作用。首先,语义残差检索 Srr 能够根据码率动态调整文本与潜在特征之间的信息分配。在低码率下,文本语义残差占比上升,用于弥补潜在特征的信息缺失;在高码率下,潜在特征已经较充分,文本开销随之降低。
其次,Pfo 能够在 Srr 的基础上进一步提升重建质量。它不仅适用于 ResULIC 本身,也可以迁移到 PerCo 等已有框架中,说明该模块具有较好的通用性。
最后,CDM 的消融结果表明,码率感知的扩散时间步选择能够同时提升质量并加速推理。相比固定扩散步数或仅在推理阶段引入低质量图像初始化的方法,CDM 将训练和推理过程统一起来,减少了训练-测试不一致问题。
总结
本文提出了 ResULIC,一种面向超低码率图像压缩的残差引导生成式压缩框架。其核心思想是:压缩潜在特征负责保留图像的基础结构和低层信息,语义残差编码负责补充压缩过程中丢失的关键语义,压缩感知扩散模型则负责在与码率匹配的生成过程中恢复高质量图像。
与直接传输完整文本描述的多模态压缩方法相比,ResULIC 通过 SRC 减少了文本冗余;与传统扩散式压缩方法相比,CDM 更好地对齐了压缩退化与扩散采样过程,在保证重建质量的同时减少了解码步数。实验结果表明,该方法在超低码率图像压缩中能够兼顾感知真实度、重建一致性和编码效率,为生成式图像压缩提供了一种更紧凑且更可靠的设计思路。
版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。