VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026

作者:vivo  BlueImage Lab
论文主页:https://arxiv.org/abs/2605.23518
代码仓库:https://huggingface.co/datasets/openvivo/VINS-120K

摘要:

4K+图像编辑新突破!针对数据匮乏与细节建模难题,我们发布首个指令式超高分辨率编辑数据集 VINS-120K(含12万精筛4K三元组)。同时提出高频感知适配策略,将预训练低分辨率模型轻松扩展至UHR领域,并配套评测基准 VINS-4KEval。显著提升编辑细节与纹理真实感!

VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026
图1:论文的方法与Kontext编辑下采样后的4K图像超分的视觉对比

01 研究背景:图像编辑模型的分辨率瓶颈

当前主流指令编辑模型大多工作在 <=1024 分辨率。在手机拍摄图像已迈入 4K 时代的背景下,直接处理 4096px 输入时,常见退化包括结构不稳定、语义偏移,难以满足电影工业修帧、商业广告设计、社交媒体分发等真实场景对编辑精准、细节真实的双重要求。

直观的替代流程是 下采样 -> 编辑 -> 上采样。这个流程虽可实现4K编辑,但存在明确上限:降采样阶段丢失的高频信息很难在后续超分中被真实恢复,最终影响细节真实性与局部编辑准确性。

论文将 UHR 编辑瓶颈归纳为两点:

  • 缺少大规模、高质量 UHR 指令编辑数据。
  • NHR 预训练模型在长序列与高频细节建模上不稳定。

02 数据支撑:VINS-120K 与 VINS-4KEval

为了填平底层架构与 4K 需求之间的鸿沟,论文正式提出了 VINS-120K ,它包含 12 万组 精心筛选的“指令-输入图-编辑图”三元组,横跨 4 大类共 13 种编辑指令,平均分辨率高达 4656×4138。

VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026
图2:VINS-120K的编辑类型分布与可视化

在数据源上采用了互补来源:25K 原生超高清视频帧对 + 95K 外部编辑数据补齐。前者用于从真实世界保留精细纹理与自然变化,后者用于补齐难以真实获取的长尾编辑类型,避免模型只擅长少数任务。

在标注上引入了视觉语言模型Gemini-2.5-Pro,进行“先全局再局部”的结构化推理生成指令,并加入自反思机制,把“图像变化”转成可执行、可评估的编辑指令。

在质量控制上,采用严格的四阶段过滤:文件有效性、图像质量、指令一致性、美学质量。最终保留前 20% 样本,确保训练信号尽量稳定且高质量。

VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026
图3:VINS-120K数据筛选流程示意图

评测基准 VINS-4KEval 含 509 个 4K 测试样本,覆盖同分布的 13 类编辑任务,用于统一评估 UHR 条件下的编辑能力和细节保真。

03 核心方法:高频感知后适应策略

相比于耗费大量算力训练全新的 4K 编辑基座模型,论文基于 VINS-120K 提出了一种高频感知后适应策略,将现有 NHR 编辑器稳定迁移到 UHR场景。方法主要针对两大挑战:

  • 4K 场景下 token 序列长度远超预训练设置,注意力和位置编码容易失稳。
  • 常规训练目标对高频细节关注不够,4K 场景下的精细纹理保留与生成仍有较大提升空间。

3.1 长序列泛化

(Long-Token-Sequence Generalization)

分辨率从 1K 升到 4K 后,token 序列显著变长,常见现象是注意力分布出现“熵漂移”(过度平滑、目标区域不聚焦)以及 RoPE 外推失稳带来的语义漂移。论文用两步修正:

1. 注意力分数重缩放:引入与分辨率挂钩的温度参数 τ 重新缩放注意力分数(Rescaling Attention Score),让长序列场景下的注意力重新变得有区分度,提升目标区域定位能力。

VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026

2. RoPE 重缩放:将更长序列的位置编码压缩回预训练相对熟悉的范围(缩放频率基数b),降低长上下文外推失效风险。

VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026

3.2 频域聚焦监督(Frequency-Focused Supervision, FFS)

仅有长序列修正尚不足以保证 UHR 编辑的细节保真度。论文在标准流匹配损失之外引入频域监督:

VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026

核心在于动态加权:早期去噪阶段抑制高频噪声放大,后期逐步增强高频约束,以恢复毛发、纹理、边缘等细节。 Fw代表离散傅里叶变换后的频谱差异。

04 评测与结果

论文基于 Flux.1-Kontext 在 VINS-120K 上进行后适应训练。与现有的主流开源模型(Step1X-Edit, Bagel, Flux.1-Kontext等)以及支持 4K 的闭源商业模型 Seedream 4.0 在 VINS-4KEval 进行系统比较。主评测采用 ImageJudgeVIEScore 和 pFID 三类指标,主要评估编辑能力和细节保真。 核心结果可以概括为三点:

  • Kontext-dev 适配后 pFID: 12.66 -> 9.15,细节保真度显著增强,明显优于现有主流方法。
  • ImageJudge/VIEScore 基本保持同量级,说明细节提升不是靠明显牺牲编辑能力换来的。
  • 与 Seedream 4.0 对比时,本文方法在 pFID 上更优(9.15 vs 12.82),但编辑能力分数上 Seedream 仍更高。
VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026
表1:论文的方法与主流基线在VINS-120K上的定量比较

在视觉对比上,论文的模型在全局和局部编辑任务中,都展现了更好的边缘清晰度和细节保留:

VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026
图4:论文的方法与主流基线的定性比较

消融结果说明最终收益来自“数据构建 + 方法设计”的协同:

  • 去掉后适应会出现明显退化,说明 UHR 迁移不能靠简单放大分辨率。
  • 去掉数据筛选与分布设计后,指标也会下降,说明数据质量和任务覆盖同样关键。
  • 只用真实视频帧对会得到更低 **pFID**,但编辑能力减弱,反映出真实性与编辑任务覆盖度之间的权衡需求。
VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026
表2:更多消融实验和评估

泛化方面也给出了积极信号在 QwenImage-Edit-2511 上无需重调即可把 pFID 从 18.33 降到 11.38,定性结果如下:

VINS-120K: 基于大规模4K数据集的超高清图像编辑 | CVPR 2026
图8:QwenImage-Edit-2511在VINS-120K上进行后适应训练的定性结果

05 总结

VINS-120K 与高频感知后适配策略的提出,有效填补了 AI 图像编辑模型与现代高清显示/采集设备之间的鸿沟,为现有 NHR 编辑模型提供了一条更具落地价值的 UHR 迁移路径。从此,对高清图像进行编辑,再也无需忍受画质的降级。

版权声明:本文内容转自互联网,本文观点仅代表作者本人。本站仅提供信息存储空间服务,所有权归原作者所有。如发现本站有涉嫌抄袭侵权/违法违规的内容, 请发送邮件至1393616908@qq.com 举报,一经查实,本站将立刻删除。

(0)

相关推荐