英伟达在其面向媒体的AI平台中推出了合成视频检测器(NIM)微服务。该服务用于筛查视频片段,检测是否存在AI生成的内容。
该检测器会检查视频的每一帧,寻找合成内容的迹象,并为视频赋予一个分类评分。机构随后可以使用此评分来审查或标记可疑视频。
该技术方法建立在2025 年 ICCV SAFE 合成视频检测挑战赛中获得第一名的研究成果之上,并在 NeurIPS 2025 上发表。
该检测器从帧中提取 504×504 像素的区域,并使用基于 Meta 的 DINOv2 和 DINOv3 视觉转换器模型的集成算法对其进行处理。这些模型生成每帧内空间和视觉特征的表示,检测器随后利用这些表示来判断内容是否包含人工智能生成的迹象。
每一帧分析结果都会获得一个合成似然度得分。该得分范围从 0 到 1,0 代表真实内容,1 代表合成内容。然后,利用帧级分析结果生成视频的总体分类器得分。
英伟达报告称,该合成视频检测器在分析未压缩视频时准确率最高可达92%。压缩率降至 15% 时,准确率降至 87%;压缩率降至 50% 时,准确率降至 82%。
实际应用场景中的性能可能因视频生成器、分辨率、编解码器、压缩级别以及其他应用于视频素材的处理方式而异。Nvidia 不提供关于误报、漏报或各个视频生成模型性能的数据。
Wowza 将英伟达的检测器引入到直播基础设施中
Wowza正在将Nvidia的合成视频检测器集成到Wowza视频智能框架中。这展示了如何将NIM微服务集成到实际运行的视频系统中。
Nvidia 提供合成视频检测模型、NIM 模型服务层和优化的推理软件,而 Wowza 提供流媒体和编排层。Nvidia 分类器可以更直接地应用于视频接收、处理或分发环节。
这意味着机构无需从视频流中移除可疑片段并将其上传到单独的检测网站。检测结果可直接整合到现有工作流程中,使机构能够在播出前标记出可疑的视频片段。
该集成旨在支持本地部署、边缘部署、混合部署或经批准的物理隔离配置。Wowza 表示,客户可以在现有的 Nvidia 基础架构上运行该检测器,同时保留对视频素材和模型输出的控制权。
Wowza首席执行官Krish Kumar表示:“我们构建了能够将其部署到任何需要的地方的层级。我们共同努力,让那些保护人们安全的组织能够信任他们在自身硬件上实时看到的信息。”
Wowza 表示,其媒体服务器技术支持超过 170 个国家/地区的 35,000 多个视频部署。
该公司指出,政府和公共部门应用是潜在的用例,合成视频可用于冒充官员。公共安全机构可以在采取行动前分析作为犯罪证据提交的视频。
同样的方法也适用于视频KYC、账户恢复和高风险金融交易。Wowza将视频通话中的合成高管和合成视频身份攻击识别为潜在的金融服务应用案例。
Wowza视频智能框架现已推出。
本文来自作者投稿,版权归原作者所有。如需转载,请注明出处:https://www.nxrte.com/zixun/70314.html