首页 > 教程攻略 > ai资讯 >英伟达出手,AI视频分析工具实测:普遍很弱,但总比没有强

英伟达出手,AI视频分析工具实测:普遍很弱,但总比没有强

来源:互联网 时间:2026-07-28 15:41:43

经常在互联网上被AI视频假冒的黄仁勋,终于决定出手了。

近日,英伟达正式发布了一款名为Synthetic Video Detector NIM的工具。

这套工具可以对视频进行逐帧分析,通过检测生成模型在创造内容时留下的统计痕迹和频域特征,来识别哪些视频是AI生成的。据官方宣称,其准确率最高可达92%。

说起来,也难怪英伟达要亲自下场。生成假图、假视频的门槛,现在低得令人发指。

举个例子,前阵子刷到一个视频:一只猫刚把花瓶碰碎,转头就溜得比谁都快,旁边的狗子当场愣住,疯狂挥爪解释,表情像是在说:不是我,真的不是我。

挺好笑的对吧?如果不是AI生成的,那就更好了。

更麻烦的是,以前判断假视频,还能靠一些比较明显的画面破绽,比如嘴型对不上、手指数量不对。但现在视频生成模型的进步速度实在太快了,很多生成内容已经不会留下这些明显的漏洞,也难怪家里的长辈能天天被这种内容“钓鱼”。

既然普通人已经很难凭肉眼分辨,那也该轮到检测工具上场了。

英伟达加入“用AI检测AI视频”大军

先简单介绍一下背景。英伟达在2024年3月发布了NVIDIA Inference Microservices,简称NIM。这东西本质上就是把“模型+推理+API接口+运行环境”等打包成一个部署工具,方便开发者快速上手AI服务。

而这次发布的

Synthetic Video Detector NIM

,可以理解为英伟达在NIM标准下,打包的一套专门用于检测AI视频的服务。

因为它主要面向本地部署场景,目前想在线使用必须通过英伟达的媒体测试申请。而本地部署又需要Linux系统,以及兼容NVENC/NVDEC视频编解码的硬件,普通用户想用上,门槛确实不低。

不过,用不上也不妨碍我们结合现有的资料和演示,好好聊聊这东西。

根据官方介绍,视频上传后,SVD NIM会先把H.264编码的MP4拆成画面帧,然后交给由DINOv2和DINOv3组成的视觉模型进行分析,最后给每一帧打分并汇总,告诉你整段视频到底有多像AI生成的。

重点是,它不会盯着六根手指、人物穿模或者水杯突然消失这些传统艺能。

按照官方说法,SVD NIM识别的是生成和去噪过程中留下的底层统计特征、频率异常,以及正常相机不太容易拍出来的像素规律。即便用户将视频进行压缩和重新编码,也依然能保持较高的识别概率。

参考官方提供的案例,可以看到这个视频本身并没有出现早期AI视频特有的画面崩坏、前后不一的问题,但SVD NIM却给出了高达99%的综合得分。

当然,这视频确实一眼假……毕竟运镜太过平滑了。

英伟达这套思路,确实比盯着画面里的破绽要靠谱些。毕竟,在没有前情提要的情况下,给大伙看下面这段视频,至少八成左右的人看不出这是完全由AI生成的——现在Seedance和Kling的视频生成能力,已经到了这个地步。

按照英伟达的说法,他们准备了超过4000个视频的内部测试集,SVD NIM检测的成功率高达85.64%,未压缩视频的准确率更是高达92%。

当然,92%的准确率不能理解成百发百中。尽管在宣传稿里没提,但英伟达在说明文档里还是标注了:这么高的准确率,是由偏严格的阈值采样得到的,在真实环境中可能造成大量误判。所以,这东西更适合给视频网站做初筛,发现可疑素材,还是得交给人工继续核实。

而且这个准确率是基于H.264编码的MP4格式视频得到的,任何转码和压缩都会降低准确率。只能说老黄的免责声明,还是那么专业。

反AI实测:朱雀还行,反诈中心不稳定

目前来看,英伟达这套SVD NIM确实离普通用户还有点远。

不过,国内其实也有类似定位的检测工具,而且直接打开就能用。一个是腾讯朱雀AI检测助手,另一个是反诈中心App里的“AI内容鉴定”。两款应用都支持文字、图片、视频检测,每天也有一定次数的免费检测。

为了看看AI抓AI到底靠不靠谱,我准备了一组混合测试:

几张由主流模型直接生成的图片、几张手机实拍照片;一段精心挑选的AI视频,再搭配Vlog题材的真实视频。我还把部分素材发过微信、截过图,准备看看它们应对二次压缩的表现怎么样。

第一轮,先来点AI视频。

这段视频本身质量很高,略显模糊的分辨率、微微晃动的模拟镜头和角色的动作神态融合在一起,很有老电影的感觉。制作者手绘了大量分镜图供模型参考,可以说完全发挥了Seedance的制作能力。

结果,腾讯朱雀第一个就栽了。

作为对比,我找了一个通过媒体申请的朋友借了腾讯朱雀的账号,可以看到SVD NIM给出了高达93%的综合得分,意味着这个视频高概率是AI合成的,同时逐帧检测的疑点也在坐标系上标注出来了。不过,检测速度确实不快,13秒的视频花了近两分钟。

更绝的是反诈中心的内容检测,我愣是试了半个小时没能传上去,最后只能作罢。

第二轮,换上真实视频。

当然了,不能是那种简单的真实视频。我选了一个很多视频生成模型都喜欢模仿的Vlog视频,制作者用的相机不错,镜头过渡顺滑自然,街头光影也很有质感,属于一眼真假莫辨的水平。

你猜怎么着?咱们腾讯朱雀又翻车了。

英伟达这边相对还是要强不少,虽然也给出了34%的综合得分,但这毕竟是个参考数值,意味着模型检测到的合成内容证据不多。

至于反诈中心,我还是没有上传成功。要是有老人家真想用这功能,那可就遭罪了。

接下来换图片,这里就不详细展开了。总之是同一个题材下的真实图片,以及两张由豆包、image 2制作的AI图片,后面两个均通过后期、压缩抹除了水印。

结果刚想夸朱雀这次认出AI图了,它就整了一个“真实照片也是AI”的活。

相反,之前折腾了好几次没传上视频的内容检测,这次倒是做到了三题全对。看来反诈中心在算法上还是有些优势的。

最后吐槽一句:这两家给的免费次数都不多,真要遇到啥事,还不一定够用。

AI识别很弱,但总比没有要强一点

这一轮测下来,对AI检测工具的信心,只能说比没有强一点。

视频这块,英伟达表现还行,腾讯朱雀完全靠不住,居然能得出相反的答案;图片相对会好一些,但腾讯朱雀依然能整出把真图当假图的好活,而反诈中心内容检测的服务器则大部分时候都是爆满的,根本上传不了内容。

这机器自己都拿不准,人就更别急着拿检测截图去评论区断案了。

相比事后猜一张图有没有AI味,生成时直接留下水印和来源记录,显然更靠谱。

如今,谷歌已经在用SynthID给生成内容加隐形标记,Adobe等公司也在推动C2PA,希望把文件从生成到修改的过程记录下来。国内也在跟进,网信办已明确要求AI内容添加标识,腾讯、阿里和字节也在检测、数字签名和平台提示上积极补课。

问题是,这套体系目前还没有完全连起来。

去部署一个开源模型,生成的内容必然也是没有水印的;图片、视频转发几次,元数据可能就没了;至于平台之间能不能互相认出对方的水印,就目前国内各家厂商互相防范的情况来看,同样也是个问题。

在这些环节真正打通以前,普通人只能自己多长个心眼了。