详情

首页手游攻略 人眼看不出的伪造:AI如何识别?实测合合信息跨模态鉴伪与去反光技术

人眼看不出的伪造:AI如何识别?实测合合信息跨模态鉴伪与去反光技术

佚名 2026-07-21 08:57:15

一、AI进入真实业务,第一步不是“看懂”

生成式AI正在快速降低内容生产和内容修改的门槛。AI图片、AI视频和大模型生成文本已经大量进入社交平台、电商交易和日常办公场景,普通用户只需输入提示词,便可以生成较为逼真的人物、商品、票据和文案。过去,修改转账截图、伪造商品破损图或制作换脸视频,需要掌握一定的软件操作能力;现在,借助图像生成、局部重绘、视频驱动和大模型写作工具,普通用户也能在较短时间内完成。更麻烦的是,这些内容往往会经过截图、压缩、裁剪和二次转发,原有的生成痕迹进一步被削弱,仅靠肉眼是很难判断的。

当AI生成内容从娱乐创作进入交易、审核和证据提交等环节后,真假判断就不再只是一个内容识别问题,而会直接影响资金安全、平台治理和业务决策。因此,市场需要的不只是“看起来像不像AI”的经验判断,而是一套可以检测生成痕迹、识别局部篡改并输出风险结果的工具。

这对真实业务提出了两个基础问题:

  • 内容是否由AI生成或经过篡改;

  • 图像是否因反光、倒影等干扰而丢失信息。

前者影响金融审核、保险理赔、电商风控和内容治理,后者则会降低证件、票据、白板和展品图像的识别质量。对大模型和Agent来说,后端推理能力再强,也无法弥补错误或残缺的输入。

2026世界人工智能大会期间,合合信息展示了AI跨模态鉴伪技术,以及旗下扫描全能王“智能高清·去反光”技术。前者负责判断内容真假,后者负责恢复被反光遮挡的信息。

AI鉴伪已经不再停留在实验室模型或后台接口,而是被做成了普通参观者可以直接体验的交互功能。用户上传或选择样本后,系统即可给出真实性判断及相关分析结果。

二、为什么越来越难判断AI伪造

很多人判断AI图片,仍然习惯寻找多余手指、乱码文字、扭曲边缘等明显错误。但更难识别的,往往不是整张生成图片,而是在真实图片上修改少量关键内容。

一张支付截图可能只替换金额和时间,一张退款图片可能只修改商品污损区域。整张图的大部分像素、界面布局和视觉风格仍然是真实的,人眼很容易因为“整体看起来没问题”而忽略局部异常。

在现场展示的“AI较真大赛”中,用户需要从多张转账、退款或商品图片中找出真实内容。这类题目并不依赖明显破绽,而是考察图片是否存在局部编辑、字段替换或生成痕迹。

在“电商仅退款”关卡中,我根据衣服污渍和拍摄环境做出判断,但最终选择错误。系统将该图片判定为伪造,并给出91.90%的置信度。

这并不代表模型在所有情况下都优于人类,但能说明双方使用的判断信号不同。

人更依赖高层语义,例如场景是否合理、界面是否熟悉、事件是否符合生活经验;鉴伪模型还会分析更底层的信息,包括局部纹理连续性、噪声分布、压缩残差、边缘融合和光影一致性。

例如,一张真实截图中的金额区域经过局部重绘后,内容语义可能完全合理,但该区域的噪声和压缩特征可能与周围区域不同。人眼关注的是“1000元是否合理”,模型关注的则可能是“这几个数字是否来自同一条成像和编码链路”。

这也是现代鉴伪从“找明显错误”走向“检测统计异常”的关键变化。这种变化在真实业务中非常关键。以电商退款为例,如果平台无法识别经过局部修改的商品破损图,可能会把伪造材料当成真实凭证,影响商家责任认定;在金融和保险场景中,被修改的转账截图、事故照片或理赔材料,则可能直接干扰审核结果。对于内容平台而言,一段经过换脸或剪辑的视频还可能被用于虚假宣传、身份冒用和舆情操纵。

因此,鉴伪系统的作用并不是简单给内容贴上真假的标签,而是在人工审核之前筛出高风险样本,提示可能被修改的区域和异常类型。它更像一道前置风控环节,判断越准确,后续的决策就越可靠。

三、实测“扫描全能王AI鉴伪"

前面的AI较真大赛更多展示了人眼面对局部伪造时的判断局限,接下来则通过扫描全能王AI鉴伪小程序,进一步观察这套能力在实际检测中的使用方式和结果呈现:

扫描全能王AI鉴伪小程序提供图片、视频和文本三个检测入口。图片支持JPG、PNG等常见格式,视频支持MP4、MOV,文本可以直接输入,也支持上传PDF文档。

这次我重点测试了图片鉴伪,上传的是一张由ChatGPT生成的“狼、羊、白菜过河”信息图。图片中不仅包含卡通人物和场景,还包括中文文字、箭头、步骤说明和逻辑关系,相比单一人像,内容结构更复杂。

检测过程中,小程序依次完成内容来源分析、AI生成分析和篡改检测,最终给出:检测到AI生成痕迹,AI可能性100%,检测耗时2.43秒。

这张图没有典型的手部畸形或人脸错误,主要由插画、文字和排版构成。系统仍然能够识别出AI生成痕迹,说明判断并不只是依赖某一个显眼缺陷,而是对整幅图像的多类特征进行联合分析。

报告中还区分了两类任务:

  • AI生成检测:判断图像是否由生成模型创建或编辑;

  • 图片篡改检测:判断图像是否经过PS、局部涂改、模板贴图等人工修改。

两者并不等价。一张图可能全部由AI生成,也可能是真实照片经过AI局部重绘,还可能只修改了金额、时间或人物区域。因此,实际系统通常需要同时处理“全局生成”和“局部篡改”。

从技术流程看,图片鉴伪通常不会只输出一次普通分类结果,而是先提取多层特征,再完成融合判断:

单个样本当然不能代表模型的整体准确率。更严格的测试还需要覆盖真实照片、AI局部编辑图、传统PS合成图,以及截图、压缩和缩放后的样本。但这次体验至少说明,复杂的鉴伪流程已经被封装成普通用户可直接使用的产品能力。

随后,我又上传了一段AI生成的人像视频进行测试:

从视频中看人物面部非常自然,肉眼很难分辨真假,但视频检测不能只看某一帧,还要结合前后画面,判断人物轮廓、表情、光影和背景细节在连续变化中是否稳定。也就是说,单帧看起来真实,并不代表整段视频都没有异常。

当然,这只是一次体验,不能据此判断系统在不同生成模型、清晰度和压缩条件下的整体表现。不过,图片和视频两个测试放在一起,也能看出跨模态鉴伪的差异:图片主要判断一张画面是否存在生成或修改痕迹,视频则还要进一步分析时间维度上的连续性。这也引出了下面要讨论的问题,不同模态的数据结构不同,鉴伪时依赖的证据和检测方法也并不一样。

四、跨模态鉴伪难点

真正的跨模态鉴伪,不是简单增加图片、视频和文本上传入口,而是针对不同信息介质建立不同的检测路径。

图片主要是二维空间信号,视频多了一条时间轴,文本则由离散Token和语义关系组成。三者的数据结构不同,可用的证据也不同。

图片、视频和文本分别提取语义、频域、噪声、时序和逻辑特征,再通过多模态证据融合输出真实性概率、伪造类型、可疑区域及人工复核建议。从流程上看,三类模态并不是先后串行处理,而是分别进入对应的特征提取分支。图片侧更关注语义异常、频域伪影、噪声残差和局部编辑痕迹;视频侧增加帧间一致性、运动轨迹和时空频域分析;文本侧则侧重语义连贯性、句法结构、表达概率和逻辑表征。不同证据完成对齐和加权后,系统再给出统一判断。

1.图片:语义之外,还要看频域和噪声

图片鉴伪通常会同时关注高层语义和底层成像特征。

高层语义包括人体结构、透视、文字排版和光影关系;底层特征则包括频率分布、噪声残差、压缩痕迹和局部纹理异常。

频域可以理解为换一个角度观察图像。空间域关注“某个像素是什么颜色”,频域关注“图像中不同尺度的变化如何分布”。生成模型中的上采样、去噪和重建过程,可能在高频区域留下不同于真实相机的统计特征。

噪声残差则更接近成像来源。真实照片通常经历镜头、传感器、ISP处理和压缩编码;AI图片由神经网络直接合成,两者的噪声形成机制不同。如果一张真实图只有局部经过重绘,该区域的噪声和压缩纹理也可能与背景不连续。

公开研究AIDE采用多专家思路,同时分析视觉伪影和噪声模式,避免把判断完全建立在画面内容是否自然上。FakeShield则进一步尝试把真假判断、篡改区域定位和解释结合起来。

2.视频:单帧真实,不代表整段真实

很多生成视频在单帧上已经足够自然,人物面部、服装和背景都可能看不出明显问题。但连续播放后,一些细微异常才会暴露出来,例如人物耳朵和脸部轮廓轻微变化、首饰忽隐忽现、头发边缘抖动、背景文字发生漂移,或者口型与声音节奏无法完全对应。

这意味着视频检测至少需要同时观察两个维度:

  • 空间维度:单帧中的面部结构、纹理、光影和生成痕迹;

  • 时间维度:前后帧之间的身份、动作、细节和光照是否连续。

从实际场景看,一段视频可能并不是全部由AI生成,而是只替换了人物面部、修改了其中几秒,或者将一段伪造画面插入真实视频。此时,仅检测少量关键帧可能会漏掉异常,系统还需要判断问题出现在哪个时间区间。

例如在身份核验、视频客服和远程面签场景中,如果换脸区域只在人物转头或说话时出现异常,单独截取正面静止画面可能很难发现。可以把它理解为两条检测线并行工作,一条看每一帧是否存在生成或篡改痕迹,另一条看连续帧之间的变化是否自然。只有把空间信息和时间信息结合起来,才能覆盖更复杂的Deepfake和局部视频篡改。

3.文本:不能只靠词频和句长

文本鉴伪同样已经不能停留在表层统计。

早期方法常看词频、句长、标点数量和困惑度,但这些特征很容易受到人工修改的影响。一段大模型生成文本经过删减或语序调整后,原有的统计特征就可能发生明显变化。因此,只凭句子是否工整、表达是否流畅判断AI文本,可靠性并不高。

更深入的检测通常会从多个层面分析文本:

  • 词汇层:用词分布、重复表达和词语选择概率;

  • 句法层:句式结构、语法模式和句子之间的连接方式;

  • 语义层:信息是否持续推进,论点与证据是否匹配;

  • 篇章层:段落结构、逻辑关系和长距离上下文是否自然;

  • 来源层:文本是否存在特定模型或生成方式留下的统计特征。

大模型生成文本往往结构完整、表达平稳,但部分内容可能存在信息密度过于均匀、段落展开方式相似或者表述正确但缺乏具体来源等问题。检测模型需要综合分析这些高维特征,而不是简单判断文章写得像不像。

文本鉴伪在实际应用中还面临一个难点,同一篇文章可能同时包含人工撰写、AI生成和人工改写的内容。因此,系统除了输出整篇文本的生成概率,还需要进一步识别可疑段落,区分完全生成和局部续写等不同情况。

合合信息AI跨模态体系已经覆盖图片、视频和文本,并针对不同介质建立差异化检测路径。虽然三类任务最终都在判断内容真假,但底层使用的证据并不相同。

五、去反光不是修图,而是分离叠加在一起的两个图层

与AI鉴伪相比,WAIC现场展示的AI去反光解决的是图像采集质量问题。

现场演示采用大尺寸屏幕展示处理画面,参观者可以直接观察玻璃反射被削弱前后的差异。隔着玻璃拍摄时,相机同时接收到两部分信息:

  • 玻璃后方目标的透射内容,可记为T;

  • 玻璃表面环境的反射内容,可记为R。

最终拍到的图像,可以近似理解为T与R的叠加:

但真实情况更加复杂,反射强度会随角度、玻璃材质、覆膜、曝光和环境光发生变化,不能通过简单降低亮度解决。

从对比图可以看到,左侧存在多条灯带反射,部分反光横跨人物头饰、面部、服饰和背景。算法不仅要识别R,还要避免破坏T中原本存在的浅色衣纹、仙鹤羽毛和人物轮廓。

这类任务主要有三个难点。

第一,反射和原图的边缘可能重叠。灯带穿过人物衣服时,模型不能简单删除整条高亮区域,否则会把真实纹理一起抹掉。

第二,真实高光和玻璃反光很难区分。丝绸、金属、白纸和颜料本身就可能存在亮部,模型需要判断高亮来自物体材质,还是来自玻璃表面的环境反射。

第三,强反光可能已经造成像素饱和。此时原始信息并不是被半透明遮挡,而是部分丢失。模型需要控制恢复范围,避免根据语义凭空生成不存在的线条和细节。

右侧处理结果中,灯带和环境倒影被明显削弱,同时保留了人物服饰、仙鹤羽毛和画面原有色调。真正值得关注的不是画面“更干净”,而是处理后没有出现明显涂抹、过度锐化或生成式重绘感。

因此,扫描全能王强调的是“高保真还原”,核心是去除反射的同时约束结构、纹理和颜色变化,而不是重新生成一张视觉上更漂亮的图片。

**合合信息团队获得了CVPR 2026 NTIRE“自然场景下的单图像去反射”赛道冠军。**该挑战更关注真实环境中的复杂反射,而不是只在人工合成数据上测试,这对玻璃展柜、橱窗、白板和证件等场景更有参考意义。

六、从个人工具到企业风控,价值在完整数据链路

AI鉴伪和去反光并不是两个孤立功能,它们分别位于可信数据链路的不同位置。

在金融、电商和保险场景中,AI鉴伪可以用于转账截图、退款材料、商品图片和理赔照片的前置筛查。系统不一定直接做最终裁决,而是先给出真实性概率和可疑区域,再将高风险样本交给人工复核。

比较合理的业务流程是:

这样可以避免只依赖人工抽样,也能减少单一模型误判直接影响业务结果。在内容平台中,跨模态鉴伪可以统一处理图片、短视频和文本。不同检测引擎输出的结果还可以与账号行为、发布时间、来源信息结合,形成更完整的风险评分。去反光则更适合放在OCR和文档解析之前。塑封证件、会议白板、玻璃展柜和相框照片都容易受到炫光影响。如果直接识别,可能出现字符缺失、数字误判和笔画断裂。先完成反光抑制,再做透视校正、图像增强和文字识别,能提高后续处理质量。

合合信息AIGC鉴伪技术已经应用于金融、保险和电商等场景,图文鉴伪可实现日均数十万条内容核验;扫描全能王“智能高清·去反光”则覆盖玻璃、白板、证件和自然拍摄等场景。未来AI能力的竞争,不会只发生在模型参数、生成效果和推理速度上,也会发生在数据进入模型之前。谁能更准确地识别虚假内容、更完整地恢复真实信息,谁就能为后续的大模型、Agent和业务系统提供更可靠的起点。从这个角度看,AI鉴伪负责守住信息真实性,去反光负责守住信息完整性。它们共同构成的,不只是一个检测工具或图像增强功能,而是一层面向真实业务的“可信输入基础设施”。

当AI越来越多地参与审核、风控、知识生产和业务决策时,真正重要的已经不只是它能否给出答案,而是这个答案是否建立在真实、完整、可追溯的信息之上。只有先让AI看见真实世界,AI才有可能对真实世界负责。

相关资讯
点击查看更多
游戏推荐
推荐专题
热门阅读
推荐下载