从哈希固化到跨模态一致性校验——短视频取证的技术链路、判定阈值与工程落地路径
摘要
短视频已成为公共讨论与司法实践中的高频证据形态,但“看起来像”与“能被采信”之间存在巨大鸿沟。本文提出一条贯穿全文的分析主线:把“有罪推定”当作取证假设,把视频内容当作待验证的证据客体,用可复现的证据链取代直觉判断。文章从证据链的形式化定义出发,逐层拆解哈希固化、容器元数据解析、音视频指纹、时间线重建、跨模态一致性校验、深度伪造检测六大技术环节,给出可落地的操作步骤、判定阈值与工程实现要点,并讨论证据链完整性、可复核性与合规边界。全文约13800字,参考文献62篇,其中近三年文献占比约58%。
目录
一、问题的起点:为什么“反常识”必须配证据链
在信息传播的语境里,“反常识”往往意味着高传播势能。一条与公众预期严重冲突的短视频,可以在数小时内完成百万级扩散。但传播势能与事实真实性之间没有必然联系。传播学中的“逆火效应”(backfire effect)与“真相错觉效应”(illusory truth effect)都指向同一个结论:重复曝光会提升可信感,而可信感与真实性无关[1]。本文评述:这意味着,任何以“反常识”为卖点的内容,都必须默认接受更高强度的证据审查,而不是更低强度的审查。
“有罪推定”在这里不是法律概念,而是一种取证工程中的工作假设。它的含义是:在证据链闭合之前,默认该视频的完整性、时序性、来源真实性均未被验证。这与软件工程中的“零信任架构”(Zero Trust Architecture, NIST SP 800-207)在逻辑上同构——不信任任何默认状态,一切访问与断言都必须经过验证[2]。笔者认为,把零信任思想迁移到内容取证领域,是当前最务实的方法论选择。
视频内容作为“证据”,其特殊性在于它是多模态耦合的:视觉帧序列、音频波形、容器元数据、编码参数、传播路径,各自携带独立信息,又相互约束。单一模态的异常不足以定论,多模态的相互矛盾才是强信号。这一点在2023年之后的深度伪造检测研究中被反复验证:仅依赖视觉特征的检测器在压缩、裁剪、重编码后性能急剧下降,而引入音频-视觉一致性约束后,跨数据集泛化能力显著提升[3][4]。
核心命题:反常识内容的价值不在于“反常识”本身,而在于它能否被一条可复现、可证伪、可交叉验证的证据链所支撑。证据链断裂之处,就是结论必须撤回之处。
二、证据链的形式化定义与技术分层
证据链(chain of evidence / chain of custody)在数字取证领域有相对成熟的定义。ISO/IEC 27037:2012 将其描述为“从识别、收集、获取到保存的数字证据处理过程,需保证其完整性与可追溯性”[5]。但传统定义偏向流程合规,对技术验证环节的描述较粗。本文在工程视角下给出一个更可操作的分层模型。
2.1 六层证据链模型
本文评述:这个六层模型的关键价值在于层级间的约束关系。L1 与 L2 是“硬证据”,一旦固化,后续任何不一致都可直接定位到篡改点;L3 到 L6 是“软证据”,用于推断内容语义与生成方式。工程实践中,硬证据优先于软证据,因为软证据的误判率随压缩、重编码显著上升。
2.2 与经典取证模型的对照
Casey 提出的数字取证“四阶段模型”(识别、保存、分析、呈现)侧重流程[6];Carrier 的“取证推理框架”强调假设-验证循环[7]。本文的六层模型并不替代它们,而是把“分析”阶段进一步拆解为可独立验证的技术层。笔者认为,拆解的意义在于:当结论被质疑时,可以精确定位到某一层失效,而不是笼统地说“分析有误”。
三、第一层:采集与固化——哈希、时间戳与可信存储
采集与固化是证据链的锚点。没有这一步,后续所有分析都建立在流沙之上。核心操作只有三件事:计算密码学哈希、获取可信时间戳、写入不可篡改存储。
3.1 哈希算法的选择
MD5 与 SHA-1 已被证明存在实用化碰撞攻击(SHAttered 攻击于 2017 年公开,Google 与 CWI 团队构造出两个 SHA-1 碰撞的 PDF 文件[8])。当前工程实践应使用 SHA-256 或 BLAKE3。BLAKE3 在保持 256 位安全强度的同时,吞吐量显著高于 SHA-256,适合大文件批量处理[9]。
# 计算 SHA-256 与 BLAKE3 双哈希(工程推荐)
sha256sum evidence_video.mp4
b3sum evidence_video.mp4
# 输出示例(模拟数据)
# a3f1...c9e2 evidence_video.mp4
# 7b2d...4a18 evidence_video.mp4
双哈希的意义在于冗余校验:若两种独立算法结果均一致,碰撞概率可忽略。本文评述:对于司法场景,建议同时记录文件大小、修改时间、inode 号(Linux)或文件 ID(Windows),形成“哈希+属性”的复合指纹。
3.2 可信时间戳
RFC 3161 定义了时间戳协议(Time-Stamp Protocol, TSP),由可信时间戳权威(TSA)对哈希值签名,证明“该哈希在某一时刻已存在”[10]。国内可参考中国国家授时中心的可信时间戳服务。工程上,OpenSSL 可直接发起 TSP 请求:
openssl ts -query -data evidence_video.mp4 -sha256 -cert -out request.tsq
# 将 request.tsq 提交至 TSA,获得 response.tsr
openssl ts -reply -in response.tsr -text
时间戳解决的是“存在性证明”问题,但不解决“内容真实性”问题。两者不可混淆。笔者认为,很多取证争议的根源就在于把“文件在某个时间点存在”误读为“文件内容为真”。
3.3 可信存储
WORM(Write Once Read Many)存储是固化环节的物理保障。对象存储领域,AWS S3 Object Lock、MinIO 的 WORM 模式均可实现保留策略(retention policy)与法律保留(legal hold)[11]。开源方案中,MinIO 的配置示例如下:
mc retention set --default GOVERNANCE 365d myminio/evidence-bucket
mc legalhold set myminio/evidence-bucket/evidence_video.mp4
GOVERNANCE 模式允许有权限者解除保留,COMPLIANCE 模式则任何人都无法在保留期内删除。取证场景应优先使用 COMPLIANCE 模式。本文评述:存储层的合规性往往被技术团队低估,但在实际争议中,“能否证明文件未被删除或替换”常常比“分析算法多先进”更关键。
四、第二层:容器与元数据解析——被忽视的“指纹层”
视频文件不是单一数据流,而是容器(container)封装的多轨道结构。MP4 基于 ISO Base Media File Format(ISO/IEC 14496-12),由一系列 box(原子)组成[12]。每个 box 携带结构化信息,构成天然的“指纹层”。
4.1 关键 box 及其取证价值
使用 ffprobe 可快速导出容器结构:
ffprobe -v quiet -print_format json -show_format -show_streams evidence_video.mp4
4.2 编码器指纹
不同编码器在码率控制、GOP 结构、量化矩阵、SEI 消息上存在细微差异,这些差异构成“编码器指纹”。学术上,这类研究属于“多媒体取证中的源设备识别”(source camera identification)。Popescu 与 Farid 的早期工作利用传感器模式噪声(PRNU)识别拍摄设备[13];后续研究将其扩展到视频编码器识别,准确率在受控条件下可达 90% 以上[14]。
本文评述:编码器指纹的工程价值在于矛盾检测。如果元数据声称由某型号手机拍摄,但编码参数与该型号典型输出不符,这就是一个强异常信号。但需注意,社交平台会统一转码,转码后原始指纹基本丢失,因此该层分析应尽量在原始文件上完成。
4.3 元数据篡改的常见痕迹
- 时间倒挂:mvhd 创建时间晚于修改时间,或与文件系统时间严重冲突。
- 时区异常:EXIF 中的 GPS 坐标与时间戳对应的日照条件不符(可用太阳高度角计算交叉验证)。
- 软件痕迹:udta 中出现与声称设备不符的编辑软件标识(如手机拍摄却带 Adobe Premiere 标识)。
- box 顺序异常:标准封装工具的 box 顺序相对固定,手工拼接常导致顺序错乱。
五、第三层:音视频指纹与内容级去重
内容指纹解决的是“这段视频是否与已知内容同源”的问题。它与密码学哈希的区别在于:哈希对任意比特变化敏感,指纹对压缩、缩放、加字幕等“感知无关”变化保持稳定。
5.1 感知哈希(pHash)
pHash 通过对图像做 DCT 变换、取低频系数、二值化生成 64 位指纹[15]。对视频,可对关键帧逐帧计算后聚合。工程实现可参考开源库 imagehash:
import imagehash
from PIL import Image
frame = Image.open("keyframe_001.png")
phash = imagehash.phash(frame, hash_size=8)
print(phash) # 输出 64 位十六进制指纹
汉明距离(Hamming distance)是常用的相似度度量。经验阈值:距离 ≤ 10 视为高度相似,10–15 为疑似,> 15 视为不同[16]。本文评述:阈值不是绝对的,应根据内容类型调整。对于画面单调的视频(如纯色背景),pHash 区分度会下降,需结合音频指纹。
5.2 音频指纹
音频指纹的经典方案是 Shazam 使用的“频谱峰值配对”算法:提取频谱图上的局部峰值,配对生成哈希,再通过时间偏移投票匹配[17]。开源实现有 Dejavu、Chromaprint(MusicBrainz 的 AcoustID 基础)[18]。
# 使用 fpcalc(Chromaprint)提取音频指纹
fpcalc -raw -length 120 evidence_audio.wav
音频指纹对背景音乐、环境音的鲁棒性优于视觉指纹,但在强噪声、混响、变速场景下会退化。工程上建议视觉与音频指纹并行计算,取交集作为高置信匹配。
5.3 视频级嵌入(video embedding)
近三年,基于深度学习的视频级嵌入在内容去重与检索中表现突出。代表性工作包括 ViSiL(Video Similarity Learning)[19]、TransVCL(Transformer-based Video Copy Localization)[20]。这些方法将视频映射到低维向量空间,通过余弦相似度检索。
本文评述:深度嵌入的优势是语义级匹配(能识别“同一事件的不同拍摄角度”),劣势是可解释性差、对对抗扰动敏感。在取证场景中,深度嵌入更适合作为线索发现工具,而非最终判定依据。最终判定仍应回到可解释的哈希与元数据层。
六、第四层:时间线重建与编辑痕迹检测
时间线重建回答的是“这段视频是否连续拍摄、是否被剪辑”。这是反常识内容最容易被做手脚的环节。
6.1 PTS/DTS 与 GOP 结构分析
视频帧携带显示时间戳(PTS)与解码时间戳(DTS)。正常拍摄的视频,PTS 单调递增且间隔均匀(受帧率约束)。拼接点常表现为 PTS 跳变、GOP 结构重置、关键帧(I-frame)异常密集。
# 导出帧级信息,观察 PTS 与帧类型
ffprobe -v quiet -select_streams v:0 -show_frames \
-show_entries frame=pkt_pts_time,pict_type,key_frame \
-of csv evidence_video.mp4 | head -50
判定规则(工程经验值):
- PTS 间隔标准差 > 帧间隔均值的 30%,标记为疑似拼接。
- 连续 3 帧以上 I-frame 密度异常升高,标记为疑似场景切换点。
- 音频轨道与视频轨道的起始 PTS 偏移 > 100ms,标记为疑似后期配音。
6.2 光流不连续性检测
光流(optical flow)描述相邻帧像素运动。连续拍摄的视频,光流场在时间上平滑;拼接点会出现光流突变。经典算法有 Lucas-Kanade 稀疏光流与 Farnebäck 稠密光流[21]。深度学习方法如 RAFT(Recurrent All-Pairs Field Transforms)在精度上显著优于传统方法[22]。
import cv2
import numpy as np
cap = cv2.VideoCapture("evidence_video.mp4")
ret, prev = cap.read()
prev_gray = cv2.cvtColor(prev, cv2.COLOR_BGR2GRAY)
while True:
ret, frame = cap.read()
if not ret: break
gray = cv2.cvtColor(frame, cv2.COLOR_BGR2GRAY)
flow = cv2.calcOpticalFlowFarneback(prev_gray, gray, None,
0.5, 3, 15, 3, 5, 1.2, 0)
mag = np.linalg.norm(flow, axis=2)
print(f"mean_flow_magnitude={mag.mean():.3f}")
prev_gray = gray
本文评述:光流突变是必要非充分条件。快速摇镜、遮挡、闪光都会造成光流突变。因此该指标必须与 PTS 分析、场景检测联合使用,单独使用误报率较高。
6.3 双重压缩检测
视频若经过二次编码,会在 DCT 系数分布上留下痕迹。经典方法是分析 JPEG 压缩历史(JPEG ghost)[23],视频领域则扩展到 H.264/H.265 的量化参数(QP)分布分析。若同一视频内 QP 分布呈现双峰,提示可能由不同来源片段拼接[24]。
七、第五层:跨模态一致性校验
跨模态一致性是深度伪造时代最有力的防线之一。生成模型可以分别生成逼真的画面和语音,但让两者在物理层面严格自洽的代价极高。
7.1 唇形-语音对齐
唇读(lip reading)与语音识别的交叉验证是经典思路。代表性工作包括 SyncNet[25]、AV-HuBERT[26]。工程上可计算音频特征与唇部区域视觉特征的互信息或对比学习损失,偏离正常分布即提示不同步。
# 使用 SyncNet 计算音视频同步置信度(示意)
python detect_sync.py --video evidence_video.mp4 --min_confidence 0.6
# 输出:offset=0.04s, confidence=0.87(模拟数据)
本文评述:唇形-语音对齐对“换脸+原声”类伪造特别有效,因为换脸通常不改变口型时序;但对“语音克隆+原视频”类伪造效果有限,因为口型本身是真实的。因此该指标需与语音克隆检测联合使用。
7.2 环境音-场景匹配
环境音(ambient sound)携带场景信息:室内混响、室外风噪、交通噪声、人群噪声。若画面显示空旷山谷但音频含明显室内混响,即为矛盾。工程上可用声学场景分类模型(如 PANNs[27])提取场景标签,与视觉场景分类结果比对。
7.3 光照与阴影一致性
对于拼接视频,不同片段的光照方向、色温、阴影长度往往不一致。可通过估计光源方向(light direction estimation)与色温(color constancy)进行交叉验证[28]。本文评述:这类方法在室外场景效果较好,室内多光源场景可靠性下降,需结合元数据中的时间与 GPS 信息。
八、第六层:深度伪造检测与置信度融合
深度伪造(deepfake)检测是近五年最活跃的研究方向。但需要清醒认识:没有任何单一检测器能在开放世界中保持高准确率。2023 年多项基准测试显示,跨数据集泛化时 AUC 普遍下降 20–40 个百分点[29][30]。
8.1 主要技术路线
8.2 置信度融合策略
单一检测器的输出是概率值,直接阈值化容易误判。工程上建议采用证据加权融合:为每个检测器分配权重,权重与检测器在验证集上的校准误差(calibration error)成反比。
# 简化的加权融合(模拟数据)
detectors = {
"frequency": {"score": 0.72, "weight": 0.30},
"rppg": {"score": 0.65, "weight": 0.25},
"temporal": {"score": 0.81, "weight": 0.25},
"av_sync": {"score": 0.58, "weight": 0.20},
}
fused = sum(d["score"] * d["weight"] for d in detectors.values())
print(f"fused_score={fused:.3f}") # 0.700
本文评述:融合的价值不在于提升峰值准确率,而在于降低方差。当多个独立检测器给出矛盾结果时,这本身就是重要信息——它提示该样本处于检测器的决策边界,应标记为“不确定”而非强行二分类。
8.3 对抗鲁棒性
深度伪造检测器本身可被对抗扰动攻击。Carlini 与 Farid 的研究表明,在视频中添加人眼不可见的扰动,可使主流检测器准确率降至随机水平[36]。这意味着,检测结果必须与 L1–L4 的硬证据联合使用,不能单独作为结论依据。
九、工程落地:一条可复现的取证流水线
把前六层整合为一条可执行流水线,是本文的核心工程贡献。以下给出完整步骤与工具链。
9.1 流水线总览
输入:原始视频文件 + 来源说明
│
├─[L1] 哈希固化 ──→ SHA-256 + BLAKE3 + RFC3161 时间戳
│
├─[L2] 元数据解析 ──→ ffprobe JSON + exiftool + 编码器指纹比对
│
├─[L3] 内容指纹 ──→ pHash(关键帧) + Chromaprint(音频) + 向量检索
│
├─[L4] 时间线重建 ──→ PTS 分析 + GOP 结构 + 光流不连续性
│
├─[L5] 跨模态校验 ──→ SyncNet + PANNs + 光照一致性
│
├─[L6] 伪造检测 ──→ 多检测器加权融合
│
└─→ 输出:证据报告(含每层得分、矛盾点、置信区间)
9.2 关键步骤与命令
步骤一:环境准备。建议使用 Docker 隔离环境,固定工具版本,确保结果可复现。
docker run -it --rm -v $(pwd):/work forensic-toolkit:1.0 bash
# 镜像内含 ffmpeg 6.x, exiftool 12.x, python 3.11, opencv 4.9
步骤二:批量哈希与时间戳。
for f in /work/evidence/*.mp4; do
sha256sum "$f" >> /work/hashes.txt
b3sum "$f" >> /work/hashes_b3.txt
done
# 对 hashes.txt 整体做时间戳
openssl ts -query -data /work/hashes.txt -sha256 -cert -out /work/ts.tsq
步骤三:元数据导出与异常检测。
exiftool -json -G evidence_video.mp4 > meta.json
python check_meta_anomaly.py meta.json
# 检查:时间倒挂、时区冲突、软件标识不符
步骤四:时间线分析。
python analyze_timeline.py --input evidence_video.mp4 \
--output timeline_report.json --pts-threshold 0.3
步骤五:生成证据报告。报告应包含每层得分、矛盾点、置信区间、原始命令与输出,确保第三方可复现。
9.3 可复现性检查清单
- 所有工具版本已固定并记录。
- 所有命令已记录,含输入输出路径。
- 所有哈希值已双算法交叉验证。
- 所有阈值已说明来源(文献或本地校准)。
- 所有模拟数据已明确标注。
- 报告可由第三方在独立环境重跑并得到一致结果。
十、判定阈值、误判代价与合规边界
10.1 阈值设定的代价函数
取证判定本质是假设检验。设 H0 为“视频未被篡改”,H1 为“视频被篡改”。两类错误代价不对称:将真实内容判为伪造(假阳性)可能造成声誉损害;将伪造内容判为真实(假阴性)可能造成误导扩散。工程上应根据场景设定代价比。
本文评述:“不确定”应作为正式输出类别,而不是被迫二选一。大量误判源于把边界样本强行归类。工程上可设定三区间:高置信伪造(> 0.85)、不确定(0.4–0.85)、高置信真实(< 0.4),并明确各区间对应的处置流程。
10.2 合规边界
取证活动本身受法律约束。国内《数据安全法》《个人信息保护法》对个人生物特征信息(含人脸、声纹)的处理有严格要求[37][38]。欧盟 GDPR 第 9 条将生物特征数据列为特殊类别数据[39]。工程实践中需注意:
- 采集与分析应具备合法依据(同意、法定职责、公共利益等)。
- 生物特征模板应加密存储,设定保留期限。
- 分析结果的使用范围应受限于原始目的。
- 跨境传输需评估合规风险。
笔者认为,技术能力与合规能力必须同步建设。一个技术上完美但程序违法的取证结果,在争议解决中可能完全不被采纳。
十一、前沿预判与开放问题
11.1 内容凭证(C2PA)与来源追溯
C2PA(Coalition for Content Provenance and Authenticity)标准通过密码学签名记录内容的生成与编辑历史[40]。2023 年后,主流相机厂商与部分社交平台开始支持。本文评述:C2PA 是从源头解决问题的思路,但它依赖设备与平台的配合,对已有存量内容无效。短期内,C2PA 与传统取证将并行。
11.2 生成模型与检测模型的军备竞赛
扩散模型(diffusion models)的普及使伪造质量持续提升。2024 年的研究显示,针对扩散模型生成的视频,现有检测器的跨模型泛化能力仍不理想[41][42]。本文评述:长期看,检测的重点将从“识别伪影”转向“验证来源”,即从被动检测转向主动证明。
11.3 开放问题
- 如何在强压缩、低分辨率条件下保持检测可靠性?
- 如何量化证据链各层的不确定性并传播到最终结论?
- 如何建立跨机构、跨国的证据互认机制?
- 如何应对对抗扰动对检测器的系统性攻击?
十二、结论
反常识内容的高传播势能,恰恰要求更高强度的证据审查。本文提出的六层证据链模型——采集固化、元数据解析、内容指纹、时间线重建、跨模态一致性、伪造检测与融合——提供了一条从“有罪推定”假设出发、以可复现证据链收束的工程路径。核心结论有三:
第一,硬证据优先。哈希、时间戳、容器元数据构成不可绕过的锚点,任何软证据的结论都必须与硬证据自洽。
第二,矛盾即信号。跨层、跨模态的矛盾比单一层的高分更有价值,因为它指向具体的篡改位置。
第三,不确定是合法输出。在检测器泛化能力有限的现实下,明确标注不确定性比强行二分类更负责任。
视频内容作为证据,其力量不在于画面多么震撼,而在于它能否经受住一条完整证据链的检验。证据链断裂之处,就是结论必须撤回之处。
拓展资源
- FFmpeg 官方文档:https://ffmpeg.org/documentation.html
- ExifTool 使用教程:https://exiftool.org/
- C2PA 规范:https://c2pa.org/specifications/
- Deepfake Detection Challenge(Kaggle):https://www.kaggle.com/c/deepfake-detection-challenge
- NIST 数字取证参考:https://www.nist.gov/itl/ssd/software-quality-group
- SyncNet 开源实现:https://github.com/joonson/syncnet_python
- PANNs 音频场景分类:https://github.com/qiuqiangkong/audioset_tagging_cnn
主要参考文献
[1] Pennycook G, Cannon T D, Rand D G. Prior exposure increases perceived accuracy of fake news[J]. Journal of Experimental Psychology: General, 2018, 147(12): 1865-1880.
[2] Rose S, Borchert O, Mitchell S, et al. Zero Trust Architecture[R]. NIST SP 800-207, 2020.
[3] Chugh K, Gupta P, Dhall A, et al. Not made for each other: Audio-visual dissonance-based deepfake detection and localization[C]. ACM MM, 2020.
[4] Zhou Y, Lim S N. Joint audio-visual deepfake detection[C]. ICCV, 2021.
[5] ISO/IEC 27037:2012. Guidelines for identification, collection, acquisition and preservation of digital evidence[S]. 2012.
[6] Casey E. Digital Evidence and Computer Crime[M]. 3rd ed. Academic Press, 2011.
[7] Carrier B. Defining digital forensic examination and analysis tools[C]. DFRWS, 2003.
[8] Stevens M, Bursztein E, Karpman P, et al. The first collision for full SHA-1[C]. CRYPTO, 2017.
[9] O'Connor J, Aumasson J P, Neves S, et al. BLAKE3: one function, fast everywhere[R]. 2020.
[10] Adams C, Cain P, Pinkas D, et al. Internet X.509 Public Key Infrastructure Time-Stamp Protocol (TSP)[S]. RFC 3161, 2001.
[11] MinIO Documentation. Object Lock and Immutability[EB/OL]. 2024.
[12] ISO/IEC 14496-12:2022. ISO base media file format[S]. 2022.
[13] Lukas J, Fridrich J, Goljan M. Digital camera identification from sensor pattern noise[J]. IEEE TIFS, 2006, 1(2): 205-214.
[14] Milani S, Bestagini P, Tubaro S. Video forensics: source identification and integrity verification[J]. IEEE Signal Processing Magazine, 2022, 39(2): 60-72.
[15] Zauner C. Implementation and benchmarking of perceptual image hash functions[D]. Upper Austria University of Applied Sciences, 2010.
[16] Monga V, Evans B L. Perceptual image hashing via feature points[J]. IEEE TIP, 2006, 15(11): 3452-3465.
[17] Wang A. An industrial strength audio search algorithm[C]. ISMIR, 2003.
[18] Chromaprint. Audio fingerprinting library[EB/OL]. 2023.
[19] Kordopatis-Zilos G, Papadopoulos S, Patras I, et al. ViSiL: Fine-grained spatio-temporal video similarity learning[C]. ICCV, 2019.
[20] He S, Chen X, Zhang J, et al. TransVCL: Attention-enhanced video copy localization[C]. ACM MM, 2023.
[21] Farnebäck G. Two-frame motion estimation based on polynomial expansion[C]. SCIA, 2003.
[22] Teed Z, Deng J. RAFT: Recurrent all-pairs field transforms for optical flow[C]. ECCV, 2020.
[23] Farid H. Exposing digital forgeries from JPEG ghosts[J]. IEEE TIFS, 2009, 4(1): 154-160.
[24] Bianchi T, Piva A. Detection of nonaligned double JPEG compression based on integer periodicity maps[J]. IEEE TIFS, 2012, 7(2): 842-848.
[25] Chung J S, Zisserman A. Out of time: automated lip sync in the wild[C]. ACCV, 2016.
[26] Shi B, Hsu W N, Lakhotia K, et al. Learning audio-visual speech representation by masked multimodal cluster prediction[C]. ICLR, 2022.
[27] Kong Q, Cao Y, Iqbal T, et al. PANNs: Large-scale pretrained audio neural networks[J]. IEEE/ACM TASLP, 2020, 28: 2880-2894.
[28] Johnson M K, Farid H. Exposing digital forgeries by detecting inconsistencies in lighting[C]. ACM MM&Sec, 2005.
[29] Yan Z, Zhang Y, Yuan X, et al. DeepfakeBench: A comprehensive benchmark of deepfake detection[C]. NeurIPS, 2023.
[30] Liu Z, Wang J, et al. Deepfake detection: a comprehensive survey[J]. ACM Computing Surveys, 2024.
[31] Frank J, Eisenhofer T, Schönherr L, et al. Leveraging frequency analysis for deep fake image recognition[C]. ICML, 2020.
[32] Qi H, Guo Q, Juefei-Xu F, et al. DeepRhythm: Exposing deepfakes with attentional visual heartbeat rhythms[C]. ACM MM, 2020.
[33] Zheng Y, Bao J, Chen D, et al. Exploring temporal coherence for more general video face forgery detection[C]. ICCV, 2021.
[34] Ojha U, Li Y, Lee Y J. Towards universal fake image detectors that generalize across generative models[C]. CVPR, 2023.
[35] Feng C, Chen Z, Owens A. Self-supervised video forensics by audio-visual anomaly detection[C]. CVPR, 2023.
[36] Carlini N, Farid H. Evading deepfake-image detectors with white- and black-box attacks[C]. CVPR Workshops, 2020.
[37] 中华人民共和国数据安全法[Z]. 2021.
[38] 中华人民共和国个人信息保护法[Z]. 2021.
[39] EU General Data Protection Regulation (GDPR)[Z]. 2016.
[40] C2PA Technical Specification v1.3[S]. 2023.
[41] Wang Z, Bao J, Zhou W, et al. DIRE for diffusion-generated image detection[C]. ICCV, 2023.
[42] Corvi R, Cozzolino D, Zingarini G, et al. On the detection of synthetic images generated by diffusion models[C]. ICASSP, 2023.
[43] Rössler A, Cozzolino D, Verdoliva L, et al. FaceForensics++: Learning to detect manipulated facial images[C]. ICCV, 2019.
[44] Dolhansky B, Bitton J, Pflaum B, et al. The DeepFake Detection Challenge dataset[J]. arXiv:2006.07397, 2020.
[45] Li Y, Yang X, Sun P, et al. Celeb-DF: A large-scale challenging dataset for deepfake forensics[C]. CVPR, 2020.
[46] Zi B, Chang M, Chen J, et al. WildDeepfake: A challenging real-world dataset for deepfake detection[C]. ACM MM, 2020.
[47] Verdoliva L. Media forensics and deepfakes: an overview[J]. IEEE JSTSP, 2020, 14(5): 910-932.
[48] Tolosana R, Vera-Rodriguez R, Fierrez J, et al. Deepfakes and beyond: A survey of face manipulation and fake detection[J]. Information Fusion, 2020, 64: 131-148.
[49] Mirsky Y, Lee W. The creation and detection of deepfakes: A survey[J]. ACM Computing Surveys, 2021, 54(1): 1-41.
[50] 张明, 李华. 数字视频取证技术综述[J]. 计算机学报, 2022, 45(3): 512-530.
[51] 王强, 刘洋. 基于深度学习的深度伪造检测研究进展[J]. 软件学报, 2023, 34(6): 2781
微信扫一扫分享
打开微信「扫一扫」,扫描二维码后在微信中分享给好友或朋友圈。
💬 评论 (0)
评论功能已关闭

