视频动画技术

慢动作制作教程:补帧、光流法让画面丝滑不卡顿

👤 为我痴狂 👁 2 阅读 ❤ 0 点赞 ➦ 0 分享 📅 2026-09-28
首页› 视频动画› 视频动画技术› 正文
慢动作制作教程:补帧、光流法让画面丝滑不卡顿

从时间维度的信息重建出发,系统拆解补帧与光流法的物理基础、算法演进、工程实现与质量评估

摘要

慢动作视频的本质是时间维度的信息重建问题:当拍摄帧率低于播放所需帧率时,缺失的中间帧必须通过算法合成。本文以“时间维度的信息重建”为贯穿主线,从帧率与快门角度的物理约束出发,系统剖析补帧(Frame Interpolation)与光流法(Optical Flow)的技术原理、算法演进与工程实践。文章覆盖从Lucas-Kanade、Horn-Schunck经典方法到FlowNet、RAFT、RIFE等深度学习模型的完整脉络,深入讨论遮挡处理、大位移估计、时序一致性等核心难题,并给出可落地的工程流程、调参策略与质量评估体系。本文评述认为,补帧技术的未来不在于单一模型的精度提升,而在于“物理先验+数据驱动+硬件协同”的三元融合。

一、慢动作的物理本质:帧率、快门与时间采样

1.1 帧率与时间采样定理

视频本质上是对连续光信号在时间维度上的离散采样。根据奈奎斯特-香农采样定理(Nyquist-Shannon Sampling Theorem),若要从离散样本中无失真地重建连续信号,采样频率必须不低于信号最高频率分量的两倍[1]。将这一原理映射到视频领域:拍摄帧率即为时间采样频率,而画面中运动物体的速度决定了信号的时间频率。

以24fps拍摄的素材为例,其时间采样间隔约为41.7ms。当画面中存在快速运动物体(如飞鸟、赛车、运动员挥拍)时,相邻帧之间的位移可能达到数十甚至上百像素,远超采样定理的约束条件。此时直接慢放会导致严重的运动断续感——这就是所谓的“卡顿”现象。

本文评述:采样定理给出了理论边界,但视频信号的特殊性在于——人眼视觉系统(HVS)对运动断续的敏感度并非均匀分布。笔者注意到,当运动速度低于约2°/s视角速度时,人眼几乎无法察觉帧间跳跃;而当速度超过10°/s时,即使将帧率提升至60fps,部分敏感观察者仍能感知到运动模糊与频闪。这意味着补帧的目标不应是“无限逼近连续信号”,而是“在感知阈值内实现视觉平滑”。

1.2 快门角度与运动模糊

快门角度(Shutter Angle)源自胶片摄影机的旋转快门设计。180°快门角度意味着快门开放时间恰好为帧间隔的一半,即1/48秒(24fps下)。这一设定产生的运动模糊量被广泛认为最接近人眼感知[2]。

快门角度与运动模糊的关系可用下式表达:

运动模糊长度(像素) = 物体角速度 × 快门时间 × 焦距 / 像素尺寸

当快门角度过大(如360°),运动模糊严重,画面“糊”;当快门角度过小(如45°),运动模糊微弱,但画面会出现“频闪”感(Strobing)。对于慢动作制作而言,理想的拍摄策略是:以高帧率拍摄,同时保持180°快门角度,这样既获得了充足的时间采样,又保留了自然的运动模糊。

1.3 慢动作的三种实现路径

路径 原理 优点 局限
高帧率拍摄 直接以120/240fps拍摄 画质最佳,无算法伪影 需要专业设备,存储量大
光学慢放 高速摄影机+特殊光学系统 可达1000fps以上 设备昂贵,光线要求极高
算法补帧 通过插帧算法合成中间帧 成本低,适用性广 依赖算法质量,可能产生伪影

本文聚焦第三条路径——算法补帧。但需要强调的是,补帧不是万能的。当原始素材的帧间位移超过算法可估计范围时,任何补帧方法都会失效。因此,工程实践中应优先保证拍摄端的质量:在条件允许时尽可能提高拍摄帧率,补帧仅作为“从现有素材中榨取更多时间分辨率”的手段。

二、补帧技术的分类体系与核心挑战

2.1 补帧技术的分类

补帧技术可从多个维度进行分类。按运动估计方式,可分为基于光流的方法、基于相位的方法、基于块匹配的方法和基于深度学习的方法;按帧合成策略,可分为基于扭曲(Warping)的方法、基于核回归的方法和基于生成模型的方法[3]。

当前主流的技术路线是“光流估计+双向扭曲+遮挡补偿”的三段式框架。这一框架的核心思想是:先估计相邻两帧之间的像素级运动矢量(光流),再根据时间插值系数t(0<t<1)将两帧分别向中间时刻扭曲,最后通过遮挡掩膜或融合权重合成中间帧。

2.2 核心挑战

补帧面临的核心挑战可归纳为以下五类:

  1. 遮挡问题:当物体A运动到物体B前方时,B被遮挡的区域在下一帧中重新出现,但该区域在两帧之间没有对应像素,光流无法估计。
  2. 大位移问题:快速运动导致帧间位移超过光流算法的搜索范围,传统变分方法依赖局部线性化假设,在大位移下失效。
  3. 光照变化:亮度恒常性假设在光照变化场景下不成立,导致光流估计错误。
  4. 运动边界:物体边缘处光流不连续,简单的平滑约束会导致边界模糊。
  5. 时序一致性:逐对插帧可能导致帧间闪烁(Flickering),需要全局时序约束。

笔者认为:这五类挑战并非孤立存在,而是相互耦合的。例如,大位移往往伴随遮挡,光照变化会加剧运动边界的估计误差。因此,任何单一策略都难以全面解决补帧问题。近年来学术界出现的“联合优化”趋势——将光流估计、遮挡检测、帧合成纳入统一的可微框架——正是对这一耦合性的回应。

三、光流法基础:从亮度恒常性到变分优化

3.1 光流的定义与物理意义

光流(Optical Flow)是空间运动物体在成像平面上的像素运动的瞬时速度[4]。它由两个分量组成:水平方向速度u和垂直方向速度v,构成二维运动场(u, v)。

需要区分两个概念:光流场(Optical Flow Field)是图像平面上像素运动的二维矢量场;运动场(Motion Field)是三维空间中物体运动在成像平面上的投影。两者在大多数情况下近似相等,但在无纹理区域、镜面反射、透明物体等场景下存在差异。

3.2 亮度恒常性假设

光流计算的基础是亮度恒常性假设(Brightness Constancy Assumption):同一物体点在运动过程中,其亮度保持不变。数学表达为:

I(x, y, t) = I(x+dx, y+dy, t+dt)

对等式右侧进行一阶泰勒展开,可得光流约束方程(Optical Flow Constraint Equation):

Ix·u + Iy·v + It = 0

其中Ix、Iy、It分别为图像在x、y、t方向的偏导数。这个方程包含两个未知数(u, v),但只有一个约束——这就是光流计算中的“孔径问题”(Aperture Problem)[5]。

3.3 孔径问题与约束引入

孔径问题是指:通过一个小孔观察运动物体时,只能感知到垂直于边缘方向的运动分量,而平行于边缘的分量无法确定。这类似于“理发店旋转灯柱”的视觉错觉——我们能看到条纹在移动,但无法确定灯柱本身是否在旋转。

解决孔径问题的思路是引入额外约束。经典方法包括:

  • 全局平滑约束:假设光流场在空间上平滑变化(Horn-Schunck方法)
  • 局部邻域约束:假设一个小窗口内的光流一致(Lucas-Kanade方法)
  • 稀疏特征约束:仅在角点等特征点处计算光流

四、经典光流算法:Lucas-Kanade与Horn-Schunck

4.1 Lucas-Kanade方法

Lucas和Kanade于1981年提出的方法[6]基于一个关键假设:在一个小的空间邻域Ω内,光流矢量(u, v)保持恒定。对于邻域内的每个像素,都可以写出一个光流约束方程,从而得到一个超定方程组:

[Ix1  Iy1]       [-It1]
[Ix2  Iy2] [u]   [-It2]
[ ...  ...] [v] = [ ... ]
[Ixn  Iyn]       [-Itn]

通过最小二乘法求解,可得:

[u]   1     [ΣIx²   ΣIxIy]⁻¹ [-ΣIxIt]
[v] = det  [ΣIxIy  ΣIy² ]   [-ΣIyIt]

其中det为矩阵行列式。当det接近零时(即邻域内梯度方向单一),解不稳定——这正是孔径问题的数学表现。因此,Lucas-Kanade方法通常只在高纹理区域(角点、边缘交点)可靠工作。

为处理大位移,Lucas-Kanade通常采用金字塔分层策略:在粗尺度估计大位移,再逐层细化。这一思想至今仍是深度学习光流方法的基础架构之一。

本文评述:Lucas-Kanade方法的优雅之处在于将病态问题转化为超定问题。但笔者认为,其“局部恒定”假设在运动边界处过于理想化。实际场景中,一个5×5窗口内可能同时包含前景和背景运动,导致估计结果偏向两者之间的“折中值”。这一缺陷在深度学习时代通过可学习的代价体(Cost Volume)和注意力机制得到了部分缓解,但并未根本解决。

4.2 Horn-Schunck方法

Horn和Schunck于1981年提出了另一种经典方法[7],其核心思想是引入全局平滑约束。定义能量函数:

E = ∬ [(Ix·u + Iy·v + It)² + α²(|∇u|² + |∇v|²)] dxdy

第一项是数据项(Data Term),要求满足光流约束方程;第二项是平滑项(Smoothness Term),要求光流场空间平滑。α是正则化参数,控制两者的权衡。

通过变分法,可得到欧拉-拉格朗日方程,进而用迭代法求解。Horn-Schunck方法的优点是能产生稠密光流场,且在纹理稀疏区域也能给出合理估计;缺点是过度平滑会导致运动边界模糊。

4.3 经典方法的对比与局限

特性 Lucas-Kanade Horn-Schunck
光流密度 稀疏(仅特征点) 稠密(全图)
核心假设 局部邻域恒定 全局平滑
大位移处理 金字塔分层 需多尺度扩展
边界保持 较好 较差(过度平滑)
计算效率 高(局部运算) 低(全局迭代)

经典方法的共同局限在于:它们都基于亮度恒常性和一阶线性化假设,对光照变化、大位移、遮挡等场景鲁棒性不足。此外,参数α或窗口大小的选择高度依赖场景,缺乏自适应能力。这些局限催生了后续基于深度学习的方法。

五、深度学习光流估计:FlowNet到RAFT的演进

5.1 FlowNet:端到端光流估计的开端

2015年,Dosovitskiy等人提出了FlowNet[8],首次将卷积神经网络(CNN)应用于光流估计。FlowNet有两种架构:

  • FlowNetSimple:将两帧图像在通道维度拼接后输入网络,结构简单但参数量大
  • FlowNetCorr:先分别提取两帧特征,再通过相关层(Correlation Layer)计算特征匹配

FlowNet的核心贡献在于证明了CNN可以从数据中学习光流估计,无需手工设计特征。但其精度仍不及当时的最优变分方法,且需要大量合成数据训练(如FlyingChairs数据集)。

5.2 FlowNet2与PWC-Net:精度与效率的改进

FlowNet2[9]通过堆叠多个FlowNet模块并引入图像扭曲操作,显著提升了精度。其核心思想是“迭代细化”:第一级估计粗略光流,后续级基于扭曲后的图像估计残差光流。

PWC-Net[10](Pyramid, Warping, and Cost Volume)进一步将金字塔分层、图像扭曲和代价体三个经典思想融入CNN架构,以更少的参数实现了更高的精度。PWC-Net的设计理念深刻影响了后续方法。

5.3 RAFT:循环全对场变换

2020年,Teed和Deng提出了RAFT[11](Recurrent All-Pairs Field Transforms),成为光流估计领域的里程碑。RAFT的核心创新包括:

  1. 全对场变换:计算所有像素对之间的4D相关体,避免了局部窗口的限制
  2. 循环迭代更新:使用GRU(门控循环单元)迭代更新光流场,每次迭代都基于当前光流从相关体中查询匹配
  3. 高分辨率保持:在1/8分辨率上计算相关体,但通过上采样保持高分辨率光流

RAFT在KITTI和Sintel基准上大幅超越了此前方法,且具有更好的跨数据集泛化能力。其迭代更新架构也为后续视频插帧模型提供了重要启发。

本文评述:从FlowNet到RAFT的演进,本质上是从“单次前馈估计”到“迭代优化求解”的范式转变。笔者认为,这一转变的深层意义在于:光流估计本质上是一个优化问题,而深度学习模型正在学习“如何优化”而非“直接给出答案”。RAFT的GRU更新模块类似于传统变分方法中的迭代求解器,但更新规则是从数据中学习得到的。这种“学习优化器”的思想,与元学习(Meta-Learning)和展开优化(Unrolled Optimization)的研究方向高度一致。

5.4 光流估计的最新进展

2023-2025年间,光流估计领域出现了若干重要进展:

  • CamLiFlow[12]:将光流估计与相机运动解耦,提升了大范围运动场景的估计精度
  • FlowFormer[13]:引入Transformer架构,利用自注意力机制捕获长距离依赖
  • GMFlow[14]:将光流估计重新定义为全局匹配问题,通过矩阵乘法实现高效的全对匹配
  • DPFlow[15]:结合扩散模型(Diffusion Model)进行光流估计,在不确定区域给出多模态预测

这些方法的共同趋势是:更大的感受野、更强的全局推理能力、以及更好的不确定性建模。

六、视频插帧模型:从Super SloMo到RIFE与EMA-VFI

6.1 Super SloMo:高质量插帧的里程碑

2018年,Jiang等人提出了Super SloMo[16],首次将深度学习光流估计与高质量帧合成结合。其核心流程为:

  1. 使用FlowNet2估计双向光流(前向和后向)
  2. 通过光流反转(Flow Reversal)将双向光流统一到中间时刻
  3. 计算可见性掩膜(Visibility Map),处理遮挡区域
  4. 根据掩膜加权融合两帧的扭曲结果

Super SloMo的贡献在于系统性地解决了插帧中的遮挡问题,并提出了光流反转的可微实现。但其依赖FlowNet2作为光流估计器,推理速度较慢。

6.2 RIFE:实时插帧的突破

2020年,Huang等人提出了RIFE[17](Real-time Intermediate Flow Estimation),实现了实时视频插帧。RIFE的核心创新是IFNet(Intermediate Flow Network),它直接从两帧图像估计中间光流,而非先估计双向光流再反转。这一设计避免了光流反转的误差累积,同时大幅提升了速度。

RIFE的另一个重要贡献是提出了“特权蒸馏”(Privileged Distillation)训练策略:先用高质量但慢速的模型(如Super SloMo)生成伪标签,再训练轻量级IFNet。这一策略在保持精度的同时实现了实时推理。

RIFE经过多个版本迭代(RIFE-v2、v3、v4),在Vimeo-90K等基准上持续刷新性能。截至2024年,RIFE-v4.6在单张RTX 3090上可实现4K视频的实时插帧[18]。

6.3 EMA-VFI与最新进展

2023年,Zhang等人提出了EMA-VFI[19](Extracting Motion and Appearance via Inter-Frame Attention),通过帧间注意力机制同时提取运动信息和外观信息。其核心思想是:运动信息(光流)和外观信息(纹理、颜色)应被解耦处理,但通过注意力机制相互引导。

2024-2025年的其他重要进展包括:

  • VFIMamba[20]:引入状态空间模型(SSM),以线性复杂度实现长序列建模
  • AMT[21]:基于All-Pairs Correlation的插帧方法,在多个基准上取得最优性能
  • GIMM-VFI[22]:将插帧建模为生成式问题,使用扩散模型生成中间帧
  • MoTIF[23]:结合光流与事件相机数据,在极端运动场景下实现高质量插帧

6.4 插帧模型性能对比

模型 年份 核心方法 Vimeo-90K PSNR 推理速度
Super SloMo 2018 双向光流+掩膜 32.15 dB 慢
RIFE-v4.6 2022 IFNet+特权蒸馏 35.61 dB 实时
EMA-VFI 2023 帧间注意力 36.12 dB 近实时
AMT 2024 全对相关+Transformer 36.54 dB 中等
GIMM-VFI 2024 扩散模型 36.89 dB 慢

注:PSNR数据来源于各论文在Vimeo-90K-T测试集上的报告值,推理速度为相对比较(基于RTX 3090)。

笔者认为:从Super SloMo到GIMM-VFI,插帧模型的演进呈现出两条并行主线:一是“更准”(PSNR从32dB提升至37dB),二是“更快”(从离线处理到实时推理)。但这两条主线存在内在张力——扩散模型虽然精度最高,但推理速度远不及RIFE。工程实践中,选择哪个模型取决于具体场景:直播/游戏场景优先实时性(RIFE),影视后期优先画质(GIMM-VFI或AMT)。

七、遮挡、大位移与时序一致性:三大核心难题

7.1 遮挡处理

遮挡是插帧中最棘手的问题之一。当物体A从物体B前方经过时,B被遮挡的区域在中间时刻不可见,但插帧算法需要“想象”出该区域的内容。

主流处理方法包括:

  • 可见性掩膜:Super SloMo提出,通过前向-后向光流一致性检测遮挡区域,生成软掩膜加权融合
  • 不对称光流:RIFE的IFNet直接估计中间光流,天然处理遮挡
  • 生成式补全:GIMM-VFI使用扩散模型“生成”遮挡区域内容,而非简单复制

遮挡处理的评价指标通常使用“遮挡区域PSNR”或“遮挡掩膜IoU”。根据Super SloMo论文报告,在遮挡区域,其方法比简单双向扭曲的PSNR提升约2-3dB[16]。

7.2 大位移估计

大位移是指帧间运动超过光流算法搜索范围的情况。传统变分方法依赖局部线性化,当位移超过约5-10像素时失效。深度学习方法通过以下策略处理大位移:

  1. 金字塔分层:在低分辨率估计大位移,逐层细化(PWC-Net、RAFT)
  2. 全局匹配:计算全对相关体,不受局部窗口限制(RAFT、GMFlow)
  3. Transformer注意力:利用自注意力捕获长距离依赖(FlowFormer)

根据GMFlow论文报告,在Sintel Final基准上,GMFlow对位移超过50像素的区域,EPE(端点误差)比PWC-Net降低约35%[14]。

7.3 时序一致性

逐对插帧可能导致帧间闪烁(Flickering),表现为亮度或纹理的随机波动。时序一致性问题在长序列插帧中尤为突出。

解决方案包括:

  • 时序损失函数:在训练时加入帧间一致性损失(如光流平滑损失、感知损失)
  • 多帧联合优化:同时优化多个中间帧,而非逐对独立处理
  • 后处理滤波:对插帧结果进行时序滤波,抑制高频闪烁

2024年的一项研究[24]表明,在Vimeo-90K数据集上,加入时序一致性损失可使插帧序列的闪烁指标(Flicker Index)降低约40%,而PSNR仅下降0.1dB。

八、工程实践:完整补帧流程与调参策略

8.1 完整补帧流程

以下是一个可落地的工程化补帧流程,适用于从24fps素材生成120fps慢动作视频:

步骤1:素材预处理
  - 解码原始视频为PNG/TIFF序列(避免二次压缩)
  - 检查帧间位移:使用简单光流估计,标记大位移帧对
  - 若位移过大,考虑先进行降采样或分块处理

步骤2:光流估计
  - 选择光流模型:RAFT(高精度)或 GMFlow(高效率)
  - 对每对相邻帧估计双向光流
  - 保存光流为.flo格式(Middlebury标准)

步骤3:中间帧合成
  - 选择插帧模型:RIFE(实时)或 EMA-VFI(高质量)
  - 设置插帧倍数:24fps→120fps需要4倍插帧(每对帧插入3个中间帧)
  - 对每个时间步t=0.25, 0.5, 0.75分别合成

步骤4:遮挡处理
  - 计算前向-后向光流一致性
  - 生成可见性掩膜
  - 对遮挡区域使用生成式补全或邻域填充

步骤5:时序后处理
  - 对插帧序列进行时序滤波(如高斯滤波)
  - 检查闪烁指标,必要时调整滤波强度

步骤6:编码输出
  - 使用H.265/HEVC编码,CRF=18-22
  - 保持原始色彩空间和位深
  - 输出ProRes或DNxHR中间格式用于后期

8.2 关键参数调优

参数 推荐值 影响 调整建议
插帧倍数 2-4倍 倍数越高,伪影越明显 超过4倍建议分阶段插帧
光流模型 RAFT/EMA-VFI 精度vs速度 实时场景用RIFE
遮挡阈值 0.5-0.7 影响掩膜范围 运动剧烈时降低阈值
时序滤波强度 σ=0.5-1.0 抑制闪烁vs保留细节 闪烁明显时增大σ
编码CRF 18-22 画质vs文件大小 中间格式用CRF=18

8.3 常见问题与解决方案

问题1:插帧后出现“果冻效应”(Jello Effect)

原因:光流估计在运动边界处不连续,导致扭曲时像素拉伸。解决方案:使用更精细的光流模型(如RAFT),或在扭曲前对光流进行边缘保持滤波。

问题2:遮挡区域出现“鬼影”(Ghosting)

原因:遮挡区域的光流估计错误,导致两帧扭曲结果不一致。解决方案:加强遮挡检测,使用生成式模型补全遮挡区域,或降低插帧倍数。

问题3:整体画面“过平滑”(Over-smoothing)

原因:时序滤波强度过大,或光流平滑约束过强。解决方案:降低滤波强度,或使用边缘保持的平滑策略。

九、质量评估:客观指标与主观感知的张力

9.1 客观评价指标

插帧质量的客观评价主要使用以下指标:

  • PSNR(峰值信噪比):衡量像素级误差,但对结构失真不敏感
  • SSIM(结构相似性):衡量结构信息保持程度,更接近人眼感知
  • LPIPS(学习感知图像块相似度):基于深度特征的感知距离,与主观评分相关性更高
  • FID(弗雷歇初始距离):衡量生成帧与真实帧的分布距离
  • tOF(时序光流误差):衡量插帧序列的光流一致性

根据2024年的一项基准研究[25],在Vimeo-90K数据集上,各指标与主观MOS(平均意见分)的相关性排序为:LPIPS > SSIM > PSNR。这意味着PSNR虽然广泛使用,但并非最佳感知指标。

9.2 主观评价方法

主观评价通常采用以下方法:

  • 双刺激连续质量标度(DSCQS):同时呈现参考视频和测试视频,评分者打分
  • 单刺激连续质量评价(SSCQE):仅呈现测试视频,评分者连续打分
  • 成对比较(Paired Comparison):两两比较,生成偏好排序

主观评价的挑战在于:评分者间一致性(Inter-rater Reliability)通常较低,需要大量评分者才能获得稳定结果。根据ITU-R BT.500建议书[26],至少需要15名非专家评分者。

本文评述:客观指标与主观感知之间存在系统性偏差。笔者注意到,PSNR最高的模型不一定获得最佳主观评分——因为PSNR对大面积的轻微模糊不敏感,但对小面积的结构错误非常敏感,而人眼恰恰相反。这一偏差在生成式插帧模型(如GIMM-VFI)上尤为明显:这些模型可能生成“看起来合理但像素不准确”的内容,PSNR较低但主观质量较高。因此,工程实践中应结合多种指标,并以主观评价为最终标准。

十、前沿展望:物理先验、事件相机与实时部署

10.1 物理先验与数据驱动的融合

当前深度学习插帧方法主要依赖数据驱动,缺乏对物理规律的显式建模。未来的重要方向是将物理先验(如运动模糊模型、遮挡几何、光照模型)融入网络架构。例如,2024年的一项研究[27]将运动模糊的物理模型作为可微层嵌入插帧网络,在运动模糊场景下PSNR提升约1.5dB。

10.2 事件相机与神经形态视觉

事件相机(Event Camera)以微秒级时间分辨率异步记录亮度变化,天然适合高速运动场景。将事件相机数据与传统帧图像融合,可显著提升插帧质量。2024年的MoTIF[23]方法在极端运动场景下,结合事件数据使插帧PSNR提升约3dB。

笔者认为,事件相机与插帧的结合是“时间维度信息重建”这一主线的自然延伸:传统相机在时间维度上采样不足,事件相机提供了额外的时序信息,两者互补可突破单一模态的物理极限。

10.3 实时部署与硬件协同

实时插帧在直播、云游戏、VR/AR等场景有强烈需求。当前挑战包括:

  • 计算量:4K分辨率下,RAFT级光流估计需要约100 GFLOPs/帧对
  • 内存带宽:光流场和特征图的读写消耗大量带宽
  • 延迟:实时场景要求端到端延迟低于20ms

解决方案包括:模型量化(INT8/INT4)、知识蒸馏、专用硬件加速(NPU/FPGA)。2024年的一项研究[28]在移动端NPU上实现了1080p@60fps的实时插帧,功耗低于2W。

10.4 未来研究方向

  1. 统一框架:将光流估计、遮挡检测、帧合成、时序一致性纳入单一可微框架
  2. 多模态融合:结合RGB、深度、事件、LiDAR等多模态数据
  3. 自监督学习:减少对合成数据的依赖,利用真实视频自监督训练
  4. 可解释性:理解深度学习插帧模型的决策机制,提升可靠性
  5. 绿色AI:降低插帧模型的计算能耗,推动可持续发展

十一、参考文献与资料

[1] Shannon C E. Communication in the presence of noise[J]. Proceedings of the IRE, 1949, 37(1): 10-21.

[2] ASC. American Cinematographer Manual[M]. 10th ed. Hollywood: ASC Press, 2013.

[3] Bao W, Lai W S, Ma C, et al. Depth-aware video frame interpolation[C]//CVPR. 2019: 3703-3712.

[4] Horn B K P. Robot Vision[M]. Cambridge: MIT Press, 1986.

[5] Marr D, Ullman S. Directional selectivity and its use in early visual processing[J]. Proceedings of the Royal Society B, 1981, 211(1183): 151-180.

[6] Lucas B D, Kanade T. An iterative image registration technique with an application to stereo vision[C]//IJCAI. 1981: 674-679.

[7] Horn B K P, Schunck B G. Determining optical flow[J]. Artificial Intelligence, 1981, 17(1-3): 185-203.

[8] Dosovitskiy A, Fischer P, Ilg E, et al. FlowNet: Learning optical flow with convolutional networks[C]//ICCV. 2015: 2758-2766.

[9] Ilg E, Mayer N, Saikia T, et al. FlowNet 2.0: Evolution of optical flow estimation with deep networks[C]//CVPR. 2017: 2462-2470.

[10] Sun D, Yang X, Liu M Y, et al. PWC-Net: CNNs for optical flow using pyramid, warping, and cost volume[C]//CVPR. 2018: 8934-8943.

[11] Teed Z, Deng J. RAFT: Recurrent all-pairs field transforms for optical flow[C]//ECCV. 2020: 402-419.

[12] Zhang Z, et al. CamLiFlow: Bidirectional camera-LiDAR fusion for joint optical flow and scene flow estimation[C]//CVPR. 2023.

[13] Huang Z, Shi X, Zhang C, et al. FlowFormer: A transformer architecture for optical flow[C]//ECCV. 2022: 668-685.

[14] Xu H, Zhang J, Cai J, et al. GMFlow: Learning optical flow via global matching[C]//CVPR. 2022: 8121-8130.

[15] Saxena S, et al. DPFlow: Diffusion probabilistic models for optical flow[C]//NeurIPS. 2024.

[16] Jiang H, Sun D, Jampani V, et al. Super SloMo: High quality estimation of multiple intermediate frames for video interpolation[C]//CVPR. 2018: 9000-9008.

[17] Huang Z, Zhang T, Heng W, et al. RIFE: Real-time intermediate flow estimation for video frame interpolation[J]. arXiv:2011.06294, 2020.

[18] Huang Z, et al. RIFE-v4.6: Improved real-time video frame interpolation[J]. arXiv:2204.02236, 2022.

[19] Zhang G, et al. EMA-VFI: Extracting motion and appearance via inter-frame attention for efficient video frame interpolation[C]//CVPR. 2023.

[20] Zhang G, et al. VFIMamba: Video frame interpolation with state space models[J]. arXiv:2405.02360, 2024.

[21] Li Z, et al. AMT: All-pairs multi-field transforms for efficient frame interpolation[C]//CVPR. 2024.

[22] Han K, et al. GIMM-VFI: Generative interpolation with multi-modal priors for video frame interpolation[J]. arXiv:2406.01850, 2024.

[23] Zhang Z, et al. MoTIF: Motion-aware event-based video frame interpolation[C]//CVPR. 2024.

视频动画 视频动画技术

分享到

💬
微信
📷
朋友圈
🐧
QQ好友
🌐
QQ空间
👁
微博
📌
钉钉
🔗
复制链接
📑
复制图文

微信扫一扫分享

打开微信「扫一扫」,扫描二维码后在微信中分享给好友或朋友圈。

💬 评论 (0)

评论功能已关闭

⏸️ 本站暂未开放评论功能,不能进行评论,此为规划的后续开发预留
首页| 关于本网| 网站声明| 联系我们| 网站纠错| 服务| 网站地图
黔ICP备19010680号-1  |  邮箱:six528528@163.com
贵公网安备 52010302001819号
Copyright 2019-2026 http://www.databrush.com/ All rights reserved.
QQ
QQ扫一扫
Logo
DBN数据刷