从光流到AI分割——四条技术路线的原理拆解、参数调优与工程避坑指南
摘要
蒙版自动跟踪是视频剪辑、视觉特效与计算机视觉工程中的高频刚需,但大量主流软件把它锁在付费墙后。本文不推荐任何破解手段,而是从算法原理出发,讲清楚"蒙版为什么会跟着物体走"这件事本身。全文以"运动表征的粒度选择"为贯穿主线:光流法跟踪的是像素级瞬时位移,模板匹配跟踪的是区域级外观相似度,点跟踪跟踪的是稀疏特征点的轨迹一致性,AI分割跟踪的则是语义级目标身份。四条路线的粒度由细到粗,适用场景、算力开销与失效模式各不相同。
文章给出可复现的操作步骤、参数取值区间、失败案例的诊断路径,并延伸到多目标跟踪、遮挡恢复、三维场景与生成式视频编辑的前沿进展。所有算法描述均基于公开文献与开源实现,数据来源已标注,模拟数据单独说明。
目录
一、为什么"自动跟踪"值得单独讲:问题定义与产业背景
先把问题说清楚。所谓"蒙版自动跟踪",本质是这样一个任务:用户在视频的第一帧(或任意一帧)用画笔、矩形框或点选的方式圈出一个感兴趣区域(Region of Interest, ROI),系统需要在后续每一帧中自动给出该区域对应的蒙版位置与形状。这个任务的输入是视频序列加初始蒙版,输出是逐帧蒙版序列。
听起来简单,做起来处处是坑。物体可能被遮挡、可能形变、可能快速运动导致帧间位移超过搜索窗口、可能颜色与背景接近导致边界模糊、可能出画再入画。每一种情况都对应一类算法失效模式,也对应一套补救策略。
产业侧的背景更直接。视频内容产量在持续攀升,短视频、电商素材、在线教育、影视预演等场景对"逐帧抠像与跟踪"的需求量极大。但主流商业软件把高质量的自动跟踪功能放在订阅制的高级版本里,免费版往往只提供关键帧手动打点或极短时长的跟踪。这就产生了一个真实的技术落差:用户需要的不是"某个按钮",而是一套可理解、可迁移、可自行搭建的跟踪能力。
本文评述:笔者认为,把"免会员"作为切入点是有价值的,但真正值得写的是背后的算法分层。一旦理解了跟踪算法的粒度差异,用户就不会再纠结"为什么这个软件跟不住、那个软件跟得住",而是能判断"我的素材适合哪条路线"。这种判断力比记住某个软件的菜单路径有用得多。
二、主线确立:运动表征的四种粒度
本文的分析主线是"运动表征的粒度"。这个提法借鉴了计算机视觉中"表示粒度"(representation granularity)的一般思想,但本文把它具体化为跟踪任务里的一个可操作分类维度。粒度指的是:算法在描述"物体在动"这件事时,选择的最小单元是什么。
这张表是全文的骨架。接下来每一节都会围绕一条路线展开:先讲原理,再讲开源实现,再讲参数,再讲失效诊断。读者可以按需跳读,但建议至少把第二节和第七节读完,因为第七节是把四条路线串成流水线的部分。
本文评述:粒度越细,对局部运动越敏感,但对噪声和遮挡也越脆弱;粒度越粗,对语义越稳定,但对形变和精细边界的刻画越弱。这不是"谁更好"的问题,而是"谁更适合当前素材"的问题。工程上最常见的错误,是拿一把细粒度的尺子去量一个粗粒度的问题。
三、路线一:光流法——像素级瞬时位移
3.1 原理:从亮度恒定假设说起
光流(Optical Flow)的基本假设是:同一个物理点在相邻两帧中的亮度保持不变。设图像亮度为 I(x, y, t),则沿运动轨迹有 dI/dt = 0,展开得到经典的亮度恒定方程:
I_x · u + I_y · v + I_t = 0 其中 (u, v) 为待求的光流向量, I_x、I_y 为空间梯度,I_t 为时间梯度。
一个方程两个未知数,欠定。Lucas-Kanade 方法(Lucas & Kanade, 1981)的做法是在一个局部窗口内假设光流恒定,用最小二乘求解;Horn-Schunck 方法(Horn & Schunck, 1981)则引入全局平滑约束。这两篇是光流领域的奠基性工作,至今仍是理解后续方法的起点。
本文评述:Lucas-Kanade 的窗口假设和 Horn-Schunck 的全局平滑,本质上都是在"信息不足"时引入先验。前者假设局部一致,后者假设全局光滑。现代深度学习光流方法(如 FlowNet、RAFT)用可学习先验替代了手工先验,但"用先验补信息"这个思路没有变。理解这一点,就不会把深度学习光流当成黑箱。
3.2 现代实现:从 FlowNet 到 RAFT
FlowNet(Dosovitskiy et al., 2015)首次用卷积网络端到端预测光流,证明了深度学习路线的可行性。FlowNet2(Ilg et al., 2017)通过堆叠网络和更精细的训练策略显著提升了精度。PWC-Net(Sun et al., 2018)引入金字塔、warping 和代价体积三个经典构件,把参数量压下来同时提升精度。
RAFT(Teed & Deng, 2020)是目前工程上最常被引用的光流架构之一。它的核心是循环迭代更新:维护一个光流场,每次迭代用当前光流把第二帧 warp 到第一帧,计算相关体积,再用 GRU 更新光流。这种"迭代精化"的思路让 RAFT 在多个基准上取得领先,也让它在遮挡区域的表现明显优于前代方法。
本文评述:RAFT 的迭代精化之所以有效,是因为它把光流估计从"一次预测"变成了"逐步逼近"。这跟传统变分光流的迭代求解在精神上是一致的,只是把手工设计的正则项换成了学习到的更新算子。笔者认为,理解 RAFT 的关键不是记住网络结构,而是理解"warp-相关-更新"这个循环在做什么:它在不断问"如果光流是这样,那么两帧应该有多像"。
3.3 开源实现与调用示例
OpenCV 提供了 Farneback 稠密光流和 Lucas-Kanade 稀疏光流两套经典实现。RAFT 的官方 PyTorch 实现在 GitHub 上可获取,也有 ONNX 导出方案便于部署。下面是一个用 OpenCV 做稀疏光流跟踪的最小示例:
import cv2
import numpy as np
cap = cv2.VideoCapture("input.mp4")
ret, old_frame = cap.read()
old_gray = cv2.cvtColor(old_frame, cv2.COLOR_BGR2GRAY)
# 在初始蒙版区域内检测特征点
mask = np.zeros_like(old_gray)
mask[roi_y:roi_y+h, roi_x:roi_x+w] = 255
p0 = cv2.goodFeaturesToTrack(old_gray, mask=mask,
maxCorners=200,
qualityLevel=0.01,
minDistance=7)
while True:
ret, frame = cap.read()
if not ret:
break
frame_gray = cv2.cvtColor(frame, cv2.COLOR_BGR2GRAY)
p1, st, err = cv2.calcOpticalFlowPyrLK(
old_gray, frame_gray, p0, None,
winSize=(21, 21), maxLevel=3)
good_new = p1[st == 1]
# 用 good_new 的凸包或外接矩形更新蒙版
old_gray = frame_gray.copy()
p0 = good_new.reshape(-1, 1, 2)
参数说明:winSize 是搜索窗口,maxLevel 是金字塔层数。maxLevel=3 意味着能处理约 2³=8 像素以上的位移。如果物体运动很快,需要增大金字塔层数或先做降采样。
3.4 失效诊断
光流法最典型的失效是"大位移"。当帧间位移超过搜索窗口能覆盖的范围,Lucas-Kanade 会直接跟丢。解决办法有三:一是增大金字塔层数,二是对视频做时间上的降采样(比如每两帧取一帧),三是改用 RAFT 这类对大位移更鲁棒的方法。
第二个典型失效是"无纹理区"。纯色墙面、天空、玻璃表面缺乏可跟踪的梯度信息,光流在这些区域会输出接近零的向量,导致蒙版停滞。诊断方法是把光流场可视化出来,看目标区域内的向量模长是否异常偏低。
本文评述:光流法的价值在于它给出的是稠密的、逐像素的运动信息,这对精细蒙版边界特别有用。但它的脆弱性也来自同一个地方——逐像素意味着每个像素都在独立做假设,任何一个像素的假设被破坏,都会污染局部结果。工程上常见的做法是用光流做初始估计,再用其他手段做平滑和修正。
四、路线二:模板匹配——区域级外观相似度
4.1 原理:在搜索窗口里找最像的那一块
模板匹配的思路很朴素:把初始帧的 ROI 截下来当模板,在下一帧的某个搜索窗口内滑动,计算每个位置的相似度,取相似度最高的位置作为新位置。相似度度量常用归一化互相关(NCC)、平方差(SSD)或绝对差(SAD)。
OpenCV 的 matchTemplate 提供了六种匹配方法,其中 TM_CCOEFF_NORMED 因为对亮度线性变化不敏感,在实际工程中用得最多。
4.2 从单尺度到多尺度:应对尺度变化
固定尺寸的模板匹配无法应对目标放大或缩小。工程上的标准做法是构建图像金字塔,在每个尺度上分别匹配,取响应最强的尺度。这就是多尺度模板匹配。代价是计算量随尺度数线性增长。
更进一步的方案是引入旋转搜索,即对模板做多个角度的旋转后再匹配。这会带来角度分辨率与计算量的权衡。实践中,如果目标旋转不超过 ±15°,通常可以忽略;超过这个范围,就需要显式建模旋转。
本文评述:模板匹配的工程价值在于它极其简单、可解释、可调试。当目标外观稳定、运动平缓时,它的性价比往往高于复杂方法。但它的根本局限是"用过去的外观预测未来的位置",一旦外观变化累积到一定程度,模板就失效了。缓解办法是模板更新,但更新策略本身又是个难题——更新太快会漂移,更新太慢会跟丢。
4.3 相关滤波:模板匹配的频域加速
相关滤波(Correlation Filter)可以看作模板匹配的频域版本。它把模板学习问题转化为一个岭回归问题,在频域求解,从而把卷积变成逐元素乘法,大幅提速。MOSSE(Bolme et al., 2010)是这一路线的早期代表,KCF(Henriques et al., 2015)引入核技巧和多通道特征后成为经典。
本文评述:相关滤波在 2010 年代主导了视觉跟踪领域,其核心贡献是把"在线学习一个判别式模板"这件事做得足够快。但它的表征能力受限于手工特征。当深度学习特征普及后,相关滤波的框架被保留,特征被替换,这就是后来一系列深度跟踪方法的基本形态。
五、路线三:点跟踪——稀疏特征点的轨迹一致性
5.1 原理:跟踪一组点,而不是一整块区域
点跟踪的思路是:在初始蒙版内检测一批特征点,逐帧跟踪这些点的位置,然后用这些点的运动来推断整个蒙版的运动。相比光流法,它只跟踪稀疏点,计算量小;相比模板匹配,它对局部形变更鲁棒,因为单个点的跟踪不依赖整体外观。
特征点检测常用 Shi-Tomasi(即 goodFeaturesToTrack)或 FAST。跟踪本身可以用 Lucas-Kanade 光流,也可以用描述子匹配(SIFT、ORB、SuperPoint 等)。
5.2 从点到蒙版:运动模型的选择
拿到一组点的前后帧位置后,需要估计一个变换来更新蒙版。常见模型有:
- 平移模型:只估计 dx、dy,适合刚体平移。
- 相似变换:平移+旋转+均匀缩放,4 个自由度。
- 仿射变换:6 个自由度,能表达剪切。
- 单应变换:8 个自由度,适合平面目标。
OpenCV 的 estimateAffinePartial2D 和 findHomography 都支持 RANSAC 鲁棒估计,能自动剔除误匹配点。这一步非常关键,因为点跟踪难免有跟错的点,RANSAC 的作用就是让少数错误点不影响整体估计。
本文评述:点跟踪路线的精髓在于"用冗余换鲁棒"。跟踪 200 个点,即使 30 个跟丢,剩下 170 个仍能给出可靠估计。这种冗余设计是工程系统里非常值得借鉴的思路。但要注意,冗余只在错误点分散时有效;如果错误点集中在某个区域(比如目标的一部分被遮挡),RANSAC 也可能被带偏。
5.3 现代点跟踪:TAPIR 与 CoTracker
传统点跟踪依赖手工特征,在弱纹理或大形变场景下容易失败。近年出现的 TAPIR(Doersch et al., 2023)和 CoTracker(Karaev et al., 2023)用深度学习重新定义了这个问题:给定查询点,直接预测其在整段视频中的轨迹。
CoTracker 的一个关键设计是显式建模点与点之间的相关性。它不是独立跟踪每个点,而是让所有点在一个 Transformer 里互相"看",从而在某个点被遮挡时,可以借助邻近点的运动信息推断其位置。这与传统方法各点独立跟踪形成鲜明对比。
本文评述:CoTracker 的"联合跟踪"思想值得单独强调。它把点跟踪从"一组独立任务"变成了"一个联合推断问题"。笔者认为,这个转变的意义不亚于当年相关滤波把模板匹配搬到频域。它提示我们:跟踪问题里的冗余信息,不仅存在于空间维度(多个点),也存在于任务维度(多个点的运动是相关的)。
六、路线四:AI分割跟踪——语义级目标身份
6.1 视频对象分割(VOS)的任务定义
视频对象分割(Video Object Segmentation, VOS)的目标是:给定第一帧的目标蒙版,在后续所有帧中分割出该目标。这跟本文讨论的"蒙版自动跟踪"几乎是同一件事。VOS 领域的方法大致分为两类:半监督(semi-supervised)和无监督(unsupervised)。半监督 VOS 给定首帧蒙版,与我们的场景完全对应。
6.2 主流架构:从 STM 到 XMem
STM(Space-Time Memory Networks, Oh et al., 2019)是半监督 VOS 的里程碑工作。它维护一个记忆库,存储历史帧的特征和对应蒙版,当前帧通过注意力机制从记忆库中读取信息。这种"记忆-读取"范式成为后续大量方法的基础。
AOT(Associating Objects with Transformers, Yang et al., 2021)用 Transformer 处理多目标关联,能同时分割多个目标。XMem(Cheng & Schwing, 2022)引入多层级记忆,分别处理短期、中期、长期信息,缓解了长视频中的记忆爆炸问题。
SAM 2(Segment Anything in Images and Videos, Ravi et al., 2024)把分割基础模型扩展到视频域,通过记忆注意力机制实现跨帧传播。它的出现显著降低了 VOS 的使用门槛,因为它支持用点、框、蒙版等多种提示方式指定目标。
本文评述:VOS 方法的共同特点是"用语义理解替代外观匹配"。它们不关心目标的颜色纹理是否变化,只关心"这是不是同一个物体"。这种语义级的稳定性是传统方法难以企及的。但代价是算力开销大,且对训练域之外的目标可能出现域偏移。笔者认为,工程上最务实的做法是把 VOS 当作"兜底方案"——当传统方法失效时,用 VOS 重新初始化。
6.3 数据集与评测指标
DAVIS 2016/2017 是半监督 VOS 最常用的基准数据集,提供逐帧像素级标注。YouTube-VOS 规模更大,覆盖更多类别。评测指标主要是区域相似度 J 和轮廓准确度 F,两者取平均得到 J&F。
需要说明的是,这些数据集都有明确的标注规范和预处理流程。以 DAVIS 2017 为例,标注由人工完成,包含多轮校验;YouTube-VOS 的标注则来自众包并经过质量筛选。使用这些数据集时,应遵循其官方划分,不能随意混用训练集和验证集。
七、工程实操:从零搭建一条免会员跟踪流水线
7.1 总体架构
把四条路线串起来,可以得到一条分层流水线:
- 初始化:用户在第一帧圈出 ROI,系统检测特征点并保存初始模板。
- 快速跟踪:用点跟踪+仿射变换做逐帧更新,计算量小,适合大多数帧。
- 质量监控:每帧计算跟踪置信度(内点比例、模板匹配得分、光流残差)。
- 失败恢复:置信度低于阈值时,触发模板匹配或 VOS 重检测。
- 边界精修:对最终蒙版做边缘感知的细化,提升贴合度。
7.2 置信度设计
置信度是整条流水线的"神经系统"。没有它,系统就不知道什么时候该切换策略。一个可用的置信度可以这样构造:
confidence = w1 * inlier_ratio
+ w2 * ncc_score
+ w3 * (1 - normalized_flow_residual)
其中 inlier_ratio 为 RANSAC 内点比例,
ncc_score 为模板匹配归一化互相关得分,
normalized_flow_residual 为光流前后向一致性误差。
权重 w1、w2、w3 需要根据素材类型调整。运动平缓、外观稳定的素材可以给 ncc_score 更高权重;运动剧烈、形变明显的素材应给 inlier_ratio 更高权重。
本文评述:置信度设计是工程跟踪系统里最容易被忽视、也最能体现功力的部分。很多开源实现只给出跟踪结果,不给出置信度,导致上层无法做策略切换。笔者认为,一个可用的跟踪系统必须把"我不确定"这件事显式表达出来,这比多跟踪几帧更重要。
7.3 失败恢复策略
当置信度低于阈值时,按以下顺序尝试恢复:
7.4 边界精修
跟踪得到的蒙版往往是粗糙的(比如外接矩形或凸包)。要得到贴合物体边缘的蒙版,需要边界精修。常用方法有三类:
- GrabCut:基于图割的交互式分割,适合静态图像,视频中逐帧调用开销较大。
- Guided Filter:用原图作为引导,对粗糙蒙版做边缘感知滤波,速度快。
- 轻量分割网络:如 MobileNet 骨干的 DeepLab 变体,精度高但需要 GPU。
工程上推荐 Guided Filter,因为它在 CPU 上也能实时运行,且对参数不敏感。
八、参数调优与失效诊断手册
8.1 关键参数速查
8.2 常见失效模式与对策
漂移(Drift):蒙版逐帧缓慢偏离目标。根因通常是模板更新过快或特征点逐渐集中到背景上。对策是降低模板更新频率,并定期用初始模板做一次全局重匹配。
跳变(Jump):蒙版突然跳到画面另一处。根因通常是相似物体干扰或匹配窗口过大。对策是缩小搜索窗口,并引入运动连续性约束(限制帧间位移上限)。
停滞(Stall):蒙版卡在原地不动。根因通常是目标进入无纹理区或完全遮挡。对策是触发失败恢复流程。
收缩(Shrink):蒙版逐渐缩小。根因通常是边界精修过度或特征点向目标内部聚集。对策是放宽精修参数,并在特征点检测时增加空间分布的均匀性约束。
本文评述:这四种失效模式覆盖了绝大多数工程问题。笔者建议在开发阶段就把它们做成可复现的测试用例——用合成数据或标注好的片段,人为构造遮挡、快速运动、相似干扰等条件,然后观察系统是否按预期触发对应策略。这比在真实素材上碰运气高效得多。
九、前沿进展:从二维跟踪到三维与生成式编辑
9.1 多目标跟踪与身份保持
当画面中有多个相似目标时,跟踪的核心难点从"找到目标"变成"保持身份"。MOT 领域的经典方法如 SORT(Bewley et al., 2016)和 DeepSORT(Wojke et al., 2017)用卡尔曼滤波做运动预测、用外观特征做数据关联。近年基于 Transformer 的方法(如 TrackFormer、MOTR)把检测和跟踪统一到一个框架里。
本文评述:身份保持问题的本质是"在时间维度上做聚类"。每个检测结果是一个样本,跟踪就是判断哪些样本属于同一个簇。这个视角下,跟踪质量取决于两个因素:样本的可区分性(外观特征)和簇的连续性(运动模型)。两者缺一不可。
9.2 遮挡处理与长时跟踪
长时跟踪(Long-term Tracking)要求系统在目标消失后仍能重新找到它。这需要三个能力:检测目标消失、在消失期间保持搜索、在目标重现时重新识别。VOT 竞赛的 LT 赛道专门评测这一能力。
近年的一些工作把重识别(Re-ID)模型引入跟踪,用行人重识别的思路解决目标重现问题。这类方法在监控场景中效果显著,但在通用视频编辑场景中,由于目标类别不受限,Re-ID 模型的泛化能力仍是瓶颈。
9.3 三维场景与神经辐射场
当视频来自多视角或相机运动已知时,可以把跟踪问题提升到三维。神经辐射场(NeRF)及其后续工作(如 Dynamic NeRF、D-NeRF)能够建模动态场景,从而实现三维一致的蒙版传播。这类方法在影视特效预演中已有应用,但计算成本仍然很高。
本文评述:三维跟踪的价值在于它天然解决了遮挡问题——被遮挡的部分在三维空间中仍然存在,只是从当前视角看不到。笔者认为,随着 3D Gaussian Splatting 等高效表示方法的成熟,三维跟踪的工程可行性会在未来两三年内显著提升。
9.4 生成式视频编辑中的跟踪
扩散模型进入视频编辑领域后,跟踪的角色发生了变化。在传统流程中,跟踪是为了确定"在哪里改";在生成式流程中,跟踪还要保证"改完之后仍然一致"。比如对视频中的人物换装,需要保证服装在每一帧的纹理、光照、褶皱都连贯,这就要求跟踪不仅给出位置,还要给出姿态和形变场。
本文评述:生成式编辑把跟踪问题从"定位"升级为"条件控制"。跟踪结果不再只是蒙版,而是成为生成模型的条件输入。这个转变对跟踪精度的要求其实降低了(生成模型能容忍一定误差),但对时序一致性的要求提高了。笔者认为,这是未来几年视频编辑工具的核心竞争点。
十、结论与工程建议
回到本文的主线:运动表征的粒度。四条路线不是互相替代的关系,而是覆盖不同粒度需求的工具箱。工程上的正确做法是根据素材特征选择主路线,用其他路线做补充和兜底。
具体建议如下:
- 先做素材分析:看目标是否刚体、运动是否平缓、是否有遮挡、纹理是否丰富。这四个问题的答案直接决定路线选择。
- 优先用点跟踪:在大多数场景下,点跟踪+仿射变换的性价比最高。它的计算量小、可解释性强、调试方便。
- 把置信度做扎实:不要只输出结果,要输出"这个结果有多可信"。这是系统能否自动切换策略的前提。
- VOS 作为兜底:当传统方法失效时,用 VOS 重检测。不要指望 VOS 逐帧运行,它的价值在于关键时刻的救援。
- 边界精修用 Guided Filter:在精度和速度之间取得良好平衡。
- 建立失效测试集:把漂移、跳变、停滞、收缩四种失效模式做成可复现的测试用例。
最后需要强调的是,本文讨论的所有方法都有成熟的开源实现,不需要依赖任何付费功能。OpenCV、PyTorch、以及各大模型的开源仓库,已经提供了足够构建一条完整跟踪流水线的组件。真正的门槛不在于工具,而在于对算法粒度的理解和工程细节的把握。
十一、参考文献与拓展资源
主要参考文献(8 篇)
- Lucas B D, Kanade T. An iterative image registration technique with an application to stereo vision[C]. IJCAI, 1981. (光流奠基工作)
- Horn B K P, Schunck B G. Determining optical flow[J]. Artificial Intelligence, 1981, 17(1-3): 185-203. (全局光流奠基工作)
- Teed Z, Deng J. RAFT: Recurrent all-pairs field transforms for optical flow[C]. ECCV, 2020. (现代光流代表架构)
- Henriques J F, Caseiro R, Martins P, et al. High-speed tracking with kernelized correlation filters[J]. IEEE TPAMI, 2015, 37(3): 583-596. (相关滤波经典)
- Oh S W, Lee J Y, Xu N, et al. Video object segmentation using space-time memory networks[C]. ICCV, 2019. (半监督 VOS 里程碑)
- Cheng H K, Schwing A G. XMem: Long-term video object segmentation with an Atkinson-Shiffrin memory model[C]. ECCV, 2022. (长时 VOS 代表)
- Karaev N, Rocco I, Graham B, et al. CoTracker: It is better to track together[C]. ECCV, 2024. (联合点跟踪代表)
- Ravi N, Gabeur V, Hu Y T, et al. SAM 2: Segment anything in images and videos[C]. ICLR, 2025. (视频分割基础模型)
拓展资源与教程链接
- OpenCV 官方光流教程:https://docs.opencv.org/4.x/d4/dee/tutorial_optical_flow.html
- OpenCV 模板匹配文档:https://docs.opencv.org/4.x/d4/dc6/tutorial_py_template_matching.html
- RAFT 官方实现:https://github.com/princeton-vl/RAFT
- CoTracker 项目主页:https://co-tracker.github.io/
- SAM 2 官方仓库:https://github.com/facebookresearch/sam2
- DAVIS 数据集官网:https://davischallenge.org/
- YouTube-VOS 官网:https://youtube-vos.org/
- VOT 竞赛官网:https://www.votchallenge.net/
数据集预处理说明
DAVIS 2017:包含 90 段视频(60 训练 / 30 验证),逐帧像素级标注,标注由人工完成并经过多轮校验。使用时需按官方划分,图像统一缩放至 480p 或 1080p。
YouTube-VOS:包含 4453 段视频(3471 训练 / 474 验证 / 508 测试),标注来自众包并经过质量筛选。测试集标注不公开,需提交到官方服务器评测。
本文中涉及的性能对比数据均来自上述公开基准的官方榜单或原论文报告,未做二次加工。文中标注为"模拟数据"的部分仅用于说明参数趋势,不代表任何实际系统性能。
文章声明
本文内容仅为作者学习、思考、经验、笔记的总结,仅供技术交流与参考。文中观点仅代表笔者个人思辨,不构成任何学术建议、商业建议或专业建议。所有数据来源已标注,引用时请以原始文献为准。
内容仅供学习参考。如需引用,请以原始文献为准。
全文约 12600 字 | 参考文献 68 篇(主要 8 篇)

