从语义锚点到结构延展——一条贯穿生成式补全全链路的技术主线
摘要
横屏素材转竖屏是短视频、电商主图、数字标牌等场景的高频刚需,但传统裁剪会丢失画面信息,简单拉伸则破坏主体比例。AI扩图(Outpainting)通过生成模型在画布外延区域合成语义一致、纹理连贯的新像素,成为解决该矛盾的核心技术路径。本文提出一条贯穿全文的分析主线:"语义锚点—结构延展—纹理合成"三层解耦,即先锁定不可裁切的主体语义锚点,再以结构先验约束画布外延的几何关系,最后用扩散或自回归模型完成纹理级补全。文章系统梳理从传统内容感知填充到扩散模型补全的技术演进,剖析主体不裁切约束下的掩码设计、条件引导与评估体系,给出可复现的工程操作路径,并对实时化、可控化与三维一致性等前沿方向作出研判。
目录
一、问题定义:横转竖为何不能靠裁剪解决
横屏视频的宽高比通常为16:9(约1.78:1),而竖屏短视频平台的主流比例为9:16(约0.5625:1)。两者面积比接近3.16倍,意味着若把横屏画面直接裁成竖屏,最多只能保留约31.6%的原始像素。对于以人物、商品、文字为主体的素材,裁剪往往直接切掉头部、商品标签或字幕,造成信息损失。
另一种朴素做法是直接拉伸或加黑边。拉伸会改变主体几何比例,人脸变窄、圆形变椭圆,视觉上明显失真;加黑边(Pillarbox)虽然保真,但竖屏上下大量留黑,观感差、完播率低。行业普遍观察到,竖屏内容中主体占比过小会显著降低前几秒的注意力留存,这也是平台侧反复强调"竖屏原生感"的原因之一。
本文评述:横转竖的本质不是"缩放"问题,而是"信息补全"问题。裁剪是减法,扩图是加法。当原始画面无法在目标比例下完整容纳主体时,唯一不损失语义的路径就是向外生成新像素。这决定了该任务天然属于生成式视觉的范畴,而非传统图像处理的范畴。
由此,"主体不裁切的画面延展"可以被形式化为一个约束优化问题:给定源图像 I_src 与目标画布 C_tgt,在保证主体区域 M_subject 像素不变的前提下,生成外延区域 C_tgt \ I_src 的内容,使其在语义、结构、纹理三个层面与源图一致。这个形式化定义,正是后文三层解耦主线的起点。
二、技术演进:从内容感知填充到扩散补全
2.1 传统内容感知填充(Inpainting)
早期图像补全依赖纹理合成与块匹配。Bertalmio 等人提出的 BSCB 模型(2000)用偏微分方程沿等照度线传播像素,适合细窄缺损;Criminisi 等人(2004)的基于样例填充(Exemplar-based Inpainting)按优先级从已知区域复制纹理块,对规则纹理效果尚可。这类方法计算轻量,但缺乏语义理解,遇到人脸、天空、建筑等结构化区域时容易出现纹理错位和结构断裂。
本文评述:传统方法的核心假设是"纹理局部平稳",即缺失区域可由邻域纹理外推。但横转竖的外延区域往往面积巨大(可达原图两倍以上),远超局部平稳假设的适用范围,因此必须引入语义级先验。
2.2 深度生成阶段:GAN 与两阶段范式
2016年后,基于深度卷积网络的补全方法成为主流。Pathak 等人的 Context Encoder(2016)首次用编码器—解码器加对抗损失做语义补全;Iizuka 等人的 Globally and Locally Consistent 模型(2017)引入全局与局部双判别器;Yu 等人的 Contextual Attention(2018)通过注意力机制从远处已知区域借纹理。此后"结构先验 + 纹理生成"的两阶段范式逐渐清晰:先预测边缘、轮廓等结构信息,再据此生成纹理。
2.3 扩散模型时代:从 LaMa 到 Stable Diffusion Inpainting
2022年前后,扩散模型(Diffusion Model)在图像生成上全面超越GAN。Rombach 等人的潜在扩散模型(LDM, 2022)把扩散过程放到VAE潜空间,大幅降低算力;Suvorov 等人的 LaMa(2022)用快速傅里叶卷积扩大感受野,在掩码补全上表现稳健;Stable Diffusion Inpainting 则把文本条件引入补全,使外延内容可控。2023年后的研究进一步聚焦于掩码感知的注意力改造、参考图引导与多尺度一致性。
表1:图像补全技术演进对比(来源:基于公开论文整理,2024)
三、核心主线:语义锚点—结构延展—纹理合成
这是本文贯穿全文的独创性分析主线。之所以提出三层解耦,是因为横转竖扩图的失败模式高度集中:要么主体被裁(语义层失败),要么外延结构与原图对不齐(结构层失败),要么纹理出现接缝或重复(纹理层失败)。把任务拆成三层,可以让每一层用最合适的工具解决,避免"一个模型包打天下"的混乱。
3.1 第一层:语义锚点(Semantic Anchor)
语义锚点指画面中不可裁切、必须完整保留的区域,通常包括人脸、主体商品、字幕、Logo等。工程上可用人脸检测、显著性检测、文本检测或分割模型(如 SAM 系列)自动提取,再结合人工框选修正。锚点一旦确定,就作为硬约束锁定,扩图算法不得覆盖其像素。
笔者认为,语义锚点的价值不仅是"保护主体",更是为后续结构延展提供参照系。例如人物锚点决定了外延天空、地面的透视方向,商品锚点决定了桌面、背景的延伸逻辑。锚点选得准,后两层才有稳定的坐标系。
3.2 第二层:结构延展(Structure Extension)
结构延展负责回答"外延区域应该长成什么几何形状"。常用手段包括边缘图外推、深度图估计、直线/平面检测与透视推断。对于室内场景,可用消失点估计延展墙面与地板;对于人像,可用人体关键点推断肩颈与背景交界;对于自然风景,可用地平线检测延展天空与地面。
本文评述:结构延展是当前多数开源扩图工具最薄弱的环节。很多工具直接让扩散模型"自由发挥",结果外延区域出现莫名其妙的物体或断裂的直线。把结构先验显式建模,是提升横转竖可用性的关键一步。
3.3 第三层:纹理合成(Texture Synthesis)
纹理合成在结构约束下生成最终像素。扩散模型是当前主力:以源图为条件,以掩码标记待生成区域,通过多步去噪逐步填充。为提升一致性,常引入参考图注意力、低通融合与色彩匹配后处理。纹理层的目标不是"生成得漂亮",而是"生成得像原图"——色彩、噪声、颗粒感都要对齐。
三层关系小结:语义锚点是"不能动什么",结构延展是"往哪个方向长",纹理合成是"长成什么样"。三者顺序不可颠倒——先锚定、再定形、后填色,这正是本文主张的工程顺序。
四、主体不裁切:掩码设计与约束建模
4.1 掩码(Mask)的生成策略
扩图任务中,掩码标记"待生成区域"。横转竖时,若把源图水平居中放入竖屏画布,左右两侧即为待生成区,掩码为两条竖带;若源图偏左放置(如人物在左),则右侧掩码更宽。掩码宽度直接决定生成难度:宽度越大,模型需要"想象"的内容越多,一致性越难保证。
实践中建议采用非对称布局:把主体锚点放在画面黄金分割位置,让两侧掩码宽度尽量均衡且不超过源图宽度的60%。超过该阈值时,可考虑先做一次轻度超分或分块生成,再拼接融合。
4.2 硬约束与软约束
主体不裁切是硬约束,必须在像素级保证。实现方式有两种:一是生成后把锚点区域原样贴回(paste-back),二是将锚点区域作为条件输入并在损失中加权。前者简单可靠,后者更自然但实现复杂。工程上推荐"生成+贴回+边缘羽化"的组合,兼顾保真与过渡。
软约束则包括色彩一致性、光照方向一致、透视一致等,通过后处理或条件引导实现。例如用直方图匹配对齐外延区与源图的色调,用泊松融合消除接缝。
4.3 条件引导的工程实现
在扩散框架下,条件引导主要有三类:文本提示(prompt)、结构条件(边缘、深度、分割图)与参考图条件(IP-Adapter 类)。横转竖场景中,文本提示应描述场景而非主体,例如"延伸的蓝天与远处山脉";结构条件用边缘外推图;参考图条件用源图本身,保证风格统一。
# 伪代码:横转竖扩图核心流程
src = load_image("input.jpg") # 源图 16:9
anchor = detect_subject(src) # 语义锚点
canvas = create_canvas(9, 16) # 目标竖屏画布
place_centered(src, canvas, anchor) # 居中放置,锚点对齐
mask = build_side_mask(canvas, src) # 左右待生成掩码
struct = extend_structure(src, mask) # 结构先验外推
out = diffusion_inpaint(canvas, mask,
prompt="natural continuation",
control=struct, ref=src) # 条件扩散补全
out = paste_back(out, src, anchor) # 锚点原样贴回
out = poisson_blend(out, src) # 泊松融合去接缝
save_image(out, "output_9x16.jpg")
五、工程实践:一条可复现的横转竖流水线
5.1 环境与工具选型
推荐技术栈:Python + PyTorch,扩散后端可选 Stable Diffusion Inpainting 或 LaMa,分割用 SAM 或轻量显著性模型,结构先验用 OpenCV 的直线检测与深度估计模型(如 MiDaS)。若追求实时,可考虑蒸馏版扩散模型或专用扩图模型。
- 分割:SAM / U2-Net / 显著性检测,提取主体锚点
- 结构:OpenCV 直线检测、MiDaS 深度估计、消失点推断
- 生成:SD Inpainting、LaMa、专用 Outpainting 模型
- 后处理:泊松融合、直方图匹配、边缘羽化
5.2 分步操作路径
第一步,确定目标比例。明确输出是9:16、3:4还是1:1,不同比例对应不同掩码宽度。短视频优先9:16,电商主图常用1:1或3:4。
第二步,提取语义锚点。自动检测人脸、文本、显著物体,人工复核。锚点框建议外扩5%作为保护带,避免贴回时边缘生硬。
第三步,布局与掩码生成。把源图放入目标画布,锚点对齐黄金分割线,生成左右掩码。掩码边缘做5—10像素羽化。
第四步,结构先验外推。检测源图直线与地平线,按透视关系向掩码区延伸,生成边缘图作为ControlNet输入。
第五步,条件扩散补全。以源图为参考、边缘图为结构条件、简短文本为语义提示,运行补全。步数建议20—30,CFG 7—9。
第六步,贴回与融合。锚点区域原样贴回,接缝处泊松融合,整体做轻度色彩匹配。
第七步,质检与迭代。检查主体是否完整、直线是否断裂、纹理是否重复,不合格则调整掩码宽度或提示词重跑。
5.3 常见坑与规避
表2:横转竖扩图常见问题与规避(来源:工程实践整理,2024)
延伸阅读可参考 Hugging Face Diffusers 官方文档中的 Inpainting 教程,以及 OpenCV 官方文档中关于图像融合与直线检测的章节,便于快速搭建原型。
六、评估体系:指标、数据集与预处理细节
6.1 客观指标
补全质量常用 PSNR、SSIM、LPIPS 与 FID。PSNR/SSIM 衡量像素与结构相似度,但对生成任务偏严苛;LPIPS 基于深度特征,更贴近人眼;FID 衡量分布距离,适合评估整体真实感。横转竖场景还应补充"主体保真度"指标,即锚点区域与源图的逐像素差异(理想为0)。
6.2 数据集与预处理
常用公开数据集包括 Places2(场景)、CelebA-HQ(人脸)、DIV2K(自然图像)。用于扩图评估时,通常从原图裁出中心区域作为源图,外圈作为真值,构造"已知—待生成"配对。预处理细节:统一缩放至短边512或768,色彩空间转RGB,归一化到[-1,1];掩码做二值化并羽化3—5像素;评估时仅统计掩码区域指标。
表3:常用数据集与预处理(来源:各数据集官方说明,2024)
6.3 主观评估
生成任务的主观性很强,建议引入双盲主观评分:让评估者只看输出,从"主体完整性、结构合理性、纹理自然度、整体协调性"四个维度打分。本文评述:客观指标与主观感受常有背离,横转竖最终服务于观看体验,主观评估不可省略。
七、前沿研判:实时化、可控化与三维一致性
7.1 实时化
扩散模型推理慢是落地瓶颈。当前主流加速路径包括:少步采样(LCM、Turbo)、模型蒸馏、潜空间降维与专用轻量网络。笔者认为,横转竖的实时化不必追求"一步生成",更现实的是"预览快、精修慢"的两级方案:先用轻量模型出低分辨率预览,用户确认构图后再跑高质量补全。
7.2 可控化
用户希望"外延成什么样"可指定。文本提示、区域涂鸦、参考图、结构草图都是控制手段。未来趋势是多种控制信号融合,且保持低门槛交互。本文评述:可控性的本质是把生成自由度收窄到用户意图范围内,这与三层解耦主线一脉相承——控制信号正是各层的输入。
7.3 三维一致性
视频横转竖比单图更难:逐帧独立扩图会导致闪烁。解决思路包括光流引导、时序注意力、三维场景重建(如 NeRF、3D Gaussian Splatting)后再渲染。对于固定机位素材,可用单帧扩图结果作为背景板,主体抠出后合成,规避逐帧不一致。
7.4 与生成式视频的融合
2024年以来,视频生成模型能力快速提升,直接"重绘"整段竖屏视频成为可能。但重绘会改变原始表演细节,版权与真实性问题突出。笔者认为,短期内"扩图补边+主体保留"仍是更稳妥的工程路线,视频生成更适合创意类而非纪实类素材。
八、结语与操作清单
横转竖智能补边不是单一模型的胜利,而是"语义锚点—结构延展—纹理合成"三层协同的结果。把主体锁死、把结构定准、把纹理填自然,才能既保住信息又保住观感。以下是一份可直接执行的操作清单:
- 明确目标比例与主体锚点,锚点外扩5%保护带;
- 非对称布局,单侧掩码不超过源图宽度60%;
- 生成结构先验(边缘/深度/消失点)作为条件;
- 条件扩散补全,步数20—30,CFG 7—9;
- 锚点贴回+泊松融合+直方图匹配;
- 主观+客观双重质检,不合格回退调参。
随着扩散模型效率提升与控制手段丰富,横转竖有望从"后期补救"变成"拍摄即适配"的默认能力。届时,比例将不再是内容表达的枷锁,而只是分发环节的一个参数。
主要参考文献
- Bertalmio M, et al. Image Inpainting. SIGGRAPH, 2000.
- Criminisi A, et al. Region Filling and Object Removal by Exemplar-Based Image Inpainting. IEEE TIP, 2004.
- Pathak D, et al. Context Encoders: Feature Learning by Inpainting. CVPR, 2016.
- Yu J, et al. Generative Image Inpainting with Contextual Attention. CVPR, 2018.
- Rombach R, et al. High-Resolution Image Synthesis with Latent Diffusion Models. CVPR, 2022.
- Suvorov R, et al. Resolution-Robust Large Mask Inpainting with Fourier Convolutions. WACV, 2022.
- Zhang L, et al. Adding Conditional Control to Text-to-Image Diffusion Models. ICCV, 2023.
- Ye H, et al. IP-Adapter: Text Compatible Image Prompt Adapter. arXiv, 2023.
- Kirillov A, et al. Segment Anything. ICCV, 2023.
注:文中涉及的参考文献与资料共60余篇,涵盖2000—2024年图像补全、扩散模型、结构引导与评估方法,其中近三年(2022—2024)文献占比超过50%。数据集预处理细节已在第六章说明,数据来源均标注于对应图表下方。
文章声明:本文内容仅为作者学习、思考、经验、笔记的总结,仅供技术交流与参考。文中观点仅代表笔者个人思辨,不构成任何学术建议、商业建议或专业建议。所有数据来源已标注,引用时请以原始文献为准。
内容仅供学习参考。如需引用,请以原始文献为准。 | 全文约12600字 | 参考文献60余篇(主要9篇)

