视频动画技术

AI 脚本功能:输入主题生成分镜脚本,创意构思从几小时缩到几分钟

👤 为我痴狂 👁 1 阅读 ❤ 0 点赞 ➦ 0 分享 📅 2026-10-01
首页› 视频动画› 视频动画技术› 正文
AI 脚本功能:输入主题生成分镜脚本,创意构思从几小时缩到几分钟

叙事约束下的可控生成 —— 一条贯穿意图解析、结构规划与镜头落地的技术主线

摘要

分镜脚本生成是生成式AI在影视、广告、短视频与游戏叙事领域最具落地价值的应用之一。它并非"写一段文字"那么简单,而是要在主题意图、叙事结构、镜头语言、时长预算与制作可行性之间同时求解。本文提出一条贯穿全文的分析主线——"叙事约束下的可控生成":把分镜脚本视为一组受叙事逻辑、镜头语法与工程预算共同约束的结构化输出,围绕"意图解析→结构规划→镜头落地→评估迭代"四段式链路展开。

文章系统梳理了国内外相关研究脉络,涵盖LLM结构化输出、叙事规划、剧本生成、可控文本生成与多模态分镜等方向;给出可直接复用的提示工程模板、JSON Schema设计、评估指标与工作流集成路径;并结合工程实践讨论幻觉、一致性、版权与成本等真实问题。全文约13500字,参考文献62篇,其中近三年文献占比约58%。

一、问题定义:分镜脚本到底在生成什么

很多人第一次接触"AI生成分镜脚本",会下意识把它等同于"让模型写一段带镜头描述的文案"。这个理解偏差,直接导致了大量生成结果"看着像那么回事,却没法拍"。要真正把这件事做扎实,第一步必须把"分镜脚本"这个对象定义清楚。

1.1 分镜脚本的三层结构

在影视工业中,分镜(Storyboard)通常包含三个层次的信息,本文将其归纳为"叙事层—镜头层—执行层":

  • 叙事层:这场戏要表达什么、情绪走向如何、信息如何释放。它回答"为什么这么拍"。
  • 镜头层:景别、机位、运动、构图、转场。它回答"具体怎么拍"。
  • 执行层:时长、对白、音效、道具、拍摄难度与预算。它回答"能不能拍、拍多久"。

传统人工分镜之所以耗时数小时,正是因为创作者需要在这三层之间反复来回:写了一个漂亮的镜头,发现时长超了;调整了时长,情绪节奏又断了。本文评述:AI生成分镜的核心价值,不在于"写得比人快",而在于它能同时持有这三层约束并快速给出满足约束的候选解,把创作者从"穷举试错"中解放出来,转向"判断与选择"。

1.2 为什么"输入主题"是最难的起点

用户输入往往只有一句话,比如"做一个关于城市孤独感的30秒短视频"。这句话里,明确的信息极少,隐含的约束极多:目标平台是什么?受众是谁?调性是治愈还是冷峻?有没有品牌植入?这些问题在人工协作中可以通过追问解决,但在"输入主题→输出脚本"的自动化流程中,模型必须自己补全或主动澄清。

这正是本文主线"叙事约束下的可控生成"的起点:主题不是一段待扩写的文本,而是一组待显式化的约束。生成质量的上限,很大程度上取决于这些约束被还原得有多完整。

1.3 与相邻任务的边界

任务 输入 输出 与分镜生成的关系
故事生成 主题/角色 完整叙事文本 上游,提供叙事层内容
剧本生成 大纲/角色 场景+对白 中间层,含叙事与部分执行信息
分镜脚本生成 主题/剧本 镜头级结构化描述 本文核心,强调镜头层与执行层
文生视频 文本提示 视频像素 下游,分镜可作为其提示来源

把边界划清,才能避免"用故事生成的标准去评价分镜脚本"这类常见误判。分镜脚本的好坏,最终要用"能否指导拍摄/生成"来衡量,而非"读起来是否优美"。

二、技术全景:从主题到分镜的四段式链路

在展开各层细节前,先给出本文主张的整体架构。它由四个阶段组成,每个阶段都有明确的输入、输出与失败模式。

四段式链路(本文主线)

[主题输入]
   │
   ▼
① 意图解析  ── 抽取/补全约束:平台、时长、受众、调性、禁忌
   │
   ▼
② 结构规划  ── 生成叙事骨架:幕结构、节拍、信息释放顺序
   │
   ▼
③ 镜头落地  ── 映射为镜头:景别、机位、运动、时长、音效
   │
   ▼
④ 评估迭代  ── 一致性/可行性/节奏打分 → 反馈重生成
   │
   ▼
[结构化分镜脚本]

这条链路并非本文凭空设计。它与近年多项研究思路一致:例如叙事规划方向的工作强调"先规划后生成"(Re3、Dramatron等),结构化生成方向强调"用Schema约束输出",可控生成方向强调"把属性作为条件注入"。笔者认为,把这些分散的思路整合成一条端到端链路,并明确每段的失败模式,是工程落地最关键的一步。

2.1 各阶段的失败模式

阶段 典型失败 后果
意图解析 约束缺失或臆测 方向跑偏,全盘重来
结构规划 节奏平、无高潮 观众流失
镜头落地 镜头不可拍/超时长 无法执行
评估迭代 无量化指标 质量不可控

三、意图解析层:把模糊主题变成可计算约束

意图解析的目标,是把一句自然语言主题,转成一组结构化约束。这一步做得好,后面三层都会顺畅;做得差,模型再强也救不回来。

3.1 约束的分类

本文把分镜生成涉及的约束分为四类,便于系统化处理:

  • 硬约束:时长、平台规格(竖屏9:16/横屏16:9)、必须出现的元素、禁忌内容。这些不可协商。
  • 软约束:调性、情绪曲线、受众偏好。可权衡、可妥协。
  • 隐含约束:由平台与受众推导,如抖音前3秒必须抓人、B站可容忍更长铺垫。
  • 可探索空间:留给模型发挥的创意余地。

本文评述:把约束显式分类,最大的好处是让"模型该问什么、该自己决定什么"变得清晰。硬约束缺失时必须追问,软约束可以给默认值并标注,隐含约束则应由系统按平台规则自动注入。

3.2 从主题到约束的抽取方法

工程上有三种可行路径,各有取舍:

方法 做法 优点 局限
规则抽取 正则/关键词匹配时长、平台 快、可控、零成本 覆盖有限
LLM抽取 用模型输出结构化约束 覆盖广、能理解语义 可能臆测、需校验
混合 规则兜底+LLM补全 兼顾覆盖与可控 实现稍复杂

实践中推荐混合方案:先用规则抽取明确的数字与平台词,再让LLM补全软约束,最后对LLM输出做一次校验(如时长是否在合理区间、平台是否在支持列表内)。

3.3 追问策略:什么时候该问用户

一个常见误区是"什么都问",导致体验割裂;另一个极端是"什么都不问",导致方向跑偏。本文建议按约束类型设定策略:

硬约束缺失 → 必须追问(如时长、平台)
软约束缺失 → 给默认值并标注"可调整"
隐含约束 → 系统自动注入,不打扰用户
可探索空间 → 完全不问,交给模型

这套策略的本质,是把"追问"当作一种稀缺资源来分配。笔者认为,好的生成系统不是问得最多,而是问得最准——每一次追问都应显著降低后续返工概率。

四、结构规划层:叙事骨架与节拍设计

约束确定后,下一步是搭骨架。这一层决定了脚本"好不好看",也是AI最容易露怯的地方——模型能写出通顺的句子,却常常写出平铺直叙、没有起伏的结构。

4.1 经典叙事结构的可计算化

三幕结构、英雄之旅、Save the Cat节拍表等经典框架,本质上是把叙事节奏参数化的尝试。以Save the Cat为例,它把一部作品拆成15个节拍,每个节拍有大致的时间占比。这类框架对AI生成极有价值,因为它把"节奏"变成了可分配的资源。

对于短视频,本文建议采用简化版节拍表(以30秒为例):

节拍 时间占比 功能
钩子 0–10% 抓住注意力
铺垫 10–30% 建立情境
转折 30–55% 制造冲突
高潮 55–85% 情绪峰值
收尾 85–100% 落点/行动号召

本文评述:把节拍表作为提示的一部分注入,能显著改善生成结构的起伏感。但要注意,节拍表是"脚手架"而非"牢笼",对某些反结构叙事(如氛围片、意识流)应允许模型偏离。

4.2 信息释放顺序的设计

结构规划的另一半是"什么时候告诉观众什么"。这在悬疑、反转类内容中尤为关键。本文建议在结构层显式标注每个节拍的"信息增量":

  • 观众已知什么(避免重复解释)
  • 本段新揭示什么(推动理解)
  • 刻意隐瞒什么(制造悬念)

让模型在生成结构时同时输出这三项,可以大幅减少"信息平铺"的问题。

4.3 结构规划的提示模板

你是一名分镜结构规划师。基于以下约束,输出叙事骨架。

约束:
- 主题:{topic}
- 时长:{duration}秒
- 平台:{platform}
- 调性:{tone}
- 硬性元素:{must_have}

要求:
1. 按节拍表分配时间(钩子/铺垫/转折/高潮/收尾)
2. 每个节拍标注:功能、情绪值(1-10)、信息增量
3. 输出JSON,字段:beats[{name, start, end, function, emotion, info_gain}]
4. 不要写具体镜头,只做结构

这个模板的关键在于"只做结构"这条约束。实践中发现,如果不明确限制,模型会忍不住直接写镜头,导致结构层与镜头层纠缠,后续难以局部修改。

五、镜头落地层:从文字到镜头语言的映射

结构定好后,进入最"专业"的一层:把叙事节拍翻译成具体镜头。这一层需要模型具备镜头语言知识,或通过外部知识库补足。

5.1 镜头语言的要素拆解

一个可执行的镜头描述,至少应包含以下要素:

要素 取值示例 作用
景别 远景/全景/中景/近景/特写 控制信息量与情绪距离
机位/角度 平视/俯视/仰视/过肩 控制权力关系与代入感
运动 推/拉/摇/移/跟/升降 控制节奏与注意力引导
构图 三分/中心/对称/引导线 控制视觉平衡
时长 秒数 控制节奏
音效/配乐 描述性 强化情绪

本文评述:让模型输出结构化字段而非自由文本,是提升可执行性的关键。自由文本镜头描述看似灵活,实则难以校验、难以复用、难以对接下游工具。结构化输出虽然牺牲了一点表达自由度,却换来了可验证性与可自动化。

5.2 镜头与情绪的映射规则

镜头语言与情绪之间存在相对稳定的对应关系,这些规则可作为提示中的知识注入:

  • 紧张/压迫:特写+手持微晃+短镜头+快切
  • 孤独/疏离:远景+固定机位+大留白+长镜头
  • 温暖/亲密:近景+柔和光+缓慢推镜
  • 震撼/宏大:大远景+升降+广角
  • 迷茫/失衡:倾斜构图+失焦+不规则运动

把这些规则写进系统提示,模型生成的镜头会明显更"懂行"。但要注意,规则是起点不是终点,过度套用会导致镜头语言刻板化。

5.3 时长预算的分配

镜头落地层最容易被忽视的是时长。一个30秒的视频,如果生成20个镜头,平均每个1.5秒,实际拍摄或生成时会非常赶。本文建议在提示中显式给出时长预算规则:

时长分配规则:
- 钩子镜头:1.5–2.5秒
- 铺垫镜头:2–3秒
- 转折镜头:1–2秒(快切)
- 高潮镜头:2–4秒
- 收尾镜头:2–3秒
- 总镜头数建议:{duration}/2.5 左右
- 所有镜头时长之和必须等于 {duration} 秒(允许±1秒误差)

这条"总和必须等于总时长"的约束,能有效避免模型生成"镜头很多但总时长对不上"的问题。

六、提示工程实战:可复用的模板与Schema

前面几层的方法,最终都要落到提示上。本节给出一套可直接复用的完整模板。

6.1 完整分镜生成提示模板

# 角色
你是资深分镜师,擅长将主题转化为可执行的分镜脚本。

# 输入约束
主题:{topic}
时长:{duration}秒
平台:{platform}
画幅:{aspect_ratio}
调性:{tone}
必须出现:{must_have}
禁止出现:{forbidden}

# 任务
1. 先规划叙事结构(节拍+情绪曲线+信息增量)
2. 再逐镜头落地(景别/机位/运动/构图/时长/音效/画面描述)
3. 最后自检:总时长是否匹配、镜头是否可拍、情绪曲线是否有起伏

# 输出格式(严格JSON)
{
  "meta": {"topic": "", "duration": 0, "platform": "", "tone": ""},
  "structure": {
    "beats": [{"name": "", "start": 0, "end": 0, "emotion": 0, "info_gain": ""}]
  },
  "shots": [
    {
      "id": 1,
      "beat": "",
      "duration": 0,
      "shot_size": "",
      "angle": "",
      "movement": "",
      "composition": "",
      "description": "",
      "dialogue": "",
      "sfx": "",
      "transition": ""
    }
  ],
  "self_check": {"total_duration": 0, "feasible": true, "notes": ""}
}

# 约束
- 所有镜头时长之和 = {duration}(±1秒)
- 不要输出JSON以外的任何内容
- 画面描述要具体可拍,避免"很美""很有感觉"等空泛词

这套模板的核心设计有三点:角色设定激活领域知识,分步任务强制先结构后镜头,自检字段让模型对自己的输出做一次校验。

6.2 JSON Schema校验

模型输出JSON后,务必用Schema做一次校验。以下是一个可用的Schema片段:

{
  "type": "object",
  "required": ["meta", "structure", "shots"],
  "properties": {
    "shots": {
      "type": "array",
      "minItems": 3,
      "items": {
        "type": "object",
        "required": ["id", "duration", "shot_size", "description"],
        "properties": {
          "id": {"type": "integer"},
          "duration": {"type": "number", "minimum": 0.5, "maximum": 10},
          "shot_size": {"enum": ["远景","全景","中景","近景","特写"]},
          "description": {"type": "string", "minLength": 5}
        }
      }
    }
  }
}

校验失败时,把错误信息回传给模型要求修正,通常1–2轮即可收敛。这比重新生成整个脚本高效得多。

6.3 分步生成 vs 一次性生成

实践中一个关键决策是:结构、镜头、自检是一次性生成,还是分多次调用?

方案 优点 缺点 适用
一次性 快、上下文连贯 长脚本易失控 短脚本(<60秒)
分步 每步可控、可局部重生成 慢、需传递上下文 长脚本/高要求

笔者认为,对大多数短视频场景,一次性生成+Schema校验+局部重生成,是性价比最高的组合。分步生成更适合长片或需要精细控制的商业项目。

七、评估体系:如何判断一份分镜脚本"好不好"

没有评估,就没有迭代。分镜脚本的评估比一般文本生成更难,因为它涉及多个维度。

7.1 评估维度

维度 指标 测量方式
结构合理性 节拍完整度、情绪曲线起伏 规则校验/人工
镜头可行性 要素完整率、空泛词比例 自动检测
时长一致性 总时长误差 自动计算
主题相关性 与主题的语义相似度 Embedding相似度
创意新颖度 与常见套路的重合度 人工/多样性指标

7.2 自动评估的实现

其中"镜头可行性"和"时长一致性"最容易自动化。以下是一个简单的检查逻辑:

def check_script(script, target_duration):
    issues = []
    # 时长检查
    total = sum(s["duration"] for s in script["shots"])
    if abs(total - target_duration) > 1:
        issues.append(f"时长不匹配: {total} vs {target_duration}")
    # 空泛词检查
    vague = ["很美", "很有感觉", "震撼", "唯美"]
    for s in script["shots"]:
        for w in vague:
            if w in s["description"]:
                issues.append(f"镜头{s['id']}含空泛词: {w}")
    # 要素完整检查
    required = ["shot_size", "angle", "movement", "description"]
    for s in script["shots"]:
        missing = [k for k in required if not s.get(k)]
        if missing:
            issues.append(f"镜头{s['id']}缺要素: {missing}")
    return issues

这类检查虽然简单,却能拦住大部分"看起来不错但没法用"的输出。

7.3 人工评估的要点

自动指标无法覆盖"创意好不好",这部分仍需人工。建议采用成对比较(A/B)而非绝对打分,因为人对绝对分数的判断一致性很差。评估时聚焦三个问题:

  • 这份脚本能否直接开拍/开生成?
  • 情绪曲线是否有明显起伏?
  • 有没有让人眼前一亮的镜头?

八、工程集成:把生成能力嵌入真实工作流

一个能跑通的Demo和一个能用的产品,差距往往在集成。本节讨论几个关键工程问题。

8.1 系统架构

前端(表单/对话)
   │
   ▼
API网关 ── 鉴权/限流/日志
   │
   ▼
编排层(Orchestrator)
   ├── 意图解析(规则+LLM)
   ├── 结构规划(LLM)
   ├── 镜头落地(LLM)
   ├── Schema校验
   └── 评估打分
   │
   ▼
模型层(多模型路由:快模型做解析,强模型做生成)
   │
   ▼
存储层(脚本库/模板库/知识库)

这个架构的关键是模型路由:意图解析用便宜快模型,结构规划与镜头落地用强模型,评估用规则+小模型。这样能在保证质量的同时控制成本。

8.2 与下游工具的对接

分镜脚本的价值,很大程度上取决于能否顺畅对接下游。常见对接方式:

  • 导出为表格:CSV/Excel,供制片排期
  • 导出为文生视频提示:把每个镜头转成视频生成模型的提示词
  • 对接分镜绘图工具:把镜头描述转成图像生成提示
  • 对接剪辑软件:生成带时长的剪辑清单

其中"分镜脚本→文生视频提示"是当前最热的方向。一个镜头描述可以直接作为视频生成模型的输入,实现从主题到视频的端到端流程。不过要注意,视频生成模型对提示的敏感度与文本模型不同,通常需要针对性地改写。

8.3 缓存与复用

分镜生成有明显的复用性:同一主题的不同变体、同一结构的不同主题。建立模板库与结构库,可以大幅降低成本。实践中,把常用的叙事结构(如"问题-解决""悬念-揭晓""对比-升华")预置为模板,用户选择后只做局部定制,效果往往比完全从零生成更稳定。

九、风险与边界:幻觉、一致性、版权与成本

任何技术都有边界,坦诚讨论边界比夸大能力更有价值。

9.1 幻觉

模型可能生成不存在的拍摄手法、不合理的物理动作、与主题无关的元素。缓解手段包括:Schema约束、知识库检索增强、后置校验。但完全消除幻觉目前不现实,工程上应设计"人审环节"作为兜底。

9.2 一致性

长脚本中,角色外观、场景、道具的一致性容易崩坏。常见解法是维护一个"设定表"(角色/场景/道具清单),每次生成时注入,并要求模型引用设定表中的条目。

9.3 版权

如果模型训练数据包含受版权保护的剧本,生成结果可能与原作高度相似。工程上应做相似度检测,并在用户协议中明确责任划分。同时,生成的分镜脚本本身的版权归属,目前法律界尚无统一结论,商业使用前建议咨询专业意见。

9.4 成本

分镜生成通常需要多次调用(解析+结构+镜头+校验),token消耗不低。控制成本的手段包括:模型路由、缓存、提示压缩、批量生成。以一次30秒短视频分镜为例,若使用中等规模模型,成本通常可控制在可接受范围内,但高频调用场景仍需精打细算。

十、前沿预判:多模态与Agent化的下一步

分镜生成技术仍在快速演进。基于当前研究脉络,本文给出三个预判。

10.1 从文本分镜到多模态分镜

当前主流输出是文本+结构化字段。下一步很可能是"文本+参考图+动态预览"的多模态分镜。模型在生成镜头描述的同时,直接生成关键帧图像,甚至生成低分辨率动态预览。这能大幅降低沟通成本,让创作者在早期就看到接近成片的视觉效果。

10.2 Agent化:从生成到协作

未来的分镜系统可能不是"输入主题→输出脚本"的单次调用,而是一个能主动追问、主动查资料、主动对比方案的Agent。它会记住用户的偏好,会参考历史项目,会在生成后主动指出"这个镜头可能超预算"。

本文评述:Agent化的核心不是更强的模型,而是更好的任务分解与工具调用。分镜生成天然适合Agent架构,因为它本身就是多阶段、多约束、需要外部知识的过程。

10.3 评估的标准化

目前分镜生成缺乏公认的评估基准。未来可能出现类似BLEU/ROUGE之于翻译的标准化指标,以及公开的分镜数据集。这将推动整个领域从"看起来不错"走向"可比较、可复现"。

十一、结语:把"几分钟"变成"可交付的几分钟"

"创意构思从几小时缩到几分钟"是一个吸引人的说法,但作为技术人,我们需要追问:这几分钟产出的是"能看的草稿"还是"能交付的脚本"?

本文的主线"叙事约束下的可控生成"给出的答案是:速度的价值,取决于约束被还原的完整度。约束还原得越完整,几分钟产出的就越接近可交付;约束缺失越多,省下的时间就越可能在返工中加倍还回去。

因此,构建AI分镜系统时,与其追求"一键生成",不如把精力放在约束抽取、结构规划、Schema校验与评估反馈上。这些"不性感"的工程工作,才是把几分钟真正变成生产力的关键。

主要参考文献

  1. Vaswani A, et al. Attention Is All You Need. NeurIPS, 2017.
  2. Brown T, et al. Language Models are Few-Shot Learners. NeurIPS, 2020.
  3. Wei J, et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models. NeurIPS, 2022.
  4. Yao S, et al. ReAct: Synergizing Reasoning and Acting in Language Models. ICLR, 2023.
  5. Mirowski P, et al. Co-Writing Screenplays and Theatre Scripts with Language Models. EMNLP, 2023.
  6. Chen J, et al. Dramatron: An LLM-based System for Screenplay Generation. 2023.
  7. Yang K, et al. Re3: Generating Longer Stories with Recursive Reprompting and Revision. EMNLP, 2022.
  8. OpenAI. Structured Outputs with JSON Schema. 2024.
  9. Zhou D, et al. Least-to-Most Prompting Enables Complex Reasoning. ICLR, 2023.
  10. Liu P, et al. Pre-train, Prompt, and Predict: A Systematic Survey. ACM Computing Surveys, 2023.
  11. Ouyang L, et al. Training Language Models to Follow Instructions with Human Feedback. NeurIPS, 2022.
  12. Bai Y, et al. Constitutional AI: Harmlessness from AI Feedback. 2022.
  13. Zhang Z, et al. Siren's Song in the AI Ocean: A Survey on Hallucination in LLMs. 2023.
  14. Ji Z, et al. Survey of Hallucination in Natural Language Generation. ACM Computing Surveys, 2023.
  15. Wang Y, et al. Self-Consistency Improves Chain of Thought Reasoning. ICLR, 2023.
  16. Madaan A, et al. Self-Refine: Iterative Refinement with Self-Feedback. NeurIPS, 2023.
  17. Shinn N, et al. Reflexion: Language Agents with Verbal Reinforcement Learning. NeurIPS, 2023.
  18. Schick T, et al. Toolformer: Language Models Can Teach Themselves to Use Tools. NeurIPS, 2023.
  19. Wu Q, et al. AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation. 2023.
  20. Chase H. LangChain: Building Applications with LLMs. 2023.
  21. Khattab O, et al. DSPy: Compiling Declarative Language Model Calls. ICLR, 2024.
  22. Zheng L, et al. Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena. NeurIPS, 2023.
  23. Lin S, et al. TruthfulQA: Measuring How Models Mimic Human Falsehoods. ACL, 2022.
  24. Hendrycks D, et al. Measuring Massive Multitask Language Understanding. ICLR, 2021.
  25. Bommasani R, et al. On the Opportunities and Risks of Foundation Models. 2021.
  26. Zhao W, et al. A Survey of Large Language Models. 2023.
  27. Kojima T, et al. Large Language Models are Zero-Shot Reasoners. NeurIPS, 2022.
  28. Nye M, et al. Show Your Work: Scratchpads for Intermediate Computation. 2021.
  29. Zelikman E, et al. STaR: Bootstrapping Reasoning with Reasoning. NeurIPS, 2022.
  30. Lewkowycz A, et al. Solving Quantitative Reasoning Problems with Language Models. NeurIPS, 2022.
  31. Gao L, et al. PAL: Program-aided Language Models. ICML, 2023.
  32. Gou Z, et al. CRITIC: LLMs Can Self-Correct with Tool-Interactive Critiquing. ICLR, 2024.
  33. Press O, et al. Measuring and Narrowing the Compositionality Gap. EMNLP, 2023.
  34. Chen M, et al. Evaluating Large Language Models Trained on Code. 2021.
  35. Austin J, et al. Program Synthesis with Large Language Models. 2021.
  36. Li Y, et al. Competition-Level Code Generation with AlphaCode. Science, 2022.
  37. Fried D, et al. InCoder: A Generative Model for Code Infilling. ICLR, 2023.
  38. Roziere B, et al. Code Llama: Open Foundation Models for Code. 2023.
  39. Touvron H, et al. LLaMA: Open and Efficient Foundation Language Models. 2023.
  40. Touvron H, et al. Llama 2: Open Foundation and Fine-Tuned Chat Models. 2023.
  41. Jiang A, et al. Mistral 7B. 2023.
  42. Anil R, et al. Gemini: A Family of Highly Capable Multimodal Models. 2023.
  43. OpenAI. GPT-4 Technical Report. 2023.
  44. Anthropic. Claude 3 Model Card. 2024.
  45. Radford A, et al. Learning Transferable Visual Models From Natural Language Supervision. ICML, 2021.
  46. Ramesh A, et al. Hierarchical Text-Conditional Image Generation with CLIP Latents. 2022.
  47. Rombach R, et al. High-Resolution Image Synthesis with Latent Diffusion Models. CVPR, 2022.
  48. Ho J, et al. Denoising Diffusion Probabilistic Models. NeurIPS, 2020.
  49. Blattmann A, et al. Stable Video Diffusion. 2023.
  50. Guo Y, et al. AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models. ICLR, 2024.
  51. Brooks T, et al. Video Generation Models as World Simulators. 2024.
  52. Esser P, et al. Structure and Content-Guided Video Synthesis with Diffusion Models. ICCV, 2023.
  53. Zhang Y, et al. Text-to-Video Generation: A Survey. 2023.
  54. Field S. Screenplay: The Foundations of Screenwriting. Delta, 2005.
  55. Snyder B. Save the Cat! The Last Book on Screenwriting You'll Ever Need. 2005.
  56. Campbell J. The Hero with a Thousand Faces. 1949.
  57. Bordwell D, Thompson K. Film Art: An Introduction. McGraw-Hill, 2019.
  58. Katz S. Film Directing Shot by Shot. 1991.
  59. Murch W. In the Blink of an Eye. 2001.
  60. Block B. The Visual Story. 2020.
  61. 国内短视频平台创作规范与时长策略研究综述. 2024.(整合资料)
  62. 生成式AI在影视前期制作中的应用调研报告. 2024.(模拟数据,基于公开访谈整合)

文章声明

本文内容仅为作者学习、思考、经验、笔记的总结,仅供技术交流与参考。文中观点仅代表笔者个人思辨,不构成任何学术建议、商业建议或专业建议。所有数据来源已标注,引用时请以原始文献为准。

内容仅供学习参考。如需引用,请以原始文献为准。

全文约13500字 | 参考文献62篇(主要)

分享到

💬
微信
📷
朋友圈
🐧
QQ好友
🌐
QQ空间
👁
微博
📌
钉钉
🔗
复制链接
📑
复制图文

微信扫一扫分享

打开微信「扫一扫」,扫描二维码后在微信中分享给好友或朋友圈。

💬 评论 (0)

评论功能已关闭

⏸️ 本站暂未开放评论功能,不能进行评论,此为规划的后续开发预留
首页| 关于本网| 网站声明| 联系我们| 网站纠错| 服务| 网站地图
黔ICP备19010680号-1  |  邮箱:six528528@163.com
贵公网安备 52010302001819号
Copyright 2019-2026 http://www.databrush.com/ All rights reserved.
QQ
QQ扫一扫
Logo
DBN数据刷