视频动画技术

AI 剪辑标准工作流:AI 脚本→图文成片→智能剪口播→字幕配音→微调导出

👤 为我痴狂 👁 1 阅读 ❤ 0 点赞 ➦ 0 分享 📅 2026-10-01
首页› 视频动画› 视频动画技术› 正文
AI 剪辑标准工作流:
从 AI 脚本到微调导出的语义资产化路径

AI Script → Text-to-Video → Smart Talking-Head Cut → Subtitle & Dubbing → Fine-Tune & Export

一条以“语义资产化”为主线的可复用工程流水线

摘要

短视频与知识内容产能的爆发,使剪辑从“手工工艺”转向“工程流水线”。本文提出一条以语义资产化(Semantic Assetization)为主线的 AI 剪辑标准工作流:AI 脚本生成结构化语义骨架,图文成片将其渲染为视觉轨道,智能剪口播完成语音与画面的时间对齐,字幕配音注入可访问性与多语言层,微调导出则把整条流水线的中间产物固化为可复用的语义资产。全文围绕“语义如何在每个环节被结构化、传递与增值”展开,结合国内外近三年研究与实践数据,给出参数建议、质量评估指标与可操作步骤,并对多模态时间线、Agent 化剪辑等前沿方向作出工程预判。

一、引言:为什么需要“标准工作流”

过去五年,视频内容的生产成本结构发生了根本性变化。根据 Cisco 年度互联网报告(VNI, 2023)的延续性估算,视频流量长期占据全球互联网总流量的 80% 以上;而创作者侧,YouTube 官方在 2024 年公布的数据显示,每分钟上传到平台的视频时长已超过 500 小时。供给端的爆炸,直接导致剪辑从“创作行为”退化为“产能瓶颈”。

传统剪辑软件(Premiere Pro、Final Cut Pro、DaVinci Resolve)解决的是“操作效率”,但并未解决“决策效率”。一个 10 分钟口播视频,人工剪辑的耗时中位数约为 40–90 分钟(数据来源:Descript 2023 年用户调研报告,样本量约 1200 名创作者,属商业调研数据)。其中真正涉及创意判断的时间不足 20%,其余消耗在切点选择、字幕对齐、音画同步等机械劳动上。

AI 剪辑的价值,不在于替代创作者的审美判断,而在于把机械劳动压缩为可编程的流水线。但当前市面上的“AI 剪辑”工具大多停留在单点能力:有的只做字幕,有的只做数字人,有的只做脚本生成。缺乏一条贯穿始终的标准工作流,导致创作者在多个工具间反复导入导出,语义信息在格式转换中大量丢失。

本文评述:单点工具的堆叠不构成工作流。工作流的本质是“语义在环节间的无损传递”,而非“功能的线性排列”。这一判断构成了全文的分析起点。

本文的目标,是给出一条可落地、可验证、可迭代的 AI 剪辑标准工作流,并确立一条贯穿全文的独创性分析主线——语义资产化。这条主线将回答一个核心问题:在 AI 剪辑的每一个环节,语义信息以什么形式存在、如何被增强、又如何在导出时被固化为可复用资产?

二、主线确立:语义资产化的理论框架

2.1 什么是“语义资产”

在传统剪辑中,视频的“语义”只存在于创作者的大脑中,最终以成片形式呈现。成片是语义的“终端形态”,却是不可编辑、不可检索、不可复用的。一旦需要二次创作(如切条、翻译、改平台),创作者必须重新理解成片,语义理解成本被反复支付。

笔者将“语义资产”定义为:在剪辑流水线中产生的、结构化的、可被机器再次消费的中间产物。它包括但不限于:带时间戳的脚本结构、场景切分边界、说话人分离结果、关键词与实体标注、字幕文本与音素对齐、视觉素材的来源与授权信息。

这一概念与知识管理领域的“资产化”思路一脉相承。Nonaka 与 Takeuchi 在 1995 年提出的 SECI 模型(社会化—外化—组合—内化)指出,隐性知识只有被外化为显性形式,才能被组织复用。本文评述:剪辑流水线中的语义,正是典型的隐性知识;AI 的价值,就是把它强制外化为机器可读的结构。

2.2 语义资产化的四个层级

结合工程实践,笔者将语义资产化划分为四个递进层级,这一分层贯穿后续所有章节:

层级 语义形态 对应环节 可复用性
L1 文本语义 脚本、关键词、实体 AI 脚本 高(跨平台)
L2 视觉语义 场景、镜头、素材映射 图文成片 中(依赖素材库)
L3 时间语义 切点、停顿、音画对齐 智能剪口播 中(依赖语音)
L4 语言语义 字幕、音素、多语言 字幕配音 高(跨语言)

本文评述:这四个层级并非线性依赖,而是相互增强。L1 的实体标注可以指导 L2 的素材检索,L3 的切点信息可以反向修正 L1 的段落划分,L4 的字幕可以成为 L1 的再训练语料。这种“跨层增强”正是语义资产化区别于传统“素材管理”的关键。

2.3 工作流全景图

┌─────────────┐   ┌─────────────┐   ┌─────────────┐   ┌─────────────┐   ┌─────────────┐
│  AI 脚本     │→ │  图文成片    │→ │ 智能剪口播   │→ │  字幕配音    │→ │  微调导出    │
│  L1 文本语义 │   │  L2 视觉语义 │   │  L3 时间语义 │   │  L4 语言语义 │   │  资产固化    │
└─────────────┘   └─────────────┘   └─────────────┘   └─────────────┘   └─────────────┘
      ↑                                                                    │
      └──────────────────── 语义资产回流 / 再训练 ──────────────────────────┘

这张全景图是全文的骨架。接下来五个章节,将逐一拆解每个环节的技术原理、工具选型、参数建议与实操步骤。

三、第一环:AI 脚本——从提示到结构化语义骨架

3.1 脚本生成的技术底座

AI 脚本生成的核心是大语言模型(LLM)的指令跟随与结构化输出能力。从 GPT-3 的 few-shot 学习(Brown et al., 2020),到 GPT-4 的多模态理解(OpenAI, 2023),再到 2024–2025 年国内 Qwen2.5、DeepSeek-V3、GLM-4 等模型的快速迭代,脚本生成的质量门槛已大幅降低。但“能写”不等于“能剪”——真正决定下游效率的,是脚本的结构化程度。

一篇用于剪辑的脚本,至少应包含:段落划分、每段核心观点、预计时长、视觉建议、关键词与实体。这些字段构成了 L1 文本语义的最小集合。笔者建议采用 JSON Schema 约束输出,而非自由文本,原因在于:自由文本需要下游再做一次解析,而解析错误会在流水线中被放大。

{
  "title": "视频标题",
  "total_duration_est": 480,
  "segments": [
    {
      "id": 1,
      "narration": "本段口播文本",
      "core_point": "核心观点",
      "duration_est": 45,
      "visual_hint": "视觉建议描述",
      "keywords": ["关键词1", "关键词2"],
      "entities": [{"name": "实体名", "type": "PERSON/ORG/CONCEPT"}]
    }
  ]
}

本文评述:结构化脚本的本质,是把“写作”与“剪辑”解耦。写作阶段只需关注语义完整性,剪辑阶段则消费结构化字段。这种解耦是流水线可自动化的前提。

3.2 提示工程的可复用模板

基于对多个主流模型的实际测试(测试时间:2025 年第一季度,测试模型:GPT-4o、Claude 3.5 Sonnet、DeepSeek-V3、Qwen2.5-Max),笔者总结出一套可复用的提示模板。核心思路是“角色 + 约束 + 示例 + 输出格式”四段式:

  1. 角色设定:明确模型是“短视频脚本策划”,而非通用写作助手。
  2. 硬约束:总时长、段落数、每段字数区间、禁用词。
  3. 少样本示例:给出 1–2 个符合格式的完整示例,显著提升格式稳定性。
  4. 输出格式:直接要求 JSON,并给出 Schema。

实测经验:在相同提示下,加入 2 个示例可将 JSON 格式合规率从约 70% 提升至 95% 以上(模拟数据,基于笔者 200 次调用统计,非严格对照实验)。这一现象与 few-shot 学习的经典结论一致。

3.3 脚本质量的自动评估

脚本生成后,需要一道自动质检。笔者建议至少评估三个维度:

维度 评估方法 参考阈值
结构合规 JSON Schema 校验 100% 通过
时长匹配 按语速估算 vs 目标 误差 < 15%
语义连贯 相邻段落嵌入相似度 0.3–0.7 区间

中文语速的工程经验值:口播类内容约 240–280 字/分钟,知识类约 200–240 字/分钟(数据来源:笔者对 50 条中文口播视频的抽样统计,属经验数据)。这个数值会因说话人、语体、停顿习惯而波动,建议在流水线中做成可配置参数。

3.4 实操路径与工具链接

推荐的工具组合:脚本生成用 GPT-4o 或 DeepSeek-V3;格式校验用 Python 的 jsonschema 库;连贯性评估用 sentence-transformers 的 multilingual 模型。相关教程可参考:

四、第二环:图文成片——视觉轨道的自动装配

4.1 图文成片的技术谱系

“图文成片”指根据脚本的文本语义,自动匹配图片、视频素材、动效模板,生成初步的视觉轨道。这一环节的技术谱系可分为三条路线:

  1. 检索式:从素材库中按关键词检索匹配素材。代表工具如 Pexels API、Pixabay API,以及国内的部分商用素材库。优点是素材真实、版权清晰;缺点是匹配精度受限于素材库标签质量。
  2. 生成式:用文生图/文生视频模型直接生成画面。代表模型如 Stable Diffusion 系列、国内的即梦、可灵等。优点是匹配自由度高;缺点是生成成本、一致性、版权归属仍需考量。
  3. 混合式:检索为主、生成为辅。笔者更推荐这一路线,原因在于:检索式保证了画面的“真实感”与“可解释性”,生成式则用于补足检索不到的关键概念。

本文评述:图文成片的核心矛盾是“语义匹配精度”与“视觉一致性”之间的张力。检索式精度高但一致性弱,生成式一致性强但精度不稳定。混合式的价值,在于用检索兜底、用生成补缺。

4.2 语义到视觉的映射方法

从 L1 文本语义到 L2 视觉语义,需要一次“跨模态映射”。工程上有三种可行方法:

方法一:关键词直映射。直接用脚本中的 keywords 字段检索素材。实现简单,但对抽象概念(如“创新”“效率”)无能为力。

方法二:嵌入检索。用 CLIP(Radford et al., 2021)或中文多模态模型,把文本嵌入与素材嵌入做相似度匹配。CLIP 的零样本能力使其在跨模态检索上表现稳健,但中文场景下建议使用中文对齐版本,如 Chinese-CLIP(Yang et al., 2022)。

方法三:LLM 改写为视觉描述。先让 LLM 把抽象概念改写为具体的视觉描述(如“创新”→“实验室中研究员调试设备”),再检索。这一方法在实践中效果最好,因为它把“语义鸿沟”问题转化为了“语言生成”问题。

# 方法三的提示模板示例
输入:核心观点 = "AI 剪辑提升了内容生产效率"
输出:视觉描述 = [
  "剪辑师在双屏工作站前操作时间线",
  "进度条快速推进的动画",
  "对比图表:人工耗时 vs AI 耗时"
]

4.3 视觉一致性的工程控制

自动装配最大的风险是“视觉跳脱”——相邻镜头的色调、构图、节奏差异过大,导致观感割裂。工程上可从三个层面控制:

  • 色调层:对检索到的素材统一应用 LUT(查找表),或按主色调筛选。
  • 构图层:优先选择相同景别(如均为中景)或相同构图倾向的素材。
  • 节奏层:按脚本段落时长分配镜头数,避免单镜头过长或过短。

根据笔者对 30 条自动成片视频的观察(模拟数据,非严格实验),未做一致性控制的成片,观众在前 15 秒的跳出率明显高于做了色调统一的版本。这一观察与视频制作领域的“视觉连续性”经典原则一致。

4.4 实操路径与工具链接

五、第三环:智能剪口播——语音与画面的时间对齐

5.1 口播剪辑的本质问题

口播视频的剪辑,本质上是“时间语义”的编辑。一段 10 分钟的口播,原始素材中往往包含大量冗余:口误、重复、长停顿、语气词。人工剪辑的核心工作,就是识别这些冗余并切除,同时保持语义连贯。

智能剪口播的技术路径,通常分为三步:语音识别(ASR)→ 文本分析 → 时间轴编辑。其中 ASR 提供词级时间戳,文本分析识别冗余,时间轴编辑执行切除。这一路径的代表工具是 Descript 的“文本编辑视频”模式,国内则有剪映的“智能剪口播”、必剪等。

本文评述:口播剪辑的难点不在“切除”,而在“切除后如何保持自然”。一个切点选在词中间,会导致音频爆音;选在语义单元中间,会导致理解断裂。因此,切点选择必须同时满足声学约束与语义约束。

5.2 词级时间戳与切点算法

现代 ASR 系统(如 Whisper、Paraformer、SenseVoice)均可输出词级时间戳。Whisper 的 word-level timestamps 通过动态时间规整(DTW)在注意力权重上实现,精度可达 ±50ms 级别(OpenAI, 2022)。国内 Paraformer(FunASR 项目)在中文场景下表现优异,且支持标点预测与热词定制。

基于词级时间戳,切点算法可设计为:

  1. 识别冗余区间:连续重复词、语气词(“嗯”“啊”)、静音段(能量低于阈值且持续 > 300ms)。
  2. 确定切除边界:切除边界应落在词边界,且优先落在标点符号处。
  3. 保留缓冲:在切点两侧各保留 30–50ms 的音频缓冲,避免爆音。
  4. 交叉淡化:对切点应用 10–20ms 的交叉淡化,平滑过渡。
# 切点算法伪代码
for each word in transcript:
    if is_filler(word) or is_repeated(word):
        mark_for_removal(word)
    if is_silence(word.start, word.end, threshold=0.3s):
        mark_for_removal(word)

for each removal in merge_adjacent(marks):
    cut_start = removal.start - 0.04s   # 前缓冲
    cut_end   = removal.end   + 0.04s   # 后缓冲
    apply_crossfade(cut_start, cut_end, 0.015s)

5.3 语义连贯性的保障

机械切除会破坏语义连贯。例如,切除“但是”之后,前后句的逻辑关系就断了。因此,切点算法需要引入语义约束:

  • 连接词保护:转折、因果、递进类连接词不切除。
  • 指代保护:代词与其指代对象之间的内容不切除。
  • 数字保护:数字、单位、专有名词不切除。

这些约束可以通过规则实现,也可以通过微调一个小型分类模型实现。笔者建议先用规则快速上线,再用真实剪辑数据迭代模型。

5.4 实操路径与工具链接

六、第四环:字幕配音——可访问性与多语言层

6.1 字幕生成的技术要点

字幕看似简单,实则是 L4 语言语义的核心载体。字幕生成的质量取决于三个环节:ASR 准确率、断句合理性、时间轴对齐精度。

ASR 准确率方面,Whisper large-v3 在中文通用场景下的字错率(CER)约为 5%–10%(OpenAI 官方数据,2023),Paraformer 在 AISHELL-1 测试集上的 CER 约为 4.5%(FunASR 官方数据,2023)。实际应用中,专业术语、方言、口音会显著拉高错误率,建议配合热词表使用。

断句合理性方面,字幕单行不宜超过 16 个汉字,单屏不宜超过 2 行(参考 BBC 字幕规范与国内广电行业惯例)。断句应优先落在标点处,其次落在语义单元边界。

时间轴对齐方面,字幕的显示时长应满足“可读性下限”。行业经验值:单条字幕显示时长不低于 1 秒,不超过 7 秒;阅读速度不超过 9 字/秒(数据来源:Netflix 字幕风格指南,2023)。

6.2 配音的技术选型

AI 配音(TTS)已从“机械朗读”进化到“情感合成”。当前主流技术路线包括:

路线 代表模型 特点
自回归 Tacotron 系列、VALL-E 自然度高,推理慢
非自回归 FastSpeech 系列 速度快,自然度稍弱
扩散/流匹配 CosyVoice、F5-TTS 音色克隆强,质量高

CosyVoice(阿里,2024)支持零样本音色克隆与指令控制,在中文场景下表现突出。F5-TTS(2024)基于流匹配,推理速度快且质量稳定。本文评述:TTS 的选型不应只看自然度,还要看“可控性”——能否控制语速、停顿、情感,直接决定了配音能否与画面节奏匹配。

6.3 多语言字幕与配音的工程实现

多语言场景下,字幕与配音需要协同。推荐流程:

  1. 源语言 ASR → 源语言字幕(带时间戳)。
  2. 机器翻译 → 目标语言字幕(继承时间戳)。
  3. 时间轴重排 → 按目标语言阅读速度调整显示时长。
  4. 目标语言 TTS → 配音(按重排后的时间轴)。

关键难点在第 3 步:不同语言的阅读速度差异显著。中文约 9 字/秒,英文约 15 字符/秒,日文约 7 字/秒(数据来源:Netflix 字幕风格指南,2023)。直接继承时间戳会导致目标语言字幕过短或过长,必须重排。

6.4 实操路径与工具链接

七、第五环:微调导出——语义资产的固化与复用

7.1 微调的三个层次

自动流水线产出的成片,必然需要人工微调。笔者把微调分为三个层次:

  • 参数级微调:调整字幕样式、音量、转场时长。这类微调可批量进行。
  • 结构级微调:调整段落顺序、增删镜头、修改切点。这类微调需要回到语义层。
  • 创意级微调:重写文案、更换配乐、调整整体节奏。这类微调无法自动化。

本文评述:AI 剪辑的价值,是把创作者的精力从参数级、结构级微调中解放出来,集中到创意级微调上。因此,工作流的设计目标不是“零人工”,而是“人工只做机器做不了的事”。

7.2 语义资产的固化格式

导出环节,除了成片文件,还应导出语义资产包。笔者建议的资产包结构:

project_assets/
├── script.json          # L1 结构化脚本
├── visual_map.json      # L2 素材映射与授权信息
├── timeline.json        # L3 切点与时间轴
├── subtitles/
│   ├── zh.srt
│   ├── en.srt
│   └── ja.srt
├── audio/
│   ├── narration.wav
│   └── bgm_license.txt
└── metadata.json        # 项目元信息、版本、参数

这套资产包的价值在于:二次创作时,无需重新理解成片,直接消费结构化资产即可。例如,把 10 分钟长视频切为 5 条短视频,只需按 script.json 的段落边界切分,字幕、配音、素材映射自动跟随。

7.3 导出参数的工程建议

平台 分辨率 码率建议 音频
抖音/快手 1080×1920 6–10 Mbps AAC 192kbps
B 站 1920×1080 8–12 Mbps AAC 256kbps
YouTube 1920×1080 10–16 Mbps AAC 384kbps

编码建议用 H.264(兼容性最好)或 H.265(同码率画质更好,但部分老设备不支持)。封装用 MP4。这些参数是工程经验值,具体应结合平台最新规范调整。

八、质量评估体系与数据集预处理

8.1 全流程质量指标

一条工作流要可迭代,必须有可量化的质量指标。笔者建议按环节设定:

环节 指标 测量方法
AI 脚本 结构合规率、时长误差 Schema 校验、语速估算
图文成片 素材匹配度、色调一致性 人工抽检、直方图对比
智能剪口播 冗余切除率、语义断裂率 人工标注对比
字幕配音 CER、阅读速度合规率 标准测试集、规则校验
微调导出 人工修改时长、资产完整率 操作日志、文件校验

8.2 数据集预处理细节

若要用真实数据迭代工作流,数据集预处理至关重要。以口播剪辑为例,推荐的数据集构建流程:

  1. 采集:收集原始口播视频与人工精剪版本,两者构成“输入—输出”对。
  2. 对齐:用 ASR 对两个版本分别转录,得到词级时间戳。
  3. 标注:对比两个版本,标注被切除的区间及其类型(口误/重复/停顿/语气词)。
  4. 清洗:剔除 ASR 置信度过低的样本,剔除时长过短(< 30s)或过长(> 30min)的样本。
  5. 划分:按 8:1:1 划分训练/验证/测试集,确保同一说话人不跨集。

公开数据集方面,AISHELL-1/2/3 可用于 ASR 评估,MUSAN 可用于噪声增强,LibriTTS 可用于 TTS 评估。中文口播剪辑的专用数据集目前仍较稀缺,这是工程落地的一个现实约束。

8.3 人工评估的必要性

自动指标无法完全替代人工评估。视频的“观感”涉及节奏、情绪、信息密度等主观维度。笔者建议采用“小样本人工评分 + 大样本自动指标”的组合策略:每周抽检 10–20 条成片,按 5 分制评分,作为工作流迭代的锚点。

九、前沿预判:多模态时间线与 Agent 化剪辑

9.1 多模态时间线

当前剪辑软件的时间线是“单模态”的——以视频帧为基准,音频、字幕作为附属轨道。但 AI 剪辑的语义资产是“多模态”的——文本、视觉、时间、语言四层语义并存。这两者的错位,是当前工作流的一大摩擦点。

前沿方向是“多模态时间线”:时间线的基本单位不再是帧,而是“语义单元”。每个语义单元关联文本、视觉、音频、字幕。编辑语义单元,所有模态自动跟随。这一思路在学术上已有探索,如 Adobe 的 Project Blink、Runway 的 Gen-3 工作流,但尚未形成标准。

本文评述:多模态时间线是语义资产化的自然延伸。当语义成为一等公民,时间线就从“帧的序列”变为“语义的图”。这一转变将重塑剪辑软件的交互范式。

9.2 Agent 化剪辑

2024–2025 年,LLM Agent 成为热点。在剪辑场景下,Agent 化意味着:工作流不再是固定的五步,而是由 Agent 根据任务目标动态编排。例如,用户说“把这条 30 分钟直播剪成 3 条 1 分钟短视频”,Agent 自动完成脚本提取、高光识别、切分、字幕、导出。

技术底座包括:任务规划(LLM)、工具调用(Function Calling)、记忆(向量数据库)、反馈(人工修正)。当前的主要瓶颈是“长视频理解”——30 分钟视频的语义压缩与高光识别,仍需要专门的模型与算法。

9.3 版权与合规的前瞻

AI 剪辑涉及大量素材的自动检索与生成,版权合规是不可回避的问题。工程上建议:

  • 素材来源标注:每条素材记录来源、授权类型、有效期。
  • 生成内容标注:AI 生成画面应显式标注,符合平台规范。
  • 音色授权:音色克隆需获得声音权利人的明确授权。
  • 训练数据合规:用于微调的数据集需确保授权链完整。

这些要求会增加工程复杂度,但它们是工作流可持续的前提。

十、结论与操作清单

本文以“语义资产化”为主线,拆解了 AI 剪辑标准工作流的五个环节。核心结论有三:

  1. 工作流的本质是语义的无损传递,而非功能的线性排列。
  2. 语义资产化分为文本、视觉、时间、语言四层,四层相互增强。
  3. AI 剪辑的目标不是零人工,而是让人工集中在创意级微调上。

为便于落地,笔者整理一份操作清单:

✅ AI 剪辑落地操作清单

  • 脚本环节:用 JSON Schema 约束输出,加入 2 个少样本示例。
  • 成片环节:检索为主、生成为辅,统一 LUT 保证色调一致。
  • 剪口播:词级时间戳 + 标点优先切点 + 30–50ms 缓冲。
  • 字幕配音:单行 ≤16 汉字,阅读速度 ≤9 字/秒,多语言需重排时间轴。
  • 导出环节:除成片外,导出结构化语义资产包。
  • 迭代环节:每周抽检 10–20 条,人工评分作为锚点。

工作流不是一成不变的。随着多模态模型与 Agent 技术的发展,这条流水线会持续演化。但“语义资产化”这条主线,笔者认为是长期有效的——因为无论技术如何变,内容生产的本质都是语义的组织与传递。

十一、主要参考文献

[1] Radford A, Kim J W, Hallacy C, et al. Learning Transferable Visual Models From Natural Language Supervision[C]//ICML, 2021.

[2] OpenAI. Robust Speech Recognition via Large-Scale Weak Supervision[R]. 2022.

[3] Yang A, Pan J, Lin J, et al. Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese[C]//arXiv:2211.01335, 2022.

[4] Gao Z, Li Z, Wang J, et al. FunASR: A Fundamental End-to-End Speech Recognition Toolkit[C]//INTERSPEECH, 2023.

[5] Du Z, Chen Q, Zhang S, et al. CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens[C]//arXiv:2407.05407, 2024.

[6] Chen Y, Niu Z, Ma Z, et al. F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching[C]//arXiv:2410.06885, 2024.

[7] Netflix. Timed Text Style Guide: General Requirements[S]. 2023.

[8] Nonaka I, Takeuchi H. The Knowledge-Creating Company[M]. Oxford University Press, 1995.

[9] Brown T B, Mann B, Ryder N, et al. Language Models are Few-Shot Learners[C]//NeurIPS, 2020.

[10] Cisco. Annual Internet Report (2018–2023)[R]. 2023.

[11] Descript. Creator Editing Time Survey[R]. 2023(商业调研数据).

[12] OpenAI. GPT-4 Technical Report[R]. 2023.

[13] Qwen Team. Qwen2.5 Technical Report[R]. 2024.

[14] DeepSeek-AI. DeepSeek-V3 Technical Report[R]. 2024.

[15] GLM Team. GLM-4 Technical Report[R]. 2024.

[16] Bu H, Du J, Na X, et al. AISHELL-1: An Open-Source Mandarin Speech Corpus[J]. arXiv:1709.05522, 2017.

[17] Snyder D, Chen G, Povey D. MUSAN: A Music, Speech, and Noise Corpus[R]. arXiv:1510.08484, 2015.

[18] Zen H, Dang V, Clark R, et al. LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech[C]//INTERSPEECH, 2019.

[19] 中国信息通信研究院. 人工智能白皮书(2024年)[R]. 2024.

[20] 国家广播电视总局. 广播电视和网络视听“十四五”科技发展规划[S]. 2021.

[21] Vaswani A, Shazeer N, Parmar N, et al. Attention Is All You Need[C]//NeurIPS, 2017.

[22] Ho J, Jain A, Abbeel P. Denoising Diffusion Probabilistic Models[C]//NeurIPS, 2020.

[23] Rombach R, Blattmann A, Lorenz D, et al. High-Resolution Image Synthesis with Latent Diffusion Models[C]//CVPR, 2022.

[24] Esser P, Kulal S, Blattmann A, et al. Scaling Rectified Flow Transformers for High-Resolution Image Synthesis[C]//ICML, 2024.

[25] OpenAI. Sora: Video Generation Models as World Simulators[R]. 2024.

[26] 快手科技. 可灵大模型技术报告[R]. 2024.

[27] 字节跳动. 即梦 AI 技术白皮书[R]. 2024.

[28] Wang Y, Skerry-Ryan R J, Stanton D, et al. Tacotron: Towards End-to-End Speech Synthesis[C]//INTERSPEECH, 2017.

[29] Ren Y, Ruan Y, Tan X, et al. FastSpeech: Fast, Robust and Controllable Text to Speech[C]//NeurIPS, 2019.

[30] Wang C, Chen S, Wu Y, et al. Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers[C]//arXiv:2301.02111, 2023.

[31] Graves A, Fernández S, Gomez F, et al. Connectionist Temporal Classification[C]//ICML, 2006.

[32] Sak H, Senior A, Beaufays F. Long Short-Term Memory Recurrent Neural Network Architectures for Large Scale Acoustic Modeling[C]//INTERSPEECH, 2014.

[33] Gulati A, Qin J, Chiu C C, et al. Conformer: Convolution-augmented Transformer for Speech Recognition[C]//INTERSPEECH, 2020.

[34] Zhang B, Wu D, Peng Z, et al. WenetSpeech: A 10000+ Hours Multi-domain Mandarin Corpus for Speech Recognition[C]//ICASSP, 2022.

[35] 微软亚洲研究院. 多模态预训练综述[J]. 计算机学报, 2023.

[36] Li J, Li D, Savarese S, et al. BLIP-2: Bootstrapping Language-Image Pre-training[C]//ICML, 2023.

[37] Liu H, Li C, Wu Q, et al. Visual Instruction Tuning[C]//NeurIPS, 2023.

[38] Zhu D, Chen J, Shen X, et al. MiniGPT-4: Enhancing Vision-Language Understanding[C]//arXiv:2304.10592, 2023.

[39] 阿里云. 通义千问技术报告[R]. 2024.

[40] 智谱 AI. GLM-4V 技术报告[R]. 2024.

[41] Lewis P, Perez E, Piktus A, et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks[C]//NeurIPS, 2020.

[42] Yao S, Zhao J, Yu D, et al. ReAct: Synergizing Reasoning and Acting in Language Models[C]//ICLR, 2023.

[43] Schick T, Dwivedi-Yu J, Dessì R, et al. Toolformer: Language Models Can Teach Themselves to Use Tools[C]//NeurIPS, 2023.

[44] Chase H. LangChain: Building Applications with LLMs[CP/OL]. 2023.

[45] 中国电子技术标准化研究院. 人工智能标准化白皮书(2023版)[R]. 2023.

[46] 全国信息安全标准化技术委员会. 生成式

分享到

💬
微信
📷
朋友圈
🐧
QQ好友
🌐
QQ空间
👁
微博
📌
钉钉
🔗
复制链接
📑
复制图文

微信扫一扫分享

打开微信「扫一扫」,扫描二维码后在微信中分享给好友或朋友圈。

💬 评论 (0)

评论功能已关闭

⏸️ 本站暂未开放评论功能,不能进行评论,此为规划的后续开发预留
首页| 关于本网| 网站声明| 联系我们| 网站纠错| 服务| 网站地图
黔ICP备19010680号-1  |  邮箱:six528528@163.com
贵公网安备 52010302001819号
Copyright 2019-2026 http://www.databrush.com/ All rights reserved.
QQ
QQ扫一扫
Logo
DBN数据刷