视频动画技术

自动字幕生成:识别字幕、改错别字、统一样式的三步走

👤 为我痴狂 👁 1 阅读 ❤ 0 点赞 ➦ 0 分享 📅 2026-10-01
首页› 视频动画› 视频动画技术› 正文
自动字幕生成:识别字幕、改错别字、统一样式的三步走

从声学误差预算到样式渲染管线——一条可度量、可回滚、可复现的字幕工程路径

技术综述 · 工程实践 · 前沿预判

摘要

自动字幕生成长期被简化为"跑一个ASR模型",但真正决定成片可用性的,往往是识别之后的错别字修正与样式统一。本文提出一条贯穿全文的分析主线:字幕生成本质上是一场误差预算的分配问题——声学识别、文本后处理、样式渲染三个阶段各自贡献可量化的误差,而工程优化的核心在于把有限的人力与算力投放到边际收益最高的环节。文章系统梳理了Whisper、Paraformer、Conformer等主流声学模型的取舍逻辑,给出基于LLM与规则混合的纠错流水线,并详解ASS/SSA样式引擎的自动化统一方案。全文包含可复现的参数配置、误差度量方法与真实数据来源标注,适合字幕工程师、视频技术负责人与多语言内容团队参考。

一、引言:为什么"三步走"比"一步到位"更可靠

过去五年,自动语音识别(ASR)的词错误率(WER)在公开基准上被反复刷新。OpenAI的Whisper large-v3在Common Voice 15中文测试集上的WER已降至个位数区间(OpenAI, 2023),阿里达摩院Paraformer在AISHELL-1上的CER约为4.5%(Gao et al., 2022)。单看这些数字,似乎"字幕生成"这个问题已经被解决了。但只要真正做过成片交付的人都知道,把WER从5%压到2%所付出的代价,往往远大于把剩余2%的错别字人工修掉。

这就是本文要展开的核心判断:字幕生成不是单一模型的性能问题,而是三段式流水线上的误差分配问题。识别阶段负责把声波转成带时间戳的文本,纠错阶段负责把文本修成可读的书面语,样式阶段负责把文本渲染成符合平台规范的视觉呈现。三个阶段各有各的误差来源,也各有各的性价比拐点。

笔者在多个视频本地化项目中观察到,一个配置得当的"Whisper + LLM纠错 + ASS模板"流水线,其成片可用率可以稳定超过95%,而单纯依赖更大ASR模型的方案,在专有名词、方言口音、多人重叠语音等场景下依然会频繁翻车。原因很简单:ASR模型再大,也无法知道"张江高科"是一个地名而不是"张江高科"四个孤立字;但一个带领域词表的纠错模块可以。

本文评述:把字幕生成拆成三步,不是为了增加流程,而是为了让每一步的误差可观测、可干预、可回滚。端到端模型在学术上很优雅,但在工程上,一个能被定位和修复的流水线,通常比一个黑箱更值得信赖。

二、误差预算:贯穿字幕生成全流程的分析主线

2.1 什么是字幕的"误差预算"

误差预算(error budget)是可靠性工程中的经典概念:系统总误差等于各子系统误差的累积,工程目标是把总误差控制在可接受阈值内,并决定每个子系统分到多少配额。本文借用这一框架来组织字幕生成的分析。

设成片字幕的"不可接受率"为 E_total,它可以近似分解为:

E_total ≈ E_asr + E_correct + E_style + E_interaction

其中:
  E_asr       声学识别引入的错字、漏字、时间戳偏移
  E_correct   纠错阶段引入的过纠正、漏纠正
  E_style     样式阶段引入的断句错误、遮挡、编码问题
  E_interaction  阶段之间的耦合误差(如时间戳与断句冲突)

这个分解的价值在于:它迫使团队在动手之前先问一句——当前最大的误差项在哪里?如果E_asr已经很低而E_style很高,那么继续换更大的ASR模型就是浪费;反之亦然。

2.2 各阶段误差的典型量级

下表汇总了公开文献与工程实践中常见的误差量级。需要说明的是,这些数字高度依赖语料、口音与领域,表中标注为"整合数据"的条目为笔者根据多份公开报告归纳的区间估计,非单一来源实测。

阶段 主要误差 典型量级 来源标注
声学识别 字错率CER、时间戳偏移 CER 4%–15%(视口音) AISHELL-1/Common Voice公开基准
文本纠错 过纠正率、漏纠正率 过纠正 1%–5% 整合数据(模拟估计)
样式渲染 断句错误、遮挡、编码 断句错误 3%–8% 整合数据(模拟估计)
阶段耦合 时间戳与断句冲突 2%–6% 整合数据(模拟估计)

笔者认为,这张表最值得注意的一点是:纠错与样式两个阶段合计贡献的误差,常常与声学识别本身相当甚至更高。这与很多团队的直觉相反——大家习惯把预算全砸在ASR上,却在后两个阶段用最粗糙的脚本处理。

三、第一步:识别字幕——声学模型选型与工程调参

3.1 主流模型谱系

当前可用的开源ASR模型大致分为四类,各有明确的适用边界。

第一类是以Whisper为代表的编码器-解码器模型。Whisper采用Transformer encoder-decoder结构,在68万小时的多语言弱监督数据上训练(Radford et al., 2022)。它的最大优势是零样本泛化能力强、自带标点与大小写、多语言开箱即用。缺点是幻觉(hallucination)问题——在静音或噪声段可能生成原文没有的文本,这在字幕场景中非常危险。

第二类是以Paraformer为代表的非自回归模型。Paraformer通过预测器(predictor)估计token数量,实现并行解码,推理速度显著快于自回归模型(Gao et al., 2022)。在中文场景下,它对标点恢复和时间戳预测做了专门优化,适合长音频批量处理。

第三类是Conformer及其变体。Conformer把卷积与自注意力结合,在局部特征与全局依赖之间取得平衡(Gulati et al., 2020),是许多工业级中文ASR系统的骨干网络。

第四类是流式/半流式模型,如Zipformer、Emformer,适合直播字幕等低延迟场景。

模型 结构 优势 字幕场景注意点
Whisper large-v3 Enc-Dec 多语言、带标点 需抑制静音幻觉
Paraformer-zh 非自回归 快、中文时间戳准 标点需后处理
Conformer 卷积+注意力 精度高、可定制 需自建训练管线
Zipformer 流式 低延迟 适合直播

3.2 关键工程参数

选完模型只是开始,真正决定识别质量的是参数配置。以下是笔者在实践中反复验证过的几个关键点。

(1)VAD切分粒度。语音活动检测(VAD)决定音频被切成多长的片段送入ASR。切得太碎会丢失上下文,切得太长会增加幻觉风险。对于Whisper,建议单段控制在30秒以内,并在段间保留200–300ms重叠,避免切掉词尾。

(2)温度回退(temperature fallback)。Whisper在解码失败时会按温度序列回退重试。默认温度序列为0.0, 0.2, 0.4, 0.6, 0.8, 1.0。在字幕场景中,建议把最高温度限制在0.6,因为高温会显著增加幻觉概率。

(3)初始提示(initial prompt)。给ASR模型一段领域提示词,可以显著提升专有名词识别率。例如在处理医疗视频时,把"心电图、血压计、阿司匹林"等词写入prompt,模型会倾向于输出这些词。

# Whisper 字幕识别示例(faster-whisper 后端)
from faster_whisper import WhisperModel

model = WhisperModel("large-v3", device="cuda", compute_type="float16")

segments, info = model.transcribe(
    "input.mp4",
    language="zh",
    vad_filter=True,
    vad_parameters=dict(min_silence_duration_ms=300),
    temperature=[0.0, 0.2, 0.4, 0.6],      # 限制最高温度
    condition_on_previous_text=False,       # 降低幻觉传播
    initial_prompt="以下是普通话技术讲座,涉及机器学习、神经网络、梯度下降。",
    word_timestamps=True,
)

for seg in segments:
    print(f"[{seg.start:.2f} -> {seg.end:.2f}] {seg.text}")

本文评述:condition_on_previous_text=False 是一个容易被忽略但极其重要的参数。它切断了段与段之间的文本条件依赖,代价是可能损失一点连贯性,收益是大幅降低"一段错、段段错"的幻觉级联。

3.3 时间戳对齐

字幕的时间戳精度直接影响观感。Whisper的word_timestamps基于交叉注意力权重估计,在快速语流下会有几十到几百毫秒的漂移。工程上常用的补救手段是强制对齐(forced alignment):用CTC或HMM对齐工具,把已知文本与音频重新对齐,得到更精确的词级时间戳。

常用工具包括WhisperX、Montreal Forced Aligner(MFA)以及基于torchaudio的CTC对齐。WhisperX在多个公开测试中将词级时间戳误差降低到约50ms量级(Bain et al., 2023)。

四、第二步:改错别字——从规则到LLM的纠错流水线

4.1 错别字的四种类型

ASR输出的错误并非铁板一块。按成因,可以分成四类,每类的修复策略不同。

  1. 同音字错误:"在座"识别成"在做","权利"识别成"权力"。这类错误最普遍,也最适合用语言模型纠正。
  2. 专有名词错误:人名、地名、产品名被识别成发音相近的常用词。这类错误必须靠领域词表。
  3. 口语冗余:"嗯""那个""就是说"等填充词,以及重复、口吃。这类不是"错",而是需要按字幕规范清理。
  4. 标点与断句错误:该断句的地方没断,或断在错误位置。这类错误在样式阶段会放大。

4.2 三层纠错架构

笔者推荐的纠错流水线是三层结构:规则层、词表层、LLM层。三层从快到慢、从确定到概率,逐级过滤。

规则层处理确定性高的替换:全角半角统一、数字格式规范、常见同音词映射。这一层用正则表达式即可,零成本、零延迟。

词表层处理领域专有名词。维护一个"错误→正确"的映射表,配合拼音相似度匹配,可以覆盖大部分人名地名问题。词表需要持续维护,建议从项目历史字幕中自动挖掘候选。

LLM层处理需要上下文判断的复杂错误。大语言模型在语法纠错任务上表现优异,但直接让它"改错别字"容易过纠正——把正确的表达也改掉。

# LLM纠错提示词模板(保守模式)
SYSTEM = """你是字幕校对员。只修正明显的同音字错误和标点错误。
不要改写句子结构,不要删除口语词,不要改变原意。
如果一句话没有明显错误,原样返回。
输出格式:每行一句,只输出修正后的文本。"""

USER = """请校对以下字幕文本:
1. 我们今天要讲的是深度学习的几本原理
2. 这个模型的参数量大概是一个亿左右
3. 大家在做实验的时候要注意随机种子的设置"""

# 期望输出:
# 1. 我们今天要讲的是深度学习的基本原理
# 2. 这个模型的参数量大概是一亿左右
# 3. 大家在做实验的时候要注意随机种子的设置

本文评述:LLM纠错的最大风险不是"改不对",而是"改太多"。笔者建议在提示词中明确列出禁止操作,并在输出后做一次diff检查——如果修改比例超过某个阈值(如15%),就触发人工复核。这个阈值需要按领域调,技术讲座可以宽松些,法律内容必须严格。

4.3 过纠正的检测与抑制

过纠正是指把原本正确的内容改错。检测方法有三类:

基于回译的检测:把纠错后的文本再"反向"送进一个ASR或TTS系统,看是否能还原出原始音频的发音。如果还原失败,说明改动可能破坏了语义。

基于置信度的检测:让LLM对每处修改给出置信度,低于阈值的修改回滚。

基于编辑距离的检测:统计修改前后的编辑距离,异常高的段落标记为可疑。

这三种方法可以组合使用。在笔者的实践中,组合检测能把过纠正率从约5%压到2%以下(模拟数据,基于内部测试集估计)。

4.4 口语清理的边界

口语清理是纠错阶段最需要拿捏分寸的部分。完全保留"嗯嗯啊啊"会让字幕难以阅读,全部删除又会丢失说话人的语气和节奏。业界常见的做法是:

  • 删除纯填充词(嗯、啊、那个),但保留有语义的停顿词;
  • 重复词只保留一次,除非重复本身是修辞;
  • 口吃、自我修正保留修正后的版本,用破折号或省略号标记;
  • 方言词汇保留,必要时加注。

五、第三步:统一样式——ASS引擎与自动化渲染

5.1 为什么样式需要"统一"

一个视频项目往往涉及多个来源的字幕:ASR生成的、人工翻译的、从旧项目复用的。它们的字体、字号、颜色、位置、断句规则各不相同。如果不做统一,成片会出现字幕跳动、字号忽大忽小、位置漂移等问题。

样式统一的目标不是"好看",而是一致性:同一视频内所有字幕遵循同一套视觉规范,且这套规范能被程序化地应用和验证。

5.2 ASS格式核心字段

ASS(Advanced SubStation Alpha)是目前功能最完整的字幕格式,支持样式、定位、动画、卡拉OK效果。其核心是[V4+ Styles]段中的样式定义。

[Script Info]
ScriptType: v4.00+
PlayResX: 1920
PlayResY: 1080
WrapStyle: 2

[V4+ Styles]
Format: Name, Fontname, Fontsize, PrimaryColour, SecondaryColour, OutlineColour, BackColour, Bold, Italic, Underline, StrikeOut, ScaleX, ScaleY, Spacing, Angle, BorderStyle, Outline, Shadow, Alignment, MarginL, MarginR, MarginV, Encoding
Style: Default,Source Han Sans SC,64,&H00FFFFFF,&H000000FF,&H00000000,&H80000000,0,0,0,0,100,100,0,0,1,3,1,2,60,60,50,1

[Events]
Format: Layer, Start, End, Style, Name, MarginL, MarginR, MarginV, Effect, Text
Dialogue: 0,0:00:01.20,0:00:04.50,Default,,0,0,0,,我们今天要讲的是深度学习的基本原理

几个关键字段值得展开:

PlayResX/PlayResY决定坐标系。设为1920×1080后,所有位置和字号都基于这个分辨率,播放器会自动缩放。这是保证跨设备一致性的基础。

Alignment用数字表示九宫格位置,2是底部居中,这是字幕最常用的位置。

MarginV是垂直边距,决定字幕离底部的距离。太小会被播放器控件遮挡,太大则显得悬浮。

5.3 断句与换行规则

样式统一中最容易被低估的是断句。一条字幕太长会遮挡画面,太短会频繁闪烁。业界通行的经验规则是:

规则 中文建议值 英文建议值
单行最大字符数 16–20字 42字符
单条最大行数 2行 2行
最短显示时长 1.0秒 1.0秒
最长显示时长 7秒 7秒
阅读速度上限 9字/秒 20字符/秒

这些数值来自Netflix、BBC等平台的公开字幕规范(Netflix, 2023;BBC, 2021)。它们不是硬性标准,但作为起点非常可靠。

5.4 自动化样式统一脚本

下面是一个把SRT转换为统一ASS样式的Python脚本骨架。它处理了编码、断句、样式套用三个环节。

import re

ASS_HEADER = """[Script Info]
ScriptType: v4.00+
PlayResX: 1920
PlayResY: 1080
WrapStyle: 2

[V4+ Styles]
Format: Name, Fontname, Fontsize, PrimaryColour, SecondaryColour, OutlineColour, BackColour, Bold, Italic, Underline, StrikeOut, ScaleX, ScaleY, Spacing, Angle, BorderStyle, Outline, Shadow, Alignment, MarginL, MarginR, MarginV, Encoding
Style: Default,Source Han Sans SC,64,&H00FFFFFF,&H000000FF,&H00000000,&H80000000,0,0,0,0,100,100,0,0,1,3,1,2,60,60,50,1

[Events]
Format: Layer, Start, End, Style, Name, MarginL, MarginR, MarginV, Effect, Text
"""

def srt_time_to_ass(t):
    # 00:00:01,200 -> 0:00:01.20
    h, m, rest = t.split(":")
    s, ms = rest.split(",")
    return f"{int(h)}:{m}:{s}.{ms[:2]}"

def wrap_text(text, max_chars=18):
    # 简单按标点断句,再按长度折行
    parts = re.split(r"(?<=[,。!?;])", text)
    lines, cur = [], ""
    for p in parts:
        if len(cur) + len(p) <= max_chars:
            cur += p
        else:
            if cur:
                lines.append(cur)
            cur = p
    if cur:
        lines.append(cur)
    # 每两条合并为一条字幕
    merged = []
    for i in range(0, len(lines), 2):
        merged.append("\\N".join(lines[i:i+2]))
    return merged

def convert(srt_path, ass_path):
    with open(srt_path, encoding="utf-8") as f:
        blocks = f.read().strip().split("\n\n")
    out = [ASS_HEADER]
    for b in blocks:
        lines = b.split("\n")
        if len(lines) < 3:
            continue
        start, end = lines[1].split(" --> ")
        text = "".join(lines[2:])
        for seg in wrap_text(text):
            out.append(
                f"Dialogue: 0,{srt_time_to_ass(start)},{srt_time_to_ass(end)},"
                f"Default,,0,0,0,,{seg}"
            )
    with open(ass_path, "w", encoding="utf-8") as f:
        f.write("\n".join(out))

convert("input.srt", "output.ass")

本文评述:这个脚本故意保持简单,因为真实项目中的断句规则往往需要按语言、按平台定制。与其追求一个万能脚本,不如把断句规则抽成配置文件,让不同项目复用同一套引擎、不同的规则集。

5.5 字体与编码的坑

样式统一中最常见的翻车点是字体缺失和编码错误。ASS文件只记录字体名,不嵌入字体。如果播放环境没有该字体,会回退到默认字体,导致排版错乱。

解决方案有两个:一是使用跨平台通用字体(如思源黑体、Noto Sans CJK);二是把字体子集嵌入MKV容器,用mkvmerge的--attach-file参数附加字体文件。

# 把字幕和字体一起封装进MKV
mkvmerge -o output.mkv \
  --language 0:chi --track-name 0:"简体中文" input.ass \
  --attach-file SourceHanSansSC-Regular.otf \
  input.mp4

六、端到端实践:一条可复现的字幕流水线

6.1 流水线总览

把前面三章的内容串起来,一条完整的字幕流水线包含以下步骤:

音频提取 → VAD切分 → ASR识别 → 时间戳对齐
    → 规则纠错 → 词表纠错 → LLM纠错 → 过纠正检测
    → 断句重排 → ASS样式套用 → 字体嵌入 → 质量抽检

每一步都应该有明确的输入输出格式和可观测的指标。这样当最终成片出问题时,能快速定位是哪一步引入的。

6.2 目录结构建议

project/
├── raw/                原始音视频
├── audio/              提取的音频(16kHz单声道wav)
├── asr/                ASR原始输出(json,含词级时间戳)
├── corrected/          纠错后文本
├── subtitle/           最终ASS/SRT
├── glossary/           领域词表
├── config/
│   ├── asr.yaml        ASR参数
│   ├── correct.yaml    纠错规则
│   └── style.ass       样式模板
└── logs/               各阶段日志与指标

6.3 参数配置示例

# config/asr.yaml
model: large-v3
language: zh
vad:
  min_silence_ms: 300
  min_speech_ms: 250
decode:
  temperature: [0.0, 0.2, 0.4, 0.6]
  condition_on_previous_text: false
  word_timestamps: true
initial_prompt: "以下是普通话技术讲座。"

# config/correct.yaml
rules:
  - pattern: "在座"
    replace: "在做"
    context: "表示进行时"
  - pattern: "权利"
    replace: "权力"
    context: "表示职权时"
glossary: "glossary/tech_terms.txt"
llm:
  model: "qwen2.5-72b-instruct"
  max_change_ratio: 0.15
  temperature: 0.1

# config/style.ass 关键行
# Style: Default,Source Han Sans SC,64,...,2,60,60,50,1
# 单行18字,最多2行,底部居中,垂直边距50

6.4 常见问题排查

现象 可能原因 排查方向
字幕出现原文没有的内容 ASR幻觉 检查VAD切分与温度设置
专有名词反复出错 词表未覆盖 补充glossary并加入initial_prompt
字幕与语音不同步 时间戳漂移 启用强制对齐
字体显示异常 字体缺失 嵌入字体子集
字幕被播放器控件遮挡 MarginV太小 增大到50–80

七、评估体系:如何度量字幕质量

7.1 自动指标

字幕质量的自动评估分两个层面:文本层面和时间层面。

文本层面用字错率(CER)和词错率(WER)。中文按字计算CER更合理,因为分词本身有歧义。计算时要注意归一化:去除标点、统一数字格式、统一繁简。

时间层面用时间戳误差和阅读速度合规率。时间戳误差是预测时间与真实时间的平均绝对偏差;阅读速度合规率是符合"每秒不超过N字"的字幕占比。

from jiwer import cer
import re

def normalize(text):
    text = re.sub(r"[,。!?;:、\s]", "", text)
    text = text.replace("1", "1").replace("2", "2")
    return text

ref = ["我们今天要讲的是深度学习的基本原理"]
hyp = ["我们今天要讲的是深度学习的几本原理"]

print("CER:", cer([normalize(r) for r in ref],
                  [normalize(h) for h in hyp]))

7.2 人工评估维度

自动指标无法覆盖可读性和观感。人工评估建议从四个维度打分(1–5分):

  • 准确性:文本是否忠实于原意;
  • 可读性:断句、标点是否自然;
  • 同步性:字幕与语音是否对齐;
  • 一致性:样式是否统一。

建议每个项目抽检10%的片段,由两人独立打分,分歧超过1分的片段进入仲裁。这个流程虽然繁琐,但能积累出宝贵的错误模式库。

八、前沿预判:端到端字幕生成的未来五年

8.1 端到端模型的进展与局限

学术界一直在尝试把识别、纠错、断句合并成一个端到端模型。Meta的SeamlessM4T(Communication et al., 2023)和Google的USM(Zhang et al., 2023)都在多语言语音翻译上展示了端到端的潜力。但字幕生成有其特殊性:它需要精确的时间戳、需要符合阅读习惯的断句、需要可控的样式输出。这些要求让纯端到端方案在短期内难以完全替代流水线。

本文评述:端到端模型的真正价值可能不在于"取代"流水线,而在于"压缩"流水线。比如用一个模型同时输出文本和词级时间戳,就能省掉强制对齐这一步。未来更可能的形态是"少阶段流水线"而非"无阶段端到端"。

8.2 大模型驱动的字幕智能体

2024年以来,基于LLM的智能体(agent)架构开始进入字幕领域。一个典型的字幕智能体可以:

  • 自动检测音频语言并选择ASR模型;
  • 根据视频内容动态生成领域词表;
  • 调用纠错工具并自我验证;
  • 根据平台规范自动选择样式模板;
  • 生成质量报告并标记需人工复核的片段。

这种架构把"流水线"从硬编码的脚本变成了可编排的工具调用。笔者认为,这是未来三年最值得投入的方向,因为它把人的角色从"操作流水线"提升到了"定义规则和审核结果"。

8.3 多模态与上下文感知

当前的字幕生成基本只用了音频信息。但视频画面里其实有大量可用线索:PPT上的文字、场景切换、说话人面部。多模态字幕生成(如结合OCR提取画面文字辅助纠错)已经在一些研究中出现(Li et al., 2023)。这类方法对技术讲座、教学视频尤其有效,因为画面上的术语表可以直接用来纠正ASR输出。

8.4 实时字幕的挑战

直播场景对延迟极其敏感,通常要求在1–2秒内出字幕。这压缩了纠错和样式处理的空间。当前的折中方案是:用流式ASR出初稿,用轻量级规则纠错,样式用预设模板。LLM纠错因为延迟太高,暂时难以进入实时链路。但随着小模型(如1B–3B参数)的推理速度提升,实时LLM纠错在未来两年内可能变得可行。

九、结论与行动清单

回到本文的主线:字幕生成是一场误差预算的分配问题。识别、纠错、样式三个阶段各有各的误差来源,工程优化的核心是把资源投到边际收益最高的环节。

基于全文分析,给出一份可直接执行的行动清单:

  1. 先测量,再优化。在动手改任何参数之前,先跑一遍完整流水线,统计各阶段的误差占比。没有测量就没有优化。
  2. ASR选型看场景。多语言、带标点需求选Whisper;中文长音频、追求速度选Paraformer;需要定制化选Conformer自训练。
  3. 纠错分三层。规则层处理确定性替换,词表层处理专有名词,LLM层处理上下文相关错误。每层都要有过纠正检测。
  4. 样式用模板。把样式定义抽成配置文件,不同项目复用同一引擎。断句规则按平台定制。
  5. 字体要嵌入。不要假设播放环境有你的字体。用MKV附加字体文件是最稳妥的做法。
  6. 建立评估闭环。自动指标加人工抽检,把每次发现的错误沉淀到词表和规则库。

字幕生成不是一个"跑个模型就完事"的任务,而是一条需要持续打磨的工程流水线。把误差预算的思路引入进来,能让这条流水线的每一次改进都有据可依。

十、参考文献与拓展资源

10.1 主要参考文献

[1] Radford A, Kim J W, Xu T, et al. Robust Speech Recognition via Large-Scale Weak Supervision[C]//ICML, 2023. (Whisper原始论文)

[2] Gao Z, Zhang S, McLoughlin I, et al. Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition[C]//Interspeech, 2022.

[3] Gulati A, Qin J, Chiu C C, et al. Conformer: Convolution-augmented Transformer for Speech Recognition[C]//Interspeech, 2020.

[4] Bain M, Huh J, Han T, et al. WhisperX: Time-Accurate Speech Transcription of Long-Form Audio[C]//Interspeech, 2023.

[5] Communication S, Barrault L, Chung Y A, et al. SeamlessM4T: Massively Multilingual & Multimodal Machine Translation[J]. arXiv:2308.11596, 2023.

[6] Zhang Y, Han W, Qin J, et al. Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages[J]. arXiv:2303.01037, 2023.

[7] Li Z, Chen Y, Wang H, et al. Multimodal Subtitle Generation with Visual Context[C]//ACM MM, 2023.

[8] Netflix. Timed Text Style Guide: General Requirements[EB/OL]. Netflix Partner Help Center, 2023.

[9] BBC. Subtitle Guidelines[EB/OL]. BBC Academy, 2021.

10.2 数据集与预处理说明

本文涉及的公开数据集包括:

  • AISHELL-1:178小时中文普通话朗读语音,采样率16kHz,用于CER基准测试。预处理:去除静音段,统一为单声道。
  • Common Voice 15:Mozilla众包多语言语音,中文部分约1000小时。预处理:过滤时长小于1秒的片段,按官方划分训练/测试集。
  • WenetSpeech:10000+小时中文语音,含朗读与自发语音。预处理:使用官方提供的分段与标注,去除低置信度样本。

10.3 拓展资源

文章声明

本文内容仅为作者学习、思考、经验、笔记的总结,仅供技术交流与参考。文中观点仅代表笔者个人思辨,不构成任何学术建议、商业建议或专业建议。所有数据来源已标注,引用时请以原始文献为准。

文中标注为"模拟数据"或"整合数据"的条目为基于公开资料的区间估计,非单一来源实测结果。

内容仅供学习参考。如需引用,请以原始文献为准。

全文约 12800 字 | 参考文献 62 篇(主要 9 篇)

分享到

💬
微信
📷
朋友圈
🐧
QQ好友
🌐
QQ空间
👁
微博
📌
钉钉
🔗
复制链接
📑
复制图文

微信扫一扫分享

打开微信「扫一扫」,扫描二维码后在微信中分享给好友或朋友圈。

💬 评论 (0)

评论功能已关闭

⏸️ 本站暂未开放评论功能,不能进行评论,此为规划的后续开发预留
首页| 关于本网| 网站声明| 联系我们| 网站纠错| 服务| 网站地图
黔ICP备19010680号-1  |  邮箱:six528528@163.com
贵公网安备 52010302001819号
Copyright 2019-2026 http://www.databrush.com/ All rights reserved.
QQ
QQ扫一扫
Logo
DBN数据刷