以“时间轴对齐精度”为主线,贯通语音识别、强制对齐、分段重排与批量编辑的完整技术链路
摘要
口播视频的字幕生产长期受困于“识别准但时间轴飘、改一条要动十条”的工程难题。本文提出一条贯穿全文的分析主线:字幕效率的本质瓶颈不在识别准确率,而在时间轴对齐精度与批量编辑的一致性传播能力。围绕这条主线,文章依次拆解语音活动检测(VAD)、自动语音识别(ASR)、强制对齐(forced alignment)、字幕分段与重排、批量修改的差分同步五个环节,结合WhisperX、Whisper、wav2vec2、Montreal Forced Aligner等开源方案,给出可复现的参数配置、脚本路径与质量评估指标。本文评述认为,当前开源工具链已能把中文口播字幕的端到端处理时间压缩到音频时长的0.1~0.3倍,但词级时间戳在连读、儿化、气声场景下仍存在系统性偏差,需通过VAD边界约束与二次对齐修正。文末给出面向个人创作者与小型团队的落地路线图,并讨论多模态对齐与端侧推理的前沿方向。
关键词:语音识别;强制对齐;字幕批量编辑;VAD分段;口播视频
目录
1 引言:为什么“识别准”不等于“字幕好用”
过去五年,自动语音识别(Automatic Speech Recognition, ASR)在中文通用场景下的字错率(Character Error Rate, CER)已从两位数降到个位数。以OpenAI Whisper系列为代表的端到端模型,在AISHELL-1、WenetSpeech等公开测试集上报告了具有竞争力的结果(Radford et al., 2022;Zhang et al., 2022)。然而,大量口播视频创作者的真实体验却是:识别出来的文字大体正确,但字幕“对不上嘴”——要么整段提前半秒,要么某句话突然滞后,手动拖动时间轴的工作量甚至超过重新打字。
这个落差揭示了一个被普遍忽视的事实:字幕质量的瓶颈不在文本识别,而在时间轴对齐。ASR模型输出的通常是片段级(segment-level)时间戳,其边界由模型的注意力机制或CTC峰值推断,精度在数百毫秒量级;而观众对字幕与语音同步的容忍阈值通常在100~200毫秒以内(ITU-R BT.1359建议书中对音频-视频同步可察觉阈值的讨论)。两者之间的差距,正是“识别准但字幕难用”的根源。
本文评述认为,要真正实现“一键生成、批量修改”,必须把字幕生产重新理解为一个时间轴工程问题,而非单纯的文本转录问题。围绕这条主线,本文构建了从VAD分段、ASR识别、强制对齐、字幕重排到批量编辑的完整链路,每一环都服务于同一个目标:让字幕的时间边界尽可能逼近真实发音边界,并让批量修改能够一致地传播到所有相关条目。
笔者认为,把字幕工具的效率指标从“识别准确率”切换到“单位音频的人工修正时间”,是理解本文全部技术选择的关键。一个CER为5%但时间轴稳定的系统,其实际可用性往往高于CER为3%但时间轴漂移的系统。
2 问题建模:字幕生成的形式化定义与误差来源
2.1 形式化定义
给定音频信号 \(x(t)\),字幕生成的目标是输出一个有序序列 \(S = \{(t_i^{start}, t_i^{end}, w_i)\}_{i=1}^{N}\),其中 \(w_i\) 是第 \(i\) 个字或词,\((t_i^{start}, t_i^{end})\) 是其发音起止时间。理想情况下,字幕边界应与音素边界对齐;工程上则要求 \(|t_i^{start} - \hat{t}_i^{start}|\) 与 \(|t_i^{end} - \hat{t}_i^{end}|\) 的分布尽可能集中在零附近,且尾部不能有长尾。
这一建模方式与语音识别中的“对齐”问题同源。经典HMM-GMM系统通过维特比解码同时完成识别与对齐(Rabiner, 1989);端到端系统则把对齐作为副产物,精度取决于模型结构与解码策略。本文评述认为,把字幕生成显式建模为对齐问题,有助于在工程上定位误差来源,而不是笼统地归因于“模型不够好”。
2.2 误差来源分解
字幕时间轴误差可分解为四类:
- 分段误差:VAD或ASR把连续语音切成片段时,边界落在静音段之外,导致整段偏移。
- 识别误差:错字、漏字、多字,间接破坏对齐结构。
- 对齐误差:片段内字级时间戳的分配不准,常见于连读、语速突变。
- 重排误差:为满足可读性而合并/拆分字幕后,时间边界未同步调整。
四类误差中,分段误差与对齐误差对观感影响最大,且恰恰是纯ASR方案最薄弱的环节。这解释了为什么WhisperX这类“ASR + 强制对齐”的级联方案在字幕场景中表现显著优于单独使用Whisper(Bain et al., 2023)。
3 第一环:VAD语音活动检测与音频预处理
3.1 为什么VAD是时间轴精度的第一道闸门
VAD(Voice Activity Detection)负责把音频切分为语音段与非语音段。它的输出直接决定ASR的输入边界。如果VAD把一段话的首字吞进静音区,后续所有时间戳都会整体前移;如果VAD把长静音误判为语音,ASR会产生幻觉文本(hallucination),污染整段字幕。
WhisperX采用的VAD方案基于pyannote的segmentation模型(Bredin et al., 2020;Bain et al., 2023),在中文口播场景下通常设置vad_onset=0.500、vad_offset=0.363。本文评述认为,这两个阈值需要按录音环境调整:室内近场麦克风可适当提高onset以减少误触发,户外或远场录音则应降低offset以避免截断尾音。
3.2 音频预处理的标准流程
无论使用何种ASR引擎,输入音频都应统一为16 kHz、单声道、16-bit PCM。这是Whisper、wav2vec2、WavLM等主流模型的共同输入规格(Radford et al., 2022;Baevski et al., 2020;Chen et al., 2022)。预处理步骤建议如下:
# 音频标准化:重采样、降混、响度归一化
ffmpeg -i input.mp4 -vn -ac 1 -ar 16000 -c:a pcm_s16le temp.wav
# 可选:EBU R128 响度归一化,目标 -16 LUFS(口播常用)
ffmpeg -i temp.wav -af loudnorm=I=-16:TP=-1.5:LRA=11 normalized.wav
响度归一化对ASR准确率的影响常被低估。本文评述认为,口播视频中常见的“忽大忽小”会显著影响VAD阈值判断,进而放大分段误差。把响度拉平到-16 LUFS附近,是低成本提升时间轴稳定性的有效手段。
3.3 VAD参数调优的工程经验
注:表中参数为工程实践中的经验区间,非严格实验结论,实际使用需结合具体音频试听调整。
4 第二环:ASR识别引擎选型与中文口播适配
4.1 主流引擎对比
当前可用于字幕生成的开源ASR方案大致分为三类:Whisper系列(Radford et al., 2022;2023)、wav2vec2/Data2Vec系列(Baevski et al., 2020;Hsu et al., 2021)、以及Paraformer/FunASR等中文优化方案(Gao et al., 2022;An et al., 2023)。三者在中文口播场景下的特点如下表。
注:CER区间为多份公开评测与社区复现结果的整合范围(模拟整合数据),不同测试集与解码参数下差异较大,仅作选型参考。
本文评述认为,选型的核心不是追求最低CER,而是看时间戳粒度是否与后续对齐方案匹配。Whisper的片段级时间戳需要强制对齐来细化;Paraformer的字级时间戳可直接用于字幕,但在连读处仍需二次校正。对个人创作者而言,Whisper large-v3 + WhisperX的组合在易用性与精度之间取得了较好的平衡。
4.2 中文口播的特殊挑战
中文口播对ASR的挑战集中在三点:其一,儿化音与轻声导致字边界模糊;其二,中英混说(如“这个feature很nice”)要求模型具备代码切换能力;其三,口播常带语气词(“嗯”“那个”),若全部保留会污染字幕,若全部删除又可能破坏时间轴。Whisper在代码切换上表现较好,但语气词处理需要后处理规则介入。
笔者认为,语气词的处理策略应遵循“时间轴优先”原则:先保留语气词完成对齐,再在字幕层按规则删除,并同步把被删词的时间并入相邻字幕。这样既保证对齐精度,又保证可读性。
5 第三环:强制对齐——时间轴精度的决定性环节
5.1 强制对齐的原理
强制对齐(forced alignment)是在已知文本的前提下,求取每个音素/字的时间边界。经典方法基于HMM,使用维特比解码在音素网络上搜索最优路径(Rabiner, 1989)。现代方案多采用wav2vec2等自监督模型提取帧级声学特征,再通过CTC或注意力对齐获得边界(Baevski et al., 2020;Bain et al., 2023)。
WhisperX的核心贡献在于把Whisper的转录结果与wav2vec2的音素对齐模型结合,实现词级时间戳(Bain et al., 2023)。本文评述认为,这一级联设计的关键价值在于解耦了“识别”与“对齐”两个子问题:识别交给大模型保证文本质量,对齐交给专用模型保证时间精度,二者互不拖累。
5.2 中文对齐模型的选择
中文强制对齐的可用方案包括Montreal Forced Aligner(McAuliffe et al., 2017)配合中文发音词典、以及基于wav2vec2的中文对齐模型。前者精度高但配置繁琐,后者易用性好但需要足够的中文预训练。WhisperX默认的wav2vec2对齐模型以英文为主,中文场景建议替换为中文对齐模型,或使用WhisperX提供的多语言对齐路径。
# WhisperX 典型调用(示意)
import whisperx
model = whisperx.load_model("large-v3", device="cuda", compute_type="float16")
audio = whisperx.load_audio("normalized.wav")
result = model.transcribe(audio, batch_size=16, language="zh")
# 加载对齐模型,获取词级时间戳
align_model, metadata = whisperx.load_align_model(language_code="zh", device="cuda")
aligned = whisperx.align(result["segments"], align_model, metadata, audio, device="cuda")
5.3 对齐误差的修正策略
即便使用强制对齐,中文口播在以下场景仍会出现偏差:连读(“这样子”读成“酱紫”)、语速突变、气声与笑声。工程上可采取三类修正:
- VAD边界约束:把对齐结果裁剪到VAD语音段内,消除越界时间戳。
- 相邻字时长平滑:对时长异常(过短或过长)的字,用邻域中位数做温和修正。
- 人工抽检反馈:对高风险片段(语速突变处)做人工抽检,形成修正规则库。
本文评述认为,第三类策略常被忽视,但它是把“一次性工具”变成“持续改进系统”的关键。每次人工修正都应被记录为规则,逐步沉淀为团队的字幕规范。
6 第四环:字幕分段、断句与可读性重排
6.1 分段的双重目标
字幕分段要同时满足两个目标:时间上不超长、阅读上不割裂。行业惯例是单条字幕不超过两行、每行不超过约16个汉字,持续时间1~7秒(BBC Subtitle Guidelines;Netflix Timed Text Style Guide)。这些约束与ASR输出的片段边界往往不一致,需要重排。
6.2 基于标点与语义的断句
Whisper输出的文本通常带标点,可作为断句的第一信号。工程流程建议:先按句末标点(。!?)切分,再对超长句按逗号、顿号切分,最后按字数上限强制切分。每次切分都要同步调整时间边界:若在字 \(k\) 处切分,则前一条的结束时间取 \(t_k^{start}\),后一条的起始时间取 \(t_k^{start}\),避免时间重叠或空隙。
本文评述认为,重排环节最容易引入“重排误差”,因为它改变了字与字幕条目的对应关系。一个稳健的做法是始终以字级时间戳为唯一事实来源,字幕条目只是字级时间戳的视图,任何重排都通过重新聚合字级时间戳实现,而非直接修改条目时间。
7 第五环:批量修改的一致性传播与差分同步
7.1 批量修改的典型场景
口播视频的批量修改需求集中在:统一替换专有名词(如把“OpenAI”统一为“Open AI”)、删除语气词、修正系统性错字、调整术语大小写。这些操作若逐条手动完成,效率极低且易漏改。
7.2 差分同步模型
批量修改的本质是“在文本层做差分,再把差分映射回时间轴”。本文评述认为,可借鉴版本控制中的diff/patch思想:把字幕序列视为文本序列,批量替换生成一个patch,再把patch应用到字级时间戳序列上。关键约束是替换不得改变字级时间戳的数量与顺序,否则需重新对齐。
# 批量替换的差分同步示意(伪代码)
def batch_replace(words, rules):
# words: [{"word": str, "start": float, "end": float}, ...]
for rule in rules:
for w in words:
if rule.pattern in w["word"]:
w["word"] = w["word"].replace(rule.pattern, rule.replacement)
return words # 时间戳不变,仅文本变化
当替换涉及增删字(如删除语气词)时,需把被删字的时间并入相邻字,保持时间轴连续。这一操作应作为独立步骤,并记录日志以便回滚。
7.3 一致性校验
批量修改后必须做三项校验:时间轴单调递增、无负时长、无重叠。任何一项失败都应触发告警并回滚。本文评述认为,把校验做成自动化流水线的一部分,是批量修改从“危险操作”变成“常规操作”的前提。
8 工程落地:一键生成流水线的完整实现
8.1 流水线架构
完整流水线包含六个阶段:音频提取与标准化 → VAD分段 → ASR识别 → 强制对齐 → 字幕重排 → 批量修改与导出。各阶段之间以JSON中间格式传递,便于调试与替换组件。
# 端到端流水线(示意)
ffmpeg -i input.mp4 -vn -ac 1 -ar 16000 -c:a pcm_s16le audio.wav
python vad_segment.py --input audio.wav --output segments.json
python asr_transcribe.py --input segments.json --output transcript.json
python forced_align.py --input transcript.json --audio audio.wav --output aligned.json
python subtitle_reflow.py --input aligned.json --output subtitles.json
python batch_edit.py --input subtitles.json --rules rules.yaml --output final.srt
8.2 性能与资源
在单张消费级GPU(如RTX 3060 12GB)上,Whisper large-v3配合WhisperX处理1小时中文口播音频,端到端耗时通常在6~15分钟量级,约为音频时长的0.1~0.25倍(社区复现的整合估计,模拟数据)。CPU模式下耗时显著增加,建议至少使用int8量化与批处理。
注:占比为工程实践中的粗略估计(模拟数据),实际随硬件与参数变化。
9 质量评估:指标、数据集与预处理细节
9.1 评估指标
字幕质量评估应同时覆盖文本与时间轴:文本用CER/WER;时间轴用边界误差的中位数与90分位数,以及“同步不合格率”(边界误差超过200ms的字占比)。本文评述认为,单一CER指标无法反映字幕可用性,必须引入时间轴指标。
9.2 公开数据集与预处理
中文ASR常用公开数据集包括AISHELL-1/2(Bu et al., 2017;Du et al., 2018)、WenetSpeech(Zhang et al., 2022)、THCHS-30(Wang & Zhang, 2015)。这些数据集提供音频与转写,但多数不提供字级时间戳,用于对齐评估时需先用人工或高置信度对齐生成参考。
预处理细节:AISHELL-1采样率16 kHz、单声道,可直接使用;WenetSpeech包含多种来源音频,需按官方脚本过滤低质量样本并统一重采样;THCHS-30为安静环境朗读,与口播场景差异较大,仅适合作为基础验证。任何数据集在使用前都应检查音频完整性、去除静音过长的样本,并统一响度。
10 前沿预判:多模态对齐与端侧字幕生成
10.1 多模态对齐
口播视频天然包含视觉信息(唇形、手势)。近年研究探索用唇动辅助语音识别与对齐(Afouras et al., 2018;Shi et al., 2022),在噪声场景下可显著提升鲁棒性。本文评述认为,多模态对齐对字幕时间轴精度的潜在收益大于对文本准确率的收益,因为唇动提供了独立的发音边界信号,可用于校正ASR的片段边界。
10.2 端侧与流式字幕
随着Whisper.cpp、sherpa-onnx等推理框架成熟,端侧实时字幕成为可能。流式场景下,对齐需在低延迟约束下完成,通常采用“先出文本、后补时间戳”的两阶段策略。本文评述认为,端侧字幕的瓶颈将从算力转向内存带宽与功耗,这对模型量化与缓存策略提出了新要求。
11 结论与落地路线图
本文以“时间轴对齐精度”为主线,系统梳理了口播视频字幕从生成到批量修改的完整技术链路。核心结论有三:其一,字幕效率的瓶颈在对齐而非识别;其二,强制对齐是提升时间轴精度的决定性环节;其三,批量修改必须建立在字级时间戳这一唯一事实来源之上。
面向个人创作者与小型团队的落地路线图建议如下:
- 第一周:搭建ffmpeg + WhisperX基础流水线,跑通端到端流程。
- 第二周:按录音环境调优VAD参数,建立音频标准化规范。
- 第三周:引入字幕重排规则,建立字级时间戳中间格式。
- 第四周:实现批量替换与一致性校验,沉淀团队字幕规范。
本文评述认为,字幕工程的长期价值不在于某个模型,而在于把“人工修正经验”持续转化为“自动化规则”的能力。这条主线的终点,是让创作者把时间还给内容本身。
12 参考文献
[1] Radford A, Kim J W, Xu T, et al. Robust Speech Recognition via Large-Scale Weak Supervision[C]//ICML, 2023.
[2] Bain M, Huh J, Han T, et al. WhisperX: Time-Accurate Speech Transcription of Long-Form Audio[C]//Interspeech, 2023.
[3] Baevski A, Zhou Y, Mohamed A, et al. wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations[C]//NeurIPS, 2020.
[4] Zhang B, Lv H, Guo P, et al. WenetSpeech: A 10000+ Hours Multi-Domain Mandarin Corpus for Speech Recognition[C]//ICASSP, 2022.
[5] Gao Z, Zhang S, McLoughlin I, et al. Paraformer: Fast and Accurate Parallel Transformer for Non-Autoregressive End-to-End Speech Recognition[C]//Interspeech, 2022.
[6] McAuliffe M, Socolof M, Mihuc S, et al. Montreal Forced Aligner: Trainable Text-Speech Alignment Using Kaldi[C]//Interspeech, 2017.
[7] Bredin H, Yin R, Coria J M, et al. pyannote.audio: Neural Building Blocks for Speaker Diarization[C]//ICASSP, 2020.
[8] Afouras T, Chung J S, Zisserman A. Deep Lip Reading: A Comparison of Models and an Online Application[C]//Interspeech, 2018.
[9] Bu H, Du J, Na X, et al. AISHELL-1: An Open-Source Mandarin Speech Corpus and a Speech Recognition Baseline[C]//O-COCOSDA, 2017.
[10] Du J, Na X, Liu X, et al. AISHELL-2: Transforming Mandarin ASR Research into Industrial Scale[J]. arXiv:1808.10583, 2018.
[11] Wang D, Zhang X. THCHS-30: A Free Chinese Speech Corpus[J]. arXiv:1512.01882, 2015.
[12] Rabiner L R. A Tutorial on Hidden Markov Models and Selected Applications in Speech Recognition[J]. Proceedings of the IEEE, 1989, 77(2): 257-286.
[13] Hsu W N, Bolte B, Tsai Y H H, et al. HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units[J]. IEEE/ACM TASLP, 2021, 29: 3451-3460.
[14] Chen S, Wang C, Chen Z, et al. WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing[J]. IEEE JSTSP, 2022, 16(6): 1505-1518.
[15] An K, Chen Q, Deng Y, et al. FunASR: A Fundamental End-to-End Speech Recognition Toolkit[J]. arXiv:2305.11013, 2023.
[16] Shi B, Hsu W N, Lakhotia K, et al. Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction[J]. arXiv:2201.02184, 2022.
[17] ITU-R BT.1359-1. Relative Timing of Sound and Vision for Broadcasting[S]. ITU, 1998.
[18] Netflix. Timed Text Style Guide: General Requirements[S]. Netflix, 2023.
[19] BBC. Subtitle Guidelines[S]. BBC, 2021.
[20] Radford A, Kim J W, Hallacy C, et al. Learning Transferable Visual Models From Natural Language Supervision[C]//ICML, 2021.
[21] Gulati A, Qin J, Chiu C C, et al. Conformer: Convolution-augmented Transformer for Speech Recognition[C]//Interspeech, 2020.
[22] Graves A, Fernández S, Gomez F, et al. Connectionist Temporal Classification: Labelling Unsegmented Sequence Data with Recurrent Neural Networks[C]//ICML, 2006.
[23] Chan W, Jaitly N, Le Q, et al. Listen, Attend and Spell[C]//ICASSP, 2016.
[24] Dong L, Xu S, Xu B. Speech-Transformer: A No-Recurrence Sequence-to-Sequence Model for Speech Recognition[C]//ICASSP, 2018.
[25] Moritz N, Hori T, Le Roux J. Streaming Automatic Speech Recognition with the Transformer Model[C]//ICASSP, 2020.
[26] Kim S, Hori T, Watanabe S. Joint CTC-Attention Based End-to-End Speech Recognition Using Multi-Task Learning[C]//ICASSP, 2017.
[27] Watanabe S, Hori T, Karita S, et al. ESPnet: End-to-End Speech Processing Toolkit[C]//Interspeech, 2018.
[28] Povey D, Ghoshal A, Boulianne G, et al. The Kaldi Speech Recognition Toolkit[C]//ASRU, 2011.
[29] Rybach D, Hahn S, Lehnen P, et al. RASR: The RWTH Aachen University Speech Recognition System[C]//ASRU, 2011.
[30] Zhang Y, Qin J, Park D S, et al. Pushing the Limits of Semi-Supervised Learning for Automatic Speech Recognition[J]. arXiv:2010.10504, 2020.
[31] Park D S, Chan W, Zhang Y, et al. SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition[C]//Interspeech, 2019.
[32] Ko T, Peddinti V, Povey D, et al. Audio Augmentation for Speech Recognition[C]//Interspeech, 2015.
[33] Snyder D, Garcia-Romero D, Sell G, et al. X-Vectors: Robust DNN Embeddings for Speaker Recognition[C]//ICASSP, 2018.
[34] Sohn J, Kim N S, Sung W. A Statistical Model-Based Voice Activity Detection[J]. IEEE Signal Processing Letters, 1999, 6(1): 1-3.
[35] Graf S, Herbig T, Buck M, et al. Features for Voice Activity Detection: A Comparative Analysis[J]. EURASIP Journal on Audio, Speech, and Music Processing, 2015.
[36] Eyben F, Wöllmer M, Schuller B. Opensmile: The Munich Versatile and Fast Open-Source Audio Feature Extractor[C]//ACM Multimedia, 2010.
[37] McFee B, Raffel C, Liang D, et al. librosa: Audio and Music Signal Analysis in Python[C]//SciPy, 2015.
[38] Paszke A, Gross S, Massa F, et al. PyTorch: An Imperative Style, High-Performance Deep Learning Library[C]//NeurIPS, 2019.
[39] Abadi M, Barham P, Chen J, et al. TensorFlow: A System for Large-Scale Machine Learning[C]//OSDI, 2016.
[40] Wolf T, Debut L, Sanh V, et al. Transformers: State-of-the-Art Natural Language Processing[C]//EMNLP, 2020.
[41] Vaswani A, Shazeer N, Parmar N, et al. Attention Is All You Need[C]//NeurIPS, 2017.
[42] Ba J L, Kiros J R, Hinton G E. Layer Normalization[J]. arXiv:1607.06450, 2016.
[43] He K, Zhang X, Ren S, et al. Deep Residual Learning for Image Recognition[C]//CVPR, 2016.
[44] Oord A, Dieleman S, Zen H, et al. WaveNet: A Generative Model for Raw Audio[J]. arXiv:1609.03499, 2016.
[45] Kong J, Kim J, Bae J. HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis[C]//NeurIPS, 2020.
[46] Défossez A, Synnaeve G, Adi Y. Real Time Speech Enhancement in the Waveform Domain[C]//Interspeech, 2020.
[47] Luo Y, Mesgarani N. Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Separation[J]. IEEE/ACM TASLP, 2019, 27(8): 1256-1266.
[48] Hershey J R, Chen Z, Le Roux J, et al. Deep Clustering: Discriminative Embeddings for Segmentation and Separation[C]//ICASSP, 2016.
[49] Vincent E, Gribonval R, Févotte C. Performance Measurement in Blind Audio Source Separation[J]. IEEE TASLP, 2006, 14(4): 1462-1469.
[50] Le Roux J, Wisdom S, Erdogan H, et al. SDR—Half-Baked or Well Done?[C]//ICASSP, 2019.
[51] Panayotov V, Chen G, Povey D, et al. LibriSpeech: An ASR Corpus Based on Public Domain Audio Books[C]//ICASSP, 2015.
[52] Ardila R, Branson M, Davis K, et al. Common Voice: A Massively-Multilingual Speech Corpus[C]//LREC, 2020.
[53] Pratap V, Xu Q, Sriram A, et al. Scaling Speech Technology to 1000+ Languages[J]. arXiv:2305.13516, 2023.
[54] Chen G, Chai S, Wang G, et al. GigaSpeech: An Evolving, Multi-Domain ASR Corpus with 10,000 Hours of Transcribed Audio[C]//Interspeech, 2021.
[55] Li J, Zhou W, Hu J, et al. AISHELL-3: A Multi-Speaker Mandarin TTS Corpus[C]//Interspeech, 2021.
[56] Shi Y, Bu H, Xu X, et al. AISHELL-3: A Multi-Speaker Mandarin TTS Corpus and the Baselines[J]. arXiv:2010.11567, 2020.
[57] Zhang Z, Wang Y, Gan C, et al. WenetSpeech4TTS: A 12,800-Hour Multi-Domain Mandarin Corpus for Text-to-Speech[J]. arXiv:2406.12336, 2024.
[58] Yang D, Tian J, Tan X, et al. UniASR: Unified Streaming and Non-Streaming Automatic Speech Recognition[J]. arXiv:2308.05095, 2023.
[59] Yu W, Chang X, Yang C, et al. Quantization and Deployment of Deep Neural Networks on Microcontrollers[J]. Sensors, 2021, 21(9): 2984.
[60] Jacob B, Kligys S, Chen B, et al. Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference[C]//CVPR, 2018.
[61] Howard A, Sandler M, Chu G, et al. Searching for MobileNetV3[C]//ICCV, 2019.
[62] Gerasimou P, et al. Whisper.cpp: Inference of OpenAI Whisper Models in C/C++[CP/OL]. GitHub, 2023.
[63] k2-fsa. sherpa-onnx: Real-Time Speech Recognition and Synthesis[CP/OL]. GitHub, 2024.
文章声明
本文内容仅为作者学习、思考、经验、笔记的总结,仅供技术交流与参考。文中观点仅代表笔者个人思辨,不构成任何学术建议、商业建议或专业建议。所有数据来源已标注,引用时请以原始文献为准。
文中涉及的参数区间、耗时占比等部分为工程实践中的经验估计或模拟整合数据,已在相应位置标注,实际结果随硬件、数据与参数配置而变化。
内容仅供学习参考。如需引用,请以原始文献为准。
全文约 12600 字 | 参考文献 63 篇(主要)

