视频动画技术

手动踩点详解:波形波峰对齐、+号添加、B 键快捷标记

👤 为我痴狂 👁 2 阅读 ❤ 0 点赞 ➦ 0 分享 📅 2026-09-30
首页› 视频动画› 视频动画技术› 正文
手动踩点详解:波形波峰对齐、+号添加、B 键快捷标记

从波形物理本质到工程操作路径——一套可复现、可量化、可迁移的手动踩点方法论

摘要

手动踩点是音频编辑、视频剪辑、音乐制作与语音标注等领域的基础工序,其精度直接决定后续自动化流程的上限。本文以“波形波峰对齐—+号添加标记—B键快捷标记”这条操作链为分析主线,从采样定理与瞬态响应的物理层面切入,系统阐述波峰对齐的相位判定准则、标记点添加的工程语义、快捷键操作的效率模型,并延伸至多轨对齐、误差量化、跨软件适配与AI辅助踩点的前沿趋势。全文兼顾理论推导与实操步骤,提供可复现的参数配置与验证方法,旨在为从业者建立一套从“看得准”到“踩得稳”再到“标得快”的完整技术认知框架。

一、波形踩点的物理本质:从采样点到瞬态峰值

1.1 数字音频的离散化表示

要理解“踩点”这件事,必须先回到数字音频的底层表示。模拟声波经麦克风转换为连续电压信号后,由模数转换器(ADC)按固定时间间隔采样,形成离散序列 x[n] = x(nTs),其中 Ts = 1/fs 为采样周期。根据奈奎斯特—香农采样定理,当 fs ≥ 2fmax 时,离散序列可无失真重建原始信号[1]。CD音质的 44.1 kHz 采样率意味着相邻采样点间隔约 22.7 微秒,而专业录音常用的 96 kHz 则缩短至约 10.4 微秒。

这个时间粒度决定了手动踩点的理论精度上限。笔者认为,很多教程忽略了一个关键事实:你在波形上看到的“波峰”并非一个数学意义上的点,而是一段由若干采样点构成的局部极大值区域。当采样率不足或信号含有高频成分时,真实峰值可能落在两个采样点之间,造成所谓的“峰值遗漏”现象。

1.2 瞬态响应与攻击段

在音乐与语音信号中,最具踩点价值的位置通常是瞬态的起始点(onset)。瞬态是信号能量在极短时间内急剧上升的区段,其物理成因包括鼓槌击打鼓面、琴弦拨动、辅音爆破等。从信号处理角度看,瞬态对应短时能量函数的陡峭上升沿。经典的 onset detection 方法包括谱通量(Spectral Flux)、高通滤波能量包络、复域相位偏差等[2][3]。

一个典型的打击乐瞬态,其攻击段(attack)持续时间约为 5–30 毫秒,衰减段(decay)则可达数百毫秒。在波形视图上,攻击段表现为一条近乎垂直的上升线,其顶点即为视觉上的“波峰”。本文评述:踩点的本质不是找到波形最高点,而是找到能量突变的起始时刻。对于底鼓(kick drum)这类低频成分丰富的信号,波形峰值可能滞后于听觉感知的“击打点”数毫秒,这是由低频振膜的物理响应时间决定的。

1.3 视觉波形与听觉感知的偏差

数字音频工作站(DAW)中显示的波形通常是经过峰值抽取(peak decimation)或RMS压缩后的视觉表示。当缩放级别较大时,每个屏幕像素可能对应数百甚至数千个采样点,此时显示的“波峰”是这一区间内的最大值包络,而非精确的瞬时峰值。这种视觉近似会引入系统性偏差。

此外,人类听觉系统对瞬态的感知存在约 1–3 毫秒的固有延迟,而视觉系统对屏幕刷新的响应也有约 10–16 毫秒的延迟(60 Hz显示器)。这意味着“看到波峰再按键”这一操作路径天然包含至少 10 毫秒以上的反应误差。理解这一点,是后续讨论精度量化和快捷键策略的前提。

二、波峰对齐的判定准则与操作路径

2.1 什么是“对齐”:三种判定标准

“波峰对齐”在不同场景下含义不同,必须区分以下三种判定标准:

判定标准 定义 适用场景 典型容差
峰值对齐 标记点位于波形局部最大值处 鼓点替换、采样切片 ±1–2 ms
起始对齐 标记点位于能量上升沿起点 节奏同步、视频卡点 ±3–5 ms
感知对齐 标记点位于听感上的“击打瞬间” 混音、母带处理 ±5–10 ms

三种标准并非互斥,而是精度递进关系。在实际操作中,建议先以“起始对齐”快速铺设标记,再对关键位置进行“峰值对齐”微调。笔者认为,对于大多数视频卡点场景,“起始对齐”已经足够,因为人眼对画面切换的容忍度远高于人耳对节奏偏差的敏感度。

2.2 操作路径:从缩放到定位

以下是一套经过验证的波峰对齐操作流程,适用于 Audition、Reaper、Audacity 等主流音频编辑器:

  1. 粗定位:在全局视图下播放音频,听到目标瞬态时按暂停,将播放头大致移到该位置。
  2. 逐级放大:以播放头为中心,逐步放大波形视图。建议每次放大倍数不超过 4 倍,避免失去上下文参照。
  3. 识别攻击沿:在放大到单个瞬态可见时,找到波形从基线急剧上升的那个采样区间。注意区分预振铃(pre-ringing)和真实攻击。
  4. 放置标记:将光标置于攻击沿的起始采样点,按标记快捷键(通常为 M 或 B)放置标记。
  5. 交叉验证:播放标记前后各 200 毫秒的片段,确认标记点与听感一致。如有偏差,使用方向键逐采样点微调。

实操提示:在 Audition 中,可以使用“时间选择工具”配合“零交叉点吸附”功能,确保标记点落在零交叉处,避免后续剪辑产生咔嗒声。Reaper 用户可开启“Snap to zero crossing”选项。相关教程可参考:Adobe Audition 标记官方文档。

2.3 常见误区与纠正

误区一:波峰就是最高点。对于对称性良好的信号(如正弦波),峰值确实在最高点。但真实乐器信号的波形往往不对称,正向峰值和负向峰值可能相差数倍。此时应选择绝对值较大的那一侧作为参考。

误区二:放大越多越准。过度放大后,单个采样点之间的连线会呈现为折线,视觉上产生“平台区”,反而难以判断真实峰值位置。建议放大到能看清 5–10 个采样点的程度即可。

误区三:所有轨道用同一标准。底鼓、军鼓、踩镲的瞬态特性差异显著。底鼓能量集中在 50–100 Hz,波形周期长,峰值判定容差大;踩镲能量集中在 8–16 kHz,瞬态极短,需要更高精度。本文评述:分轨设定不同的对齐标准,是专业踩点与业余踩点的分水岭。

三、+号添加标记:工程语义与参数配置

3.1 标记点的数据结构

在 DAW 内部,一个标记点(marker)通常包含以下字段:时间位置(以采样点或时间码表示)、名称/标签、颜色、类型(cue、region、chapter 等)。以 Reaper 的 RPP 工程文件格式为例,标记点存储为 MARKER 1 12.345 "Kick" 0 0 1 0,其中第一个数字为索引,第二个为时间位置(秒),第三个为名称[4]。

“+号添加”这一操作在不同软件中对应不同的交互逻辑。在 Audition 的多轨视图中,点击标记面板的“+”按钮会创建一个新标记;在 Reaper 中,快捷键 Shift+M 可在播放头位置插入命名标记;在 Premiere Pro 中,M 键添加序列标记。

3.2 标记粒度:什么值得标

并非每一个波峰都值得添加标记。过度标记会导致信息过载,反而降低后续编辑效率。以下是建议的标记粒度决策矩阵:

素材类型 建议标记对象 标记密度 命名规范
鼓组循环 底鼓、军鼓、踩镲 每拍 1–3 个 K/S/H + 序号
人声旁白 段落起始、呼吸点 每句 1 个 P01/P02…
环境音效 事件起始、显著变化 按事件 事件描述
音乐曲目 小节线、段落边界 每小节 1 个 B01/V01/C01

笔者认为,标记命名的规范化程度直接决定了工程的可维护性。一个只有时间位置而没有语义标签的标记集合,在项目交付后几乎等同于废数据。建议在项目启动时就制定命名规范,并写入团队 SOP。

3.3 批量添加与自动化

当需要添加大量标记时,手动逐个点击效率极低。以下是几种批量添加的技术路径:

路径一:基于静音检测的自动分段。Audition 的“标记—自动标记”功能可基于静音阈值自动生成标记。参数设置建议:阈值 -40 dB,最小静音时长 300 ms,最小片段时长 500 ms。相关文档:Audition 自动标记。

路径二:基于 onset detection 的脚本化标记。使用 Python 的 librosa 库,可通过 librosa.onset.onset_detect() 自动检测 onset 位置,再导出为 CSV 或直接写入 DAW 工程文件[5]。

import librosa
import numpy as np

# 加载音频
y, sr = librosa.load('drums.wav', sr=None)

# onset 检测
onsets = librosa.onset.onset_detect(
    y=y, sr=sr,
    hop_length=512,
    backtrack=True,      # 回溯到能量起始点
    units='time'
)

# 转换为采样点位置
onset_samples = librosa.time_to_samples(onsets, sr=sr)
print(f"检测到 {len(onsets)} 个 onset")
for i, (t, s) in enumerate(zip(onsets, onset_samples)):
    print(f"  #{i+1}: {t:.4f}s (sample {s})")

路径三:基于 MIDI 的网格对齐。如果素材有对应的 MIDI 文件,可直接从 MIDI 音符位置生成标记,精度取决于 MIDI 录制时的量化设置。

四、B键快捷标记:效率模型与肌肉记忆构建

4.1 为什么是 B 键

在多数 DAW 和视频编辑软件中,B 键被映射为“添加标记”或“切割”功能。这一映射并非随意选择,而是基于人体工学与操作频率的综合考量。B 键位于键盘中央偏左,左手食指自然放置位置附近,按键行程短,适合高频操作。相比之下,M 键虽然也常被用作标记快捷键,但其位置更靠右,需要手腕移动。

不同软件的默认映射存在差异。在 Reaper 中,M 为添加标记,Shift+M 为添加命名标记;在 Premiere Pro 中,M 添加标记,Ctrl+M 导出;在 DaVinci Resolve 中,M 添加标记。用户可根据习惯自定义快捷键,但建议保持跨软件一致性,降低认知切换成本。

4.2 效率模型:从“看-移-按”到“听-按”

手动踩点的效率瓶颈不在于按键速度,而在于“定位—确认—执行”这一认知循环。初学者通常采用“看波形→移动光标→按键”的三步流程,每一步都消耗认知资源。熟练操作者则将其压缩为“听→按”的两步流程,依赖听觉预判和肌肉记忆。

这一转变的关键在于建立“听觉—动作”的条件反射。训练方法如下:

  1. 阶段一(认知阶段):正常速度播放,看到波峰时按键。允许误差 ±50 ms。目标:建立“波峰—按键”关联。
  2. 阶段二(关联阶段):关闭波形显示,仅凭听觉按键。允许误差 ±30 ms。目标:建立“听觉—按键”关联。
  3. 阶段三(自动化阶段):在 0.75 倍速下练习,逐步提升至 1.5 倍速。允许误差 ±15 ms。目标:形成肌肉记忆,不受播放速度影响。

本文评述:这一训练模型借鉴了认知心理学中的 Fitts 定律和 Anderson 的 ACT-R 理论。Fitts 定律指出,目标定位时间与目标距离和大小相关;ACT-R 则描述了技能从陈述性知识向程序性知识转化的过程。将这两个理论应用于踩点训练,可以解释为什么“盲踩”训练比“看波形”训练更有效——前者强制大脑建立听觉与动作的直接映射,绕过视觉处理环节[6][7]。

4.3 快捷键组合与工作流优化

单一快捷键的效率提升有限,真正的效率飞跃来自快捷键组合与工作流的整体优化。以下是一套推荐的高效踩点快捷键配置(以 Reaper 为例,其他软件可类比映射):

操作 默认快捷键 建议自定义 使用频率
添加标记 M B 极高
播放/暂停 Space Space 极高
逐采样点左移 ← ← 高
逐采样点右移 → → 高
放大波形 + W 中
缩小波形 - Q 中
删除最近标记 无默认 Ctrl+Z 中

将“添加标记”从 M 改为 B 的理由是:B 键更靠近左手自然位置,且与 Space(播放/暂停)形成“拇指—食指”的协同操作模式。在连续踩点场景中,左手拇指控制播放/暂停,食指控制标记添加,右手可专注于鼠标定位或参数调整。

五、多轨场景下的对齐策略与误差传播

5.1 多轨对齐的层级模型

在多轨工程中,对齐不是单一操作,而是一个层级化的过程。建议按以下优先级依次对齐:

  1. 第一层:节奏骨架——底鼓和军鼓,决定整体律动。
  2. 第二层:和声基础——贝斯和节奏吉他,与鼓组形成节奏咬合。
  3. 第三层:旋律与装饰——主音吉他、键盘、人声,在前两层基础上进行微调。
  4. 第四层:效果与氛围——Pad、环境音效,通常不需要精确对齐。

笔者认为,这一层级模型的价值在于避免“过度对齐”。将所有轨道都对齐到同一个采样点,反而会损失音乐的呼吸感和人性化。专业混音中,鼓组和贝斯通常对齐到 1–2 ms 以内,而吉他与人声可以保留 5–15 ms 的自然偏差。

5.2 误差传播的量化分析

在多轨对齐中,每一层的对齐误差会向下游传播。假设第 i 层的对齐误差为 εi,且各层误差独立同分布,则第 n 层的累积误差为:

εtotal = √(ε1² + ε2² + … + εn²)

这是随机误差的均方根合成公式。如果各层误差存在系统性偏差(如统一滞后 5 ms),则总误差为各层偏差的线性叠加。因此,在每一层对齐完成后,都应进行独立验证,避免误差累积。

根据 ITU-R BS.1387 感知音频质量评估标准,节奏偏差在 10 ms 以内时,大多数听众难以察觉;超过 20 ms 时,节奏感开始明显松散;超过 50 ms 时,会被感知为“跑拍”[8]。这一数据为多轨对齐的精度目标提供了参考基准。

5.3 相位对齐与梳状滤波

当两轨相同或相似的信号存在微小时间差时,会在频域产生梳状滤波效应。对于 1 kHz 信号,1 ms 的时间差会导致约 180° 的相位偏移,在叠加时产生抵消。因此,对于需要叠加的轨道(如双轨吉他、和声人声),对齐精度要求更高,通常需要控制在 0.5 ms 以内。

检测梳状滤波的实用方法:将两轨反相(相位反转)后叠加,如果听到明显的残留信号,说明存在相位偏差。调整其中一轨的时间位置,直到残留信号最小。这一方法在专业混音中被广泛使用。

六、精度量化:如何评估你的踩点质量

6.1 评价指标

踩点质量可以通过以下指标量化评估:

指标 定义 计算方法 目标值
平均绝对误差 (MAE) 标记点与参考点的平均偏差 Σ|tmark - tref| / N < 5 ms
标准差 (SD) 偏差的离散程度 √(Σ(εi - ε̄)² / N) < 3 ms
F1 分数 在容差窗口内的命中率 2PR/(P+R) > 0.95
一致性 多次踩点结果的可重复性 组内相关系数 (ICC) > 0.9

这些指标借鉴了音乐信息检索(MIR)领域对 onset detection 算法的评估框架。在 MIREX(Music Information Retrieval Evaluation eXchange)的 onset detection 任务中,标准评估使用 ±50 ms 的容差窗口计算 F1 分数[9]。对于手动踩点,建议使用更严格的 ±10 ms 窗口。

6.2 自测方法

以下是一套可自行执行的踩点精度测试流程:

  1. 准备测试素材:选择一段节奏清晰的鼓组循环(建议 120 BPM,4/4 拍,时长 30 秒)。
  2. 生成参考标记:使用 librosa 的 onset_detect 生成参考标记,或手动精修一套“金标准”标记。
  3. 执行测试:在不知道参考标记的情况下,手动踩点一遍,保存标记。
  4. 计算偏差:将手动标记与参考标记按最近邻匹配,计算每个标记的偏差。
  5. 重复测试:间隔 1 小时后重复测试,计算一致性。
import numpy as np

def evaluate_markers(manual, reference, tolerance=0.010):
    """评估手动标记与参考标记的偏差"""
    manual = np.array(manual)
    reference = np.array(reference)
    
    errors = []
    for m in manual:
        idx = np.argmin(np.abs(reference - m))
        errors.append(m - reference[idx])
    
    errors = np.array(errors)
    mae = np.mean(np.abs(errors))
    sd = np.std(errors)
    hits = np.sum(np.abs(errors) < tolerance)
    f1 = 2 * hits / (len(manual) + len(reference))
    
    return {'MAE': mae, 'SD': sd, 'F1': f1, 'N': len(errors)}

# 模拟数据示例
manual = [0.512, 1.023, 1.534, 2.045, 2.556]
reference = [0.500, 1.000, 1.500, 2.000, 2.500]
result = evaluate_markers(manual, reference)
print(result)

注:以上代码为方法演示,实际使用时需替换为真实标记数据。

七、跨软件适配:Audition、Reaper、Premiere与Python工具链

7.1 主流软件操作对照

功能 Audition Reaper Premiere Pro
添加标记 M 或点击 + 按钮 M(Shift+M 命名) M
标记面板 窗口→标记 View→Marker Manager 窗口→标记
零交叉吸附 编辑→吸附→零交叉 Snap to zero crossing 不支持
导出标记 CSV / XML CSV / 工程文件 CSV / XML
脚本支持 ExtendScript ReaScript (Lua/EEL) ExtendScript

7.2 Python 工具链

对于需要批量处理或自定义分析流程的场景,Python 提供了灵活的工具链。核心库包括:

  • librosa:音频加载、onset detection、节拍跟踪。文档:librosa 官方文档
  • madmom:专注于音乐信号处理的 onset 和 beat 检测,精度较高。GitHub:madmom
  • aubio:轻量级音频分析库,支持实时 onset detection。官网:aubio
  • soundfile:音频文件读写,支持多种格式。

以下是一个将 onset 检测结果导出为 Audition 兼容 CSV 格式的示例:

import librosa
import csv

y, sr = librosa.load('input.wav', sr=None)
onsets = librosa.onset.onset_detect(y=y, sr=sr, units='time', backtrack=True)

with open('markers.csv', 'w', newline='') as f:
    writer = csv.writer(f)
    writer.writerow(['Name', 'Start', 'Duration', 'Time Format'])
    for i, t in enumerate(onsets):
        writer.writerow([f'Onset_{i+1:03d}', f'{t:.6f}', '0', 'decimal'])

print(f'已导出 {len(onsets)} 个标记')

7.3 视频编辑软件中的踩点

在 Premiere Pro 和 DaVinci Resolve 中,踩点通常用于视频卡点剪辑。操作要点:

  • 先将音频轨添加到序列,使用 M 键在关键节拍处添加标记。
  • 开启“吸附”功能,确保视频片段边缘吸附到标记点。
  • 对于复杂节奏,可先在 Audition 中完成精确踩点,再导入 Premiere 作为参考轨。
  • DaVinci Resolve 用户可使用“Edit”页面的标记功能,或切换到“Fairlight”页面进行音频精修。

相关教程:Premiere Pro 标记官方文档、DaVinci Resolve 官方培训。

八、AI辅助踩点:前沿进展与人工复核的不可替代性

8.1 基于深度学习的 onset detection

近年来,基于深度神经网络的 onset detection 方法取得了显著进展。早期方法使用卷积神经网络(CNN)在频谱图上进行帧级分类,后续研究引入循环神经网络(RNN)和 Transformer 架构来捕捉时序依赖[10][11]。2023 年以来的代表性工作包括:

  • Böck 等人的 CNN+RNN 混合模型:在多个数据集上达到 state-of-the-art 性能,F1 分数超过 0.90[12]。
  • 基于 Transformer 的端到端方法:利用自注意力机制捕捉长程时序关系,在复杂音乐场景中表现更稳健[13]。
  • 自监督预训练模型:如 BYOL-A、MERT 等,在少量标注数据下即可微调出高性能 onset 检测器[14][15]。

本文评述:尽管 AI 方法在标准数据集上表现优异,但在实际工程场景中仍面临挑战。首先,训练数据多集中于西方流行音乐,对民族音乐、电子音乐、实验音乐的泛化能力有限。其次,AI 模型输出的 onset 位置通常以帧为单位(约 10–20 ms 分辨率),难以满足采样级精度需求。因此,AI 辅助踩点的合理定位是“粗筛+人工精修”,而非完全替代人工。

8.2 商业软件中的 AI 功能

主流 DAW 已开始集成 AI 辅助功能:

软件 AI 功能 精度 适用场景
Audition 自动标记(静音检测) ±20 ms 语音分段
Reaper Dynamic Split(瞬态检测) ±5 ms 鼓组切片
Logic Pro Flex Time / Smart Tempo ±10 ms 节奏对齐
Ableton Live Warp / Transient 检测 ±5 ms Loop 处理
iZotope RX Dialogue Isolate / De-click N/A 后期修复

这些功能的共同特点是:在特定场景下可显著提升效率,但输出结果仍需人工复核。以 Reaper 的 Dynamic Split 为例,其瞬态检测灵敏度参数需要根据素材特性调整,默认参数在复杂混音中容易产生漏检或误检。

8.3 人工复核的不可替代性

AI 辅助踩点无法完全替代人工的原因有三:

  1. 语义理解:AI 可以检测到能量突变,但无法理解“这个鼓点是否应该被强调”“这个人声停顿是否具有修辞意义”。
  2. 上下文依赖:同一段音频在不同项目中的踩点策略可能完全不同。AI 缺乏项目级上下文。
  3. 审美判断:音乐制作中的“人性化”偏差往往是有意为之。AI 倾向于消除所有偏差,反而可能破坏艺术表达。

笔者认为,未来 3–5 年内,AI 辅助踩点的最佳实践将是“AI 粗筛 + 人工精修 + 规则引擎”的三层架构。AI 负责处理 80% 的常规检测,人工负责 15% 的边界判断,规则引擎负责 5% 的格式化和一致性检查。

九、实战工作流:从原始素材到标记交付

9.1 完整工作流示例

以下是一个面向视频卡点项目的完整踩点工作流:

  1. 素材准备:将音频导入 Audition,统一采样率为 48 kHz(视频项目标准),位深 24 bit。
  2. 粗标:播放全曲,用 B 键在每 4 拍或 8 拍处添加粗略标记,建立整体结构感。
  3. 精标:逐段放大,对每个标记进行采样级微调。使用零交叉吸附避免咔嗒声。
  4. 分类:根据标记的语义重要性,使用不同颜色或前缀进行分类(如 K_ 表示底鼓,S_ 表示军鼓)。
  5. 导出:将标记导出为 CSV 或 XML,导入 Premiere Pro 或 DaVinci Resolve。
  6. 验证:在视频编辑软件中,将视频片段边缘吸附到标记点,播放检查卡点效果。
  7. 交付:将标记文件、工程文件和操作说明打包交付。

9.2 常见问题排查

问题 可能原因 解决方案
标记点有咔嗒声 未对齐零交叉点 开启零交叉吸附,或手动微调
标记位置整体偏移 音频延迟或采样率不匹配 检查音频驱动延迟补偿设置
导入视频软件后标记错位 时间码格式不一致 统一使用秒或采样点作为时间单位
标记数量过多难以管理 标记粒度太细 按层级筛选,只保留关键标记

十、结语:手动踩点的不可替代价值

在 AI 工具日益普及的今天,手动踩点似乎是一项“低效”的工作。但笔者认为,手动踩点的价值不仅在于结果,更在于过程。通过手动踩点,操作者被迫深入理解音频的微观结构,建立对节奏、音色、动态的敏锐感知。这种感知能力是任何自动化工具都无法替代的。

从工程角度看,手动踩点是自动化流程的质量基准。只有当你能够手动达到 ±5 ms 的精度时,才能有效评估 AI 工具的输出质量,并在必要时进行干预。从艺术角度看,手动踩点保留了“人性化”的微妙偏差,这是音乐之所以动人的重要原因之一。

波峰对齐、+号添加、B 键快捷标记——这三个看似简单的操作,构成了音频编辑领域最基础也最核心的技能链。掌握它们,不仅是为了完成当前的项目,更是为了建立一套可迁移、可扩展的技术认知框架。在工具不断迭代的未来,这套框架将帮助你快速适应新软件、新格式、新场景,始终保持专业竞争力。

主要参考文献

  1. Smith, S. W. The Scientist and Engineer's Guide to Digital Signal Processing. California Technical Publishing, 1997.
  2. Bello, J. P., et al. "A Tutorial on Onset Detection in Music Signals." IEEE Transactions on Speech and Audio Processing, vol. 13, no. 5, 2005, pp. 1035–1047.
  3. Dixon, S. "Onset Detection Revisited." Proceedings of the 9th International Conference on Digital Audio Effects (DAFx), 2006.
  4. Reaper 官方文档. "Markers and Regions." reaper.fm.
  5. McFee, B., et al. "librosa: Audio and Music Signal Analysis in Python." Proceedings of the 14th Python in Science Conference, 2015.
  6. Fitts, P. M. "The Information Capacity of the Human Motor System in Controlling the Amplitude of Movement." Journal of Experimental Psychology, vol. 47, no. 6, 1954, pp. 381–391.
  7. Anderson, J. R. How Can the Human Mind Occur in the Physical Universe? Oxford University Press, 2007.
  8. ITU-R BS.1387. "Method for Objective Measurements of Perceived Audio Quality." International Telecommunication Union, 1998.
  9. MIREX. "Audio Onset Detection Evaluation." music-ir.org.
  10. Schlüter, J., and Böck, S. "Improved Musical Onset Detection with Convolutional Neural Networks." IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2014.
  11. Böck, S., et al. "Online Onset Detection with a Recurrent Neural Network." Proceedings of the 18th International Society for Music Information Retrieval Conference (ISMIR), 2017.
  12. Böck, S.,

分享到

💬
微信
📷
朋友圈
🐧
QQ好友
🌐
QQ空间
👁
微博
📌
钉钉
🔗
复制链接
📑
复制图文

微信扫一扫分享

打开微信「扫一扫」,扫描二维码后在微信中分享给好友或朋友圈。

💬 评论 (0)

评论功能已关闭

⏸️ 本站暂未开放评论功能,不能进行评论,此为规划的后续开发预留
首页| 关于本网| 网站声明| 联系我们| 网站纠错| 服务| 网站地图
黔ICP备19010680号-1  |  邮箱:six528528@163.com
贵公网安备 52010302001819号
Copyright 2019-2026 http://www.databrush.com/ All rights reserved.
QQ
QQ扫一扫
Logo
DBN数据刷