perf: ASR GPU 利用率优化 — batch_size 16→32 + beam_size 5→2

faster-whisper 的 GPU 利用率呈尖刺波(峰=批量解码满载,谷=CPU 提取 Mel
特征 + 处理结果时 GPU 空闲),平均利用率低。瓶颈不在算力而在 CPU/GPU
未重叠。

- batch_size 16→32:拉长单次 GPU 解码时间,相对掩盖 CPU 特征提取间隙,
  尖刺变宽变平,平均利用率上升。turbo FP16 仅 ~1.6GB,3090 24G 充裕。
- beam_size 5→2:turbo 模型鲁棒,候选数 5→2 大幅减少解码步数,让 GPU
  峰更密、间隙更短。保留 1 个候选做歧义发音保险,质量损失小。
- beam_size 从硬编码提到 config 可调,CPU/CPU 模板/GPU/示例 四份配置对齐
- /health 增加 asr_beam_size,模型加载日志同步输出 batch+beam

word_timestamps 保留 True:segmenter 强依赖词级时间戳做精确断句,
关闭会触发匀速估算退化路径,得不偿失。
This commit is contained in:
audio2text dev
2026-07-06 22:28:37 +08:00
parent e0dd987dba
commit a6b5c7231c
7 changed files with 10 additions and 4 deletions

View File

@@ -32,7 +32,8 @@ asr:
language: en # 仅英语
word_timestamps: true # 词级时间戳:让断句精确而非纯匀速估算
vad_filter: true # 过滤静音段,提升质量与速度
batch_size: 8 # CPU: 8 | GPU: 16BatchedInferencePipeline 批量解码音频块)
batch_size: 8 # CPU: 8 | GPU: 32BatchedInferencePipeline 批量解码音频块,拉长单次 GPU 解码掩盖 CPU 特征提取间隙
beam_size: 5 # CPU: 5默认| GPU: 2turbo 鲁棒可降,候选数↓解码步数↓,加速明显质量损失小)
translation:
# CPU devHelsinki-NLP/opus-mt-en-zh~300MB2GB 内存可跑)