- scheduler: ffmpeg 异步线程 + GPU 串行调度 + 模型复用(2N→2 次加载) - pipeline: 阶段拆分(extract/asr/translate),中间数据存 Task 字段 - translate_service: 长度排序批处理,padding 浪费减少 91% - model_manager: ASR/翻译不共驻,BatchedInferencePipeline 批量解码 - 日志分级: INFO=任务流转里程碑,DEBUG=进度详情;默认 INFO - 前端: 日志最新在上+滚动感知+退避轮询;24h 时间;上传中状态显示 - /health: 返回完整 Whisper/NLLB 配置 - upload_service: 单事务 complete + 扩展名白名单 - task_router: 合并 UploadSession 虚拟任务到列表 - Dockerfile: CPU/GPU 独立构建链,deps 缓存稳定 - prefetch_models: 安装时预下载模型权重
59 lines
1.7 KiB
YAML
59 lines
1.7 KiB
YAML
# audio2text — GPU 生产配置(NVIDIA 3090 24G)
|
||
# 模型按之前指定选型,质量优先:
|
||
# ASR = whisper large-v3-turbo(8x 速度,质量接近 large-v3)
|
||
# 翻译 = NLLB-200-distilled-1.3B(质量最好)
|
||
# ASR 与翻译不共驻:翻译时卸载 Whisper 独占显存跑大 batch。
|
||
|
||
server:
|
||
host: 0.0.0.0
|
||
port: 8000
|
||
workers: 1
|
||
|
||
storage:
|
||
upload_dir: /data/uploads
|
||
work_dir: /data/.work
|
||
output_dir: /data/outputs
|
||
chunk_bytes: 1048576
|
||
chunk_session_ttl_seconds: 300
|
||
cache_retention_days: 7 # 任务产物保留天数,超期清理(字幕/中间音频/保留的原始视频+DB记录)
|
||
cache_cleanup_interval_hours: 24 # 定时清理间隔(启动时跑一次,之后循环)
|
||
|
||
processing:
|
||
delete_original_after_extract: true
|
||
keep_audio: false
|
||
|
||
asr:
|
||
model: large-v3-turbo # 8x 速度,质量接近 large-v3
|
||
device: cuda
|
||
compute_type: float16 # 3090 FP16,速度与显存兼顾
|
||
language: en
|
||
word_timestamps: true
|
||
vad_filter: true
|
||
batch_size: 16 # BatchedInferencePipeline:每批解码 16 个 30s 音频块,填充 GPU
|
||
|
||
translation:
|
||
model: facebook/nllb-200-distilled-1.3B # 质量最好
|
||
device: cuda
|
||
src_lang: eng_Latn
|
||
tgt_lang: zho_Hans
|
||
batch_size: 32 # 不共驻时显存独占,大 batch 填充 GPU
|
||
max_length: 256
|
||
sort_by_length: true # 按句子长度排序后分批,减少批内 padding 浪费
|
||
|
||
segmentation:
|
||
max_words_per_line: 14
|
||
max_duration_seconds: 7.0
|
||
min_duration_seconds: 1.0
|
||
max_chars_per_line: 42
|
||
|
||
|
||
logging:
|
||
level: info # debug | info | warning | error(控制台最低级别)
|
||
buffer_size: 2000
|
||
|
||
docs:
|
||
enabled: true
|
||
username: admin
|
||
password: "CHANGE_ME"
|
||
realm: "audio2text docs"
|