feat: 调度器+并发管线+GPU优化+日志分级+前端修复

- scheduler: ffmpeg 异步线程 + GPU 串行调度 + 模型复用(2N→2 次加载)
- pipeline: 阶段拆分(extract/asr/translate),中间数据存 Task 字段
- translate_service: 长度排序批处理,padding 浪费减少 91%
- model_manager: ASR/翻译不共驻,BatchedInferencePipeline 批量解码
- 日志分级: INFO=任务流转里程碑,DEBUG=进度详情;默认 INFO
- 前端: 日志最新在上+滚动感知+退避轮询;24h 时间;上传中状态显示
- /health: 返回完整 Whisper/NLLB 配置
- upload_service: 单事务 complete + 扩展名白名单
- task_router: 合并 UploadSession 虚拟任务到列表
- Dockerfile: CPU/GPU 独立构建链,deps 缓存稳定
- prefetch_models: 安装时预下载模型权重
This commit is contained in:
audio2text dev
2026-07-06 21:59:59 +08:00
parent 00e2a95fb7
commit 73110848f4
30 changed files with 1238 additions and 259 deletions

View File

@@ -54,15 +54,18 @@ class ModelManager:
if self._translator is not None:
self._unload_translator_locked()
s = get_settings().asr
logger.debug("加载 ASR 模型 model=%s device=%s compute_type=%s",
logger.info("加载 ASR 模型 model=%s device=%s compute_type=%s",
s.model, s.device, s.compute_type)
from faster_whisper import WhisperModel
from faster_whisper import WhisperModel, BatchedInferencePipeline
# device/compute_type 组合cpu+int8 / cuda+float16
self._asr = WhisperModel(
# BatchedInferencePipeline 包装 WhisperModel使 transcribe() 支持 batch_size
# 多个音频块chunk_length=30s一次性送 GPU 解码,配合内部 prefill 提高利用率。
whisper = WhisperModel(
s.model, device=s.device, compute_type=s.compute_type,
)
self._asr = BatchedInferencePipeline(model=whisper)
self._current = "asr"
logger.debug("ASR 模型已就绪")
logger.info("ASR 模型已就绪batched, batch_size=%d)。", s.batch_size)
return self._asr
def unload_asr(self) -> None:
@@ -72,7 +75,7 @@ class ModelManager:
def _unload_asr_locked(self) -> None:
if self._asr is None:
return
logger.debug("卸载 ASR 模型(释放显存供翻译器独占)。")
logger.info("卸载 ASR 模型(释放显存供翻译器独占)。")
# faster-whisper 模型无显式 closedel 即可
del self._asr
self._asr = None
@@ -89,7 +92,7 @@ class ModelManager:
if self._asr is not None:
self._unload_asr_locked()
s = get_settings().translation
logger.debug("加载翻译模型 model=%s device=%s", s.model, s.device)
logger.info("加载翻译模型 model=%s device=%s", s.model, s.device)
from transformers import pipeline
self._translator = pipeline(
"translation",
@@ -97,9 +100,11 @@ class ModelManager:
device=s.device,
src_lang=s.src_lang,
tgt_lang=s.tgt_lang,
batch_size=s.batch_size, # pipeline 内部批大小,与 translate_service 分块对齐
)
self._current = "translator"
logger.debug("翻译模型已就绪(独占显存,可用大 batch)。")
logger.info("翻译模型已就绪(显存独占batch_size=%dsort_by_length=%s)。",
s.batch_size, s.sort_by_length)
return self._translator
def unload_translator(self) -> None:
@@ -109,7 +114,7 @@ class ModelManager:
def _unload_translator_locked(self) -> None:
if self._translator is None:
return
logger.debug("卸载翻译模型。")
logger.info("卸载翻译模型。")
# 释放 pipeline 持有的 model + tokenizer
mdl = getattr(self._translator, "model", None)
tok = getattr(self._translator, "tokenizer", None)