即時低延遲音源分離模型調研:遊戲腳步聲增強應用
由 張志豪 分享的筆記
任務:AI 音訊 R&D 研究員 — 尋找即時低延遲音源分離模型,應用於遊戲腳步聲的加強處理 調研日期:2026-07-22 Executive Summary(執行摘要) 本報告針對「遊戲腳步聲即時增強」應用場景,系統性地調研了當前即時低延遲音源分離/目標聲音提取(Target Sound Extraction, TSE)領域的 SOTA 模型與技術路線。 核心結論 面向 建議 ------ ------ 最佳模型架構 Waveformer(即時目標聲音提取專用)— 首個實現 streaming TSE 的模型,相較 prior models runtime 降低 1.5–2x、SI-SNRi 提升 2.2–3.3 dB 輕量替代方案 Conv-TasNet(5.1M params, ~2ms latency)— 時域端到端分離,支持 causal 模式,最成熟的即時分離 backbone 最新 SOTA Band-SCNet(2.59M params, SDR 7.79 dB, 因果設計)— Interspeech 2025 最佳學生論文,稀疏壓縮+跨頻帶模組 超輕量備選 RNNoise 風格 GRU(~0.06M params / 111KB INT8)— 以極低成本做頻域 mask 增強,適合嵌入到 APO 等受限環境 兩階段 Pipeline 建議 第一階段:Tiny CRNN 腳步聲偵測 → 第二階段:輕量來源分離/增強模型 分離並放大 腳步聲 可行性總結:在現代遊戲 PC(具備 CPU/GPU)上,Conv-TasNet 或 Waveformer 均可實現 8 kHz(���境高頻) 此頻率分布決定了分離模型的特徵提取重點應放在中高頻區域。