文章
所有已发布的文章。
深度学习音频笔记 4:ASR 的语言、知识与部署
从语言模型融合、知识来源到离线、流式与端侧约束,把 Representation、Alignment、Language、Knowledge 和 Deployment 五个维度连起来。
深度学习音频笔记 3:ASR 的对齐问题
从 DTW、HMM 到 CTC、LAS 与 RNN-T,理解连续语音如何对应离散文字,以及对齐约束、语言依赖与流式部署之间的取舍。
深度学习音频笔记 2:ASR 与语音表征
Updated:从 ASR 应用、WER/CER 和真实场景挑战出发,梳理 MFCC、CNN、Transformer、Conformer 与自监督语音表征。
深度学习音频笔记 1:语音任务与音频表示
从语音任务出发,理解声音、采样率、傅立叶变换、STFT、Mel spectrogram 和 MFCC。
Omni 模型架构:一个框架,两大流派
从音频编码、Thinker、Talker、Vocoder、离散编解码器、连续潜变量与 ASR 等维度,可视化比较 Omni 模型架构。
先编码,再准入
Fun-ASR 如何通过批处理、single-flight 去重和 LRU 缓存,将全上下文音频编码移到 LM 准入之前。