归档
所有已归档的文章。
深度学习音频笔记 4:ASR 的语言、知识与部署
从语言模型融合、知识来源到离线、流式与端侧约束,把 Representation、Alignment、Language、Knowledge 和 Deployment 五个维度连起来。
深度学习音频笔记 3:ASR 的对齐问题
从 DTW、HMM 到 CTC、LAS 与 RNN-T,理解连续语音如何对应离散文字,以及对齐约束、语言依赖与流式部署之间的取舍。
深度学习音频笔记 2:ASR 与语音表征
Updated:从 ASR 应用、WER/CER 和真实场景挑战出发,梳理 MFCC、CNN、Transformer、Conformer 与自监督语音表征。
深度学习音频笔记 1:语音任务与音频表示
从语音任务出发,理解声音、采样率、傅立叶变换、STFT、Mel spectrogram 和 MFCC。
Omni 模型架构:一个框架,两大流派
从音频编码、Thinker、Talker、Vocoder、离散编解码器、连续潜变量与 ASR 等维度,可视化比较 Omni 模型架构。
先编码,再准入
Fun-ASR 如何通过批处理、single-flight 去重和 LRU 缓存,将全上下文音频编码移到 LM 准入之前。
让内容缓存名副其实
MOSS-TTS Local v1.5 参考音频缓存中batch不变性的大调查
Design agentic alpha discovery system
Design agentic alpha discovery system
Minimax Speech 2.0
Updated:Minimax Speech 2.0 论文阅读笔记:语音合成模型的技术细节
Seedream 3.0 Technical Report
Updated:Seedream 3.0 技术报告阅读笔记
2025-03-23 本周播客记录
Updated:本周播客记录:日本医保、短剧进好莱坞、特斯拉/NVIDIA、Willow量子芯片等
设定系推理的减法艺术:为何我不喜欢《献给名侦探的甜美死亡》
Updated:设定系推理小说评析:关于《献给名侦探的甜美死亡》的书评与思考
Seedream 2.0: A Native Chinese-English Bilingual Image Generation Foundation Model
Updated:Seedream 2.0 技术报告阅读笔记:中英双语图像生成基础模型
2025-03-15 本周播客记录
Updated:本周播客记录:硅谷101 Microstrategy/Bitcoin、潜空间访谈等
关于运动的思考
Updated:关于运动、热身康复、运动的好处以及不同快乐激素的思考
为什么要写博客
Updated:关于为什么要开始写博客的思考:记录想法、保持思考能力、建立个人知识库