跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

47条精选相关主题多模态AI 视频产品更新

最新精选

第 41–47 条 · 共 47 条
12月20日周三
  1. Hugging Face Blog75

    使用推测解码将 Whisper 推理速度提升 2 倍

    Hugging Face 博客发文演示了如何在 Whisper 模型中应用推测解码(Speculative Decoding)技术。通过引入 Distil-Whisper 作为辅助模型,在保持转录精度完全一致的前提下,将 16GB T4 GPU 上的推理时间缩短约 2 倍。文章提供了基于 Transformers 库的完整代码实现,并探讨了多语言场景下的模型选择及批处理策略。

    推荐理由:文章提供了基于 Transformers 库的完整代码,演示了如何利用 Speculative Decoding 在不损失精度的前提下将 Whisper 推理速度提升约 2 倍。

8月30日周三
8月9日周三
  1. Hugging Face Blog68

    使用Transformers优化Bark语音生成模型

    本文演示了如何利用Hugging Face生态中的BetterTransformer、半精度和CPU卸载技术优化Bark语音生成模型。结合这三种优化手段,Bark-large的显存占用可从5GB降至2GB,推理速度提升约23%。

    推荐理由:原文给出了结合BetterTransformer、半精度和CPU卸载的具体代码,读者可直接复用以显著降低Bark模型的显存占用并提升推理速度。

6月19日周一
  1. Hugging Face Blog75

    使用MMS Adapter微调低资源语音识别模型

    Hugging Face发布教程,展示如何使用MMS Adapter技术微调低资源语音识别模型。通过仅训练约2.5M权重的Adapter层,在Common Voice土耳其语数据集上仅需4小时数据和4个epoch即可达到优异效果。

    推荐理由:提供基于MMS Adapter的少样本语音识别微调代码,展示如何用极小数据量实现高效适配。

5月18日周四
9月21日周三
4月30日周四
  1. OpenAI News70

    OpenAI 发布 Jukebox 音乐生成模型

    OpenAI 发布 Jukebox,这是一个能生成包含简单歌唱的原始音频的音乐神经网络,支持多种流派和艺术家风格。官方同步开源了模型权重、代码及样本探索工具。

    推荐理由:Jukebox 开源了生成音乐和原始音频的模型权重与代码,为音频生成研究提供了可复用的基础。