跳到正文

#语音

今日 0 条
8月21日周五
  1. Hugging Face Blog68

    Hugging Face 研究揭示语音识别模型对公开基准的过拟合与优化现象

    Hugging Face 发布研究,通过参考不一致、实体检索和正字法切换三项测试,量化语音识别模型在 VoxPopuli 和 LibriSpeech 等公开基准上的过拟合现象。研究发现部分高分模型会复现基准中的错误转录、恢复被静音的数字,并依据音频中的数据集特定线索选择拼写,导致基准分数高估了真实场景下的转录能力。

    推荐理由:通过三项测试量化语音识别模型对公开基准的过拟合现象,揭示高分模型在真实场景中可能依赖数据集特定线索而非音频内容。

3月7日周六
12月4日周四
  1. Google Research42

    Google 发布 MSEB 基准测试:评估多模态听觉智能的八大核心能力

    Google Research 发布 Massive Sound Embedding Benchmark (MSEB),旨在标准化评估多模态模型的听觉智能。该基准涵盖语音检索、推理、分类等八大核心能力,并包含包含 177,352 条语音查询的 Simple Voice Questions (SVQ) 数据集。实验显示当前声音表示远非通用,在各项任务中均存在显著的性能提升空间。

11月19日周三
  1. Google Research85

    Google 发布端到端实时语音翻译模型并部署于 Google Meet 和 Pixel 10

    Google 发布端到端实时语音翻译模型,延迟仅2秒并保留原声,已在 Google Meet 和 Pixel 10 部署。该模型基于 AudioLM 和 SpectroStream 架构,支持英、西、德、法、意、葡等语言。

    推荐理由:端到端架构将延迟降至2秒并保留原声,已在Google Meet和Pixel 10部署,可据此评估实时语音翻译的技术进展。