跳到正文

#语音

今日 0 条
10月8日周四
  1. Ars Technica · AI40

    利用 1 万个 AI 机器人和 AI 歌曲进行流媒体欺诈的男子被判入狱

    一名男子因使用 1 万个机器人和 AI 歌曲进行流媒体欺诈,被判处 18 个月监禁并没收 8,091,843.64 美元。美国司法部指控其通过操纵流媒体平台,从艺术家共享的版税池中窃取数百万美元。尽管其律师辩称此举旨在警示行业且被告已深感悔意,法院仍认为需通过严厉判决以起到威慑作用。

10月7日周三
  1. Hugging Face Blog62

    TII 发布 Falcon ASR 语音识别模型,支持阿联酋方言

    TII 发布 Falcon ASR 语音识别模型,参数量 1.6B,针对阿联酋方言优化并支持英语、法语、西班牙语和葡萄牙语。在公开基准上平均词错率(WER)为 20.92%,优于此前最佳结果,并提供在线 Demo 体验。

    推荐理由:模型针对阿联酋方言优化并支持多语种,提供了可验证的基准成绩与在线体验入口。

10月6日周二
9月30日周三
  1. Hugging Face Blog60

    Hugging Face 发布开源多语言 TTS 排行榜

    Hugging Face 推出 Open TTS Leaderboard,采用客观指标评估开源 TTS 模型。该排行榜涵盖多语言识别率、推理速度和说话人相似度,并支持语音克隆与流式性能对比,旨在解决人工投票榜扩展性不足的问题。

    推荐理由:Hugging Face 推出基于客观指标的开源多语言 TTS 排行榜,弥补了人工投票榜在扩展性上的不足。

9月25日周五
  1. Google DeepMind77

    Gemini 3.8 Live 新增 Live Avatar 实时视觉形象功能

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,将实时对话与低延迟流式视频生成原生耦合,赋予 AI 具备动态视觉形象。该功能支持 97 种语言无缝切换且保持口型同步,可在后台异步调用工具以维持对话流畅,目前已在 Gemini Enterprise 中开放。

    推荐理由:原生耦合实时对话与低延迟视频流,支持97种语言无缝切换及异步工具调用,为多模态交互提供企业级入口。

9月23日周三
  1. Google DeepMind82

    Gemini 3.8 Flash TTS 与 Flash-Lite TTS 发布

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持通过自然语言提示从零创建角色声音、30秒样本复刻声音,并提供逐行表演控制与原生双人对白编排。模型已上线 Google AI Studio 和 Gemini API,并在 Hume AI 语音设计基准测试中取得领先。

    推荐理由:提供了原生双人对白编排与细粒度表演控制,可据此评估其在播客、有声书及多语言配音场景的落地能力。

9月16日周三
  1. Google DeepMind85

    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 实时对话模型

    Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 两款实时对话模型,支持近实时视觉输入、97 种语言自动切换及后台工具调用。3.8 Live Extended Thinking 在 Artificial Analysis 语音质量指数中排名第一,并在 τ-Voice 基准测试中展现多步推理能力。

    推荐理由:新增实时对话与扩展推理能力,提供语音基准数据与多语言支持,便于开发者构建生产级语音智能体。

8月28日周五
8月25日周二
  1. Mistral AI42

    Mistral 与 HUMAIN 宣布战略合作推进中东主权AI

    Mistral 与 HUMAIN 宣布战略合作,在沙特阿拉伯及中东地区推进主权AI。双方将联合开发针对阿拉伯语优化的前沿模型,重点聚焦网络安全与语音领域,并探索利用 HUMAIN 数据中心满足当地算力需求。该合作涉及数亿欧元,旨在通过本地基础设施与开放权重模型,帮助金融、制造等受监管行业实现数据与控制权自主。

8月21日周五
  1. Hugging Face Blog68

    Hugging Face 研究揭示语音识别模型对公开基准的过拟合与优化现象

    Hugging Face 发布研究,通过参考不一致、实体检索和正字法切换三项测试,量化语音识别模型在 VoxPopuli 和 LibriSpeech 等公开基准上的过拟合现象。研究发现部分高分模型会复现基准中的错误转录、恢复被静音的数字,并依据音频中的数据集特定线索选择拼写,导致基准分数高估了真实场景下的转录能力。

    推荐理由:通过三项测试量化语音识别模型对公开基准的过拟合现象,揭示高分模型在真实场景中可能依赖数据集特定线索而非音频内容。

8月11日周二
  1. Hugging Face Blog78

    NVIDIA Magpie TTS 开源多语言语音模型,新增阿拉伯语等三种语言

    NVIDIA 在 Hugging Face 开源 Magpie 多语言 TTS 模型,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,支持12种语言。该模型提供364M参数开源权重及NIM部署方案,在B200上单流首音频延迟低至32ms,并引入帧堆叠与局部Transformer架构优化推理速度。

    推荐理由:提供开源权重与NIM部署方案,支持12种语言及低延迟指标,适合需要私有化部署和定制语音的开发者。

7月1日周三
  1. Hugging Face Blog70

    Hugging Face 联合 Cerebras 发布实时语音 AI 演示

    Hugging Face 与 Cerebras 联合展示了基于 Cerebras 推理加速的实时语音 AI 架构,该架构采用 Nvidia Parakeet 进行语音识别、Gemma 4 VLM 进行推理、Qwen3TTS 进行语音合成,实现了低延迟的端到端语音交互。

    推荐理由:展示了结合Cerebras推理与Gemma 4、Qwen3TTS的实时语音架构,为开发者提供了低延迟语音交互的开源参考实现。

5月27日周三
  1. Hugging Face Blog77

    Hugging Face 教程:让 Reachy Mini 机器人实现全本地语音交互

    Hugging Face 发布教程,指导用户将 Reachy Mini 机器人的语音交互栈完全部署在本地。通过 speech-to-speech 库串联 Silero VAD、Parakeet-TDT 0.6B v3、Qwen3-TTS 等开源组件,并结合 llama.cpp 或 vLLM 运行 Gemma-4 或 Qwen3-4B 等模型,实现无需云端 API 的隐私保护与低延迟对话。

    推荐理由:提供将语音交互栈完全本地化的实操指南,展示如何在端侧实现隐私保护与低延迟的机器人对话。

5月6日周三
  1. Hugging Face Blog40

    Open ASR Leaderboard 引入 Appen 和 DataoceanAI 私有数据集以防范刷榜

    Hugging Face 在 Open ASR Leaderboard 中引入 Appen 和 DataoceanAI 提供的高质量私有 ASR 数据集,以防范测试集污染和刷榜行为。默认排行榜平均分仍基于公开数据集计算,用户可手动开启私有数据集查看影响。此举旨在通过标准化评估和增加数据多样性,更全面地反映模型在多种口音和对话场景下的真实鲁棒性。