跳到正文

语音与音频

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

23条精选相关主题多模态AI 视频产品更新

最新精选

第 21–23 条 · 共 23 条
7月17日周四
  1. Mistral AI68

    Mistral Le Chat 新增 Deep Research 智能体与 Voxtral 语音功能

    Mistral 发布 Le Chat 多项新功能,包括 Deep Research 智能体可自动生成结构化研究报告;基于 Voxtral 模型的语音模式支持自然对话;Magistral 推理模型提供原生多语言思考能力;Projects 功能支持将对话分组管理;与 Black Forest Labs 合作实现图像直接编辑。

    推荐理由:Le Chat 新增 Deep Research 智能体、Voxtral 语音交互及 Magistral 多语言推理,提供了更完整的 AI 助手工作流。

12月20日周五
  1. Hugging Face Blog73

    Big Bench Audio 发布:语音推理性能显著落后于文本

    Artificial Analysis 发布 Big Bench Audio 数据集,评估语音语言模型的推理能力。测试显示 GPT-4o 在语音到语音任务中准确率仅为 66%,远低于文本处理的 92%,传统语音转文本再转语音的流水线方案在推理准确性上目前优于原生语音模型。

    推荐理由:首次量化语音推理性能衰减,揭示原生语音模型在复杂推理任务中显著落后于文本处理。

10月9日周三
  1. Hugging Face Blog70

    Gradio 5 稳定版发布

    Hugging Face 发布 Gradio 5 稳定版,引入服务端渲染(SSR)实现近乎即时的浏览器加载,并支持基于 WebSockets 和 WebRTC 的低延迟流式传输。新版本更新了组件现代设计,内置 AI Playground 辅助生成应用,并增强了 Web 安全性。

    推荐理由:Gradio 5 引入服务端渲染与低延迟流式传输,显著改善 ML 应用性能与实时交互体验。