跳到正文

全部动态

今日 17 条
5月18日周一
  1. Hugging Face Blog60

    PaddleOCR 3.5 新增 Transformers 推理后端

    PaddleOCR 3.5 发布,支持通过设置 engine="transformers" 使用 Hugging Face Transformers 作为推理后端。该更新让 PP-OCRv5 等模型更自然地融入基于 Transformers 的 RAG 和 Agent 工作流,同时保留原有 Paddle 后端以保障吞吐量。

    推荐理由:PaddleOCR 3.5 新增 Transformers 推理后端,降低在 Hugging Face 生态中集成文档解析的门槛。

  2. Google DeepMind42

    Project Genie 新增 Street View 功能,支持基于真实地点生成虚拟世界

    Google DeepMind 在 Project Genie 中新增 Street View 功能,允许用户基于美国真实地点生成可交互的虚拟世界。该功能结合 Maps Imagery Grounding 技术,支持“Ocean World”等风格,用户可自定义角色探索或重塑现实场景。Project Genie 现已面向全球 18 岁以上 Google AI Ultra 订阅用户开放。

5月17日周日
  1. Google DeepMind70

    Google 发布 Gemini for Science 实验工具与科学技能

    Google 发布 Gemini for Science,包含 Google Labs 上的三个实验工具:基于 Co-Scientist 的假设生成、基于 AlphaEvolve 的计算发现、基于 NotebookLM 的文献洞察,以及集成 AlphaFold 等数据库的 Google Antigravity 科学技能。

    推荐理由:Google 发布 Gemini for Science 系列实验工具与技能,覆盖假设生成、计算发现与文献洞察,提供科研加速新路径。

5月16日周六
  1. Google DeepMind48

    Google DeepMind 发布 Co-Scientist 助力 Calico 衰老研究

    Google DeepMind 发布 Co-Scientist,协助 Calico Life Sciences 在衰老生物学研究中生成可验证假设。该工具帮助研究人员从混杂的文献中识别出关于整合应激反应(ISR)受代谢调节的新颖假设,并优化实验设计。Calico 团队利用 Co-Scientist 筛选噪音并推进实验,最终获得具有健康与疾病意义的新发现。

  2. Google DeepMind40

    Google DeepMind 发布 Co-Scientist 加速肝病机制发现

    Google DeepMind 发布 Co-Scientist,利用 AI 辅助生物医学研究以加速疾病机制发现。该系统帮助爱丁堡大学团队在代谢功能障碍相关脂肪性肝炎(MASH)研究中,通过综合肝脏生物学与药理学证据,提出 NLRP3 炎症小子作为连接炎症与代谢的关键分子桥梁假设。该假设后经实验验证,为靶向双重疗法开发提供了新方向。

  3. Google DeepMind23

    Co-Scientist 助力 MIT 与波士顿儿童医院合作探索 ALS 疗法

    Co-Scientist 帮助 MIT 的 Ritu Ritu Raman 与波士顿儿童医院的 Ryan Flynn 跨越学科壁垒,将组织模型与 RNA 映射技术结合以探索肌萎缩侧索硬化症(ALS)疗法。该工具快速梳理了矛盾文献,协助团队提出可验证假设并评估可行性与风险。双方正利用 Co-Scientist 迭代寻找针对 ALS 的新型 RNA 机制及潜在药物。

  4. Google DeepMind72

    Google DeepMind发布Co-Scientist并验证其在肝纤维化药物发现中的应用

    Google DeepMind发布科研智能体Co-Scientist,斯坦福大学Gary Peltz团队利用其从海量文献中筛选出3种候选药物,并在活体人类肝细胞实验中证实其中2种能阻断肝纤维化并促进细胞再生,其中癌症药物伏立诺他(vorinostat)效果显著,阻断了91%的损伤反应。

    推荐理由:通过斯坦福大学独立实验验证了Co-Scientist在药物重定位中的有效性,为科研工作者提供了可参考的AI辅助发现路径。

5月12日周二
  1. Google DeepMind80

    Google DeepMind 发布 Co-Scientist 多智能体科研助手

    Google DeepMind 发布 Co-Scientist,这是一个基于 Gemini 的多智能体 AI 系统,旨在通过生成、辩论和进化假设来加速科学研究。该系统包含生成、辩论和进化三个阶段,利用“思想锦标赛”机制对假设进行交叉验证和排名,目前已通过 Hypothesis Generation 工具向研究人员开放。

    推荐理由:原文披露了基于 Gemini 的多智能体协作机制与“思想锦标赛”验证流程,为科研场景下的 AI 智能体提供了可迁移的方法论。

5月6日周三
  1. Hugging Face Blog40

    Open ASR Leaderboard 引入 Appen 和 DataoceanAI 私有数据集以防范刷榜

    Hugging Face 在 Open ASR Leaderboard 中引入 Appen 和 DataoceanAI 提供的高质量私有 ASR 数据集,以防范测试集污染和刷榜行为。默认排行榜平均分仍基于公开数据集计算,用户可手动开启私有数据集查看影响。此举旨在通过标准化评估和增加数据多样性,更全面地反映模型在多种口音和对话场景下的真实鲁棒性。

4月30日周四
  1. Google DeepMind73

    Google DeepMind 发布 AI co-clinician 研究:实时多模态医疗辅助能力评估

    Google DeepMind 发布 AI co-clinician 研究,探索 AI 智能体在医生监督下辅助患者的“三元护理”模式。研究通过 120 次模拟远程问诊对比 GPT-realtime,发现 AI 在 140 项评估指标中 68 项优于初级全科医生,但在识别红旗症状等关键判断上仍不及专家。

    推荐理由:通过对比GPT-realtime等前沿模型,验证了AI在实时多模态问诊中的能力边界与临床辅助价值。

4月29日周三
4月27日周一
  1. Hugging Face Blog80

    Hugging Face 展示基于 OpenAI Privacy Filter 构建的三个 Web 应用

    Hugging Face 展示了基于 OpenAI 开源隐私过滤模型 Privacy Filter 构建的三个 Web 应用:文档隐私探索器、图像匿名化工具和智能文本脱敏服务。该模型支持 128k 上下文,可识别八类个人敏感信息。

    推荐理由:Hugging Face 展示了基于 OpenAI Privacy Filter 构建的三个 Web 应用,揭示了其在文档、图像和文本场景中的工程实践。

4月23日周四
4月16日周四
  1. Google DeepMind75

    Gemini 3.1 Flash TTS 发布,引入细粒度音频标签实现自然语言控制

    Google DeepMind 发布 Gemini 3.1 Flash TTS 文本转语音模型,引入细粒度音频标签(audio tags)支持自然语言控制语音风格、节奏和表达。该模型支持 70 多种语言,在 Artificial Analysis 基准测试中表现优异,已面向开发者、企业和 Workspace 用户开放预览,所有生成音频均嵌入 SynthID 水印。

    推荐理由:引入细粒度音频标签实现自然语言控制,兼顾高音质与低成本,为开发者提供精准表达控制。

4月9日周四
  1. Google Research60

    Google 发布 PaperVizAgent 与 ScholarPeer 两个科研 AI 智能体

    Google Research 发布两个实验性 AI 智能体:PaperVizAgent 可从文本自动生成出版级学术图表,在多项指标上超越 GPT-Image-1.5 等基线;ScholarPeer 模拟资深审稿人,通过多智能体协作和实时文献检索生成深度评审意见。

    推荐理由:Google 发布两个实验性 AI 智能体,分别用于生成高质量学术图表和模拟资深审稿人,展示了 AI 深度介入科研流程的潜力。

3月29日周日
  1. Google DeepMind72

    Google DeepMind 发布 AI 指针概念,探索 Gemini 驱动的跨应用交互

    Google DeepMind 发布 AI 指针概念,展示基于 Gemini 的原型,通过视觉与语义理解实现跨应用自然交互。该功能已集成至 Chrome 和 Googlebook,支持在网页中直接询问特定内容或进行可视化对比。

    推荐理由:文章展示了基于 Gemini 的 AI 指针原型,通过自然语言与视觉上下文结合,探索跨应用无缝交互的新范式。

3月26日周四
  1. Google DeepMind85

    Google 发布 Gemini 3.1 Flash Live 语音模型

    Google 发布 Gemini 3.1 Flash Live 语音模型,在 ComplexFuncBench Audio 基准测试中得分 90.8%,支持更自然的对话与多语言实时交互。该模型已上线 Gemini Enterprise、Gemini Live 和 Search Live,并集成 SynthID 音频水印。

    推荐理由:模型在语音基准测试中刷新纪录并降低延迟,为开发者构建语音智能体提供了更可靠的底层能力。

  2. Google DeepMind68

    Google DeepMind 发布 Lyria 3 Pro 音乐生成模型

    Google DeepMind 发布 Lyria 3 Pro,支持生成长达3分钟且具备结构意识的音乐曲目,可自定义前奏、主歌等元素。该模型已接入 Vertex AI、Google AI Studio、Google Vids、Gemini 应用及 ProducerAI,面向企业和创作者开放。

    推荐理由:模型支持3分钟长曲并细化结构控制,同时扩展至多个Google产品,可据此评估其工作流整合价值。

3月25日周三
  1. Google Research75

    Google 发布 Vibe Coding XR 工作流加速 AI + XR 原型开发

    Google 发布 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与 XR Blocks 框架,将自然语言直接转化为功能性的 Android XR 应用。该工作流利用 Gemini 进行多步规划与空间逻辑处理,在 60 秒内生成包含物理感知和交互的 3D 体验,并提供了桌面模拟器与 Android XR 头显的实时预览功能。

    推荐理由:原文展示了利用 Gemini 长上下文推理将自然语言直接转化为 XR Blocks 应用的完整工作流,为空间计算原型开发提供了可复用的新范式。

3月18日周三
  1. Google Research65

    Google Research 在 The Check Up 大会展示医疗AI从创新到临床落地的进展

    Google Research 在 The Check Up 大会上展示了AI在医疗领域的最新进展,涵盖从个性化健康到临床辅助的多个方向。在临床协作方面,与 NHS 合作的研究显示AI可识别25%的漏诊乳腺癌,并联合 Beth Israel Deaconess 测试 AMIE 多智能体系统。

    推荐理由:系统展示了从临床辅助到公共卫生到科研加速的AI应用全景,揭示了多模态与智能体在医疗场景的落地路径。

3月12日周四
  1. Google Research70

    Google Flood Hub 上线 AI 驱动的城市内涝预测功能

    Google Research 宣布在 Flood Hub 上线城市内涝(Flash Flood)预测功能,利用 AI 方法将预警时间提前至 24 小时。该模型通过 Gemini 分析公开新闻报道构建 Groundsource 数据集,结合全球气象数据预测人口密集区的内涝风险,在部分南方国家的表现与美国国家气象局相当。

    推荐理由:利用Gemini提取新闻数据构建训练集,在缺乏地面观测的南方国家实现24小时城市内涝预测。

  2. Google Research68

    Google 发布 Groundsource 将新闻转化为城市内涝历史数据

    Google 发布 Groundsource 框架,利用 Gemini 从全球新闻中提取结构化历史数据,构建了包含 260 万条城市内涝事件的开放数据集。该数据集已用于提升 Google Flood Hub 的预报能力,可提前 24 小时预测近全球范围的城市内涝。

    推荐理由:利用 Gemini 从新闻中提取结构化数据,填补了城市内涝历史数据空白,并直接用于提升 Flood Hub 的预报能力。

2月27日周五
  1. Google DeepMind83

    Google 发布 Nano Banana 2 图像生成模型

    Google DeepMind 发布 Nano Banana 2(Gemini 3.1 Flash Image),结合 Pro 级智能与 Flash 速度,支持多主体一致性和精确文本渲染。该模型已上线 Gemini、Search、AI Studio 及 Google Ads 等产品,并集成 SynthID 和 C2PA 溯源技术。

    推荐理由:Nano Banana 2 将 Pro 级能力与 Flash 速度结合,提供多主体一致性和精确文本渲染,适合快速迭代场景。

2月11日周三
  1. Google Research55

    Google Research 发布开源框架 DialogLab 用于模拟多角色动态人机对话

    Google Research 发布开源原型框架 DialogLab,用于设计、模拟和测试动态多角色人机对话。该框架通过可视化界面解耦社交设置与对话流程,支持拖拽式角色配置与结构化脚本编排。评估显示,其“人工控制”模式在模拟真实人类行为时比全自动或纯响应式代理更具沉浸感和有效性。

2月5日周四
1月30日周五
  1. Google DeepMind72

    Google DeepMind 发布 Project Genie 实验原型

    Google DeepMind 面向美国 Google AI Ultra 订阅用户发布 Project Genie 实验原型,基于 Genie 3 模型提供世界创建、实时探索与混剪功能。该原型支持文本与图像提示词生成动态环境,并允许下载探索视频,目前存在生成时长与物理一致性等已知限制。

    推荐理由:原文给出了世界模型在实时生成与交互上的能力边界,读者可据此评估其在创意探索中的实际可用性。

1月15日周四
1月14日周三
  1. Google Research75

    Google 发布 MedGemma 1.5 4B 与 MedASR 医疗语音模型

    Google 发布 MedGemma 1.5 4B 模型,新增对 CT、MRI 等三维医学影像及解剖定位的支持,并在多项医疗基准上提升准确率。同时发布 MedASR 医疗语音识别模型,在医疗听写场景下错误率显著降低。两款模型均通过 Hugging Face 和 Vertex AI 开源。

    推荐理由:新增三维影像与解剖定位能力并开源,为医疗AI开发者提供了更贴近临床工作流的基座模型。

  2. Google DeepMind72

    Google DeepMind 发布 Veo 3.1 更新:增强参考图生成视频能力并支持原生竖屏与4K

    Google DeepMind 发布 Veo 3.1 更新,强化基于参考图生成视频的能力,提升角色与背景一致性,并新增原生 9:16 竖屏输出及 1080p/4K 超分。新功能已上线 YouTube Shorts、Gemini App、Flow、Gemini API 及 Vertex AI,同时 Gemini App 新增视频 SynthID 水印验证功能。

    推荐理由:更新强化了参考图生成视频的一致性并新增原生竖屏与4K输出,适配移动端与专业工作流。

12月17日周三
  1. Hugging Face Blog70

    使用 NeMo Evaluator 复现 NVIDIA Nemotron 3 Nano 评测

    NVIDIA 发布 Nemotron 3 Nano 30B A3B 的完整开源评测配方,包含 NeMo Evaluator 配置、YAML 参数与 CLI 命令。开发者可一键复现 BFCL v4、LiveCodeBench 等基准测试,独立验证模型性能。

    推荐理由:提供完整复现 Nemotron 3 Nano 评测的 NeMo Evaluator 配置与命令,便于独立验证模型性能。

12月16日周二
  1. Google Research72

    Google 推出 Gemini 论文辅助工具,在 STOC 2026 中验证推理能力

    Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具(PAT),在 STOC 2026 会议中为作者提供提交前的自动化反馈。该工具利用推理扩展方法,成功识别了包括计算错误和逻辑漏洞在内的多种问题,97% 的参与者认为反馈有帮助。

    推荐理由:Google 推出基于 Gemini 2.5 Deep Think 的论文辅助工具,在理论计算机科学会议中验证了其在发现逻辑漏洞方面的有效性。

  2. Hugging Face Blog72

    开源智能体框架CUGA上线Hugging Face Spaces

    IBM Research开源智能体框架CUGA正式集成至Hugging Face Spaces,提供CRM场景演示与可视化开发入口。CUGA支持多工具集成与可配置推理模式,在AppWorld等基准测试中表现优异,兼容gpt-oss-120b与Llama-4等开源模型。

    推荐理由:开源智能体框架CUGA上线Hugging Face Spaces,提供可视化演示与多模型支持,便于开发者快速体验与集成。

12月13日周六
12月12日周五
12月11日周四
  1. Hugging Face Blog70

    llama.cpp 新增 Router 模式支持多模型动态管理

    llama.cpp server 新增 Router 模式,支持在不重启服务的情况下动态加载、卸载和切换多个模型。该功能采用多进程架构,每个模型独立运行,支持自动发现 GGUF 文件、按需加载及 LRU 淘汰机制,默认同时加载 4 个模型。

    推荐理由:实现了多模型动态加载与切换,无需重启服务,便于本地多模型管理与性能隔离。

12月5日周五