跳到正文

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 121–140 条 · 共 147 条
11月20日周四
  1. Google DeepMind85

    Google DeepMind 发布 Gemini 3 Pro Image 图像生成模型

    Google DeepMind 发布 Gemini 3 Pro Image(代号 Nano Banana Pro),提供 2K/4K 分辨率、高精度文本渲染及物理控制能力。该模型支持通过 Google Search 进行实时知识检索,并内置 SynthID 数字水印,已在 Google AI Studio 和 Vertex AI 开放预览。

    推荐理由:该模型在文本渲染、物理控制和知识检索方面实现升级,开发者可据此构建更精准的多模态应用。

  2. Google DeepMind85

    Google DeepMind 发布 Nano Banana Pro 图像生成与编辑模型

    Google DeepMind 发布基于 Gemini 3 Pro 的 Nano Banana Pro 图像生成与编辑模型,强化了文本渲染、多模态推理与局部精细编辑能力。该模型已在全球 Gemini App、Google Ads、Google Slides 及 Vids 中逐步开放,并为开发者提供 Gemini API 与 Vertex AI 支持。

    推荐理由:基于 Gemini 3 Pro 架构,强化了文本渲染、多模态推理与局部精细编辑能力,并明确了各订阅层级的开放范围。

11月19日周三
  1. Google Research85

    Google 发布端到端实时语音翻译模型并部署于 Google Meet 和 Pixel 10

    Google 发布端到端实时语音翻译模型,延迟仅2秒并保留原声,已在 Google Meet 和 Pixel 10 部署。该模型基于 AudioLM 和 SpectroStream 架构,支持英、西、德、法、意、葡等语言。

    推荐理由:端到端架构将延迟降至2秒并保留原声,已在Google Meet和Pixel 10部署,可据此评估实时语音翻译的技术进展。

  2. Google DeepMind92

    Google DeepMind 发布 Gemini 3 Pro 模型

    Google DeepMind 发布 Gemini 3 Pro 模型,在编码、Agent 工作流及多模态理解基准上表现领先。该模型提供 100 万 token 上下文窗口,API 预览版定价为输入 2 美元/百万 token、输出 12 美元/百万 token,并同步推出 Google Antigravity 开发平台。

    推荐理由:原文给出了核心能力变化和 API 定价,读者可据此评估其对现有开发工作流的影响。

  3. Google DeepMind95

    Google 发布 Gemini 3 模型,刷新多项基准测试纪录

    Google DeepMind 发布 Gemini 3 Pro,在 LMArena、GPQA Diamond 和 SWE-bench Verified 等基准测试中刷新纪录。同步推出增强推理的 Gemini 3 Deep Think 模式及面向开发者的 Google Antigravity 平台。

    推荐理由:Gemini 3 在多项基准测试中刷新纪录,并推出深度思考模式与 Antigravity 开发平台,展示了前沿智能与工程能力的全面升级。

  4. Google DeepMind82

    Google 发布智能体开发平台 Antigravity

    Google 发布智能体开发平台 Antigravity,提供异步交互与自主规划能力。平台包含编辑器与管理器视图,支持 Gemini 3、Claude Sonnet 4.5 和 GPT-OSS 模型,目前面向个人免费开放预览。

    推荐理由:提供异步交互与自主规划能力,展示智能体主导开发的新形态。

  5. Google Research82

    Google 在 Gemini 和搜索中落地生成式 UI,按需定制交互界面

    Google 在 Gemini 应用和 Google 搜索 AI 模式中推出生成式 UI 实验,利用 Gemini 3 的编码能力为任意提示词动态生成定制化交互界面。配套论文《Generative UI: LLMs are Effective UI Generators》指出,在忽略生成速度的情况下,人类评估者更偏好该生成式 UI 而非标准文本或 Markdown 输出。

    推荐理由:Gemini 3 通过动态视图和搜索 AI 模式落地生成式 UI,提供按需定制交互界面,展示了模型在复杂任务中的编码与多模态能力。

11月17日周一
  1. Google DeepMind75

    Google DeepMind 发布 WeatherNext 2 天气预测模型

    Google DeepMind 发布 WeatherNext 2,生成速度提升 8 倍,分辨率达小时级,可预测数百种天气场景。该模型基于 Functional Generative Network 架构,在 99.9% 的变量上超越前代,数据已上线 Earth Engine 和 BigQuery,并升级了 Google Search、Gemini 及 Maps 的天气服务。

    推荐理由:模型速度提升8倍且支持小时级分辨率,通过多场景预测增强极端天气研判能力。

11月14日周五
  1. Google Research61

    Google Research 发布全球天然林地图及AI基准数据集

    Google Research 联合 Google DeepMind 发布 Natural Forests of the World 2020 地图及数据集,利用 MTSViT 模型实现 10 米分辨率天然林识别,准确率达 92.2%。同时发布 Planted 和 ForTy 两个大规模基准数据集,用于支持 EUDR 合规及下一代森林分类模型研发。

    推荐理由:发布全球首个10米分辨率天然林地图及基准数据集,为合规与生态监测提供高精度AI基线。

11月13日周四
  1. Google DeepMind75

    Google DeepMind 发布 SIMA 2:基于 Gemini 推理的 3D 世界通用智能体

    Google DeepMind 发布 SIMA 2,将 Gemini 模型作为核心推理引擎,使智能体能在 3D 虚拟环境中理解复杂指令、进行链式推理并自我改进。该模型在跨游戏泛化和与用户协作方面表现显著,目前作为有限研究预览向学术界和游戏开发者开放。

    推荐理由:SIMA 2 将 Gemini 推理能力引入 3D 游戏,实现了跨游戏泛化与自我改进,为具身智能提供了新路径。

11月12日周三
11月5日周三
  1. Google Research70

    Google 发布 ForestCast 预测森林砍伐风险并开源基准数据集

    Google Research 与 DeepMind 发布 ForestCast,利用纯卫星数据和视觉 Transformer 模型预测森林砍伐风险。同时开源首个用于训练深度学习模型的公开基准数据集,旨在帮助政府和企业提前干预以遏制森林损失。

    推荐理由:基于纯卫星数据预测森林砍伐风险并开源基准数据集,为生态保护提供可复现的AI工具。

9月4日周四
  1. Hugging Face Blog82

    Google发布EmbeddingGemma开源多语言嵌入模型

    Google发布EmbeddingGemma,一款仅308M参数、支持100多种语言的开源多语言嵌入模型,专为端侧设备设计。该模型基于Gemma3架构,在MTEB基准测试中表现优异,并提供了Sentence Transformers、LangChain、LlamaIndex等主流框架的集成示例及微调指南。

    推荐理由:模型仅308M参数且支持100+语言,适合端侧部署,并提供了多框架集成与微调指南。

7月23日周三
  1. Hugging Face Blog75

    TimeScope 开源长视频多模态模型评测基准

    Hugging Face 发布 TimeScope 开源基准,通过向 1 分钟至 8 小时的长视频中插入短片段,评估模型在局部检索、信息综合和细粒度时序感知方面的能力。评测显示,尽管 Gemini 2.5-Pro 在长视频上表现优异,但多数模型在时序推理上仍面临挑战,且模型规模并非决定长视频理解能力的唯一因素。

    推荐理由:通过插入视频片段评估长视频理解能力,揭示了当前模型在时序推理上的局限。

6月26日周四
  1. Hugging Face Blog83

    Gemma 3n 模型正式开源,原生支持多模态与端侧部署

    Google 发布 Gemma 3n 模型,原生支持图像、文本、音频和视频输入。提供 gemma-3n-E2B 和 gemma-3n-E4B 两个版本,实际参数量分别为 5B 和 8B,但显存占用仅需 2GB 和 3GB。模型已集成至 transformers、MLX、llama.cpp 等主流开源库,并支持多模态微调。

    推荐理由:Gemma 3n 原生支持多模态并针对端侧部署优化,提供了详细的开源生态集成与微调指南。

3月12日周三
  1. Hugging Face Blog92

    Google 发布多模态开源大模型 Gemma 3

    Google 发布多模态开源大语言模型 Gemma 3,包含 1B 至 27B 参数版本,支持 128k 上下文窗口和 140 多种语言。其中 4B 及以上版本具备图文处理能力,Gemma 3 27B 在多项基准测试中表现优异,并原生支持 Transformers、MLX 及 llama.cpp 等生态。

    推荐理由:Google 发布支持 128k 上下文和 140+ 语言的多模态开源模型,提供端侧部署方案。

2月21日周五
  1. Hugging Face Blog70

    Hugging Face 解读 Google 开源多模态编码器 SigLIP 2

    Hugging Face 发布博文解读 Google 开源的多模态视觉语言编码器 SigLIP 2。该模型在 SigLIP 基础上引入解码器、全局-局部损失和掩码预测等训练目标,新增动态分辨率(naflex)变体及 1B 参数巨型模型,在零样本分类和图像文本检索等核心能力上全面超越前代。

    推荐理由:原文详细拆解了SigLIP 2引入的解码器、自蒸馏等训练目标及动态分辨率特性,为开发者优化多模态模型提供了具体技术参考。

2月19日周三
  1. Hugging Face Blog77

    Google 发布 PaliGemma 2 Mix 系列视觉语言模型

    Google 发布 PaliGemma 2 Mix 系列视觉语言模型,该系列在 OCR、长短期图像描述等视觉语言任务上进行了微调。提供 3B、10B、28B 三种参数规模及 224x224、448x448 两种分辨率,支持通过 Transformers 框架进行推理和微调,并开放了 10B 模型的在线 Demo。

    推荐理由:Google 发布 PaliGemma 2 Mix 系列微调模型,提供开箱即用的视觉语言任务能力,便于快速评估预训练模型在下游任务上的表现。

12月5日周四
  1. Hugging Face Blog79

    Google 发布 PaliGemma 2 多模态模型

    Google 发布 PaliGemma 2 视觉语言模型,基于 SigLIP 和 Gemma 2 架构,提供 3B、10B 和 28B 三种参数规模,支持 224x224、448x448 和 896x896 多种输入分辨率。模型采用 Gemma 许可协议,支持商业使用与微调,Hugging Face 同步更新了 transformers 集成与 LoRA 微调脚本。

    推荐理由:提供了多尺寸模型与多分辨率支持,并附带微调脚本,便于开发者快速适配视觉语言任务。

10月23日周三
  1. Hugging Face Blog65

    Hugging Face 发布 SynthID Text 文本水印工具

    Google DeepMind 与 Hugging Face 联合在 Transformers v4.46.0 中发布 SynthID Text,提供用于在 AI 生成文本中嵌入不可见水印的 logits processor 及检测分类器。该工具通过伪随机函数增强生成过程,支持配置密钥和 ngram 长度,并附带端到端的检测器训练示例。

    推荐理由:官方提供了可直接复用的水印生成与检测代码,帮助开发者在生成文本中嵌入可验证的AI标识。