跳到正文

全部动态

今日 48 条
3月20日周四
  1. Hugging Face Blog72

    如何在本地使用 OlympicCoder 进行编码

    LM Studio 发布教程,指导用户将 OlympicCoder 7B 模型通过 LM Studio 和 VS Code 插件接入本地环境。该模型基于 CodeForces-CoTs 数据集优化,适合解决高难度编程挑战,评测显示其 7B 参数版本在 LiveCodeBench 上优于 Claude 3.7 Sonnet 和 GPT-4o。

    推荐理由:原文给出了将开源模型接入本地 IDE 的具体配置步骤,读者可据此搭建私有编码助手。

3月19日周三
  1. Hugging Face Blog35

    Hugging Face 回应白宫 AI 行动计划 RFI

    Hugging Face 提交了对白宫 AI 行动计划信息征询的回复,强调开放 AI 系统和开放科学对提升性能、效率和安全性至关重要。文章建议将开源和开放科学视为 AI 成功的基石,优先通过高效可靠的技术解锁广泛创新,并通过开放、可追溯和透明的系统保障 AI 安全。

3月18日周二
  1. Hugging Face Blog82

    NVIDIA GTC 2025 发布 Cosmos Transfer 世界模型与 Isaac GR00T N1 人形机器人模型

    NVIDIA 在 GTC 2025 上发布三项开源物理 AI 成果:70 亿参数的 Cosmos Transfer 世界模型支持多控制信号生成高保真场景;包含 15TB 数据的 Physical AI 数据集;以及首个通用具身推理模型 Isaac GR00T N1,采用双系统架构支持多平台人形机器人操作。

    推荐理由:NVIDIA 开源了 Cosmos Transfer 世界模型与 Isaac GR00T N1 人形机器人模型,为物理 AI 开发提供了关键工具。

  2. Hugging Face Blog68

    Hugging Face 将仓库迁移至 Xet 存储以加速大文件传输

    Hugging Face 将首批模型和数据集仓库从 LFS 迁移至 Xet 存储,利用内容定义分块实现字节级去重,显著降低大文件上传下载开销。团队在迁移 4.5 TB 数据后修复了下载冗余和负载不均等工程问题,并推出 hf_xet 包以无缝集成。

    推荐理由:Hugging Face 将部分仓库迁移至 Xet 存储,通过块级去重显著降低大文件传输开销。

3月17日周一
  1. Mistral AI82

    Mistral Small 3.1 发布:开源多模态模型,超越 GPT-4o Mini 等竞品

    Mistral AI 发布 Mistral Small 3.1,该模型支持 128k 上下文窗口和多模态理解,在同等参数量级下性能超越 GPT-4o Mini 和 Gemma 3,推理速度达 150 tokens/秒。

    推荐理由:模型在同等体量下超越主流闭源小模型,支持128k上下文且可单卡运行,为端侧部署和低成本应用提供了开源替代方案。

3月14日周五
3月13日周四
3月12日周三
  1. Hugging Face Blog92

    Google 发布多模态开源大模型 Gemma 3

    Google 发布多模态开源大语言模型 Gemma 3,包含 1B 至 27B 参数版本,支持 128k 上下文窗口和 140 多种语言。其中 4B 及以上版本具备图文处理能力,Gemma 3 27B 在多项基准测试中表现优异,并原生支持 Transformers、MLX 及 llama.cpp 等生态。

    推荐理由:Google 发布支持 128k 上下文和 140+ 语言的多模态开源模型,提供端侧部署方案。

  2. Hugging Face Blog74

    Open R1 发布 OlympicCoder 代码模型及代码推理数据集

    Hugging Face 发布 OlympicCoder-7B 和 32B 模型,在 IOI 基准上超越 Claude 3.7 Sonnet 和 DeepSeek-R1。同时开源了包含近 10 万条样本的 CodeForces-CoTs 数据集及 IOI 评测基准,并分享了训练推理模型的关键经验。

    推荐理由:开源了从 R1 蒸馏的代码推理数据集及 OlympicCoder 模型,并分享了训练推理模型的关键经验。

3月11日周二
  1. Hugging Face Blog75

    Hugging Face 发布 LeRobot L2D 自动驾驶数据集

    Hugging Face 与 Yaak 联合发布 LeRobot L2D,这是全球最大的开源自动驾驶数据集,包含来自德国 30 个城市的 90+ TB 多模态数据。数据涵盖 5000+ 小时驾驶记录,包含 6 路 RGB 摄像头、车辆状态及自然语言指令,并区分了专家与学生两种驾驶策略。

    推荐理由:提供了包含专家与学生策略的超大规模多模态数据集,为训练端到端自动驾驶模型提供了关键数据基础。

3月10日周一
3月7日周五
  1. Hugging Face Blog70

    使用React Native在手机上本地运行大语言模型教程

    Hugging Face发布教程,指导开发者使用React Native和llama.rn在移动端本地运行大语言模型。教程涵盖从环境搭建、模型选择(如DeepSeek-R1-Distill-Qwen-1.5B)、GGUF文件下载、模型加载到构建聊天界面的完整流程,代码开源在EdgeLLM仓库。

    推荐理由:提供基于React Native和llama.rn的端侧大模型应用开发全流程,涵盖模型选择、下载、加载与对话实现。

  2. Mistral AI83

    Mistral 发布 Mistral OCR API

    Mistral 发布 Mistral OCR API,支持图像和 PDF 输入,可高精度提取文本、表格、公式及嵌入图片,并输出有序交错的 Markdown 或结构化 JSON。该模型在多项基准测试中超越竞品,支持多语言处理,API 定价为每 1000 页 1 美元,已在 Le Chat 中作为默认文档理解模型使用。

    推荐理由:Mistral 发布专用 OCR API 并公布基准数据与定价,为 RAG 场景提供结构化文档解析方案。

3月6日周四
3月4日周二
  1. OpenAI News35

    OpenAI 推出 NextGenAI

    OpenAI 推出 NextGenAI 项目,向领先机构投入 5000 万美元资金及工具。该举措旨在支持相关机构的发展,具体合作细节与工具内容未在文中详述。

  2. Hugging Face Blog78

    Cohere For AI 发布 Aya Vision 多语言视觉模型

    Cohere For AI 发布 Aya Vision 8B 和 32B 开源视觉语言模型,支持 23 种语言。模型采用合成数据增强与模型融合技术,在 AyaVisionBench 等基准测试中超越参数量两倍以上的 Llama-3.2 90B 和 Qwen2.5-VL 72B。同时开源了包含 23 种语言的 AyaVisionBench 评测基准。

    推荐理由:原文披露了合成数据增强与模型融合等关键技术细节,为构建多语言视觉模型提供了可复用的训练范式。

2月28日周五
2月27日周四
  1. OpenAI News80

    OpenAI 发布 GPT-4.5 研究预览版

    OpenAI 发布 GPT-4.5 研究预览版,定位为目前最大且知识最丰富的模型。

    推荐理由:OpenAI 发布 GPT-4.5 研究预览版,定位为目前最大且知识最丰富的模型,提供前沿能力体验。

2月25日周二
  1. Hugging Face Blog70

    Hugging Face 发布 FastRTC 实时通信库

    Hugging Face 发布 FastRTC,一个专为 Python 设计的实时音视频通信库。它内置语音检测、自动 UI 及电话接入功能,支持快速构建实时 AI 应用。

    推荐理由:提供内置语音检测与自动 UI,降低 Python 实时音视频应用开发门槛。

2月24日周一
  1. Hugging Face Blog65

    Hugging Face 推出远程 VAE 解码功能

    Hugging Face 推出远程 VAE 解码功能,将高显存消耗的解码过程委托给云端端点,降低本地显存占用并支持并发队列。该功能已为 Stable Diffusion v1、SDXL、Flux 和 HunyuanVideo 提供专用端点,并开源了相关代码。

    推荐理由:Hugging Face 推出远程 VAE 解码功能,通过云端端点降低本地显存占用并提升并发能力。

2月21日周五
  1. Hugging Face Blog70

    Hugging Face 解读 Google 开源多模态编码器 SigLIP 2

    Hugging Face 发布博文解读 Google 开源的多模态视觉语言编码器 SigLIP 2。该模型在 SigLIP 基础上引入解码器、全局-局部损失和掩码预测等训练目标,新增动态分辨率(naflex)变体及 1B 参数巨型模型,在零样本分类和图像文本检索等核心能力上全面超越前代。

    推荐理由:原文详细拆解了SigLIP 2引入的解码器、自蒸馏等训练目标及动态分辨率特性,为开发者优化多模态模型提供了具体技术参考。

2月20日周四
  1. Hugging Face Blog82

    Hugging Face 发布 SmolVLM2 视频理解模型

    Hugging Face 发布 SmolVLM2 系列视频理解模型,包含 256M、500M 和 2.2B 三种参数规模。2.2B 模型在 Video-MME 基准上超越所有现有 2B 模型,500M 和 256M 模型在极低内存消耗下实现同等视频理解能力,且原生支持 Transformers 和 MLX 框架。

    推荐理由:Hugging Face 开源了支持视频理解的 SmolVLM2 系列模型,提供 256M 至 2.2B 三种尺寸,兼顾端侧部署与前沿性能。

2月19日周三
  1. Hugging Face Blog77

    Google 发布 PaliGemma 2 Mix 系列视觉语言模型

    Google 发布 PaliGemma 2 Mix 系列视觉语言模型,该系列在 OCR、长短期图像描述等视觉语言任务上进行了微调。提供 3B、10B、28B 三种参数规模及 224x224、448x448 两种分辨率,支持通过 Transformers 框架进行推理和微调,并开放了 10B 模型的在线 Demo。

    推荐理由:Google 发布 PaliGemma 2 Mix 系列微调模型,提供开箱即用的视觉语言任务能力,便于快速评估预训练模型在下游任务上的表现。

2月18日周二
  1. OpenAI News70

    OpenAI 发布 SWE-Lancer 基准

    OpenAI 发布 SWE-Lancer 基准,旨在评估前沿大语言模型能否通过完成真实的自由职业软件工程任务赚取 100 万美元。

    推荐理由:OpenAI 发布 SWE-Lancer 基准,通过真实自由职业任务评估前沿模型在软件工程中的实际变现能力。

  2. Hugging Face Blog36

    Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三个无服务器推理提供商

    Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三个无服务器推理提供商,支持 DeepSeek-R1 和 Flux.1 等模型。用户可在设置中配置 API Key 或选择由 HF 路由的请求,并通过 Python 和 JS SDK 无缝集成。PRO 用户每月可获得 2 美元推理额度,免费用户享有少量免费配额。

2月17日周一
  1. Mistral AI70

    Mistral Saba 发布,首款面向中东与南亚的区域语言模型

    Mistral AI 发布 Mistral Saba,这是一款 24B 参数的区域语言模型,针对中东和南亚语言(如阿拉伯语、泰米尔语)进行了优化。该模型在区域语言任务上表现优于大 5 倍的通用模型,支持 API 调用及单 GPU 本地部署,速度超过 150 tokens/秒。

    推荐理由:原文给出了24B参数模型在阿拉伯语等区域语言上的性能优势及本地部署能力,读者可据此评估区域化定制方案。

2月14日周五