使用Arize Phoenix追踪和评估smolagents智能体
Hugging Face发布教程,介绍如何使用Arize Phoenix结合OpenTelemetry追踪smolagents智能体的内部执行流程,并利用GPT-4o作为裁判对DuckDuckGo搜索工具的相关性进行自动化评估。
Hugging Face发布教程,介绍如何使用Arize Phoenix结合OpenTelemetry追踪smolagents智能体的内部执行流程,并利用GPT-4o作为裁判对DuckDuckGo搜索工具的相关性进行自动化评估。
Mercari 利用 GPT-4o mini 和 GPT-4 优化商品列表并提升销量。平台通过 AI Listing Support 和 Mercari AI Assistant 等功能简化销售流程,从而改善在线市场体验。
OpenAI 发布 GPT-4.5 研究预览版,定位为目前最大且知识最丰富的模型。
推荐理由:OpenAI 发布 GPT-4.5 研究预览版,定位为目前最大且知识最丰富的模型,提供前沿能力体验。
Endex 利用 OpenAI 的推理模型 o1 和 o3-mini 构建自主金融分析系统。该平台旨在重塑金融分析的未来,通过整合前沿的大语言模型能力,实现自动化且智能化的数据处理与分析流程。
Hugging Face 与印度科学研究所(IISc)合作推广 Vaani 开源多模态数据集,该数据集涵盖 54 种语言及 150,000 小时语音数据。目前开源的转录子集包含 790 小时音频,支持语音识别、语言建模及多模态大语言模型微调。
OpenAI 发布 Deep research 系统卡片,概述发布前的安全工作,包括外部红队测试、根据准备框架进行的尖端风险评估,以及针对关键风险领域构建的缓解措施。
Hugging Face 发布 FastRTC,一个专为 Python 设计的实时音视频通信库。它内置语音检测、自动 UI 及电话接入功能,支持快速构建实时 AI 应用。
推荐理由:提供内置语音检测与自动 UI,降低 Python 实时音视频应用开发门槛。
Hugging Face 推出远程 VAE 解码功能,将高显存消耗的解码过程委托给云端端点,降低本地显存占用并支持并发队列。该功能已为 Stable Diffusion v1、SDXL、Flux 和 HunyuanVideo 提供专用端点,并开源了相关代码。
推荐理由:Hugging Face 推出远程 VAE 解码功能,通过云端端点降低本地显存占用并提升并发能力。
Hugging Face 发布博文解读 Google 开源的多模态视觉语言编码器 SigLIP 2。该模型在 SigLIP 基础上引入解码器、全局-局部损失和掩码预测等训练目标,新增动态分辨率(naflex)变体及 1B 参数巨型模型,在零样本分类和图像文本检索等核心能力上全面超越前代。
推荐理由:原文详细拆解了SigLIP 2引入的解码器、自蒸馏等训练目标及动态分辨率特性,为开发者优化多模态模型提供了具体技术参考。
Uber 通过引入 AI 技术优化其按需服务体验。这一举措旨在提升用户满意度与服务效率,体现了公司在人工智能领域的持续投入。
Hugging Face 发布 SmolVLM2 系列视频理解模型,包含 256M、500M 和 2.2B 三种参数规模。2.2B 模型在 Video-MME 基准上超越所有现有 2B 模型,500M 和 256M 模型在极低内存消耗下实现同等视频理解能力,且原生支持 Transformers 和 MLX 框架。
推荐理由:Hugging Face 开源了支持视频理解的 SmolVLM2 系列模型,提供 256M 至 2.2B 三种尺寸,兼顾端侧部署与前沿性能。
Google 发布 PaliGemma 2 Mix 系列视觉语言模型,该系列在 OCR、长短期图像描述等视觉语言任务上进行了微调。提供 3B、10B、28B 三种参数规模及 224x224、448x448 两种分辨率,支持通过 Transformers 框架进行推理和微调,并开放了 10B 模型的在线 Demo。
推荐理由:Google 发布 PaliGemma 2 Mix 系列微调模型,提供开箱即用的视觉语言任务能力,便于快速评估预训练模型在下游任务上的表现。
OpenAI 发布 SWE-Lancer 基准,旨在评估前沿大语言模型能否通过完成真实的自由职业软件工程任务赚取 100 万美元。
推荐理由:OpenAI 发布 SWE-Lancer 基准,通过真实自由职业任务评估前沿模型在软件工程中的实际变现能力。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三个无服务器推理提供商,支持 DeepSeek-R1 和 Flux.1 等模型。用户可在设置中配置 API Key 或选择由 HF 路由的请求,并通过 Python 和 JS SDK 无缝集成。PRO 用户每月可获得 2 美元推理额度,免费用户享有少量免费配额。
Mistral AI 发布 Mistral Saba,这是一款 24B 参数的区域语言模型,针对中东和南亚语言(如阿拉伯语、泰米尔语)进行了优化。该模型在区域语言任务上表现优于大 5 倍的通用模型,支持 API 调用及单 GPU 本地部署,速度超过 150 tokens/秒。
推荐理由:原文给出了24B参数模型在阿拉伯语等区域语言上的性能优势及本地部署能力,读者可据此评估区域化定制方案。
OpenAI 与卫报媒体集团宣布建立内容合作伙伴关系,旨在将卫报的新闻内容整合至 ChatGPT 中。此举标志着 OpenAI 在内容生态合作上的进一步拓展,用户有望在 ChatGPT 中获取更丰富的新闻信息。
Fireworks.ai 正式成为 Hugging Face Hub 支持的推理提供商,用户可直接在模型页面及 HF 生态库中运行无服务器推理。支持 DeepSeek-R1、Llama-3.2-90B-Vision-Instruct 等模型,通过 Python 或 JS SDK 设置 provider 参数即可调用。
Hugging Face 引入 Math-Verify 解析器重测 Open LLM Leaderboard 全部 3,751 个模型,修正了旧版在格式提取、符号转换和数值比较上的缺陷。重测后模型平均得分提升 4.66 分,Qwen 和 DeepSeek 等模型分数大幅上涨,Nvidia AceMath 登顶 MATH-Hard 榜单。
推荐理由:Hugging Face 引入 Math-Verify 重测全量模型,修正了旧版解析缺陷,导致榜单排名大幅洗牌。
Fanatics Betting and Gaming 首席财务官 Andrea Ellis 探讨了公司如何利用 AI 技术聚焦宏观战略。该对话深入分析了人工智能在博彩与游戏业务中的应用,旨在通过技术赋能提升整体业务视野与决策效率。
Wayfair 首席技术官 Fiona Tan 探讨了人工智能如何重塑零售业的未来。该公司正利用 AI 技术优化零售体验,推动行业向智能化方向演进。
Rogo 利用 OpenAI o1 扩展 AI 驱动的金融研究。该方案通过集成 OpenAI o1 模型,旨在提升金融分析领域的自动化与研究效率。
Hugging Face 发布文章,通过实测分析10亿级文本分类、嵌入及视觉嵌入推理的成本与延迟。使用Infinity服务器和k6工具,在NVIDIA L4等硬件上寻找最优Batch Size与并发数。结果显示文本分类10亿次成本约253美元,嵌入约409美元,而视觉嵌入因模型复杂和图像Token多,成本高达44496美元。
Hugging Face 发布用于构建视频生成数据集的开源工具与脚本,提供包含 yt-dlp 下载、多模型过滤(水印、美学、NSFW、运动)及 Florence-2 标注的三阶段流水线,并分享了 finetrainers/crush-smol-v0 等微调案例。
推荐理由:提供从下载、清洗到标注的完整视频数据集构建流程,帮助开发者高效准备视频生成模型训练数据。
Hugging Face 开源 xet-core 和 hf_xet,通过内容定义分块与块聚合技术加速 Hub 上的文件传输。该技术将分块聚合成最大 64MB 的块,显著减少网络请求和存储开销,实测上传速度提升近 2 倍。
推荐理由:通过引入块聚合机制优化上传下载速度,为处理大型模型仓库提供了可复用的工程实践。
Hugging Face 发布 OpenR1-Math-220k 数据集,包含 22 万条高质量数学推理轨迹,用于复现 DeepSeek R1 的推理能力。该数据集基于 NuminaMath 1.5,利用 512 张 H100 本地生成,并通过 Math Verify 和 Llama3.3-70B 进行自动过滤。
推荐理由:Hugging Face 开源了 22 万条数学推理数据集及生成代码,为复现 DeepSeek R1 推理能力提供了可复用的数据与工程方案。
OpenAI 与 Schibsted Media Group 宣布达成内容合作伙伴关系,将《卫报》的新闻及档案内容引入 ChatGPT。此举旨在丰富 ChatGPT 的信息来源,为用户提供更权威的新闻资讯。
Hugging Face 联合 2A2I 和 TII 发布 Open Arabic LLM Leaderboard 2。首版 OALL 上线不到 7 个月吸引超 46,000 访客,收录超 700 个模型。新版旨在解决资源限制与结果验证问题,提供更统一、透明的基准测试平台。
OpenAI 在超级碗期间投放了首款电视广告,旨在激发公众对人工智能的好奇心。该广告强调 AI 能像过往工具一样,为用户开辟新可能性、提升生活满足感并增强生产力。
Mistral 发布全新 le Chat AI 助手,支持 iOS 和 Android 移动端,提供 Flash Answers、代码解释器及基于 Flux Ultra 的图像生成功能。同时推出 Pro、Team 及企业版私有部署,Pro 版月费 14.99 美元。
推荐理由:Mistral 推出全功能 le Chat 并上线移动端,提供 Flash Answers 与代码解释器,覆盖多场景工作流。
OpenAI 在欧洲推出数据驻留功能。该功能建立在 OpenAI 支持全球客户的企业级数据隐私、安全和合规计划基础之上。
OpenAI 与加州州立大学(CSU)系统合作,将 ChatGPT 部署至 50 万名学生和教职员工。这是迄今为止最大规模的 ChatGPT 部署,旨在扩大教育领域的人工智能应用,并助力美国构建具备 AI 能力的劳动力队伍。
Hugging Face 与 Adyen 联合发布 DABStep 基准,包含 450 多个基于真实金融支付业务提取的多步数据分析任务。评测显示,即使是 o3-mini 等最强推理模型,准确率也仅为 16%,暴露出当前 AI 智能体在复杂数据推理上的显著不足。
推荐理由:基于真实业务数据构建,揭示了当前最强推理模型在复杂多步数据分析任务中准确率不足20%的显著差距。
ChatGPT 可用于为美甲设计寻找灵感。用户通过该模型获取创意参考,辅助完成美甲艺术创作。
Hugging Face 开源了 smolagents 框架以复现 OpenAI Deep Research 的搜索智能体。该框架采用 CodeAgent 架构,在 GAIA 验证集上达到 55.15% 的成绩,优于此前开源方案。
推荐理由:Hugging Face 开源了复现 OpenAI Deep Research 的 smolagents 框架,展示了 CodeAgent 在 GAIA 基准上的性能提升。
ChatGPT 可用于构建个性化的数学辅导系统。该方案通过定制提示词和交互逻辑,实现针对用户学习进度的针对性指导。这种应用方式展示了大语言模型在教育领域的灵活性与实用性。
ChatGPT 被用于指导捕获大比目鱼。
Hugging Face 官方宣布将 Physical Intelligence 开发的 π0 和 π0-FAST 视觉-语言-动作(VLA)模型接入 LeRobot 仓库。π0 基于流匹配实现 50Hz 实时动作生成,π0-FAST 引入 FAST 频域动作序列分词技术,训练速度提升 5 倍。
推荐理由:官方将π0和π0-FAST模型接入LeRobot,提供了从推理到微调的完整工程路径。
OpenAI 推出 Deep Research,这是一个利用推理能力综合大量在线信息并完成多步研究任务的智能体。该功能今日向 Pro 用户开放,Plus 和 Team 用户随后可用。
推荐理由:OpenAI 推出基于推理的 Agent 处理多步研究任务,明确了 Pro 及 Plus 用户的开放节奏。
OpenAI Deep Research 帮助贝恩公司理解复杂的行业趋势。该工具通过深度研究功能,协助企业分析并掌握复杂的市场动态与行业走向。
Hugging Face 发布 Open-R1 项目进展,报告了复现 DeepSeek R1 训练管线与合成数据的最新成果。团队在 MATH-500 基准上验证了复现结果,并分享了利用 TRL 库集成 GRPO 算法及通过 vLLM 优化长文本推理吞吐量的工程经验。
推荐理由:Hugging Face 团队公开了复现 DeepSeek R1 的训练进展与合成数据生成方案,为社区提供了可验证的参考路径。