Mistral le Chat 更新搜索、Canvas 与 Agent 功能
Mistral AI 宣布 le Chat 新增网络搜索、Canvas 协作界面、文档图像理解、图像生成及 Agent 功能。这些新功能目前作为免费 Beta 版提供,旨在整合模型与输出,提供一站式 AI 生产力工具。
推荐理由:le Chat 新增搜索、Canvas 和 Agent 功能,且目前免费开放,为工作流整合提供了新选择。
Mistral AI 宣布 le Chat 新增网络搜索、Canvas 协作界面、文档图像理解、图像生成及 Agent 功能。这些新功能目前作为免费 Beta 版提供,旨在整合模型与输出,提供一站式 AI 生产力工具。
推荐理由:le Chat 新增搜索、Canvas 和 Agent 功能,且目前免费开放,为工作流整合提供了新选择。
Mistral 发布 Pixtral Large,这是一款 123B 参数的多模态解码器模型,在 MathVista、DocVQA 等基准上超越 GPT-4o 和 Gemini-1.5 Pro,支持 128K 上下文窗口。同时 Mistral Large 24.11 版本同步更新,提升了长上下文理解与函数调用能力,即将在 Google Cloud 和 Microsoft Azure 上线。
推荐理由:Pixtral Large 在多项多模态基准上超越 GPT-4o 等闭源模型,且提供 128K 上下文窗口,适合文档与图表理解场景。
Hugging Face Hub 提供海量存储与流式读取功能,支持 TB 级数据集托管。平台内置 Datasets Viewer 与 SQL Console,支持全文搜索、排序及 DuckDB 语法查询。数据集可无缝对接 Pandas、Polars 等主流库,并提供公开、私有及 Gated 访问控制。
Mistral 在 La Plateforme 推出批量 API,处理高体积请求成本比同步 API 降低 50%。该功能适用于客户反馈分析、文档批量摘要及向量化等场景,单工作区限制 100 万并发请求。
Mistral AI 发布内容审核 API,该 API 基于 Le Chat 内部服务,支持原始文本与对话上下文两种端点。模型为原生多语言 LLM 分类器,涵盖 9 类政策定义,可处理模型生成危害如无资质建议与 PII 泄露。
推荐理由:Mistral 官方发布内容审核 API,提供多语言支持与对话上下文分类能力,开发者可据此构建定制化的应用安全护栏。
PyCharm Professional 推出 Hugging Face 集成,支持在 IDE 内直接插入模型代码并查看 Model Card。该功能允许开发者快速调用如 microsoft/Phi-3.5-vision-instruct 等多模态模型,并管理本地模型缓存。
Argilla 2.4 发布,支持无需代码即可在 Hugging Face Hub 上构建微调与评估数据集。用户可通过 UI 直接导入公开 Hub 数据集,自动建议初始配置并收集人类反馈。该功能旨在降低数据标注门槛, democratize 高质量数据集的创建。
Intel Labs 与 Hugging Face 联合提出 Universal Assisted Generation (UAG),通过双向 tokenizer 翻译实现跨模型家族的辅助生成,无需共享词表即可加速推理。该方法已集成至 Transformers 4.46.0,基准测试显示在 CodeLlama、Mixtral 等模型上可获得 1.5x-1.9x 的加速效果。
推荐理由:原文给出了跨模型加速的具体实现逻辑与代码,读者可据此在缺乏同族小模型时实现推理提速。
Digital Green 在 Hugging Face 专家支持下,基于 GARDIAN 知识库开发 Farmer.chat 农业问答机器人。系统采用 RAG 架构,由 GPT-4o 驱动规划智能体,通过向量数据库检索并生成回答。团队引入 LLM-as-a-Judge 技术,对模型输出的准确性、简洁性等指标进行自动化评估,以解决缺乏确定性评测标准的问题。
Cohere For AI 发布 Aya Expanse 系列多语言大语言模型,包含 8B 和 32B 参数版本,并在 Hugging Face 开源权重。
推荐理由:Aya Expanse 通过数据套利与模型融合等创新训练策略,在多项多语言评测中超越 Llama 3.1 等主流模型,为多语言大模型训练提供了新的技术路径。
Google DeepMind 与 Hugging Face 联合在 Transformers v4.46.0 中发布 SynthID Text,提供用于在 AI 生成文本中嵌入不可见水印的 logits processor 及检测分类器。该工具通过伪随机函数增强生成过程,支持配置密钥和 ngram 长度,并附带端到端的检测器训练示例。
推荐理由:官方提供了可直接复用的水印生成与检测代码,帮助开发者在生成文本中嵌入可验证的AI标识。
Hugging Face 发布 Transformers.js v3,引入 WebGPU 支持,推理速度最高提升 100 倍。新增 120 种模型架构,支持 Node.js、Deno 和 Bun 环境,并提供 25 个新示例项目。
推荐理由:引入WebGPU加速与多端运行时支持,为前端和边缘端部署提供可迁移的高性能推理方案。
Hugging Face 宣布与 Protect AI 合作,将 Guardian 安全扫描工具集成至 Hub 扫描套件。所有公开模型仓库在上传文件时将自动接受 Guardian 扫描,以检测 pickle 等序列化格式中的任意代码执行漏洞。
Hugging Face Diffusers 正式支持 Stable Diffusion 3.5 Large,提供 8B 参数模型及少步推理的 Turbo 版本。文章介绍了 QK 归一化与双注意力层等架构变化,并给出了量化推理与 LoRA 微调的实操代码。
推荐理由:文章详细说明了SD3.5 Large的架构变化及Diffusers使用方式,并提供了量化推理与微调的实操指南。
Keras 已原生支持加载 Llama 3.2 模型,用户可直接使用 safetensors 格式权重进行生成、训练和微调。文章演示了通过 keras-hub 调用模型,利用 JAX 后端实现多 GPU/TPU 并行推理,并展示了在 TPU 上微调 Llama 3.1 8B 模型的完整流程。
Hugging Face 修复了 Transformers Trainer 在梯度累积时损失计算不匹配的问题,确保数学等价于全批量训练。同时暴露 API 允许用户传入自定义损失函数,并将在后续版本中全面支持。
推荐理由:修复了梯度累积下损失计算偏差,并开放自定义损失函数API,帮助开发者规避训练误差。
Gradio 5 发布,经 Trail of Bits 独立审计修复多项安全漏洞,默认保障机器学习应用安全。修复涵盖本地运行、Hugging Face Spaces 部署、内置分享链接及 CI 供应链等场景,包括 CORS 配置错误、SSRF、任意文件上传、远程代码执行及 GitHub Actions 风险。所有修复已验证并包含在 Gradio 5.0 版本中。
Hugging Face 验证 AMD 5th Gen EPYC Turin CPU 在 LLM 推理中实现 2 倍加速。通过 ZenDNN PyTorch 插件 zentorch 优化 torch.compile,AMD Turin 在 Meta LLaMA 3.1 8B 的摘要、聊天等五种场景下,吞吐量较 AMD Genoa 提升约 2 倍。
Hugging Face博客介绍利用Dask和Coiled将数据处理规模从100行扩展至2.11亿行的方法。通过FineWeb-Edu分类器在云端多GPU上并行运行文本分类,实现了TB级数据集的高效清洗与结构化。
Hugging Face 发布 Gradio 5 稳定版,引入服务端渲染(SSR)实现近乎即时的浏览器加载,并支持基于 WebSockets 和 WebRTC 的低延迟流式传输。新版本更新了组件现代设计,内置 AI Playground 辅助生成应用,并增强了 Web 安全性。
推荐理由:Gradio 5 引入服务端渲染与低延迟流式传输,显著改善 ML 应用性能与实时交互体验。
Hugging Face 在 Transformers 4.45.0 中将动态推测解码设为默认操作模式,该方法通过动态调整草稿模型生成的 token 数量,相比静态或启发式方法最高实现 2.7 倍加速。用户无需修改代码即可直接受益,同时支持通过配置参数切换至启发式或静态模式。
推荐理由:动态推测解码已作为默认模式集成至 Transformers 4.45.0,无需修改代码即可实现最高 2.7 倍的推理加速。
Hugging Face 发布 Open FinLLM Leaderboard,填补金融领域大语言模型评估空白。该榜单涵盖信息提取、情感分析、信用风险评分等七大类别,采用零样本评估方法,通过准确率、F1 分数等指标衡量模型在真实金融场景中的表现。
2024年中国AI企业加速海外扩张,华为、腾讯、阿里等巨头聚焦中东、东南亚及非洲的云计算与AI基础设施,字节跳动则深耕西方B2C市场。面对国内238个大语言模型引发的激烈价格战与盈利压力,MiniMax、01.AI等初创公司转向海外C端应用探索,Talkie和PopAI等产品已实现盈利。
BenCzechMark 是首个全面评估大语言模型捷克语能力的评测基准,涵盖 50 项任务和 9 个类别。该基准包含 90% 的原生非翻译内容,提供准确率、精确匹配、AUROC 和困惑度等指标。目前排行榜已收录 25 多个不同规模的开源模型。
Hugging Face 推出 Daily Papers 页面,已收录超 3,700 篇论文并拥有超 12k 订阅者。作者可一键认领论文以关联账号,用户可通过评论 @username 与作者实时互动,并在评论区输入 @librarian-bot 获取相关论文推荐。页面支持多语言评论及内置翻译,并集成 arXiv 扩展功能以快速跳转至 Hugging Face 论文页或 Spaces 演示。
Hugging Face 发布 FineVideo 数据集,包含 4.3 万个视频、3.4k 小时时长及丰富的结构化标注。文章详细披露了从 YouTube-Commons 中筛选动态内容、构建分类法,以及利用 Gemini 1.5 Pro 和 GPT4o 进行时间级语义标注的完整技术管线。
推荐理由:文章详细披露了构建4.3万小时高质量视频数据集的过滤与标注管线,为多模态模型训练提供了可复用的工程方法。
Hugging Face 发布教程,介绍如何利用 Optimum-Intel 和 OpenVINO GenAI 将 Transformers 模型部署到边缘设备。内容涵盖环境配置、模型导出为 OpenVINO IR、基于 NNCF 的 INT4 量化优化,以及通过 LLMPipeline 在 Python 和 C++ 中进行推理部署的具体代码示例。
Hugging Face 发布基于 BitNet 架构的 LLaMA3 8B 1.58bit 模型,公开了通过动态 Lambda 调度实现微调的技术细节与 Triton 自定义内核,模型在 MMLU 等基准上表现优异。
推荐理由:文章公开了将LLaMA3微调至1.58bit的量化方法与代码,为降低大模型推理成本提供了可复用的工程方案。
Mistral AI 发布 Mistral Small v24.09 模型,下调全线模型 API 价格,并推出 la Plateforme 免费层。le Chat 免费开放 Pixtral 12B 视觉能力,支持任意尺寸图片理解。
推荐理由:官方同步更新模型定价与发布新模型,提供了免费层与Apache 2.0授权,便于评估成本与部署方案。
Mistral 发布 Pixtral 12B 多模态模型,采用 400M 视觉编码器与 12B 解码器,支持 128K 长上下文及可变图像尺寸。该模型在 MMMU 推理基准上达到 52.5%,支持图表理解、文档问答及多图像处理,以 Apache 2.0 协议开源。
推荐理由:Pixtral 12B 提供原生多模态与 128K 长上下文,兼顾文本与图像能力,适合本地部署与 API 集成。
Hugging Face 推出数据集 SQL Console 功能,允许用户直接在浏览器中运行 SQL 查询、过滤和发现数据集。该功能基于 DuckDB WASM 引擎,无需后端依赖,支持导出 Parquet 格式结果,并内置了数据格式转换等实用示例。
推荐理由:基于浏览器端 DuckDB WASM 实现零依赖查询,提供数据探索与格式转换的便捷入口。
HuggingChat 发布社区工具功能,允许用户将 Hugging Face 上的公开 Space 直接转化为模型可调用的工具。该功能扩展了多模态支持,涵盖图像理解、视频生成及语音合成,并支持用户创建自定义工具或基于私有文档构建 RAG 工具。
推荐理由:HuggingChat 开放将社区 Space 转为工具的功能,支持多模态交互与自定义 RAG,丰富了现有工作流。
Hugging Face 发布 Accelerate 1.0.0 首个候选版,新增 FP8 训练、torch.compile 及多模型 DeepSpeed 支持。该版本稳定了核心 API,并提供了详细的弃用项与迁移指南。
Hugging Face 与 TruffleHog 达成合作,将 TruffleHog 的密钥扫描功能集成至平台。Hugging Face 在自动化扫描管道中引入 TruffleHog 检测密码、Token 和 API 密钥,并在发现已验证密钥时通过邮件通知用户。
Hugging Face 发布 DataCollatorWithFlattening,使 Flash Attention 2 兼容无填充指令微调,训练吞吐量最高提升 2 倍,峰值显存降低 20%,且不影响收敛质量。
推荐理由:通过新数据整理器实现无填充训练,在保持收敛质量的同时显著提升训练吞吐量和降低显存占用。
Meta Llama 3.1 405B 模型可在 Google Cloud Vertex AI 上部署,推荐使用 FP8 量化版本以适配 8 x H100 的 A3 节点。该模型具备 128K tokens 上下文窗口,支持多语言及工具使用。部署需配置 Vertex AI API 并申请 A3 节点配额。
Hugging Face 复现 Infini-Attention 失败,发现随着内存压缩次数增加,模型性能反而下降。在将 Llama 3 8B 扩展至 100 万 token 上下文的实验中,Ring Attention、YaRN 和 rope scaling 仍是目前延长预训练模型上下文长度的最佳方案。
ggml 是一个专注于 Transformer 推理的 C/C++ 开源机器学习库,具有极简、轻量且兼容性好的特点。该库核心代码少于 5 个文件,编译后二进制体积小于 1MB,支持量化张量以节省内存。本文面向开发者介绍 ggml 的基础概念、编译方法及核心 API 使用,涵盖上下文、计算图及后端接口等关键术语。
Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,使代码可跨 Mistral、Cohere、NousResearch 和 Llama 等模型复用。Transformers 库新增辅助功能,支持将 Python 函数自动转为 JSON Schema,并提供完整文档与示例。
推荐理由:Hugging Face 推出统一工具调用 API,通过 Chat Templating 屏蔽多模型差异,提供可复用的工程实现方案。
TII 发布 Falcon Mamba 7B,这是首个性能强劲的无注意力 7B 模型,基于 Mamba 架构实现线性时间序列建模。该模型在长序列生成中保持恒定吞吐量且显存不增,支持 4-bit 量化及 torch.compile 加速,并提供指令微调版本。
推荐理由:Falcon Mamba 7B 验证了纯 Mamba 架构在长序列推理上的效率优势,为 Transformer 之外的替代方案提供了可复用的工程实践。