Mistral 发布内容审核 API
Mistral AI 发布内容审核 API,该 API 基于 Le Chat 内部服务,支持原始文本与对话上下文两种端点。模型为原生多语言 LLM 分类器,涵盖 9 类政策定义,可处理模型生成危害如无资质建议与 PII 泄露。
推荐理由:Mistral 官方发布内容审核 API,提供多语言支持与对话上下文分类能力,开发者可据此构建定制化的应用安全护栏。
Mistral AI 发布内容审核 API,该 API 基于 Le Chat 内部服务,支持原始文本与对话上下文两种端点。模型为原生多语言 LLM 分类器,涵盖 9 类政策定义,可处理模型生成危害如无资质建议与 PII 泄露。
推荐理由:Mistral 官方发布内容审核 API,提供多语言支持与对话上下文分类能力,开发者可据此构建定制化的应用安全护栏。
PyCharm Professional 推出 Hugging Face 集成,支持在 IDE 内直接插入模型代码并查看 Model Card。该功能允许开发者快速调用如 microsoft/Phi-3.5-vision-instruct 等多模态模型,并管理本地模型缓存。
Argilla 2.4 发布,支持无需代码即可在 Hugging Face Hub 上构建微调与评估数据集。用户可通过 UI 直接导入公开 Hub 数据集,自动建议初始配置并收集人类反馈。该功能旨在降低数据标注门槛, democratize 高质量数据集的创建。
OpenAI 推出 ChatGPT 搜索功能,旨在提供带有相关网页来源链接的快速、实时答案。
推荐理由:ChatGPT 新增搜索功能,提供带有来源链接的快速实时回答,可据此评估其对现有搜索场景的替代潜力。
Promega 自上而下采用 ChatGPT,加速了制造、销售和营销流程。
OpenAI 发布 SimpleQA,这是一个用于衡量语言模型回答简短事实性问题能力的基准测试。该基准专注于评估模型在事实准确性方面的表现。
Decagon 与 OpenAI 合作交付高性能、全自动的规模化客户支持方案。该方案实现了客服流程的完全自动化,旨在满足大规模业务场景下的高性能需求。
Intel Labs 与 Hugging Face 联合提出 Universal Assisted Generation (UAG),通过双向 tokenizer 翻译实现跨模型家族的辅助生成,无需共享词表即可加速推理。该方法已集成至 Transformers 4.46.0,基准测试显示在 CodeLlama、Mixtral 等模型上可获得 1.5x-1.9x 的加速效果。
推荐理由:原文给出了跨模型加速的具体实现逻辑与代码,读者可据此在缺乏同族小模型时实现推理提速。
Digital Green 在 Hugging Face 专家支持下,基于 GARDIAN 知识库开发 Farmer.chat 农业问答机器人。系统采用 RAG 架构,由 GPT-4o 驱动规划智能体,通过向量数据库检索并生成回答。团队引入 LLM-as-a-Judge 技术,对模型输出的准确性、简洁性等指标进行自动化评估,以解决缺乏确定性评测标准的问题。
Cohere For AI 发布 Aya Expanse 系列多语言大语言模型,包含 8B 和 32B 参数版本,并在 Hugging Face 开源权重。
推荐理由:Aya Expanse 通过数据套利与模型融合等创新训练策略,在多项多语言评测中超越 Llama 3.1 等主流模型,为多语言大模型训练提供了新的技术路径。
OpenAI 发布研究,展示了简化、稳定并扩展连续时间一致性模型的方法,在仅使用两步采样的情况下实现了与领先扩散模型相当的样本质量。
推荐理由:研究展示了连续时间一致性模型在两步采样下达到主流扩散模型画质,为高效图像生成提供新路径。
Google DeepMind 与 Hugging Face 联合在 Transformers v4.46.0 中发布 SynthID Text,提供用于在 AI 生成文本中嵌入不可见水印的 logits processor 及检测分类器。该工具通过伪随机函数增强生成过程,支持配置密钥和 ngram 长度,并附带端到端的检测器训练示例。
推荐理由:官方提供了可直接复用的水印生成与检测代码,帮助开发者在生成文本中嵌入可验证的AI标识。
OpenAI 与 Lenfest Institute 推出 AI Collaborative 和 Fellowship program 合作项目。
Hugging Face 发布 Transformers.js v3,引入 WebGPU 支持,推理速度最高提升 100 倍。新增 120 种模型架构,支持 Node.js、Deno 和 Bun 环境,并提供 25 个新示例项目。
推荐理由:引入WebGPU加速与多端运行时支持,为前端和边缘端部署提供可迁移的高性能推理方案。
Hugging Face 宣布与 Protect AI 合作,将 Guardian 安全扫描工具集成至 Hub 扫描套件。所有公开模型仓库在上传文件时将自动接受 Guardian 扫描,以检测 pickle 等序列化格式中的任意代码执行漏洞。
Hugging Face Diffusers 正式支持 Stable Diffusion 3.5 Large,提供 8B 参数模型及少步推理的 Turbo 版本。文章介绍了 QK 归一化与双注意力层等架构变化,并给出了量化推理与 LoRA 微调的实操代码。
推荐理由:文章详细说明了SD3.5 Large的架构变化及Diffusers使用方式,并提供了量化推理与微调的实操指南。
Keras 已原生支持加载 Llama 3.2 模型,用户可直接使用 safetensors 格式权重进行生成、训练和微调。文章演示了通过 keras-hub 调用模型,利用 JAX 后端实现多 GPU/TPU 并行推理,并展示了在 TPU 上微调 Llama 3.1 8B 模型的完整流程。
Hugging Face 修复了 Transformers Trainer 在梯度累积时损失计算不匹配的问题,确保数学等价于全批量训练。同时暴露 API 允许用户传入自定义损失函数,并将在后续版本中全面支持。
推荐理由:修复了梯度累积下损失计算偏差,并开放自定义损失函数API,帮助开发者规避训练误差。
OpenAI 分析了 ChatGPT 如何根据用户姓名做出不同回应。研究利用 AI 研究助手保护隐私,旨在评估模型在对待不同姓名用户时的公平性表现。
OpenAI 推出 MLE-bench,用于评估 AI 智能体在机器学习工程任务中的表现。该基准旨在衡量智能体执行相关工程工作的能力。
Gradio 5 发布,经 Trail of Bits 独立审计修复多项安全漏洞,默认保障机器学习应用安全。修复涵盖本地运行、Hugging Face Spaces 部署、内置分享链接及 CI 供应链等场景,包括 CORS 配置错误、SSRF、任意文件上传、远程代码执行及 GitHub Actions 风险。所有修复已验证并包含在 Gradio 5.0 版本中。
Hugging Face 验证 AMD 5th Gen EPYC Turin CPU 在 LLM 推理中实现 2 倍加速。通过 ZenDNN PyTorch 插件 zentorch 优化 torch.compile,AMD Turin 在 Meta LLaMA 3.1 8B 的摘要、聊天等五种场景下,吞吐量较 AMD Genoa 提升约 2 倍。
Hugging Face博客介绍利用Dask和Coiled将数据处理规模从100行扩展至2.11亿行的方法。通过FineWeb-Edu分类器在云端多GPU上并行运行文本分类,实现了TB级数据集的高效清洗与结构化。
Hugging Face 发布 Gradio 5 稳定版,引入服务端渲染(SSR)实现近乎即时的浏览器加载,并支持基于 WebSockets 和 WebRTC 的低延迟流式传输。新版本更新了组件现代设计,内置 AI Playground 辅助生成应用,并增强了 Web 安全性。
推荐理由:Gradio 5 引入服务端渲染与低延迟流式传输,显著改善 ML 应用性能与实时交互体验。
OpenAI 与 Hearst Content 达成合作,将 Hearst 旗下标志性品牌的精选生活方式和本地新闻内容引入 OpenAI 的产品中。
Hugging Face 在 Transformers 4.45.0 中将动态推测解码设为默认操作模式,该方法通过动态调整草稿模型生成的 token 数量,相比静态或启发式方法最高实现 2.7 倍加速。用户无需修改代码即可直接受益,同时支持通过配置参数切换至启发式或静态模式。
推荐理由:动态推测解码已作为默认模式集成至 Transformers 4.45.0,无需修改代码即可实现最高 2.7 倍的推理加速。
Hugging Face 发布 Open FinLLM Leaderboard,填补金融领域大语言模型评估空白。该榜单涵盖信息提取、情感分析、信用风险评分等七大类别,采用零样本评估方法,通过准确率、F1 分数等指标衡量模型在真实金融场景中的表现。
OpenAI 推出 Canvas 功能,旨在为 ChatGPT 用户提供更新的写作与编码方式。
2024年中国AI企业加速海外扩张,华为、腾讯、阿里等巨头聚焦中东、东南亚及非洲的云计算与AI基础设施,字节跳动则深耕西方B2C市场。面对国内238个大语言模型引发的激烈价格战与盈利压力,MiniMax、01.AI等初创公司转向海外C端应用探索,Talkie和PopAI等产品已实现盈利。
OpenAI 宣布获得新融资,旨在扩大人工智能的益处。此举标志着公司在实现通用人工智能造福全人类使命方面取得进展。
OpenAI 宣布推出 Realtime API,允许开发者在应用中构建快速的语音到语音交互体验。
推荐理由:原文宣布推出实时语音 API,开发者可据此构建低延迟的语音交互应用。
OpenAI 宣布开发者现在可以使用图像和文本对 GPT-4o 进行微调,以增强模型的视觉能力。
推荐理由:GPT-4o 微调 API 新增图像输入支持,开发者可利用图文数据优化模型视觉能力。
OpenAI 在 API 中推出提示词缓存功能,为模型近期已看到的输入提供自动折扣。
OpenAI 在 API 中提供模型蒸馏功能,允许用户使用大型前沿模型的输出来微调更具成本效益的模型。该功能完全在 OpenAI 平台上运行,旨在帮助用户利用大模型的生成能力优化自身模型性能。
Altera 利用 GPT-4o 构建了一种新型的人类协作领域。该方案通过整合 GPT-4o 模型能力,探索智能体与人类协同工作的新模式,旨在优化人机交互流程并提升协作效率。
OpenAI 封禁了疑似属于 SweetSpecter 账户,该组织被追踪为中国关联的网络活动方。该组织利用 AI 研究漏洞、编写代码并支持鱼叉式网络钓鱼活动。
OpenAI 封禁了伊朗起源的 STORM-2035 账户,这些账户利用 AI 生成针对美国和英国选举的内容并跨平台发布。
OpenAI 封禁了疑似属于伊朗关联黑客组织 CyberAv3ngers 的账号。该组织利用 AI 研究工业控制系统、默认凭据及潜在目标。
BenCzechMark 是首个全面评估大语言模型捷克语能力的评测基准,涵盖 50 项任务和 9 个类别。该基准包含 90% 的原生非翻译内容,提供准确率、精确匹配、AUROC 和困惑度等指标。目前排行榜已收录 25 多个不同规模的开源模型。
OpenAI 封禁了利用 AI 起草针对越南公众人物和平台进行虐待性举报的账户。该行动旨在遏制滥用举报机制的行为,维护平台秩序。