ChatGPT 更新数据分析功能,支持云端文件直传与图表交互
ChatGPT 更新数据分析功能,支持直接添加 Google Drive 和 Microsoft OneDrive 文件,并增强与表格和图表的交互能力。
推荐理由:ChatGPT 新增云端文件直传与图表交互能力,扩展了多模态处理范围。
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
ChatGPT 更新数据分析功能,支持直接添加 Google Drive 和 Microsoft OneDrive 文件,并增强与表格和图表的交互能力。
推荐理由:ChatGPT 新增云端文件直传与图表交互能力,扩展了多模态处理范围。
Hugging Face 在 Transformers 库中集成 KV Cache 量化功能,支持 int2 至 int4 精度,可显著降低长上下文生成的显存占用。实验显示 int4 精度在保持模型质量的同时,相比 fp16 可实现约 2.5 倍的显存节省,在 80GB A100 上支持最高 128k tokens 上下文。
推荐理由:官方在 Transformers 中集成 KV Cache 量化功能,提供 int2 至 int4 精度选项,显著降低长文本生成的显存占用。
Hugging Face 与 LangChain 联合发布 langchain-huggingface 官方包,解决此前社区维护导致的更新滞后问题。
推荐理由:官方联合维护解决社区维护滞后问题,提供本地与云端两种接入方式,便于开发者快速集成最新模型。
Google 在 Hugging Face 发布了开源视觉语言模型 PaliGemma,该模型结合 SigLIP 图像编码器和 Gemma-2B 文本解码器,提供 224x224、448x448 和 896x896 三种分辨率。
推荐理由:Google 开源了基于 SigLIP 和 Gemma 的多分辨率视觉语言模型,提供了详细的微调指南和推理代码。
Hugging Face 将 Transformers Agents 升级为独立库 smolagents,引入支持基于过往观察进行迭代的 ReactAgent 新架构。使用 Llama-3-70B-Instruct 驱动的多模态 Agent 在 GAIA 基准测试中排名第四,超越了多个基于 GPT-4 的 Agent。
推荐理由:Hugging Face 发布独立 Agent 库,提供可迭代的新架构,开源模型在 GAIA 基准上表现超越 GPT-4。
Hugging Face 发布 StarCoder2-15B-Instruct-v0.1,这是首个采用完全透明且许可自由的自对齐管道训练的代码大语言模型。该模型仅使用 StarCoder2-15B 自身生成的指令-响应对进行微调,无需人工标注或闭源模型蒸馏数据。
推荐理由:模型采用完全自生成的指令微调数据,在编码基准上超越部分闭源模型,提供了可复用的自对齐方法。
OpenAI 宣布推出 ChatGPT 和 Whisper API,为开发者提供直接调用大模型和语音识别能力的入口。
推荐理由:OpenAI 官方宣布推出 ChatGPT 和 Whisper API,为开发者提供直接调用大模型和语音识别能力的入口。
Mistral AI 发布 Mixtral 8x22B 开源模型,采用稀疏 MoE 架构,141B 参数中仅激活 39B,支持 64K 上下文窗口。该模型在数学和编码任务上表现优异,指令微调版在 GSM8K 上得分 90.8%,以 Apache 2.0 协议开源。
推荐理由:该模型以141B参数实现39B活跃参数推理,在数学和编码基准上表现突出,为开源生态提供了高性价比的基座选择。
Hugging Face 发布 Idefics2,一款基于 Mistral-7B 和 SigLIP 的 8B 参数开源多模态模型,采用 Apache 2.0 许可证。
推荐理由:开源8B多模态模型在多项基准上超越更大参数模型,提供完整权重与微调数据集,降低多模态应用门槛。
Google 发布 CodeGemma 代码大模型,包含 2B 和 7B 基础模型及 7B 指令微调模型,在 HumanEval 等基准上表现优异。Hugging Face 提供 Transformers 集成、4-bit 量化及 Google Cloud 部署支持。
推荐理由:提供了2B和7B模型及详细评测,给出了HF生态集成与部署方案,便于开发者评估与落地。
Hugging Face 联合 Lighthouz AI 推出 Chatbot Guardrails Arena,这是一个针对 AI 聊天机器人数据隐私的对抗性压力测试平台。该平台包含 12 款结合 RLHF 及 NeMo Guardrails、LlamaGuard 等防护措施的模型,用户通过盲测尝试诱导模型泄露虚构银行的敏感信息,投票结果将基于 Elo 评级系统生成公开的隐私安全排行榜。
推荐理由:Hugging Face联合推出隐私对抗测试平台,通过盲测对比12款模型防泄露能力,提供可迁移的安全评估基准。
Hugging Face 发布 Cosmopedia,这是目前最大的开源合成数据集,包含250亿token和3000万个文件,由 Mixtral-8x7B-Instruct-v0.1 生成。Hugging Face 开源了端到端生成代码、数据集以及基于此训练的 1B 模型 cosmo-1b,详细披露了通过提示词工程和 Web 数据聚类构建大规模预训练数据的完整技术栈。
推荐理由:开源了250亿token合成数据及生成代码,为复现Phi模型提供了可迁移的预训练数据构建方案。
Hugging Face 发布 Optimum-Quanto,一个面向 PyTorch 的量化后端,支持 int2/int4/int8/float8 权重与激活量化,无缝集成 transformers 库,支持 CPU/GPU/MPS 设备与 torch.compile。
推荐理由:提供了从动态量化到静态冻结的完整工作流,并原生支持 transformers 集成,便于快速部署。
Hugging Face 发布 WebSight-v0.2 数据集,包含 200 万对真实截图与 HTML 代码,并开源了基于该数据集微调的 Sightseer 模型,可将网页截图转换为包含图片引用的功能 HTML 代码。
推荐理由:Hugging Face 开源了包含 200 万对截图与 HTML 代码的 WebSight 数据集及微调模型,为视觉语言模型生成前端代码提供了高质量数据基础。
Hugging Face 发布 TTS Arena,这是一个基于社区投票的文本转语音(TTS)模型排行榜。该工具允许用户提交文本并对比不同模型的合成效果,通过类似 Elo 的算法对 ElevenLabs、MetaVoice、OpenVoice 等模型进行排名。
推荐理由:Hugging Face 推出基于社区投票的 TTS 模型排行榜,为开发者提供直观的比较工具。
Mistral AI 发布首款对话助手 Le Chat,底层支持 Mistral Large、Small 及原型模型 Mistral Next,提供可调节的系统级内容审核机制。同时推出支持私有化部署和细粒度审核的 Le Chat Enterprise 版本,目前面向公众开放 Beta 内测。
推荐理由:官方发布首款对话助手并开放内测,提供企业私有化部署方案,可据此评估其多模型调度与商业落地能力。
Hugging Face 发布 Google Gemma 开源大模型集成指南,提供 2B 和 7B 参数版本。支持 Transformers 和 JAX 权重,兼容 Google Cloud 和 Inference Endpoints 部署,并给出单卡微调示例。
推荐理由:Hugging Face 提供了 Gemma 的完整集成与部署指南,帮助开发者快速上手这款开源模型。
🤗 PEFT 新增多种 LoRA 适配器合并方法,包括 cat、linear、svd、TIES 和 DARE 等算法。开发者可使用 add_weighted_adapter() 在推理时动态合并适配器,实现能力组合与优化。
推荐理由:提供了多种 LoRA 合并算法与代码示例,帮助开发者在有限资源下组合模型能力。
OpenAI 正在测试 ChatGPT 的记忆能力,使其能记住用户讨论过的内容以提供更有用的后续对话,并强调用户完全掌控该功能。
推荐理由:ChatGPT 测试记忆功能并强调用户控制权,提供了解决对话连贯性的新方案。
Hugging Face 在 TGI 1.4.0 版本中引入 Messages API,提供与 OpenAI Chat Completion API 兼容的接口。该功能支持通过 OpenAI 客户端库、LangChain 和 LlamaIndex 直接调用部署在 Inference Endpoints 上的开源模型,简化了从 OpenAI 到开源 LLM 的迁移流程。
推荐理由:提供与 OpenAI 兼容的接口,帮助开发者低成本将应用迁移至 Hugging Face 开源模型。