跳到正文

全部动态

今日 3 条
今天10月9日周五
  1. Simon Willison13

    ttok 0.4 发布

    CLI 工具 ttok 发布 0.4 版本。该版本修复了 Click 警告,更新了 CI 流程,并新增 --list-models 命令以列出可用模型。工具基于 OpenAI 的 tiktoken 库构建,支持通过 uvx 运行,例如使用 cat file.txt | uvx ttok 统计文件 token 数量。

10月8日周四
  1. Hugging Face Blog85

    用ML-Intern在几天内构建6个定制AI模型

    作者利用HuggingChat中的ML-Intern功能,在两天内完成了6个定制模型的构建,总计算成本约103美元。项目涵盖领域微调、角色LoRA、提示词蒸馏等场景,展示了智能体在自动化训练与发布流程中的实际能力。

    推荐理由:作者实测了ML-Intern在微调、蒸馏等场景的落地效果,提供了可复用的提示词模板和成本参考。

  2. Microsoft Research80

    微软发布Agent Lightning v1.0轻量级智能体RL训练框架

    微软发布Agent Lightning v1.0,通过LLM代理复用部署端Agent进行强化学习训练,代码仅约3,500行。该框架原生支持Kubernetes,无需商业沙箱服务,在Qwen3.5-9B上仅用6,000个样本在SWE-bench Verified上提升14.6个百分点。

    推荐理由:框架通过LLM代理复用部署端Agent,提供轻量级RL训练方案与Kubernetes原生支持。

10月7日周三
  1. AWS Machine Learning Blog38

    超越节省工时:构建智能体自动化的商业论证框架

    AWS 提出智能体价值模型,指出传统 RPA 投资回报模型无法捕捉智能体在异常处理、决策质量和变更韧性方面的价值。该框架强调释放的工时需通过减少支出或重新部署转化为实际经济收益。例如在理赔流程中,仅释放工时并不等于省钱,必须结合错误纠正成本降低和人员重新部署产生的价值进行综合计算。

  2. AWS Machine Learning Blog63

    利用AWS Lambda持久化函数与Bedrock实现DevOps Agent调查后的自动化修复

    AWS发布教程,展示如何结合AWS DevOps Agent、Lambda持久化函数、EventBridge与Bedrock构建自动化修复工作流。该方案将Agent的调查结论转化为预验证的修复动作,通过工具白名单与人工审批门控确保安全,实现从诊断到修复的闭环。

    推荐理由:提供基于AWS Lambda持久化函数与Bedrock的自动化修复架构,将人工审批前置,降低运维MTTR。

  3. Simon Willison40

    llm-openai-decisions 0.1a0 发布

    OpenAI 发布 Jev-style Decisions API,支持 gpt-6-luna 模型进行图像和文本决策推理。该模型输入定价为每百万 token 10 美分,支持 yes/no、choices 和 scores 三种问题类型。llm-openai-decisions 0.1a0 插件已上线,可通过 llm install 命令安装使用。

  4. AWS Machine Learning Blog72

    在AgentCore和OpenClaw上构建带记忆的AI助手

    AWS发布教程,展示如何在Amazon Bedrock AgentCore和开源框架OpenClaw上构建带长期记忆的AI助手。方案通过AgentCore Memory实现上下文持久化,结合Claude Haiku 4.5和Sonnet 4.5进行任务路由,并提供CloudFormation模板一键部署。

    推荐理由:原文给出了基于AgentCore和OpenClaw构建带记忆智能体的完整架构与代码,读者可直接复用该模式。

10月6日周二
  1. AWS Machine Learning Blog28

    Amazon SageMaker HyperPod 管理与治理最佳实践

    Amazon SageMaker HyperPod 通过 SageMaker Unified Studio 提供四层控制体系,涵盖组织、项目、集群和工作负载,以解决多团队共享加速计算资源时的治理难题。文章详细阐述了如何设计身份、容量和可观测性策略,在保持基础设施团队对集群操作控制权的同时,向机器学习团队提供项目上下文中的批准计算资源。

10月5日周一
  1. AWS Machine Learning Blog75

    使用 LangChain 和 Amazon Bedrock 实现智能体检索

    Amazon Bedrock Managed Knowledge Base 新增 AgenticRetrieveStream API,通过规划循环分解多意图查询以提升召回率。文章对比了标准 Retrieve 与智能体检索在复杂问题上的表现差异,并提供了基于 LangChain 的完整实现代码与路由策略。

    推荐理由:原文对比了标准检索与智能体检索在复杂多意图场景下的召回差异,并给出了基于查询形状的路由策略。

10月2日周五
  1. GitHub Blog · AI & ML25

    GitHub 博客:AI 正在改变开发者工作,这里有三个需要加强的技能

    GitHub 博客指出 AI 正在改变开发者工作,建议开发者加强三项核心技能。首先,学会指导 AI 智能体而非仅使用它,通过定义问题和评估输出来协调多个 Agent。其次,不要盲目信任 AI 的首个答案,应利用第二个模型或自身经验进行审查。最后,利用 AI 节省的实施时间解决更宏观的问题,如理解客户需求、评估权衡并做出技术决策。

  2. Hugging Face Blog73

    ServiceNow 发布 AutoSynthData:基于失败模式生成企业智能体训练数据

    ServiceNow 发布 AutoSynthData,一种利用目标模型失败模式和更强教师模型成功轨迹自动生成企业智能体训练数据的方法。该方法通过验证任务可行性与真实性,在 EnterpriseOps Gym 的 Hybrid 和 ITSM 环境中,使 Gemma-4-26B-A4B-it 模型 Pass@1 分别提升 7.2 和 8.4 个百分点。

    推荐理由:提出利用模型失败模式自动生成企业智能体训练数据的闭环方法,并在企业环境中验证了微调效果。

10月1日周四
9月10日周四
  1. Hugging Face Blog82

    TRL v1.14 支持 LoRA 异步同步,结合 HF Jobs 实现训练推理解耦

    TRL v1.14 的 AsyncGRPOTrainer 支持仅同步 LoRA 适配器,配合 Hugging Face Jobs 和存储桶挂载,无需 NCCL 即可实现训练与推理解耦。通过 token-budget batching 和代理路由优化,500 步训练时间从 3 小时 27 分缩短至 53 分。

    推荐理由:TRL v1.14 支持 LoRA 异步同步,结合 HF Jobs 和存储桶可消除 NCCL 依赖,实现训练与推理解耦。

9月9日周三
  1. Mistral AI38

    Mistral 利用 AI 智能体将 40,000 行 Fortran 77 迁移至 C++

    Mistral 利用 AI 智能体将 40,000 行 Fortran 77 迁移至 C++,完成物理密集型储层模拟器的现代化改造。项目通过构建数值一致性测试框架验证迁移结果,并使用 Vibe CLI 和 Mistral OCR 生成文档。最终采用人类主导的 coder、tester 和 reviewer 智能体工作流,在保留代码质量的同时解决智能体卡死问题。

9月3日周四
  1. Hugging Face Blog74

    100步GRPO微调LFM2.5-350M提升结构化输出合规性

    Liquid AI 发布教程,展示使用 TRL 库和 GRPO 算法微调 LFM2.5-350M 模型。在 IFStruct 基准测试中,经过约 500 样本和 100 步训练,模型结构化输出合规率从 22.6% 提升至 29.7%,其中 JSON 通过率提升近 14 个百分点。

    推荐理由:提供在免费算力上微调小模型提升结构化输出合规性的具体方法与数据。

  2. Hugging Face Blog75

    使用TRL和OpenEnv复现语言模型水彩画训练

    本文详细记录了使用TRL和OpenEnv在Hugging Face上复现语言模型水彩画训练的全过程。作者开源了包含参考池、RL环境、评分模型及训练脚本的完整流水线,并对比了三种奖励权重组合的训练效果,指出通过构建高质量参考池可实现对模型审美风格的精准控制。

    推荐理由:提供了基于TRL和OpenEnv复现RL绘画的完整代码与基础设施搭建细节,可直接迁移用于其他审美对齐任务。

8月26日周三
  1. Hugging Face Blog88

    Sentence Transformers v6.0 多向量模型训练与微调教程

    Sentence Transformers v6.0 引入 MultiVectorEncoder 支持 ColBERT 风格检索,并提供完整的训练与微调方法。作者使用 mLateOn-unsupervised 在医疗数据上微调,14.5 小时在单张 RTX 3090 上训练出的模型在 MIRIAD 基准上 NDCG@10 达 0.9139,超越所有通用检索模型。

    推荐理由:提供了多向量模型微调的完整代码与评估数据,展示了在消费级显卡上训练出超越通用模型的方法。

8月21日周五
  1. Hugging Face Blog55

    Hugging Face 如何利用 Jobs、Buckets 和 Inference Endpoints 构建 Papers with Code 搜索

    Hugging Face 博客详解了 Papers with Code 搜索系统的架构,利用 Jobs 进行批量嵌入、Buckets 管理数据流转、Inference Endpoints 提供低延迟查询。系统采用 PostgreSQL 全文检索与 pgvector 向量检索结合的混合搜索方案,通过 RRF 算法融合结果,并支持冷启动降级与增量更新。

8月19日周三
  1. Hugging Face Blog80

    IBM研究:智能体记忆剂量需按模型能力校准

    IBM发布ALTK-Evolve研究,发现智能体记忆需按模型能力分级注入。强模型适用全量指南,弱模型适用检索,饱和模型无增益。检索策略能以极低成本提升弱模型表现,全量指南可通过提示词缓存降低开销。

    推荐理由:研究揭示了智能体记忆需按模型能力分级注入,为兼顾性能与成本的Agent部署提供了可迁移的校准方法。

8月18日周二
  1. Hugging Face Blog83

    Sentence Transformers v6.0 原生支持多向量编码与 ColBERT 检索

    Sentence Transformers 发布 v6.0 版本,原生引入 MultiVectorEncoder 以支持 ColBERT 风格的晚期交互检索。该更新统一了 PyLate、Stanford-NLP 和 colpali-engine 模型的加载接口,支持文本、视觉文档、音频和视频的多模态检索,并内置了 MaxSim 评分、Token Pooling 压缩及推理加速功能。

    推荐理由:Sentence Transformers v6.0 原生支持多向量编码,统一了 ColBERT 等模型的加载与检索接口。

  2. Hugging Face Blog70

    Dharma AI 约束感知 GPU 分配器:通过调度顺序提升利用率

    Dharma AI 发布约束感知 GPU 分配器,在相同硬件上通过优化调度顺序,将 GPU 利用率最高提升 33 个百分点,优先级加权产出最高提升 105%。该方案将实时推理视为需求曲线而非固定预留,并结合优先级与时间衰减权重进行全局规划,在 1-15 毫秒内完成决策。

    推荐理由:原文给出了约束感知分配器的设计逻辑与实测数据,读者可据此优化集群调度策略。

8月14日周五
  1. Hugging Face Blog70

    Strands Robots 结合 Storage Buckets 实现机器人数据流式闭环

    AWS Strands Robots 结合 Hugging Face Storage Buckets 实现机器人数据闭环。通过 Xet 字节级去重降低同步成本,利用流式读取避免全量下载,完成从采集、训练到部署的无缝衔接。

    推荐理由:原文给出了基于 Storage Buckets 和流式读取的机器人数据闭环实操,读者可据此优化采集训练部署流程。

7月10日周五
  1. Hugging Face Blog66

    PyTorch Profiling 第三篇:注意力机制的Profiler迹线分析

    Hugging Face 发布 PyTorch Profiling 系列第三篇,对比了朴素注意力、in-place掩码、SDPA math/efficient/flash/cuDNN 五种实现的Profiler迹线。文章解释了FlashAttention低占用率源于片上资源占用,cuDNN高CPU开销源于运行时内核生成,并指出math后端因FP32上转换和多次HBM读写导致性能最差。

    推荐理由:通过对比五种注意力实现的Profiler迹线,揭示了FlashAttention低占用率与cuDNN高CPU开销的底层原因。

7月6日周一
  1. Hugging Face Blog67

    Photoroom PRX 数据策略:从 Lance 探索到 MDS 流式训练

    Photoroom 发布 PRX 模型数据策略,采用 Lance 格式进行数据探索与特征工程,利用 Qwen3-VL-8B 对图像进行长文本重标注,最终转换为 MDS 格式进行流式训练。

    推荐理由:Photoroom 公开了 PRX 模型的数据构建全流程,提供了从数据探索、VLM 重标注到 MDS 流式训练的具体工程实践。

6月26日周五
  1. Hugging Face Blog71

    一条命令在 Hugging Face Jobs 上运行 vLLM 服务

    Hugging Face 推出 HF Jobs 功能,允许用户通过单条命令在 HF 基础设施上快速部署 vLLM 服务并开放 OpenAI 兼容接口。该服务支持按秒计费,提供 GPU 选择、SSH 调试、Gradio 交互界面及编码 Agent 后端集成,适合模型测试、评估和批量生成等实验场景。

    推荐理由:提供通过单条命令在 HF Jobs 部署 vLLM 并开放 OpenAI 兼容接口的完整流程,便于快速进行模型测试与评估。

6月23日周二
  1. Hugging Face Blog40

    在 Transformers.js 中实验拟议的跨域存储 API

    拟议的 Cross-Origin Storage API 通过密码学哈希而非 URL 标识文件,旨在解决浏览器中跨域缓存隔离导致的重复下载问题。在 Transformers.js 应用中,不同来源的 Web 应用即使请求相同的模型资源或 Wasm 运行时,也会因 Network Isolation Key 不同而无法共享缓存,造成如 177 MB 的重复存储。

  2. Hugging Face Blog80

    Hugging Face 开源每周自动化发布工作流:AI 起草与人工校验

    Hugging Face 开源了 huggingface_hub 的每周自动化发布工作流,利用 GLM-5.2 等开源模型起草发布说明,并通过确定性脚本校验 PR 完整性,人工仅需少量时间审核。该流程结合 GitHub Actions 与 PyPI 可信发布,将发布周期从 4-6 周缩短至每周一次,且成本极低。

    推荐理由:提供了一套基于开源模型与确定性校验的自动化发布工作流,可迁移至其他开源项目以大幅降低维护成本。

6月22日周一
  1. Hugging Face Blog72

    利用本地模型与 Agent 框架实现 GitHub PR 自动分类

    Hugging Face 分享了在本地硬件上使用 Gemma-4-26b-a4b 和 Qwen3.6-35b-a3b 模型,结合 Agent 框架和受限 Shell 对 GitHub PR 进行实时分类的实践。该方案通过结构化输出实现高吞吐过滤,在 330 行评估集上 Qwen 精确率达 0.831,Gemma 召回率达 0.905。

    推荐理由:文章给出了在本地硬件上利用 Agent 框架和受限 Shell 实现高吞吐 PR 分类的完整工程方案与性能数据。

6月18日周四
  1. Hugging Face Blog72

    Hugging Face PEFT基准测试:LoRA并非微调唯一最佳选择

    Hugging Face发布PEFT库基准测试,对比LoRA与OFT、Lily等数十种参数高效微调技术。测试显示在图像生成等任务中OFT在精度和显存上均优于LoRA,建议用户根据显存、精度和兼容性需求进行权衡选择。

    推荐理由:官方通过统一基准测试对比多种PEFT方法,揭示LoRA并非全能,提供可迁移的选型权衡思路。

6月17日周三
  1. Hugging Face Blog70

    AWS 发布 Strands Robots SDK,将 LeRobot 封装为 Agent 工具

    AWS 发布 Strands Robots SDK,将 LeRobot 硬件抽象、仿真和数据集封装为 Agent 工具。开发者可通过自然语言编排 Agent,实现从仿真记录、策略运行到真机部署的无缝流程,并支持多机器人编队协调。

    推荐理由:AWS 发布 Strands Robots SDK,将 LeRobot 封装为 Agent 工具,实现从仿真到真机的无缝部署。

6月11日周四
6月9日周二
  1. Hugging Face Blog82

    利用 agents.md 链式调用 Hugging Face Spaces 构建 3D 巴黎画廊

    Hugging Face 推出 agents.md 标准,使 Agent 能直接调用 Gradio Space 的 API 进行链式组合。作者通过该机制调用 ideogram-ai/ideogram4 生成图像,再经 VAST-AI/TripoSplat 重建 3D 高斯泼溅,最终自动构建并部署了 3D 巴黎地标画廊,展示了多媒体应用开发的模块化新范式。

    推荐理由:通过 agents.md 实现 Hugging Face Spaces 的标准化调用与链式组合,展示了 Agent 构建多媒体应用的低成本路径。

  2. Hugging Face Blog75

    将 GitHub CI 迁移至 Hugging Face Jobs 的教程

    Hugging Face 发布教程,指导用户通过 huggingface/jobs-actions 桥接工具,将 GitHub Actions 的 CI 任务调度到 Hugging Face Jobs 运行。该方案支持 CPU 和 GPU 硬件,实测 CPU 任务提速约 30%,并显著降低 GPU 测试成本。

    推荐理由:提供将 GitHub Actions 接入 Hugging Face Jobs 的完整方案,实现低成本 GPU 测试与更快的 CI 执行。

6月1日周一
  1. Hugging Face Blog40

    超越大语言模型:可扩展企业 AI 采用取决于智能体逻辑

    IBM 通过引入程序分析和知识图谱等智能体逻辑,显著提升了企业级 AI 智能体的性能与成本效益。在遗留代码理解场景中,Mistral Medium 250B 模型配合该逻辑实现约 30 倍更低的 Token 消耗;在测试生成方面,Devstral 24B 模型结合 Aster 库使代码覆盖率提升 20%-45%,Token 消耗降低多达 15 倍。

5月29日周五