跳到正文

#数据/训练

今日 0 条
10月8日周四
  1. Hugging Face Blog85

    用ML-Intern在几天内构建6个定制AI模型

    作者利用HuggingChat中的ML-Intern功能,在两天内完成了6个定制模型的构建,总计算成本约103美元。项目涵盖领域微调、角色LoRA、提示词蒸馏等场景,展示了智能体在自动化训练与发布流程中的实际能力。

    推荐理由:作者实测了ML-Intern在微调、蒸馏等场景的落地效果,提供了可复用的提示词模板和成本参考。

10月6日周二
10月2日周五
  1. Hugging Face Blog73

    ServiceNow 发布 AutoSynthData:基于失败模式生成企业智能体训练数据

    ServiceNow 发布 AutoSynthData,一种利用目标模型失败模式和更强教师模型成功轨迹自动生成企业智能体训练数据的方法。该方法通过验证任务可行性与真实性,在 EnterpriseOps Gym 的 Hybrid 和 ITSM 环境中,使 Gemma-4-26B-A4B-it 模型 Pass@1 分别提升 7.2 和 8.4 个百分点。

    推荐理由:提出利用模型失败模式自动生成企业智能体训练数据的闭环方法,并在企业环境中验证了微调效果。

9月22日周二
9月19日周六
9月11日周五
  1. Google Research72

    ToolGrad:基于文本梯度的高效工具调用数据集生成方法

    Google Research 提出 ToolGrad,通过文本梯度迭代构建 API 工作流,以更低成本生成高质量工具调用数据。在 BFCL 基准上,基于该方法微调的 Gemma-3-12B 模型得分 83.1,超越 Gemini-2.5-pro、Claude 4.5 Opus 和 GPT-5。

    推荐理由:提出基于文本梯度的答案优先范式,以更低成本生成高质量工具调用数据,使小模型在基准上超越主流闭源模型。

9月10日周四
9月8日周二
  1. Google DeepMind83

    Google DeepMind 发布 AlphaGenome Atlas 全基因组变异预测平台

    Google DeepMind 发布 AlphaGenome Atlas,包含人类基因组中90亿种单核苷酸变异的分子影响预测。平台提供 AVI 评分、特征归因及 DNA 序列基序,已用于发现罕见病致病突变及解析复杂性状关联。

    推荐理由:预计算了全基因组90亿种单核苷酸变异,提供AVI评分与可视化门户,加速罕见病与复杂性状研究。

8月21日周五
8月10日周一
7月6日周一
  1. Hugging Face Blog67

    Photoroom PRX 数据策略:从 Lance 探索到 MDS 流式训练

    Photoroom 发布 PRX 模型数据策略,采用 Lance 格式进行数据探索与特征工程,利用 Qwen3-VL-8B 对图像进行长文本重标注,最终转换为 MDS 格式进行流式训练。

    推荐理由:Photoroom 公开了 PRX 模型的数据构建全流程,提供了从数据探索、VLM 重标注到 MDS 流式训练的具体工程实践。

6月30日周二
6月18日周四
  1. Hugging Face Blog72

    Hugging Face PEFT基准测试:LoRA并非微调唯一最佳选择

    Hugging Face发布PEFT库基准测试,对比LoRA与OFT、Lily等数十种参数高效微调技术。测试显示在图像生成等任务中OFT在精度和显存上均优于LoRA,建议用户根据显存、精度和兼容性需求进行权衡选择。

    推荐理由:官方通过统一基准测试对比多种PEFT方法,揭示LoRA并非全能,提供可迁移的选型权衡思路。

6月11日周四
  1. Google Research42

    Google Research 提出正则化 f-散度核检验框架以审计机器学习遗忘

    Google Research 提出正则化 f-散度核检验框架,旨在解决大规模模型机器遗忘审计中传统两样本检验统计效力低且计算昂贵的问题。该框架利用 f-散度(如 KL 散度、Hockey-stick 散度)结合核正则化方法,自动选择最佳散度类型以精准定位局部数据偏移。该研究已在 AISTATS 2026 发表,理论上证明了其对假阳性的控制能力及随样本增加假阴性收敛至零的特性。

5月16日周六
  1. Google DeepMind48

    Google DeepMind 发布 Co-Scientist 助力 Calico 衰老研究

    Google DeepMind 发布 Co-Scientist,协助 Calico Life Sciences 在衰老生物学研究中生成可验证假设。该工具帮助研究人员从混杂的文献中识别出关于整合应激反应(ISR)受代谢调节的新颖假设,并优化实验设计。Calico 团队利用 Co-Scientist 筛选噪音并推进实验,最终获得具有健康与疾病意义的新发现。

  2. Google DeepMind40

    Google DeepMind 发布 Co-Scientist 加速肝病机制发现

    Google DeepMind 发布 Co-Scientist,利用 AI 辅助生物医学研究以加速疾病机制发现。该系统帮助爱丁堡大学团队在代谢功能障碍相关脂肪性肝炎(MASH)研究中,通过综合肝脏生物学与药理学证据,提出 NLRP3 炎症小子作为连接炎症与代谢的关键分子桥梁假设。该假设后经实验验证,为靶向双重疗法开发提供了新方向。

  3. Google DeepMind23

    Co-Scientist 助力 MIT 与波士顿儿童医院合作探索 ALS 疗法

    Co-Scientist 帮助 MIT 的 Ritu Ritu Raman 与波士顿儿童医院的 Ryan Flynn 跨越学科壁垒,将组织模型与 RNA 映射技术结合以探索肌萎缩侧索硬化症(ALS)疗法。该工具快速梳理了矛盾文献,协助团队提出可验证假设并评估可行性与风险。双方正利用 Co-Scientist 迭代寻找针对 ALS 的新型 RNA 机制及潜在药物。

  4. Google DeepMind72

    Google DeepMind发布Co-Scientist并验证其在肝纤维化药物发现中的应用

    Google DeepMind发布科研智能体Co-Scientist,斯坦福大学Gary Peltz团队利用其从海量文献中筛选出3种候选药物,并在活体人类肝细胞实验中证实其中2种能阻断肝纤维化并促进细胞再生,其中癌症药物伏立诺他(vorinostat)效果显著,阻断了91%的损伤反应。

    推荐理由:通过斯坦福大学独立实验验证了Co-Scientist在药物重定位中的有效性,为科研工作者提供了可参考的AI辅助发现路径。

5月2日周六
4月1日周三
  1. Google Research38

    Google Research:构建更可靠的 AI 基准测试,需要多少标注员才够?

    Google Research 发布研究指出,AI 基准测试中常见的 3-5 名标注员标准往往不足以捕捉人类意见的细微差异,建议每条目使用超过 10 名标注员。研究通过模拟测试发现,标注策略取决于评估指标:追求准确率时增加条目数量更有效,而捕捉观点多样性则需增加标注员数量。在优化比例后,仅需约 1,000 次总标注即可实现高可复现性,相关模拟器已开源。

3月13日周五
  1. Berkeley AI Research42

    Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,实现大规模 LLM 交互作用的高效识别

    Berkeley AI Research 提出 SPEX 和 ProxySPEX 算法,通过稀疏恢复和层级结构特性,以极少消融次数高效识别 LLM 中的关键交互作用。ProxySPEX 在保持 SPEX 性能的同时,将消融次数减少约 10 倍。该方法在数千特征的上下文窗口中仍能保持高忠实度,显著优于 LIME 等边际方法。

12月4日周四
  1. Hugging Face Blog80

    Hugging Face Skills 让 Claude 等 Agent 完成 LLM 微调全流程

    Hugging Face 发布 Skills 工具,使 Claude Code、Codex 和 Gemini CLI 等编程 Agent 能够自动完成数据集验证、硬件选择、脚本生成、云端 GPU 任务提交、进度监控及模型推送至 Hub 的完整微调流程。该技能支持 SFT、DPO 和 GRPO 等训练方法,兼容 0.5B 至 70B 参数模型,并支持将训练好的模型转换为 GGUF 格式。

    推荐理由:原文提供了将 Claude Code 等 Agent 接入 Hugging Face 进行全流程微调的实操指南与配置方法。