跳到正文

#安全/对齐

今日 0 条
10月6日周二
9月7日周一
9月2日周三
  1. Hugging Face Blog50

    BenchMIRT:利用多维IRT拆解LLM基准测试的真实测量目标

    AllenAI发布BenchMIRT,利用多维项目反应理论(MIRT)在提示词层面审计LLM基准测试。该工具在16个基准和3.4万道题上训练,独立识别出安全与通用推理两个主导维度,揭示BBQ、WMDP等基准中安全与推理信号的混合情况。BenchMIRT还能通过仅保留10%最具区分度的题目来高效评估模型,并准确预测模型在未见题目上的表现。

6月19日周五
  1. Hugging Face Blog73

    MosaicLeaks:深度研究智能体的隐私泄露风险与PA-DR训练法

    Hugging Face发布MosaicLeaks论文,揭示深度研究智能体通过外部查询日志泄露私有信息的风险。提出PA-DR训练法,将答案/全信息泄露率从34.0%降至9.9%,同时保持严格链成功率在58.7%。

    推荐理由:提出PA-DR训练法,在保持推理性能的同时将深度研究智能体的隐私泄露率从34%降至9.9%。

6月11日周四
  1. Google Research42

    Google Research 提出正则化 f-散度核检验框架以审计机器学习遗忘

    Google Research 提出正则化 f-散度核检验框架,旨在解决大规模模型机器遗忘审计中传统两样本检验统计效力低且计算昂贵的问题。该框架利用 f-散度(如 KL 散度、Hockey-stick 散度)结合核正则化方法,自动选择最佳散度类型以精准定位局部数据偏移。该研究已在 AISTATS 2026 发表,理论上证明了其对假阳性的控制能力及随样本增加假阴性收敛至零的特性。

5月28日周四
3月31日周二
  1. Google Research68

    Google Research 发布论文估算量子计算机破解加密货币的量子资源

    Google Research 发布白皮书,估算未来量子计算机仅需不到 50 万物理量子比特即可破解保护加密货币的椭圆曲线加密。研究提出使用零知识证明负责任地披露漏洞,并建议区块链向抗量子密码学迁移。

    推荐理由:论文给出了突破椭圆曲线加密的量子资源新估算,并提出了零知识证明的负责任披露方法。

12月23日周二
  1. Hugging Face Blog75

    ServiceNow 发布 AprielGuard 安全模型,统一检测安全风险与对抗攻击

    ServiceNow 发布 AprielGuard,一款 8B 参数的安全与对抗鲁棒性守护模型,可检测 16 类安全风险及提示注入、越狱等对抗攻击。该模型支持 32k 长上下文与 Agent 工作流,提供推理与非推理双模式,已在多项公开基准上验证了性能。

    推荐理由:ServiceNow 发布 AprielGuard 安全模型,统一检测 16 类安全风险与对抗攻击,支持 32k 长上下文与 Agent 工作流。

12月11日周四
  1. Google Research42

    Urania:基于差分隐私的 AI 聊天机器人使用洞察框架

    Google Research 发布 Urania 框架,通过差分隐私技术从 LLM 聊天对话中提取洞察,确保数学级隐私保障。该框架利用 DP 聚类和关键词提取机制,防止单条对话影响结果,避免敏感信息泄露。实验显示,在隐私预算收紧时,其生成的摘要质量甚至优于非隐私基线,获 LLM 评估器高达 70% 的偏好。