跳到正文

#RAG

今日 0 条
3月17日周二
  1. Google Research60

    Google 研究论文:LLM 在超导领域专家级问答中的表现评估

    Google 与康奈尔大学合作在 PNAS 发表论文,评估 GPT-4o、Claude 3.5 等六款 LLM 在高能超导领域的专家级问答表现。基于精选文献的 NotebookLM 和自建 RAG 系统在准确性、平衡性和证据支持上优于开放网络模型。研究指出模型在视觉推理和时序理解上仍有不足,并将发布 CMT-benchmark 进行更严格评估。

    推荐理由:通过专家盲评对比发现,基于精选文献的 NotebookLM 在科学准确性上优于开放网络模型,揭示了 RAG 在科研场景中的关键价值。

10月1日周三
  1. Hugging Face Blog42

    Hugging Face 发布检索嵌入基准 RTEB

    Hugging Face 发布检索嵌入基准(RTEB)Beta 版,旨在通过混合开放与私有数据集策略,可靠评估嵌入模型在真实应用中的检索准确性。该基准涵盖 20 种语言及法律、医疗等关键领域,默认使用 NDCG@10 作为排行榜指标,以解决现有基准存在的泛化差距和与企业用例脱节问题。