Google 研究论文:LLM 在超导领域专家级问答中的表现评估
Google 与康奈尔大学合作在 PNAS 发表论文,评估 GPT-4o、Claude 3.5 等六款 LLM 在高能超导领域的专家级问答表现。基于精选文献的 NotebookLM 和自建 RAG 系统在准确性、平衡性和证据支持上优于开放网络模型。研究指出模型在视觉推理和时序理解上仍有不足,并将发布 CMT-benchmark 进行更严格评估。
推荐理由:通过专家盲评对比发现,基于精选文献的 NotebookLM 在科学准确性上优于开放网络模型,揭示了 RAG 在科研场景中的关键价值。