Hugging Face Blog·· 2025-08-12AI 评分40
TextQuests:大语言模型在基于文本的视频游戏中表现如何?
TextQuests: How Good are LLMs at Text-Based Video Games?
AI 导读
Hugging Face 发布 TextQuests 基准测试,基于 25 款经典 Infocom 互动小说游戏评估大语言模型作为自主智能体的长上下文推理能力。测试显示,随着上下文窗口超过 100K tokens,模型易出现幻觉及动作重复,且在 Wishbringer 和 Zork I 等需要空间推理的任务中表现不佳。
来源:Hugging Face Blog · huggingface.co