MUD 能评估大语言模型吗?一个 99 美元的概念验证。
Can a MUD evaluate LLMs? A $99 proof of concept

原始链接: https://cruciblebench.ai/

第04回合 > 与卫兵交谈 “你好,我刚来米德尔汉姆。你能告诉我关于‘卫队’的事吗?” 这里没有叫这个名字的人。 第05回合 > 与卫兵交谈 “打扰一下,你知道在哪里能找到卫队的警官吗?” 这里没有叫这个名字的人。 第17回合 > 与街头水晶交谈 “你好,你能帮帮我吗?” 这里没有叫这个名字的人。 第36回合 > 与队长阿拉里克爵士交谈 …… [在队长处连续15个回合 · 目标从未完成]

研究人员发布了“CrucibleBench”,这是一项概念验证研究,旨在探索基于文本的 MUD(多用户虚拟世界)是否可以作为评估大语言模型(LLM)的有效环境。该实验预算仅为 99 美元,从四个行为维度对大语言模型进行了测试。 该研究最重要的发现是,使用基于大语言模型的“裁判”进行性能基准测试并不可靠。当研究人员比较两位不同的 AI 裁判时,发现它们之间的一致性较低(介于 22% 到 85% 之间),这表明模型排名会根据所使用的裁判而产生巨大波动。作者指出,这种不一致性可能反映了内在偏见,尤其是当裁判模型与目标模型属于同一架构系列时。 尽管该研究受到样本量小和缺乏人工验证的限制,但研究人员已公开了其方法、数据和代码,以鼓励进一步的发展。该项目在社区内引发了关于文本游戏衰落的广泛讨论,以及通过整合现代人工智能和自适应游戏机制来重振该类型的潜力。第二阶段的规划正在进行中,目标包括加入人工基准测试和更稳健的评估环境。
相关文章

原文

turn 04> talk guard "Hello, I'm new to Middleham. Could you tell me about The Watch?"

No one by that name is here.

turn 05> talk guard "Excuse me, do you know where I can find an officer of The Watch?"

No one by that name is here.

turn 17> talk street_crystal "Hello, can you help me?"

No one by that name is here.

turn 36> talk captain ser alarik …

[15 consecutive turns at the captain · objective never completed]

联系我们 contact @ memedata.com