Generating a game is not the same as making one that can be played. Despite advances in code generation, existing approaches treat game generation as one-shot translation from prompt to artifact, leaving interaction-level failures undetected. We argue that evaluating and improving game generation requires a player, and study two roles for graphical user interface (GUI) agents in this process: (1) as an objective evaluator, for which we introduce PlaytestArena, a new evaluation environment that pairs 200 browser-based game generation tasks across eight genres with rubrics of expected in-play behaviors, adjudicated by a GUI agent that loads each build in a browser and plays it; and (2) as a subjective playtester, for which we propose Play2Code, where a game agent and a GUI agent operate in a sustained loop with shared memory, turning game generation into a dialogue between coding and playing. Our experiments show that even frontier models struggle to generate playable games directly, while Play2Code achieves a 66.8\% rubric pass-rate, improving over single-pass and agentic-coding baselines by 37.1 and 14.6 points respectively. Further analysis shows that GUI playtester feedback is more traceable than a human report, yet idiosyncratic in ways reminiscent of human testers, establishing game playtesting as a critical testbed for interactive code generation. Our project website is available at https://continual-game-generation.vercel.app/.


翻译:生成一款游戏并不等同于制作一款可玩的游戏。尽管代码生成技术取得了进展,现有方法将游戏生成为从提示到产物的单次转换,导致交互层面的故障未被检测。我们认为,评估和改进游戏生成需要一个玩家,并在此过程中研究图形用户界面(GUI)智能体的两种角色:(1)作为客观评估器,我们引入PlaytestArena,这是一个新的评估环境,将200个跨八个类别的基于浏览器的游戏生成任务与预期的游戏内行为评分标准配对,由GUI智能体在每个构建加载到浏览器并游玩后进行裁决;(2)作为主观试玩测试员,我们提出Play2Code,其中游戏智能体和GUI智能体在共享内存的持续循环中运作,将游戏生成为编码与游戏之间的对话。我们的实验表明,即使是最先进的模型也难以直接生成可玩的游戏,而Play2Code实现了66.8%的评分标准通过率,分别比单次生成和智能体编码基线高出37.1和14.6个百分点。进一步分析显示,GUI试玩测试员的反馈比人工报告更具可追溯性,但在特异性上与人类测试员相似,从而将游戏试玩确立为交互式代码生成的关键测试平台。我们的项目网站位于https://continual-game-generation.vercel.app/。

0
下载
关闭预览

相关内容

代码(Code)是专知网的一个重要知识资料文档板块,旨在整理收录论文源代码、复现代码,经典工程代码等,便于用户查阅下载使用。
智能体工程(Agent Engineering)
专知会员服务
36+阅读 · 2025年12月31日
AI生成代码缺陷综述
专知会员服务
17+阅读 · 2025年12月8日
面向兵棋游戏的多层级智能体架构
专知会员服务
40+阅读 · 2025年1月23日
【新书】使用AI智能体构建应用程序
专知会员服务
61+阅读 · 2024年10月26日
设计和构建强大的大语言模型智能体
专知会员服务
55+阅读 · 2024年10月6日
浅谈群体智能——新一代AI的重要方向
中国科学院自动化研究所
44+阅读 · 2019年10月16日
面向人工智能的计算机体系结构
计算机研究与发展
14+阅读 · 2019年6月6日
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
4+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
10+阅读 · 2013年12月31日
国家自然科学基金
18+阅读 · 2009年12月31日
VIP会员
最新内容
学习数据的几何:形状空间分析数学综述
专知会员服务
7+阅读 · 6月17日
定向能反无人机系统最新发展动态
专知会员服务
7+阅读 · 6月17日
从燃煤战舰到算法战争:水面指挥的永恒要求
专知会员服务
6+阅读 · 6月17日
相关VIP内容
智能体工程(Agent Engineering)
专知会员服务
36+阅读 · 2025年12月31日
AI生成代码缺陷综述
专知会员服务
17+阅读 · 2025年12月8日
面向兵棋游戏的多层级智能体架构
专知会员服务
40+阅读 · 2025年1月23日
【新书】使用AI智能体构建应用程序
专知会员服务
61+阅读 · 2024年10月26日
设计和构建强大的大语言模型智能体
专知会员服务
55+阅读 · 2024年10月6日
相关基金
国家自然科学基金
1+阅读 · 2015年12月31日
国家自然科学基金
4+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
2+阅读 · 2015年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
1+阅读 · 2014年12月31日
国家自然科学基金
0+阅读 · 2014年12月31日
国家自然科学基金
10+阅读 · 2013年12月31日
国家自然科学基金
18+阅读 · 2009年12月31日
Top
微信扫码咨询专知VIP会员