面向游戏 AI 研究、自动化游戏测试与玩家行为模拟场景,解决传统脚本 Agent 依赖固定规则、难以理解视觉场景和适应未知关卡的问题。项目在 Godot 中构建可交互的 2D 平台游戏,并接入视觉语言模型,使 Agent 能够仅依据游戏截图识别玩家、平台、陷阱和目标,自主规划移动与跳跃动作。同时建设自动化评测环境,用于持续记录通关进度、推理耗时、落点误差、死亡原因和失败案例,为游戏 Agent 算法迭代、关卡测试及可玩智能研究提供可复现的实验平台。
点击空白处退出提示
面向游戏 AI 研究、自动化游戏测试与玩家行为模拟场景,解决传统脚本 Agent 依赖固定规则、难以理解视觉场景和适应未知关卡的问题。项目在 Godot 中构建可交互的 2D 平台游戏,并接入视觉语言模型,使 Agent 能够仅依据游戏截图识别玩家、平台、陷阱和目标,自主规划移动与跳跃动作。同时建设自动化评测环境,用于持续记录通关进度、推理耗时、落点误差、死亡原因和失败案例,为游戏 Agent 算法迭代、关卡测试及可玩智能研究提供可复现的实验平台。
项目由游戏环境、Agent 通信服务、视觉感知、路线规划、自适应控制、经验记忆和自动化评测七个模块组成。Godot 游戏支持角色移动、跳跃、动画、音效、陷阱、死亡复活、金币和关卡完成等机制,并兼容键盘与 AI 双模式操作。Agent 通过 HTTP/TCP 接口获取 512×288 游戏截图,调用 VLM 提取玩家位置、平台边界、危险区域和目标信息,再将可站立表面建模为图,根据距离、高度、平台宽度和危险程度规划安全落点。控制器将落点转换为有限帧移动和跳跃计划,并依据真实落点误差在线修正控制时长。系统还支持失败黑名单、经验记忆、已验证动作前缀回放、自动重置、轨迹记录、证据截图和 JSON/CSV 评测报告
本人负责项目的整体架构设计、Godot 游戏环境开发、Agent 接口、视觉决策链路、控制算法、记忆系统及评测框架。首先在 Godot 4.7 中实现角色物理、碰撞、死亡复活和关卡状态,并开发串行 HTTP/TCP 动作服务,通过 request_id 缓存保证请求幂等,利用有限帧执行和超时停车避免模型延迟造成角色失控。随后使用 Python 调用 Qwen-VL-Max,将截图解析为结构化玩家、平台和危险区域几何;通过短视野图搜索完成可达性判断、危险惩罚和安全落点规划。针对 VLM 不适合精确实时控制的问题,将感知与控制分层,并根据实际位移在线估计移动速度和帧偏置。评测端严格隔离 Agent 观察与环境真值,记录每一步动作、推理耗时、死亡阶段、落点反馈及证据截图。项目累计完成 337 局实验和 1,936 个决策步骤,控制器迭代至 v51,首次实现 7 个决策步骤内端到端自主通关,完成 5 次已验证平台转移且全程零死亡。



评论