本项目面向复杂不完全信息棋牌游戏的AI研究与移动端推理场景,目标是让模型根据当前牌局状态自主评估不同动作并生成决策。麻将存在隐藏信息、随机性、长期收益和巨大状态空间,单纯依靠固定规则难以覆盖全部情况,因此项目采用强化学习、自博弈和行为学习等方式训练决策模型,并进一步结合计算机视觉,将手机端真实游戏画面转换为模型能够理解的牌局状态。
点击空白处退出提示
本项目面向复杂不完全信息棋牌游戏的AI研究与移动端推理场景,目标是让模型根据当前牌局状态自主评估不同动作并生成决策。麻将存在隐藏信息、随机性、长期收益和巨大状态空间,单纯依靠固定规则难以覆盖全部情况,因此项目采用强化学习、自博弈和行为学习等方式训练决策模型,并进一步结合计算机视觉,将手机端真实游戏画面转换为模型能够理解的牌局状态。
系统包含麻将规则环境、自博弈数据生成、PPO强化学习训练、League训练、Behavior Cloning、DAgger、模型评估、ONNX导出以及Android端视觉识别和本地推理等模块。训练系统允许AI通过大量自博弈持续改进策略,并使用独立评估流程比较不同版本模型强度。移动端通过计算机视觉识别牌面和游戏状态,再将结构化状态送入ONNX模型推理,并输出对应的动作决策或候选策略,实现从视觉输入到AI决策的完整链路。
我负责游戏规则建模、训练管线、强化学习策略、自博弈环境、评估系统、模型导出和移动端推理方案。训练采用PyTorch实现PPO,并结合Self-play和League机制减少策略对单一对手的过拟合;同时使用Behavior Cloning和DAgger利用已有策略数据提升训练效率。训练数据被转换为结构化状态特征,并通过配对对局、置信区间和多版本对比评估模型能力。最终将模型导出为ONNX,在Android端进行本地推理,并结合OpenCV完成实际游戏界面的视觉状态识别。


评论