🤖 强化学习演示

通过扫地机器人和军棋游戏,直观理解强化学习核心概念

⚙️ 环境配置(对所有扫地机器人 Demo 生效)

💡 实际脏概率 = 基准概率 ± 随机波动(每步随机),模拟真实环境的不可预测性。显示的是本次实际使用的概率。

🤖 简单反射型 Agent(Simple Reflex Agent)

逻辑:若当前房间脏→打扫;否则移动到下一个脏房间(多房间时循环巡视)

房间每步按配置的概率变脏,概率可随时间增长。

-
机器人位置
0
脏房间数
0
步数
25%
当前脏概率
📋 查表策略 Agent(Table-driven Agent)

逻辑:每个房间有独立策略表,机器人按表执行最优动作。

-
机器人位置
0
脏房间数
0
步数
25%
当前脏概率
🎲 随机策略 Agent(ε-Greedy)

ε=0 完全利用(选最优);ε=1 完全随机探索

-
机器人位置
0
脏房间数
0
步数
0
探索次数
🧠 Q-Learning(核心算法)

Q(s,a) ← Q(s,a) + α[r + γ·max_a' Q(s',a') - Q(s,a)]

支持多房间多机器人,Q 表按房间数动态生成。

-
机器人位置
0
脏房间数
0
步数
0
累计奖励
25%
当前脏概率

📊 Q 表(实时更新,房间数变化时自动重生成)

📋 Q-Learning 更新日志

♟️ 军棋 · 双人对战

🎯 与好友对垒:创建房间后,把带房间号的链接发给好友,双方同时登录本页即可开战。
♟️ 军棋是回合制、信息掩蔽的棋类游戏:你的棋子对手看不见,碰撞时才会揭开。