R · LR 0.1RLCard · LEDUC HOLD'EM · PUBLIC REPORT
看过前期结果后追加的探索 · 不是预先设定的验证
把奖励缩小 7 倍,
没有让扑克 AI 学得更好。
我让两组策略用相同的 10 个随机起点各训练 30 万局。结果很一致:使用原始奖励的策略更不容易被对手针对。
NEW MECHANISM SCREEN · NOT CONFIRMATORY
奖励缩小后变差,会不会只是学习步子太小?
我们只改一个优化设置。
原始奖励与 1/7 奖励,分别使用 Q 学习率 0.1 和 0.2;8 个全新随机起点,共 32 次训练。
R · LR 0.2R / 7 · LR 0.1R / 7 · LR 0.2R · LR .1
0 / 8R/7 · LR .1
0 / 8R · LR .2
0 / 8R/7 · LR .2
0 / 8ONE REAL RUN · 单次真实数据
等待第一组训练
当前一组的公开 CSV;不是 8 个随机起点的平均。
首个真实指标点会在 10,000 局后出现。
SANITIZED CSV · 公开数据行
当前运行的 CSV 数值
每个 10,000 局评估点显示训练局数、策略可利用度和随机对手收益。路径、checkpoint 与专家诊断不会公开。
| 设置 | Seed | 训练局数 | 容易被针对 ↓ | 对随机对手收益 |
|---|---|---|---|---|
| 首个数据点将在 10,000 局后出现。 | ||||
THE QUESTION
奖励变差,是公式的问题,还是因为整体变小了?
可以把它想成调音量。
上次我们既换了“内容”,又把整体音量调小。现在分别测试,避免把两种影响混在一起。
R
R + 1.75ΔΦ
R / 7
R / 7 + 0.25ΔΦ
四种设置使用相同的 8 个随机起点。这样既能比较“奖励变小”的影响,也能比较“加入 CFR 引导”的影响。
LIVE STUDY
现在做到哪一步?
一共 32 次独立训练。
四种设置各跑 8 次,每次训练 100,000 局。页面每 3 秒读取一次公开状态。
原始奖励
0 / 8奖励 ÷ 7
0 / 8缩小 + 引导
0 / 8原始 + 引导
0 / 8ONE REAL RUN · 单次真实数据
等待下一次运行
这条线只代表当前一个设置和一个随机起点,不是 8 组平均。
训练尚未开始。启动后,10,000 局处会出现第一个真实指标点。
SANITIZED CSV · 公开数据行
曲线背后的真实数值
每一行对应当前 arm / seed 的一个真实评估点。网页只公开训练局数、策略可利用度与随机对手收益;本机路径和原始诊断不会上传。
| 设置 | Seed | 训练局数 | 容易被针对 ↓ | 对随机对手收益 |
|---|---|---|---|---|
| 首个数据点将在 10,000 局后出现。 | ||||
FROZEN RESULT
最终报告尚未生成。
FOLLOW-UP · OFFLINE DIAGNOSTICS
我们正在查:为什么奖励缩小后学得更差?
这里只读取已经完成的 32 份 CSV,不启动新训练、不占用训练资源,也不是 Confirmation。
FOR CURIOUS READERS
想看技术细节?这里再展开。
实验设计、判断规则与运行诊断 默认折叠,不影响普通读者理解
怎样保证比较公平
- 4 种设置共享 8 个全新随机起点,每种设置训练 100,000 局。
- 运行顺序提前平衡,减少时间、温度和设备状态带来的偏差。
- 每 10,000 局计算一次“容易被针对”,每 25,000 局保存恢复点。
- 本研究看过此前结果后才设计,因此明确不是确认性实验。
怎样决定是否值得继续
主要比较训练全过程的平均“容易被针对”数值,同时检查最终表现和策略是否异常变得单一。
只有满足预先写下的全部门槛,PBRS 方案才有资格进入另一项使用全新数据的正式验证。
如果没有方案过线,这条路线就停止,不会用同一批结果继续调参数。
EXECUTIVE SUMMARY
先说结论
-
01
问题:把每次奖励缩小为原来的 1/7,会不会让训练更稳定、更有效?
-
02
答案:没有。训练结束时,缩放奖励在 10 个随机起点上全部更容易被针对。
-
03
决定:不采用缩放奖励,继续把原始奖励作为基线;这次探索也不会被包装成确认性证据。
THE MAIN RESULT
最后一刻,原始奖励更稳。
“容易被针对”是什么意思?
它衡量一个对手还能利用多少策略漏洞。数字越低,策略越稳。
THE WHOLE TRAINING JOURNEY
不只是终点,整个学习过程也没有改善。
全程综合表现更差
把 2.5 万到 30 万局之间的表现全部算进去,缩放奖励平均仍然更容易被针对;10 组里有 9 组如此。
反例没有被隐藏
随机起点 57721 的全程综合表现由缩放奖励胜出,但它在最终 30 万局时仍然更差。这提醒我们不要把结果说成“任何时候都更差”。
WHAT THIS MEANS
接下来怎么做?
继续使用原始奖励
它仍是当前更可靠、也更容易解释的基线。
不采用缩放奖励
它没有在这次延长训练中显示出实际优势。
先写问题,再看数据
未来若做确认性实验,需要新的预设方案和没有使用过的随机起点。
METHODS & EVIDENCE
想核对?完整方法和数据都在这里。
方法、10 组完整数字与研究限制 适合想进一步核对的读者
测试是怎么做的
- 两种设置:原始奖励,以及把奖励缩小为 1/7。
- 10 个相同的独立随机起点,每个起点两种设置各跑一次。
- 每次训练 300,000 局,共 20 次运行、6,000,000 局。
- 主要指标是策略有多容易被针对,越低越好。
为什么不能叫“确认”
这项延长是在看过前期 Pilot 结果后才决定的,而且用了原本预留的随机起点。因此它只能提出探索性证据,不能充当事先设计的最终验证。
前期 Pilot 没有让任何奖励方案晋级。选择缩放奖励继续探索,只因为它是非对照方案中全程指标最低、变换也最简单的一种,不代表 Pilot 支持它有效。
结论只适用于这次 Leduc Hold'em、NFSP 和这些训练设置,不能证明所有奖励设计在其他任务里都无效。
| 随机起点 | 原始奖励 | 奖励 ÷ 7 | 较好者 |
|---|---|---|---|
| 31415 | 1.166 | 1.310 | 原始奖励 |
| 27182 | 1.203 | 1.304 | 原始奖励 |
| 16180 | 1.108 | 1.331 | 原始奖励 |
| 57721 | 1.213 | 1.341 | 原始奖励 |
| 65537 | 1.151 | 1.317 | 原始奖励 |
| 99991 | 1.184 | 1.201 | 原始奖励 |
| 104729 | 1.196 | 1.297 | 原始奖励 |
| 13007 | 1.234 | 1.242 | 原始奖励 |
| 17011 | 1.156 | 1.326 | 原始奖励 |
| 23003 | 1.186 | 1.305 | 原始奖励 |
统计数字(给需要复核的读者)
终点均值:原始奖励 1.1796,缩放奖励 1.2975;配对平均差 0.1179,配对 bootstrap 95% 区间为 0.0781–0.1554。 双侧 exact sign-flip p = 0.00195。
全程综合指标从 25,000 到 300,000 局计算,单位为“容易被针对 × 训练局数”。原始奖励均值 328,774,缩放奖励 358,724;缩放奖励高 9.1%,10 组中 9 组更差。
Bootstrap 按随机起点成对重采样 10,000 次;sign-flip 是 n=10、共 1,024 种符号组合的双侧检验。这些统计描述的是探索数据,不会把它变成确认性证明。
下载机器可读的完整报告 JSON →最后一次运行的真实 CSV 曲线 单个设置与随机起点,不是 10 组平均
曲线暂时无法读取;上面的研究总结仍来自已保存的完整报告。
最后保存的运行:原始奖励 · 随机起点 23003。