RLCard · LEDUC HOLD'EM · PUBLIC REPORT

看过前期结果后追加的探索 · 不是预先设定的验证

把奖励缩小 7 倍,
没有让扑克 AI 学得更好。

我让两组策略用相同的 10 个随机起点各训练 30 万局。结果很一致:使用原始奖励的策略更不容易被对手针对。

研究完成 · 报告已保存 20 / 20 组训练 · 共 6,000,000 局

奖励缩小后变差,会不会只是学习步子太小?

我们只改一个优化设置。
原始奖励与 1/7 奖励,分别使用 Q 学习率 0.1 和 0.2;8 个全新随机起点,共 32 次训练。

Q 学习率 0.1原设置
Q 学习率 0.2学习步子加倍
原始奖励R
A · 对照原始奖励R · LR 0.1
C · 机制对照原始奖励R · LR 0.2
奖励缩小 7 倍R / 7
B · 已知较差缩小奖励R / 7 · LR 0.1
D · 候选缩小奖励 + 大步子R / 7 · LR 0.2
PHASE 10 · OPTIMIZER SCREEN等待启动
0 / 32
A

R · LR .1

0 / 8
B

R/7 · LR .1

0 / 8
C

R · LR .2

0 / 8
D

R/7 · LR .2

0 / 8

等待第一组训练

当前一组的公开 CSV;不是 8 个随机起点的平均。

随机起点
训练进度0 / 100,000
容易被针对
对随机对手收益

首个真实指标点会在 10,000 局后出现。

当前运行的 CSV 数值

0 ROWS

每个 10,000 局评估点显示训练局数、策略可利用度和随机对手收益。路径、checkpoint 与专家诊断不会公开。

设置Seed训练局数容易被针对 ↓对随机对手收益
首个数据点将在 10,000 局后出现。
纵轴越低越好。只有 32 组全部完成后才按冻结门槛判断;页面不会根据中途曲线提前宣布胜负。

先说结论

  1. 01

    问题:把每次奖励缩小为原来的 1/7,会不会让训练更稳定、更有效?

  2. 02

    答案:没有。训练结束时,缩放奖励在 10 个随机起点上全部更容易被针对。

  3. 03

    决定:不采用缩放奖励,继续把原始奖励作为基线;这次探索也不会被包装成确认性证据。

10 / 10 随机起点的最终结果都更差
+10.0% 缩放奖励平均更容易被针对
6,000,000 总训练局数

最后一刻,原始奖励更稳。

“容易被针对”是什么意思?
它衡量一个对手还能利用多少策略漏洞。数字越低,策略越稳。

原始奖励 TERMINAL · 对照组
1.180
奖励缩小为 1/7 SCALED · 测试组
1.298
在 30 万局终点,缩放奖励的平均值高 10.0%。这里“高”代表更差。

不只是终点,整个学习过程也没有改善。

+9.1%

全程综合表现更差

把 2.5 万到 30 万局之间的表现全部算进去,缩放奖励平均仍然更容易被针对;10 组里有 9 组如此。

1 个例外

反例没有被隐藏

随机起点 57721 的全程综合表现由缩放奖励胜出,但它在最终 30 万局时仍然更差。这提醒我们不要把结果说成“任何时候都更差”。

接下来怎么做?

保留

继续使用原始奖励

它仍是当前更可靠、也更容易解释的基线。

不晋级

不采用缩放奖励

它没有在这次延长训练中显示出实际优势。

若再验证

先写问题,再看数据

未来若做确认性实验,需要新的预设方案和没有使用过的随机起点。

想核对?完整方法和数据都在这里。

方法、10 组完整数字与研究限制 适合想进一步核对的读者

测试是怎么做的

  • 两种设置:原始奖励,以及把奖励缩小为 1/7。
  • 10 个相同的独立随机起点,每个起点两种设置各跑一次。
  • 每次训练 300,000 局,共 20 次运行、6,000,000 局。
  • 主要指标是策略有多容易被针对,越低越好。

为什么不能叫“确认”

这项延长是在看过前期 Pilot 结果后才决定的,而且用了原本预留的随机起点。因此它只能提出探索性证据,不能充当事先设计的最终验证。

前期 Pilot 没有让任何奖励方案晋级。选择缩放奖励继续探索,只因为它是非对照方案中全程指标最低、变换也最简单的一种,不代表 Pilot 支持它有效。

结论只适用于这次 Leduc Hold'em、NFSP 和这些训练设置,不能证明所有奖励设计在其他任务里都无效。

每个随机起点在 300,000 局时的“容易被针对”数值(越低越好)
随机起点原始奖励奖励 ÷ 7较好者
314151.1661.310原始奖励
271821.2031.304原始奖励
161801.1081.331原始奖励
577211.2131.341原始奖励
655371.1511.317原始奖励
999911.1841.201原始奖励
1047291.1961.297原始奖励
130071.2341.242原始奖励
170111.1561.326原始奖励
230031.1861.305原始奖励

统计数字(给需要复核的读者)

终点均值:原始奖励 1.1796,缩放奖励 1.2975;配对平均差 0.1179,配对 bootstrap 95% 区间为 0.0781–0.1554。 双侧 exact sign-flip p = 0.00195。

全程综合指标从 25,000 到 300,000 局计算,单位为“容易被针对 × 训练局数”。原始奖励均值 328,774,缩放奖励 358,724;缩放奖励高 9.1%,10 组中 9 组更差。

Bootstrap 按随机起点成对重采样 10,000 次;sign-flip 是 n=10、共 1,024 种符号组合的双侧检验。这些统计描述的是探索数据,不会把它变成确认性证明。

下载机器可读的完整报告 JSON →
最后一次运行的真实 CSV 曲线 单个设置与随机起点,不是 10 组平均
设置原始奖励
随机起点23003
进度300,000 / 300,000
最终数值1.186
最后一次运行的策略可利用度曲线 原始奖励、随机起点 23003,从 25,000 到 300,000 局的单次真实 CSV 曲线。

最后保存的运行:原始奖励 · 随机起点 23003。