Posts
- Splendor AIのvalueが手番を見ていなかったので特徴量を追加した
- Splendor AIで教師データをさらに2倍にしたが、対局の強さは伸びなかった
- Splendor AIの次の大規模学習を58,800局・16,000 stepにスケールする
- Splendor AIで学習行数を増やさず、対局数を4倍にしたら強くなった
- Splendor AIの128回探索を再検証したら、同じ局面でも22.5%で1位の手が変わった
- Splendor AIのvalue教師を継続対局で測ったが、8回平均は現行モデルを上回らなかった
- Splendor AIでランダム補充の探索を工夫したが、単純なPUCTの方が強かった
- Splendor AIで探索値をvalue教師に混ぜたモデルを1,600局で確認した
- Splendor AIで128回探索の自己対局を8,192局作り、value教師の弱点を測った
- Splendor AIでPUCT探索がどれだけ強さを増幅するか測った
- Splendor AIを2世代回したが伸びなかったので、学習量不足を切り分けた
- Splendor AIを自己対局に進めて、最初のモデル更新を通した
- Splendor AIを教師あり学習してみた: policyは伸びたがvalueが過学習した
- Splendor AIのモデル構造と特徴量
- Earlier writing is at mirror.xyz