
Reinforcement-Learning-Agent für Spiele (AlphaZero)
Auf AlphaZero basierendes Framework, das Tic-Tac-Toe, Vier gewinnt und CartPole mit einer einheitlichen Modellarchitektur erlernt.

Auf AlphaZero basierendes Framework, das Tic-Tac-Toe, Vier gewinnt und CartPole mit einer einheitlichen Modellarchitektur erlernt.