Ein auf AlphaZero basierendes Framework, das Ein- und Zwei-Spieler-Spiele (Tic-Tac-Toe, Vier gewinnt und CartPole) mit einer einheitlichen Modellarchitektur erlernen kann, trainiert per Self-Play und Monte-Carlo-Baumsuche. Dabei wurden Netzarchitekturen mit ResNet- und MLP-Backbone erprobt und verglichen. Entstanden als Teamprojekt im Kurs Deep Learning: Architectures & Methods an der TU Darmstadt.
Das Titelbild zeigt eine Self-Play-Partie zwischen zwei Kopien des trainierten Agenten (600 MCTS-Simulationen pro Zug, die in einem hart umkämpften Unentschieden endet) sowie die Such-Policy an der umstrittensten Entscheidung der Partie.
Technologien: PyTorch, AlphaZero, self-play RL
