Mathematik  |  Informatik

 

Leo Pracht, 2006 | Landschlacht, TG

 

In dieser Arbeit wird untersucht, inwiefern ein AlphaZero-ähnlicher Ansatz das Spiel Othello durch Selbstspiel auf ein kompetitives Niveau erlernen kann, wenn nur die begrenzten Rechenressourcen eines Heimrechners zur Verfügung stehen. Dazu wurde ein System entwickelt, das ein neuronales Netzwerk mit einer Monte-Carlo-Tree-Search (MCTS) kombiniert und über 55 Generationen durch Selbstspiel trainiert wurde.

Die Evaluation erfolgte gegen die Engine Edax unter kontrollierten Bedingungen. Das finale Modell erreicht rund 1700 Elo, während das rohe Netzwerk ohne MCTS etwa 1240 Elo erzielt. Dies zeigt, dass ein wesentlicher Teil der Spielstärke aus der Kombination von Lernen und Suche entsteht.

Die Ergebnisse zeigen, dass kompetitive Spielstärke auch unter begrenzten Rechenressourcen erreicht werden kann, sofern das Rechenbudget effizient genutzt wird.

Fragestellung

Inwiefern kann ein AlphaZero-ähnlicher Algorithmus das Spiel Othello durch Selbstspiel auf ein kompetitives Niveau erlernen, wenn Training und Evaluation auf die begrenzten Rechenressourcen eines Heimrechners beschränkt sind?

Methodik

Zur Untersuchung wurde ein AlphaZero-ähnliches System in Python (PyTorch, NumPy, Matplotlib) implementiert. Das Othello-Brett wird als 8×8-Gitter in kanonischer Form modelliert, wobei das neuronale Netzwerk sowohl eine Zugwahrscheinlichkeit (Policy) als auch eine Positionsbewertung (Value) vorhersagt.

Das Modell ist ein convolutional neural network mit einem Eingabelayer und vier Residualblöcken mit 64 Kanälen sowie zwei Ausgabeköpfen für Policy und Value. Es umfasst rund 456 000 Parameter und benötigt etwa 40.6 MFLOPs pro Inferenz.

Die Entscheidungsfindung erfolgt über eine Monte-Carlo-Tree-Search (MCTS) mit 1400 Simulationen pro Zug.

Das Training erfolgte ausschliesslich durch Selbstspiel über 55 Generationen auf einem Heimrechner (RTX 4060, i7, 32 GB RAM).

Zur Evaluation wurde jede fünfte Generation in jeweils 100 Partien gegen Edax (Level 1–6) getestet. Zur Sicherstellung fairer Bedingungen wurden 100 feste Startpositionen verwendet und empirisch überprüft, dass Edax unabhängig von Systemlast konstant spielt. Zusätzlich wurde das rohe neuronale Netzwerk ohne MCTS evaluiert.

Ergebnisse

Die Resultate zeigen eine kontinuierliche Leistungssteigerung über die Trainingsgenerationen hinweg. Das vollständige System erreicht rund 1700 Elo und erzielt stabile Resultate bis etwa Edax Level 5, während gegen Level 6 weiterhin deutliche Unterschiede bestehen.

Das rohe neuronale Netzwerk verbessert sich ebenfalls, bleibt jedoch deutlich schwächer und erreicht etwa 1240 Elo. Der Unterschied von rund 450 Elo zeigt, dass ein wesentlicher Teil der Spielstärke aus der Kombination von Netzwerk und MCTS entsteht.

Die Analyse zeigt zudem einen klaren Zusammenhang zwischen eingesetzten FLOPs und erreichter Leistung: Während das rohe Modell konstant mit etwa 40.6 MFLOPs pro Zug arbeitet, führt der zusätzliche Rechenaufwand durch MCTS zu einem signifikanten Leistungsgewinn.

Diskussion

Die Ergebnisse zeigen, dass ein AlphaZero-ähnlicher Ansatz auch unter den begrenzten Rechenressourcen eines Heimrechners zu kompetitiver Spielstärke führen kann und die Fragestellung damit grundsätzlich bestätigt wird.

Der Vergleich zwischen rohem Modell und vollständigem System zeigt, dass die Leistung nicht allein aus dem neuronalen Netzwerk stammt, sondern entscheidend vom Zusammenspiel mit MCTS abhängt.

Die gewählte Methodik erweist sich als geeignet, stabile Lernfortschritte unter begrenztem Rechenbudget zu erzielen. Verbesserungen erscheinen vor allem durch effizientere Nutzung der vorhandenen Ressourcen sowie weitere Optimierung der Netzwerkarchitektur möglich.

Schlussfolgerungen

Die Arbeit zeigt, dass ein AlphaZero-ähnlicher Ansatz das Spiel Othello auch unter den begrenzten Rechenressourcen eines Heimrechners erfolgreich auf ein kompetitives Niveau bringen kann.

Das entwickelte System erreicht rund 1700 Elo und demonstriert, dass leistungsfähige Spiel-KI nicht zwingend grosse Rechenzentren erfordert. Entscheidend ist die effiziente Nutzung der Rechenressourcen sowie das Zusammenspiel von Lernen und Suche.

Gleichzeitig bleibt ein Leistungsabstand zu spezialisierten Engines bestehen, sodass weitere Optimierungen notwendig sind.

 

 

Würdigung durch den Experten

Jakub Adamek

The student investigates training a neural network for Othello via self-play, utilizing only consumer-grade hardware (an RTX 4060). They implement an AlphaZero-like training and evaluation framework, design a small neural network for the task, and iterate on the quality of their model. For the strategically rich game of Othello, they obtain a model that beats Edax level 4 when playing purely via the policy network, and Edax level 5 when paired with MCTS. This is a very impressive demonstration of the student’s resourcefulness and forms a solid foundation for future work on democratizing AI.

Prädikat:

Gold

Sonderpreis «I-FEST²» gestiftet von der Metrohm Stiftung

 

 

 

Kantonsschule Kreuzlingen
Lehrerin: Dr. Franziska Flegel