:quality(85))
Kann Künstliche Intelligenz den Ausgang der Fußball-Weltmeisterschaft vorhersagen? Mit LLM SoccerArena startet an der Ludwig-Maximilians-Universität München (LMU) gemeinsam mit Forschenden der Universität zu Köln und der Universität Paderborn ein neues Forschungsprojekt, das genau diese Frage untersucht. Die Plattform vergleicht die Vorhersagefähigkeiten großer Sprachmodelle wie GPT, Claude oder Mistral anhand realer Fußballspiele und Turnierergebnisse – und macht die Resultate in einem öffentlich zugänglichen Live-Leaderboard sichtbar.
Das Projekt wird von Prof. Dr. Stefan Feuerriegel, Professor an der LMU Munich School of Management, geleitet. Ziel ist es, die Leistungsfähigkeit großer Sprachmodelle unter realen Bedingungen zu evaluieren und neue Maßstäbe für deren Bewertung zu entwickeln.
Fußball als Testfeld für KI
Während viele etablierte Benchmarks auf standardisierten Prüfungsaufgaben basieren, setzt LLM SoccerArena auf reale Ereignisse mit überprüfbaren Ergebnissen. Die Modelle werden aufgefordert, Spielausgänge, Turnierverläufe und den späteren Weltmeister vorherzusagen – Entscheidungen, deren Qualität sich nach Abschluss des Turniers objektiv bewerten lässt.
Dafür müssen die Systeme eine Vielzahl von Faktoren berücksichtigen: aktuelle Formkurven, Verletzungen, Kaderqualität, Trainerentscheidungen, historische Begegnungen oder Wettquoten. Die Herausforderung besteht darin, aus dynamischen und teilweise widersprüchlichen Informationen belastbare Prognosen unter Unsicherheit abzuleiten.
Ein neuer Benchmark für reale Entscheidungssituationen
Große Sprachmodelle erzielen mittlerweile Spitzenleistungen bei medizinischen Prüfungen, juristischen Aufgaben oder Management-Tests. Allerdings bilden solche Benchmarks häufig idealisierte und statische Szenarien ab. Wie zuverlässig KI-Systeme in dynamischen Umgebungen mit unvollständigen Informationen agieren, bleibt oft offen.
Genau hier setzt LLM SoccerArena an. Die Plattform untersucht, wie Sprachmodelle mit Unsicherheit umgehen und ob ihre Entscheidungen auch außerhalb klassischer Testumgebungen belastbar sind. Die Vorhersagen werden kontinuierlich mit den tatsächlichen Ergebnissen verglichen und transparent dokumentiert.
Relevanz für Wirtschaft und Management
Die Erkenntnisse reichen weit über den Sport hinaus. Unternehmen nutzen große Sprachmodelle zunehmend, um Marktinformationen auszuwerten, Risiken einzuschätzen oder strategische Entscheidungen vorzubereiten. Die Frage, wie zuverlässig KI-Systeme in solchen Situationen arbeiten, gewinnt daher an Bedeutung.
Ein weiterer Schwerpunkt von LLM SoccerArena ist die Untersuchung sogenannter agentischer KI-Systeme. Dabei wird analysiert, wie Sprachmodelle externe Informationen aus dem Internet recherchieren und in ihre Entscheidungen einbeziehen.
Die Forschenden untersuchen unter anderem, ob Modelle aktuelle Verletzungen, Aufstellungen, Formkurven, Trainerwechsel, direkte Duelle oder Wettquoten berücksichtigen – und wie gut sie diese Informationen gewichten. Dadurch soll besser verstanden werden, welche Strategien erfolgreiche KI-Systeme bei komplexen Prognoseaufgaben einsetzen.
Mit LLM SoccerArena entsteht damit ein neuartiger Realitätscheck für große Sprachmodelle. Die Fußball-Weltmeisterschaft 2026 wird so nicht nur zum sportlichen Großereignis, sondern auch zum wissenschaftlichen Experiment für die nächste Generation Künstlicher Intelligenz.