Reichen lokale KI-Modelle für deutsche Fachaufgaben?
Von Axel Dunkel
Reicht ein Sprachmodell, das im eigenen Rechenzentrum läuft, für deutsche Fachaufgaben? Oder führt an den großen Cloud-Modellen kein Weg vorbei?
Wer KI auf eigener Hardware betreiben will, braucht darauf eine belastbare Antwort. Davon hängt ab, ob vertrauliche Daten das Haus verlassen müssen. Die üblichen Ranglisten liefern diese Antwort selten. Sie messen meist Allgemeinwissen, fast immer auf Englisch und kaum je ein deutsches Fachthema. Und in den Benchmarks der Hersteller liegt auffällig oft das eigene Modell vorn.
Deshalb haben wir KI-Battle gebaut. Seit dem 17. September 2026 ist es online und beantwortet die Frage Thema für Thema, mit einem eigenen Lauf je Fachgebiet. Das erste Ergebnis vorweg: Ein lokal betreibbares Modell hat ein Cloud-Modell geschlagen. Nur läuft es auf keinem Rechner, der unter einen Schreibtisch passt.
Wie ein Battle abläuft
Mehrere Sprachmodelle treten zu einem Thema gegeneinander an, Cloud-Modelle und lokal betreibbare im selben Lauf, alles auf Deutsch. Schon die Fragen stammen von den Modellen. Jedes schlägt welche vor, gemeinsam wählen sie aus, was in den Katalog kommt, von leicht bis schwer. Danach beantwortet jedes Modell jede Frage für sich.
Bewertet wird blind. Die Modelle vergleichen die anonymisierten Antworten in mehreren Runden. Keines weiß, von wem eine Antwort stammt, und keines bewertet die eigene. Wie bei einem Schachturnier entsteht aus vielen einzelnen Vergleichen eine Rangliste.
Dann beginnt die Fehlersuche. Ein Modell greift die Antwort eines anderen an, das angegriffene verteidigt sich, ein unbeteiligtes drittes entscheidet. Gezählt wird nur, was bestätigt ist, und wer einen Fehler erfindet, verliert Punkte. Zum Schluss bekommt jedes Modell seine Fragen noch einmal in anderer Formulierung. Wer dabei stabil antwortet, punktet.
Wir selbst bewerten keine einzige Antwort, und Musterlösungen braucht das Verfahren nicht. Deshalb funktioniert es auch bei Themen ohne fertigen Testkatalog.
Der naheliegende Einwand lautet: Da benoten sich die KIs doch nur gegenseitig. Das stimmt, und es hat eine Grenze. Irren sich alle Modelle an derselben Stelle, bemerkt es keines von ihnen. Ein Battle zeigt also, welches Modell sich im Feld durchsetzt. Fehlerfreie Antworten garantiert es nicht.
Das erste Battle: deutsche Rechtschreibung und Grammatik
Acht Modelle haben 16 Fragen beantwortet, von der einfachen Verbbestimmung bis zu Ersatzinfinitiv und Zustandspassiv. Zwei davon laufen in der Cloud, sechs lassen sich selbst betreiben. Aus Deutschland kam keines: Die Cloud-Modelle stammen aus den USA, die lokal betreibbaren aus China und den USA. Der Lauf stammt vom 7. August 2026.
Gewonnen hat Claude Opus 5 mit 88,8 Punkten. Der Vorsprung von gut zehn Punkten hält der statistischen Prüfung stand: Über 317 Duelle hinweg überlappen die Unsicherheitsbereiche von Platz 1 und 2 nicht. Auf Platz 2 folgt mit 78,5 Punkten Kimi K3, ein lokal betreibbares Modell, noch vor dem zweiten Cloud-Modell im Feld, GPT-5.5 (73,8). Bei der Konsistenz lag Kimi K3 sogar vorn. Allerdings ist das Modell riesig. Allein seine Gewichte belegen rund 1,5 Terabyte.
Und auf einem einzelnen Rechner? In der Klasse bis 16 GB Grafikspeicher, also dem, was eine gut ausgestattete Workstation schafft, lag Gemma 4 12B vorn. Das Modell kommt mit rund 9 GB aus. In der Gesamtwertung reichte es mit 56,6 Punkten für Platz 7 von 8. Das zweite Modell dieser Klasse, GPT-OSS 20B, wurde mit 44,3 Punkten Letzter. Vor dem Lauf hatte sich Gemma mit 9,0 von 10 die höchste Selbstnote des Feldes gegeben. Der spätere Sieger blieb bei 8,0.
34 Fehler haben sich die acht Modelle gegenseitig nachgewiesen, darunter erfundene Paragrafen des amtlichen Regelwerks und falsch zugeschriebene Duden-Regeln. Ein Modell schrieb „zu zuzubereiten“, ausgerechnet in einer Tabelle, die typische Fehler korrigieren sollte. Ein anderes erklärte den Apostroph in „Andreas’ Buch“ damit, dass der Name auf einen Vokal ende. Ein Muster zog sich durch: Der Kern einer Antwort stimmte, die Fehler kamen mit dem Beiwerk, sobald ein Modell Regeln herleitete und zu erfinden begann.
Für die Eingangsfrage heißt das: „Cloud oder lokal“ ist die falsche Trennlinie. Das Feld zerfällt in drei Klassen: Cloud-Modelle, große selbst betriebene Modelle und kleine Modelle für einen einzelnen Rechner. Ein großes lokales Modell spielt in der Liga der Cloud mit, braucht dafür aber einen Serverraum. Die kleine Klasse belegte bei diesem Thema die beiden letzten Plätze. Ob das bei DSGVO oder IPv6 genauso aussieht, zeigen die nächsten Battles.
Auf www.ki-battle.de stehen das vollständige Ranking und alle Antworten in voller Länge, dazu jeder belegte Fehler.
Die nächsten Termine
Neue Battles erscheinen im Katalog auf www.ki-battle.de donnerstags um 17 Uhr. Als Nächstes:
- 8. Oktober: Networking mit LinkedIn, von der Vernetzungsanfrage bis zum Employee-Advocacy-Programm
- 15. Oktober (geplant): Qwen 3.8 27B in fünf Größen, vom Original bis zur stark komprimierten Fassung. Wie viel Wissen bleibt dabei übrig?
- 22. Oktober: DSGVO in Theorie und Praxis
- 5. November: IPv6 Networking
Auf unserem YouTube-Kanal gibt es zu jedem Battle ein Video von acht bis neun Minuten. Wie das Verfahren funktioniert, erklärt dort ein eigenes Video: Wie testet man KI ohne Musterlösung?
Und Ihre eigene Aufgabe?
Rechtschreibung ist ein Beispiel. Ihre Frage lautet vermutlich anders: Welches Modell taugt für unsere Verträge oder für unsere Support-Anfragen? Ein Modell, das Grammatik beherrscht, kann bei Vertragsklauseln anders abschneiden. Messen lässt sich das nur an der Aufgabe selbst.
Dafür bieten wir das Auftrags-Battle an. Dieselbe Pipeline läuft dann mit Ihrer Aufgabe und den Modellen Ihrer Wahl, eigene Fine-Tunes eingeschlossen und auf Wunsch vertraulich. Weil auch ein einhelliges Urteil unter Modellen falsch sein kann, prüfen wir bei jedem Auftrag einen Teil der Urteile von Hand und weisen das Ergebnis im Report aus.
Weitere Beiträge zu: