Auftrags-Battle
Welches KI-Modell ist für Ihre Aufgabe das richtige? Hersteller-Benchmarks beantworten diese Frage selten neutral — dort liegt der eigene Kandidat auffällig oft vorn. Und die öffentlichen Ranglisten messen Allgemeinwissen, nicht Ihre Fachfrage, Ihre Dokumente oder Ihren Ton.
Ein Auftrags-Battle vermisst die Modelle Ihrer Wahl auf Ihrer echten Aufgabe. Die Antworten werden anonymisiert und blind bewertet, die Modelle begutachten sich gegenseitig, und in einer Challenge-Phase muss jede Antwort begründeter Kritik standhalten. Das Ergebnis ist ein nachvollziehbares Ranking mit Belegen — unabhängig von jedem Hersteller.
Die Methode dahinter ist KI-Battle , der Benchmark der Dunkel Cloud GmbH. Dieselbe Pipeline, mit der wir öffentliche Battles fahren, läuft auch für Ihren Auftrag — mit Ihren Modellen, Ihrer Aufgabe und Ihren Daten.
So läuft ein Auftrags-Battle ab
- Aufgabe definieren — Im Erstgespräch legen wir Thema, Fragestellung und Bewertungsschwerpunkte fest. Sie erhalten dabei einen anonymisierten Musterreport, damit Sie vorher wissen, was am Ende auf dem Tisch liegt.
- Modelle wählen — Cloud-Modelle von OpenAI, Anthropic oder Google, lokale Modelle via Ollama, OpenAI-kompatible Endpunkte oder Ihre eigenen Custom- und Fine-Tune-Setups.
- Battle & Report — Fragenkatalog, Antworten, Blind-Ranking, Challenges und Konsistenz-Check laufen automatisiert durch. Sie bekommen Ranking und Belege.
Was Sie bekommen
Unabhängig vom Paket:
- Gesamt-Ranking mit gewichteten Scores aus Peer-Anerkennung, Challenge-Erfolg und Konsistenz
- Vollständige Antworten aller Modelle auf alle Fragen
- Challenge-Protokoll — die gefundenen Fehler, jeweils mit Beleg
- Konsistenz- und Reproduzierbarkeits-Check
Bei einem vertraulichen Lauf erhalten Sie zusätzlich einen aufbereiteten PDF-Report. Bei einem veröffentlichten Lauf erscheint das Battle als Katalog-Eintrag, Video und Blogbeitrag auf ki-battle.de.
Pakete und Preise
Jedes Paket gibt es in zwei Varianten:
- Veröffentlicht — Das Battle darf nach Ihrer schriftlichen Freigabe auf ki-battle.de erscheinen. Sie profitieren vom günstigeren Preis und von der Reichweite eines öffentlichen Vergleichs.
- Vertraulich — Das Battle bleibt exklusiv bei Ihnen. Keine Veröffentlichung, kein Zugriff durch Dritte, PDF-Report statt Video.
| Paket | Umfang | Veröffentlicht | Vertraulich |
|---|---|---|---|
| S Kompakt | bis 4 Modelle | 1.900 € | 2.900 € |
| M Individual | bis 8 Modelle, eigene Modelle, erweiterter Fragenkatalog | 4.900 € | 7.900 € |
| L Maß | individueller Zuschnitt nach Erstgespräch | ab 12.500 € | |
| Re-Battle | neues Modell gegen ein bereits vermessenes Feld | ab 40 % des Paketpreises | |
Einführungspreise. Alle Preise netto zzgl. gesetzlicher MwSt.
S Kompakt — Ein Thema, bis zu vier Modelle aus dem Standardangebot der großen Anbieter, kompletter Lieferumfang. Der schnelle Weg zu einer belastbaren Antwort auf die Frage „welches Modell?".
M Individual — Bis zu acht Modelle, darunter Ihre eigenen Custom- oder Fine-Tune-Setups, und ein umfangreicherer Fragenkatalog. RAG-Setups sind hier nicht enthalten; sie gehören wegen des individuellen Aufwands in „L Maß".
L Maß — Individueller Zuschnitt: RAG-Setups, mehrere Themen, besondere Bewertungskriterien oder Modelle ohne API. Umfang und Preis legen wir im Erstgespräch fest.
Re-Battle — Ein neues Modell tritt später gegen das bereits vermessene Feld an, ohne dass Sie den ganzen Lauf noch einmal bezahlen. Ein vollständiger Neu-Lauf wird nach Umfang berechnet.
Vertraulichkeit
NDA und sauberes Datenhandling gelten für alle Pakete — auch ein veröffentlichter Lauf beginnt mit vertraulichen Kundendaten. Der Unterschied liegt allein in der Freigabe: Veröffentlicht wird nur nach Ihrer schriftlichen Zustimmung, und der günstigere Preis ist kein stillschweigender Verzicht auf diese Kontrolle.
Warum Sie dem Ergebnis trauen können
Der naheliegende Einwand lautet: „Da bewerten sich die KIs doch nur selbst." Genau dagegen ist das Verfahren gebaut:
- Blind-Bewertung — Beim Ranking sieht kein Modell, von welchem Modell eine Antwort stammt. Antworten sind anonymisiert und werden in mehreren Runden bewertet.
- Kein Selbst-Urteil — Ein Modell bewertet weder die eigene Antwort noch die selbst vorgeschlagene Frage.
- Challenge-Phase — Ein Modell kritisiert, das angegriffene Modell verteidigt sich, ein unbeteiligter Judge bewertet beide Seiten. Erfundene Kritik wird erkannt und bestraft, ein ehrliches „kein Fehler gefunden" belohnt.
- Manuelles Stichproben-Audit — Bei jedem Auftrag prüfen wir einen Teil der Judge-Urteile von Hand und weisen das Ergebnis im Report aus.
Technologie
KI-Battle ist ein Benchmark-Verfahren, das ohne kuratierten Musterlösungs-Datensatz auskommt: Die teilnehmenden Modelle erzeugen den Fragenkatalog zum gewählten Thema selbst und wählen per Abstimmung die trennschärfsten Fragen aus. Danach folgen Antworten, Blind-Ranking im Swiss-System, Challenges und ein Konsistenz-Check. Die Endnote ist eine gewichtete Aggregation dieser Phasen. Die Pipeline spricht OpenAI, Anthropic, Google und Ollama sowie OpenAI-kompatible Endpunkte; Custom-, Fine-Tune- und RAG-Setups lassen sich einhängen. KI-Battle wird von der Dunkel Cloud GmbH entwickelt und betrieben — öffentliche Battles finden Sie auf ki-battle.de .