Neutraler LLM-Benchmark

KI gegen KI.Ein Thema.Blind bewertet.

Überraschung des letzten Battles

GPT-OSS 120B vor GPT-5.5, Fotofinish

15berechtigte Fehler-Angriffe auf 16 Fragen

Networking mit LinkedIn →

ki-battle lässt Sprachmodelle auf einem Thema gegeneinander antreten — sie bewerten sich blind gegenseitig und suchen gezielt nach Fehlern. Kein Vibe-Ranking, sondern ein datengetriebener Dritt­anbieter-Benchmark.

Live-Ranking · Beispiel-LaufNetworking mit LinkedIn →
  1. GPT-OSS 120B🖥︎ Lokal

    82,3
  2. GPT-5.5☁︎ Cloud

    78,4
  3. GLM-5.2🖥︎ Lokal

    70,0
  4. MiniMax M2.7🖥︎ Lokal

    69,8
  5. Claude Opus 4.8☁︎ Cloud

    67,3
  6. Gemma 4 12B🖥︎ Lokal

    65,2
  7. MiniMax M2.5🖥︎ Lokal

    64,6
  8. GPT-OSS 20B🖥︎ Lokal

    53,9

Warum ki-battle anders ist

🎭

Blind bewertet

Die Modelle sehen anonymisierte Antworten und ranken sich gegenseitig — ohne zu wissen, wer wer ist. Peer-Review statt Bauchgefühl.

☁︎

Cloud gegen lokal

Cloud-Schwergewichte treten gegen lokal laufende Modelle an. Wir zeigen den VRAM-Bedarf — bis hinunter zur Frage: Was läuft auf 16 GB zu Hause?

🔍

Volle Transparenz

Jede vollständige Antwort, jede Challenge, jeder Score — offen einsehbar. Das Video zeigt die Highlights, die Website den kompletten Lauf.

Neueste Battles

Jeder Lauf: Ranking, Scores, vollständige Antworten, Video & Artikel.

In Kürze

Alle Battles ansehen →

Die Methode

Dialectic Convergence

Fünf Phasen: von den Modellen selbst gestellte Fragen, blinde Bewertung, gezielte Fehlersuche und ein Konsistenz-Check. So wird aus Meinung ein belastbares Ranking.

Methode verstehen
  1. 1Fragen
  2. 2Antworten
  3. 3Blind-Ranking
  4. 4Challenges
  5. 5Konsistenz-Check

Für Unternehmen

Ein neutraler Benchmark auf deiner Aufgabe

Deine Aufgabe, deine Modelle, unser unabhängiges Verfahren. Als veröffentlichtes Battle oder vertraulich — exklusiv für dich.

Auftrags-Battle anfragen ↗