Local Suite Benchmark: Wenn die Cloud-Baseline auf die Fresse fliegt
Tja... manchmal liefert so ein Benchmark-Lauf Zahlen, bei denen man zweimal hinschauen muss. Nicht weil sie kompliziert sind, sondern weil sie einem ins Gesicht grinsen.
Ich hab die komplette Local Suite nochmal durch die Mangel gedreht. Alles, was bei mir lokal auf der GPU brutzelt, dazu als Referenz die üblichen Cloud-Verdächtigen: Claude Fable-5, Claude Sonnet-5 und Gemini 3.6 Flash.
Das Ergebnis? Ein Sammelsurium aus stillen Überfliegern, lauten HuggingFace-Enttäuschungen und einem Premium-API-Anbieter, der sich bei zwei von vier Kategorien komplett blamiert hat. Kommt rein.
(Disclaimer: Ja, der Stempel da oben hat Recht. Der Text ist KI-unterstützt, aber von mir persönlich moderiert und in Form geprügelt. ;)
🧪 Der Testaufbau
Vier Kategorien, ein Haufen lokaler Modelle, drei Cloud-Baselines. Keine Wohlfahrtsveranstaltung, keine Schonfrist:
- Performance – reine Token-Geschwindigkeit, t/s
- Planning – kann das Ding einen Plan bauen und den auch einhalten
- Structured Output – hält es sich an das geforderte Format, oder faselt es frei Schnauze
- Needle in Haystack – findet es die Nadel im Heuhaufen, oder erzählt es mir was es glaubt gefunden zu haben
- Multi-turn – bleibt der Kontext über mehrere Turns stabil, oder verabschiedet sich das Modell schon nach Runde 2
Und ja, bei qwen3:14b fehlt in der Performance-Zeile ein Wert. Das Ding hat den Durchlauf einfach nicht sauber durchgezogen. Passiert. Steht als … in der Tabelle, weil ich hier keine Zahlen erfinde. Auch nicht für die Optik.
Die Zahlen
| Benchmark | deepseek-coder-v2:16b | deepseek-r1:14b | deepseek-r1:7b | dolphin-llama3:8b | gemma3:12b | gemma4:31b | Qwen3.6-27B-NVFP4-A | Qwen3.6-27B-Heretic:Q4_K_M | Qwen3.6-35B-HauhauCS:IQ3_M | Qwen3.6-27B:Q4_K_M | gemma-4-12B-Composer2.5:Q4_K_M | qwen2.5-coder:14b | qwen2.5-coder:32b | qwen2.5-coder:7b | qwen2.5:14b | qwen3.6-35b-nolimit:IQ3_M | qwen3:14b | qwen3:4b | claude-fable-5 | claude-sonnet-5 | gemini-3.6-flash |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| ⚡ Performance | 14.7 t/s | 19.6 t/s | 77.2 t/s | 66.4 t/s | 40.2 t/s | 1.6 t/s | 23.2 t/s | 6.6 t/s | 45.4 t/s | 4.1 t/s | 50.4 t/s | 44.9 t/s | 2.4 t/s | 75.3 t/s | 23.6 t/s | 65.0 t/s | … | 155.5 t/s | 73.1 t/s | 116.2 t/s | 88.2 t/s |
| 🧠 Planning | 78.8% | 70.8% | 68.3% | 0.0% | 37.5% | 0.0% | 0.0% | 0.0% | 0.0% | 0.0% | 77.5% | 77.5% | 78.8% | 38.8% | 77.5% | 0.0% | 0.0% | 0.0% | 0.0% | 0.0% | 77.5% |
| 📋 Structured Output | 100.0% | 75.0% | 50.0% | 100.0% | 100.0% | 25.0% | 0.0% | 0.0% | 25.0% | 0.0% | 100.0% | 93.8% | 100.0% | 93.8% | 100.0% | 0.0% | 0.0% | 0.0% | 25.0% | 75.0% | 100.0% |
| 🔍 Needle in Haystack | 100.0% | 0.0% | 0.0% | 100.0% | 100.0% | 0.0% | 0.0% | 0.0% | 0.0% | 0.0% | 20.0% | 100.0% | 100.0% | 100.0% | 100.0% | 0.0% | 0.0% | 0.0% | 0.0% | 80.0% | 100.0% |
| 💬 Multi-turn | 100.0% | 100.0% | 33.3% | 100.0% | 100.0% | 100.0% | 66.7% | 100.0% | 100.0% | 66.7% | 100.0% | 100.0% | 100.0% | 100.0% | 100.0% | 100.0% | 33.3% | 100.0% | 0.0% | 0.0% | 100.0% |
🔎 Was die Zahlen erzählen
Fangen wir mit dem Elefanten im Raum an: Claude Sonnet-5 liefert bei Performance und Structured Output solide Werte, fällt aber bei Planning und Multi-turn auf glatte 0.0% – zwei von vier nicht-Speed-Kategorien komplett verkackt. Für eine Premium-Cloud-API ist das... suboptimal, um es freundlich zu formulieren.
Gemini 3.6 Flash dagegen räumt quasi überall ab – Planning, Structured Output, Needle in Haystack und Multi-turn jeweils zwischen 77.5% und 100.0%. Wer auf Cloud setzt, hat hier offenbar den saubereren Allrounder am Start.
Bei den lokalen Modellen ist das Bild gespalten: Die qwen2.5-coder-Familie (7b, 14b, 32b) zieht über fast alle Kategorien konstant durch, während die ganzen HuggingFace-Finetunes (Heretic, HauhauCS, NVFP4-A, Composer2.5) bei Planning und Needle in Haystack reihenweise auf 0.0% absacken – trotz teils respektabler Performance-Werte. Sieht nach Modellen aus, die auf Benchmarks trainiert wurden, die mit meinen nicht viel gemein haben.
Und qwen3:14b bleibt der Wackelkandidat des Durchlaufs: fehlender Performance-Wert, 0.0% bei Needle in Haystack, nur 33.3% bei Multi-turn. Muss ich nochmal separat durchjagen.
Fazit
Was bleibt hängen? Rohe Token-Geschwindigkeit sagt nichts über Zuverlässigkeit aus – die schnellsten Modelle im Perf-Ranking sind nicht zwangsläufig die, die bei Planning oder Multi-turn nicht einbrechen. Und: Cloud ist nicht automatisch besser. Gemini 3.6 Flash zeigt, wie es geht, Claude Sonnet-5 zeigt in dieser Runde, wie es nicht geht.
Für meine eigene Pipeline heißt das: kein Modell blind vertrauen, nur weil der Name Eindruck macht. Erst durch die Suite jagen, dann einsetzen.
Stay secure, bleibt pragmatisch.
Cheers,
MrMarco ;)
Footnote: Dieser Inhalt wurde mit Hilfe von KI-Modellen generiert und anschließend durch einen Menschen (mich!) moderiert, korrigiert und in den typischen MrMarco-Stil übersetzt.
Transparency Note: Einige Inhalte, Code-Snippets und Beschreibungen in diesem Post wurden mittels KI (LLMs / Vibecoding) erstellt oder unterstützt, jedoch von mir persönlich kuratiert, überarbeitet und geprüft. Die Benchmark-Zahlen stammen 1:1 aus meiner llmbenchy-Suite – nichts davon ist erfunden.