Rang #4 Lokale / Private KI — Ihr Gehirn, Ihre Maschine, Ihre Regeln
DeepSeek

DeepSeek-V4-Flash-0731

Ein effizientes Text- und Code-MoE mit 284 Milliarden Parametern, von denen 13 Milliarden aktiv sind, das auf Systemen der 128-GB-Klasse attraktiv bleibt. Neue multimodale Konkurrenten haben seinen kurzen Anspruch auf die Krone unter lokalen Agenten beendet.

Aktualisiert 29. August 2026 Open WeightsMIT1M Context
Am besten für

Ein effizientes Text- und Code-MoE mit 284 Milliarden Parametern, von denen 13 Milliarden aktiv sind, das auf Systemen der 128-GB-Klasse attraktiv bleibt. Neue multimodale Konkurrenten haben seinen kurzen Anspruch auf die Krone unter lokalen Agenten beendet.

Warum es gewinnt

Enorme Fortschritte bei agentischen Aufgaben gegenüber der Vorschauversion: 82.7 im Terminal-Bench 2.1 und 54.4 in DeepSWE. Hinzu kommt eine nahezu verlustfreie 4-Bit-Quantisierung mit nur 155 GB Speicherbedarf.

Zu beachten

Das Modell verarbeitet nur Text, benötigt selbst in einer aggressiven 3-Bit-Ausführung rund 103 GB und die meisten seiner herausragenden Agentenwerte stammen aus Herstellertests. Qwen und GLM Flash bieten inzwischen leistungsfähigere oder vollständigere Pakete für private Agenten.

01

Was es wirklich ist

Wenn es um lokale KI geht, dreht sich das Gespräch meist um Kompromisse. Entweder bekommt man ein riesiges Modell, für dessen Betrieb eine Serverfarm nötig ist, oder ein kleines Modell, das während einer komplexen Coding-Sitzung Mühe hat, den Zusammenhang zu bewahren. DeepSeek-V4-Flash-0731 durchbricht diesen Gegensatz.

Flash-0731 erschien am 31. Juli 2026 als reines Post-Training-Upgrade und verwendet exakt dieselbe MoE-Architektur mit insgesamt 284 Milliarden und 13 Milliarden aktiven Parametern wie die frühere Vorschauversion. Trotzdem sind die durch dieses Update freigesetzten Fähigkeiten verblüffend. Im Terminal-Bench 2.1 steigt das Modell auf 82.7 und kommt damit dem geschlossenen Schwergewicht Opus 4.8 sehr nahe. In DeepSWE springt es von bescheidenen 7.3 auf beeindruckende 54.4. Das zeigt: Für einen Agenten auf Frontier-Niveau braucht man keine Billion Parameter. Man muss einem hocheffizienten Modell vielmehr gezielt beibringen, Werkzeuge zu nutzen, durch Terminals zu navigieren und sich von eigenen Fehlern zu erholen.

Das Geheimnis von Flash-0731 liegt in seiner sparsamen Architektur. Weil bei der Inferenz nur 13 Milliarden Parameter aktiv sind, benötigt es deutlich weniger Speicherbandbreite als gewaltige dichte Modelle oder schwerere MoEs wie GLM-5.2. Bei sorgfältiger Quantisierung mit den dynamischen GGUF-Formaten von Unsloth schrumpft die 3-Bit-Version auf etwa 103 GB RAM. Damit überschreitet sie eine entscheidende Schwelle: Autonomes Coding auf Frontier-Niveau wird für einzelne Entwickler mit 128 GB Unified Memory erreichbar, statt ausschließlich Unternehmensteams mit Multi-GPU-Clustern vorbehalten zu bleiben.

Das Modell ist gegenüber Bildern völlig blind, und in aktuellen unabhängigen Tests der allgemeinen Intelligenz liegt es hinter neueren Flash-Veröffentlichungen von GLM und Qwen. Für seinen vorgesehenen Einsatz — als kosteneffizienter Text- und Code-Agent auf einem System der 128-GB-Klasse — bleibt es stark, ist aber nicht länger konkurrenzlos.

Die MIT-Lizenz, der Kontext von 1 Million Token und die DSpark-Unterstützung machen DeepSeek weiterhin zu einer nützlichen Blaupause für effiziente lokale KI. Der Unterschied: Diese Blaupause steht nun im vierten statt im ersten Regal — als fokussierte Text- und Code-Option für Menschen, die rund 103 GB entbehren können und keine native Bildverarbeitung benötigen.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Agentische Stärke bei sparsamem Betrieb: Dies ist nicht einfach ein weiteres offenes Modell, sondern ein spezialisiertes Kraftpaket für Agenten. Mit 82.7 im Terminal-Bench 2.1 — fast auf dem Niveau von Opus 4.8 — und 54.4 in DeepSWE zeigt Flash-0731, dass Post-Training Werkzeugnutzung und mehrstufiges Denken auf Frontier-Niveau freisetzen kann, ohne das Basismodell aufzublähen.
  • Außergewöhnliche Hardware-Effizienz: Von insgesamt 284 Milliarden Parametern sind nur 13 Milliarden aktiv, weshalb das Modell nur einen Bruchteil der Speicherbandbreite seiner Konkurrenten benötigt. Mit den dynamischen GGUFs von Unsloth passt die 3-Bit-Version in etwa 103 GB RAM und läuft damit auf MacBooks mit 128 GB Unified Memory. Für ambitionierte lokale Entwickler ist es tatsächlich erreichbar.
  • Freiheit durch die MIT-Lizenz: DeepSeek hält mit einer MIT-Lizenz an seinem Open-Source-Kurs fest. Sie können die Gewichte herunterladen, quantisieren und ohne Einschränkungen kommerziell einsetzen. Keine versteckten Bedingungen, keine Abhängigkeit von einer API — nur lokale Rechenleistung.
  • 1 Million Token Kontext für große Aufgaben: Flash-0731 übernimmt das riesige Kontextfenster von 1 Million Token aus der Vorschauversion und ist damit wie geschaffen für die Analyse vollständiger Codebasen. Die Unterstützung für spekulatives Dekodieren mit DSpark kann den Durchsatz bei gewaltigen Logdateien oder Repositories deutlich erhöhen.

Ehrliche Einschränkungen

  • Nur Text und Code: Wie viele spezialisierte Coding-Modelle besitzt es keine native Bildverarbeitung. UI-Screenshots oder Diagramme lassen sich nicht zur Fehlersuche einspeisen. Wenn Ihr Workflow stark auf multimodalen Eingaben beruht, brauchen Sie ein separates Vision-Modell.
  • Die allgemeine Leistungsfähigkeit gehört nicht mehr zur Spitze: Sein Artificial Analysis Intelligence Index von rund 50 liegt hinter neueren GLM- und Qwen-Flash-Modellen im mittleren bis hohen 50er-Bereich. DeepSeek bleibt ein Spezialist und ist nicht die vielseitigste private Werkbank.
  • Risiken aggressiver Quantisierung: Dass eine 3-Bit-Quantisierung in 103 GB passt, ist beeindruckend; eine derart starke Komprimierung kann jedoch komplexes Denken beeinträchtigen. Sie müssen prüfen, ob die 3-Bit-Version genau die feinen agentischen Verhaltensweisen beibehält, die Ihr konkreter Testaufbau verlangt.
03

Benchmark-Übersicht

Terminal-Bench 2.1 — 82.7

Ein gewaltiger Sprung bei der agentischen Terminalnutzung, der das Modell in Reichweite von Claude 4.8 Opus mit 85.0 bringt.

DeepSWE — 54.4

Ein beeindruckender Sprung vom Wert 7.3 der Vorschauversion, der die Wirkung des Post-Trainings vom 31. Juli zeigt.

Architektur — 284B insgesamt / 13B aktiv

Ein stark sparsames Mixture-of-Experts-Design, das FLOPs und Speicherbandbreite reduziert und so eine robuste Leistung auf begrenzter Hardware ermöglicht.

AutomationBench Public — 25.1

Fast doppelt so hoch wie der Wert von GLM-5.2 mit 12.9 — ein Beleg für die Überlegenheit bei autonomer, mehrstufiger Ausführung.

04

Das Fazit

DeepSeek-V4-Flash-0731 rückt in der Kategorie „Lokale / Private KI“ mit einer Bewertung von 9.0 auf Platz 4. Seine Quantisierung für Systeme ab etwa 103 GB, die MIT-Lizenz, der Kontext von 1 Million Token und die starke Ausrichtung auf Text und Terminal machen es weiterhin zu einer überzeugenden Option für Rechner mit 128 GB. Die Bezeichnung „Goldstandard“ ist nicht mehr angebracht: Qwen3.8-27B lässt sich erheblich leichter betreiben, GLM-5.3-Flash ist leistungsfähiger und multimodal, und Qwen3.8-Flash-Next aktiviert noch weniger Rechenleistung. Wählen Sie DeepSeek, wenn Agentenarbeit mit Text und Code wichtiger ist als visuelle Eingaben und seine konkrete Quantisierung in Ihrem Testaufbau gut abschneidet.

05

Häufig gestellte Fragen