Rang #3 Lokale / Private KI — Ihr Gehirn, Ihre Maschine, Ihre Regeln
Alibaba (Qwen Team)

Qwen3.8-Flash-Next

Eine Vorschau auf die Qwen4-Architektur, die rund 180B Parameter speichert, aber pro Token nur 6B aktiviert. Sie bringt multimodale Fähigkeiten nahe der Spitze auf Maschinen mit viel RAM – sofern die ungewöhnliche Lizenz zu Ihrem Produkt passt.

Aktualisiert 29. August 2026 Open WeightsQwen License125B MoE
Am besten für

Eine Vorschau auf die Qwen4-Architektur, die rund 180B Parameter speichert, aber pro Token nur 6B aktiviert. Sie bringt multimodale Fähigkeiten nahe der Spitze auf Maschinen mit viel RAM – sofern die ungewöhnliche Lizenz zu Ihrem Produkt passt.

Warum es gewinnt

Artificial Analysis bewertet den gehosteten Weg mit 56 Punkten bei Intelligence und misst etwa 77 Token pro Sekunde. Der native Kontext umfasst 262K, aggressive Ein-Bit-GGUFs beginnen bei ungefähr 72,5 bis 75 GB, und die riesige N-Gramm-Tabelle kann aus dem knappen Beschleunigerspeicher ausgelagert werden.

Zu beachten

Der offene Checkpoint ist experimentell und nicht mit dem gehosteten Qwen3.8-Flash-SKU gleichzusetzen. Die Qwen Community License verlangt für kommerzielle MaaS- und KI-Arbeitsassistenten eine separate Lizenz; winzige Quantisierungen können Qualität verlieren, und selbst 75 GB liegen weit jenseits einer normalen Verbraucher-GPU.

01

Was es wirklich ist

Moderne Sprachmodelle werden meist leistungsfähiger, indem man ein größeres Lagerhaus aus Parametern baut und für jede Antwort mehr Kisten bewegt. Qwen3.8-Flash-Next versucht eine ungewöhnlichere Anordnung: ein großes Lager, eine kleine aktive Mannschaft und ein riesiger Phrasenindex, der in günstigem Speicher liegen kann.

Das eigentliche Sprachmodell umfasst 125 Milliarden Parameter und aktiviert pro Token ungefähr sechs Milliarden. Eine N-Gramm-Embedding-Tabelle mit 51 Milliarden Parametern speichert Muster aus kurzen Tokenfolgen; ein Modul für Multi-Token Prediction mit rund vier Milliarden Parametern hilft dabei, effizient mehr als ein künftiges Token zu erzeugen. Zusammengerundet beschreiben die Dateien etwa 180 Milliarden Parameter. „6B aktiv“ bezeichnet die Arbeit pro Schritt, nicht die Größe des Lagerhauses.

Auch die Attention ist hybrid. Die meisten Schichten verwenden Gated DeltaNet, ein Linear-Attention-System zur effizienten Weitergabe von Informationen. In regelmäßigen Abständen wählt Qwen Sparse Attention kleine Blöcke aus einem früheren, relevanten Kontext, statt jedes Token gleichermaßen zu prüfen. Stellen Sie sich vor, Sie lesen ein langes juristisches Archiv mithilfe eines Index, der auf einige wahrscheinlich passende Regale verweist. Der Index spart Laufwege; die Bücher existieren trotzdem.

Das Ergebnis beeindruckt in unabhängigen Tests. Artificial Analysis bewertet den gehosteten Weg im Intelligence Index mit 56 Punkten und misst bei der Decodierung ungefähr 77 Token pro Sekunde. Qwen meldet starke Werte für Coding, Büroarbeit und Werkzeugeinsatz, darunter 62,5 auf SWE-bench Pro und 73,9 auf dem internen CoWorkBench. Diese Werte beschreiben sorgfältig konfigurierte Systeme. Sie garantieren nicht, dass sich ein stark quantisierter lokaler Build identisch verhält.

Die lokale Größe hängt davon ab, welche Treppenstufe Sie wählen. Offizielles BF16 belegt in Dezimaleinheiten ungefähr 360 GB, offizielles FP8 rund 186 GB. Die aggressivsten GGUFs von Unsloth beginnen bei etwa 72,5 bis 75 GB – unter anderem, weil die N-Gramm-Tabelle mehr Präzision bewahrt, als das schlichte Schlagwort „ein Bit für alles“ vermuten lässt. Das kann auf einen Mac mit viel Speicher, einen Server oder eine ungewöhnliche Workstation passen. Auf eine gewöhnliche Grafikkarte mit 24 GB passt es nicht, und auch der KV-Cache braucht Platz.

Nativ umfasst der Kontext 262.144 Token. Mit statischem YaRN lässt er sich auf nahezu eine Million erweitern; Qwen warnt jedoch, dass dauerhaft aktives Scaling die Qualität bei kürzeren Prompts verschlechtern kann. Das gehostete Produkt Qwen3.8-Flash aktiviert standardmäßig ein Kontextfenster von einer Million Token und ergänzt offizielle Werkzeuge. Dieser gehostete SKU ist ein naher Verwandter, kein Synonym. Er besitzt eigene API-Preise, Caches, Verfügbarkeiten, Grenzen und Updates.

Die Lizenz ist der entscheidende Vorbehalt. Die Qwen Community License 1.0 gestattet Nutzung und Veränderung in weitem Umfang, verlangt für kommerzielle MaaS- und „AI Work Assistant“-Geschäfte aber eine separate Lizenz. Die Definition schließt eigenständige Assistenten für Coding und Büroproduktivität ausdrücklich ein. Produkte mit mehr als 100 Millionen monatlichen Nutzern oder $20 Millionen Monatsumsatz müssen außerdem den Modellnamen deutlich anzeigen. Interne Nutzung kann ausgenommen sein, sofern kein Dritter das Modell, seine Fähigkeiten oder seine Ausgaben erhält. Das ist nicht Apache 2.0.

Frühe Berichte aus der Community passen sowohl zum Versprechen als auch zur Jugend der Architektur. Betreiber loben die Leistung pro aktivem Parameter und demonstrieren auf spezialisierten Systemen brauchbare Geschwindigkeiten. Sie berichten ebenso von übermäßigem Nachdenken, hohem Kontextverbrauch, Fehlern wegen erschöpften Speichers, Cache-Verunreinigungen und Kernels, die erst mit den neuesten Laufzeiten funktionieren. Artificial Analysis zählte über seinen Index hinweg ungefähr 200 Millionen Output-Token – beinahe das Doppelte des Vergleichsmedians.

Qwen3.8-Flash-Next ist deshalb nicht die neue einfache Standardwahl für lokale KI. Diese Rolle behält Qwen3.8-27B, dessen Vier-Bit-Dateien unter Apache 2.0 in die Größenklasse von 18 GB passen. Flash-Next ist die Stufe darüber: ein faszinierendes Experiment für viel RAM, das sich der Leistungsspitze nähern kann, ohne Rechenleistung der Spitzenklasse aktivieren zu müssen. Verwenden Sie es, wenn Hardware, Geduld und Lizenz gleichermaßen passen – nicht bloß, weil sechs Milliarden klein klingen.

02

Stärken und ehrliche Grenzen

Zentrale Stärken

  • Sechs aktive Milliarden verändern die Rechnung beim Rechenaufwand: Ein MoE mit 125B Parametern leitet jedes Token an nur 10 Experten plus einen gemeinsamen Experten weiter, während eine N-Gramm-Tabelle mit 51B Parametern vor allem den Speicher statt die Rechenlast vergrößert. Das Design zielt auf hohe Leistung, ohne bei jedem Schritt ein riesiges Modell aktivieren zu müssen.
  • Die unabhängig gemessene Leistung ist ungewöhnlich hoch: Artificial Analysis vergibt für Flash-Next 56 Punkte bei Intelligence, nur einen Punkt weniger als für GLM-5.3-Flash, und misst mit rund 77 Token pro Sekunde eine schnellere Decodierung.
  • Multimodale und langkontextige Grundlagen sind enthalten: Der Checkpoint akzeptiert Text, Bilder und Videos, bietet nativ 262.144 Token und lässt sich mit statischem YaRN in Richtung einer Million konfigurieren.
  • Das Deployment-Ökosystem entstand schnell: Offizielle oder dokumentierte Wege umfassen Transformers, vLLM, SGLang, TokenSpeed, llama.cpp, MLX, Ollama-Pakete und GGUFs von Unsloth.

Ehrliche Einschränkungen

  • Die Lizenz kann gerade die naheliegende kommerzielle Nutzung verhindern: Ein kommerzielles MaaS-Angebot oder ein eigenständiges „AI Work Assistant“-Geschäft für Coding oder Büroarbeit benötigt eine separate Qwen-Lizenz. Große Produkte müssen außerdem Bedingungen zur Anzeige des Modellnamens beachten.
  • Flash-Next ist nicht das gehostete Flash: Qwen3.8-Flash ist ein verwalteter Produktions-SKU mit standardmäßig 1M Kontext und eingebauten Werkzeugen. Preis, Grenzen, Zuverlässigkeit und Ausgabe dürfen nicht stillschweigend jedem lokalen Checkpoint zugeschrieben werden.
  • Selbst die kleinste Quantisierung ist ein Projekt für viel RAM: Etwa 72,5 bis 75 GB umfassen ein aggressives Paket im Ein-Bit-Stil, noch ohne Laufzeit- und Kontextspeicher. Offizielles BF16 belegt ungefähr 360 GB dezimal, FP8 rund 186 GB.
  • Ausführliches Reasoning und junge Laufzeiten brauchen Aufsicht: Artificial Analysis beobachtete über seinen Index hinweg ungefähr 200M Output-Token; frühe Betreiber berichten zudem von OOM-Fehlern, Cache-Problemen, inkompatiblen Kernels und stark konfigurationsabhängiger Qualität.
03

Benchmark-Übersicht

Artificial Analysis Intelligence Index — 56

Unabhängige Tests des gehosteten Weges platzieren Flash-Next nahe der Open-Weight-Spitze. Sie belegen nicht denselben Wert für eine lokale 75-GB-Quantisierung.

Ausgabegeschwindigkeit — rund 77 Token/s

Im Test von Artificial Analysis decodiert das Modell schneller als GLM-5.3-Flash. Die erste Antwort erscheint dennoch später, weil Reasoning und Time to First Token getrennte Größen sind.

GDPval-AA v2 — etwa 1743 Elo im geprüften Snapshot

Ein starkes Signal für professionelle Aufgaben, allerdings mit Konfidenzintervall und einer beweglichen Live-Skala. Nennen Sie das Datum und behandeln Sie einen kleinen Abstand nicht als entscheidenden Sieg.

SWE-bench Pro — 62,5 (Qwen-Test)

Starke Repository-Reparatur in Qwens überarbeitetem Aufgabensatz und Claude-Code-Harness. Die Korrekturen an Aufgaben und das Harness verlangen eine klare Quellenangabe; der Wert ist kein universelles lokales Ergebnis.

OSWorld 2.0 — 19,4 binär / 52,3 teilweise (Qwen-Test)

Eine Erinnerung daran, dass starke Coding- und Bürowerte nicht automatisch zu starker vollständiger Computerbedienung werden. Das strenge binäre Ergebnis bleibt bescheiden.

04

Das Fazit

Qwen3.8-Flash-Next steigt in der Kategorie „Lokale / Private KI“ mit 9,0 Punkten auf Platz 3 (#3) ein. Qwen3.8-27B bleibt die beste Standardwahl auf Platz 1 (#1) für persönliche Rechner; GLM-5.3-Flash belegt wegen geringfügig stärkerer unabhängiger Leistung, nativem 1M-Kontext und klaren MIT-Rechten Platz 2 (#2). Flash-Next ist die faszinierende mittlere Treppenstufe: schneller, mit deutlich weniger aktiver Rechenleistung und dank aggressiver Quantisierung ab ungefähr 75 GB betreibbar. Wählen Sie es nach einer sorgfältigen Lizenzlektüre für interne Experimente und lokale Arbeit auf Systemen mit viel RAM. Bauen Sie keinen kommerziellen gehosteten Coding-Assistenten darauf auf, bevor Qwen Ihren Lizenzweg bestätigt hat, und verwenden Sie Ergebnisse des gehosteten Qwen3.8-Flash nicht als Beleg für eine ungetestete lokale Quantisierung.

05

Häufig gestellte Fragen