Ranking-Guide

Lokale Bildgenerierung — Pixel ohne Genehmigung

Die leistungsfähigsten Bildgeneratoren der Welt passen jetzt auf eine einzige GPU. Keine Cloud-Konten, keine Inhaltsfilter, keine monatlichen Gebühren — nur deine Hardware und eine Intelligenz, die Text in fotorealistische Bilder verwandelt, in Sekunden. Diese Open-Weight-Modelle demokratisieren, was einst Billionen-Dollar- Unternehmen vorbehalten war.

Die Entscheidung zuerst

Unser Ranking

Beginne mit dem Sieger und vergleiche dann die Abwägungen, die deine Wahl ändern könnten.

#1 Lokale Bildgenerierung

Qwen-Image-2512

Alibaba (Qwen Team)

Der Schwergewichtschampion der Open-Source-Bildgenerierung. Eine 27-Milliarden- Parameter-Architektur, die einen Diffusion Transformer mit einem Vision-Language-Modell verschmilzt und fotorealistische Menschen sowie zweisprachige Textdarstellung liefert, die es mit reinen Cloud-Diensten aufnehmen kann — alles unter Apache 2.0, was bedeutet: dir gehört jedes Pixel, das es generiert.

Warum es gewinnt

Bestplatziertes Apache 2.0 Open-Weight-Modell auf Arena.ai (Elo ~1.130). Fotorealistische menschliche Gesichter ohne Uncanny Valley. Zweisprachige Textdarstellung in Englisch und Chinesisch. Volle kommerzielle Rechte ohne jegliche Einschränkungen.

Der Haken

27 Milliarden Parameter sind eine Menge neuronales Netz zum Zuhause-Betreiben. Du brauchst eine RTX 4090 mit INT4-Quantisierung, um es auf ~14GB VRAM zu quetschen, und selbst dann bist du am Limit der Hardware. Die Dokumentation ist stark China-lastig.

8.6 Redaktionswertung
Test lesen
Am besten für

Der Schwergewichtschampion der Open-Source-Bildgenerierung. Eine 27-Milliarden- Parameter-Architektur, die einen Diffusion Transformer mit einem Vision-Language-Modell verschmilzt und fotorealistische Menschen sowie zweisprachige Textdarstellung liefert, die es mit reinen Cloud-Diensten aufnehmen kann — alles unter Apache 2.0, was bedeutet: dir gehört jedes Pixel, das es generiert.

Warum es gewinnt

Bestplatziertes Apache 2.0 Open-Weight-Modell auf Arena.ai (Elo ~1.130). Fotorealistische menschliche Gesichter ohne Uncanny Valley. Zweisprachige Textdarstellung in Englisch und Chinesisch. Volle kommerzielle Rechte ohne jegliche Einschränkungen.

Zu beachten

27 Milliarden Parameter sind eine Menge neuronales Netz zum Zuhause-Betreiben. Du brauchst eine RTX 4090 mit INT4-Quantisierung, um es auf ~14GB VRAM zu quetschen, und selbst dann bist du am Limit der Hardware. Die Dokumentation ist stark China-lastig.

#2

FLUX.2 Klein

Black Forest Labs

Der Bildgenerator des Volkes. Vom selben Team gebaut, das Stable Diffusion erschaffen hat, packt FLUX.2 Klein den FLUX-typischen Fotorealismus in Modelle, die klein genug sind, um auf einem durchschnittlichen Gaming-Laptop zu laufen. Die 4B-Variante braucht nur 8GB VRAM — das heißt, die RTX 4060 in deinem Uni-Laptop kann jetzt studioqualitative Bilder produzieren. Apache 2.0 lizenziert.

8.5 Redaktionswertung
Test lesen
#3

Z-Image

Alibaba Tongyi

Der Geschwindigkeitsdämon der lokalen Bildgenerierung. Ein 6-Milliarden-Parameter- Modell, das Bilder in 8 Inferenzschritten generiert — oft unter einer Sekunde — auf so bescheidener Hardware, dass andere KI-Modelle neidisch werden. Läuft auf 6GB VRAM mit Quantisierung. Apache 2.0 lizenziert. Wenn FLUX.2 Klein die Qualität demokratisiert hat, hat Z-Image die *Geschwindigkeit* demokratisiert.

8.3 Redaktionswertung
Test lesen
Fragen und Antworten

Häufig gestellte Fragen