Bildgenerator
Deep floyd
DeepFloyd IF ist ein modulares Modell aus einem eingefrorenen Text-Encoder und drei kaskadierten Pixeldiffusionsmodulen: einem Basismodell für 64x64-px-Bilder aus Text-Prompts sowie zwei Superauflösungsmodellen für 256x256 px und 1024x1024 px.
Über dieses Tool
Wichtige Merkmale
DeepFloyd IF ist ein modulares Modell aus einem eingefrorenen Text-Encoder und drei kaskadierten Pixeldiffusionsmodulen: einem Basismodell, das anhand eines Text-Prompts Bilder mit 64x64 px erzeugt, sowie zwei Superauflösungsmodellen für Bilder mit 256x256 px und 1024x1024 px. Alle Stufen verwenden einen auf dem T5-Transformer basierenden eingefrorenen Text-Encoder zur Extraktion von Text-Embeddings. Diese werden einer UNet-Architektur mit Cross-Attention und Attention-Pooling zugeführt. Das Modell übertrifft aktuelle State-of-the-Art-Modelle und erreicht auf dem COCO-Datensatz einen Zero-Shot-FID-Wert von 6.66. Dies unterstreicht das Potenzial größerer UNet-Architekturen in der ersten Stufe kaskadierter Diffusionsmodelle.
Modi und Anwendungsfälle
- Dream (Text-zu-Bild): erzeugt Bilder anhand von Text-Prompts mit anpassbaren Parametern wie
guidance_scaleundsample_timestep_respacing. - Zero-Shot-Bild-zu-Bild-Übersetzung: Die Ausgabe des Prompts wird im Stil von
support_pil_imgerzeugt, mit Unterstützung für Stile wie professionelles Origami, Ölkunst, Kunststoffbausteine und klassischen Anime. - Superauflösung: IF-II, IF-III oder Stable x4 können auf ein Bild angewendet werden, das nicht zwingend mit IF erzeugt worden sein muss, um Bilder mit niedriger Auflösung hochzuskalieren.
- Zero-Shot-Inpainting: führt lokales Neuzeichnen auf Grundlage des bereitgestellten Originalbilds, der Inpainting-Maske und des Text-Prompts durch.
Nutzung und Integration
- Die Integration erfolgt über die Hugging Face Diffusers-Bibliothek. Durch CPU-Offloading des Modells lässt sich die gesamte IF-Pipeline mit nur 14 GB VRAM ausführen. Bei
torch>=2.0.0müssen alle Funktionenenable_xformers_memory_efficient_attention()entfernt werden. - Erforderlich sind ein Hugging-Face-Konto, die Zustimmung zur Lizenz auf der Modellkarte und eine lokale Anmeldung mit
huggingface_hubund einem Zugriffstoken. - Eine lokale Installation über die Python-Bibliothek
deepfloyd_ifist ebenfalls möglich und benötigtxformersund CLIP.
Hardwareanforderungen
- Für IF-I-XL (4.3B) und IF-II-L (1.2B) werden mindestens 16GB VRAM benötigt. Für den zusätzlichen Stable-x4-Upscaler bis 1024x1024 sind 24GB VRAM erforderlich. Außerdem werden
xformersund die UmgebungsvariableFORCE_MEM_EFFICIENT_ATTN=1benötigt.
Modellzoo und Umfang
Enthalten sind Modelle mit unterschiedlichen Parametergrößen, darunter IF-I-M (400M), IF-I-L (900M), IF-I-XL (4.3B), IF-II-M (450M), IF-II-L (1.2B) und IF-III-L (700M).
Preis und Lizenz
Der Code wird unter einer eigenen Lizenz mit bestimmten Einschränkungen veröffentlicht. Die erste Veröffentlichung des IF-Modells steht vorübergehend unter einer eingeschränkten Lizenz ausschließlich für Forschungszwecke. Später soll ein vollständig quelloffenes Modell veröffentlicht werden. Die Modellgewichte sind über Hugging Face kostenlos zugänglich.
Traffic-Analyse
Traffic-, Ranking- und Engagement-Signale für dieses Tool.
Besuchstrend
Keine Trenddaten
Engagement
- Absprungrate--
- Seiten pro Besuch--
- Durchschnittliche Dauer--
Traffic-Quellen
Keine Quelldaten
Top-Länder
Keine Länderdaten