Bildgenerator

Deep floyd

DeepFloyd IF ist ein modulares Modell aus einem eingefrorenen Text-Encoder und drei kaskadierten Pixeldiffusionsmodulen: einem Basismodell für 64x64-px-Bilder aus Text-Prompts sowie zwei Superauflösungsmodellen für 256x256 px und 1024x1024 px.

Aufrufe 416,3M
Monatliche Besuche 416,3M
Globaler Rang ##76
Stimmen 0

Über dieses Tool

Wichtige Merkmale

DeepFloyd IF ist ein modulares Modell aus einem eingefrorenen Text-Encoder und drei kaskadierten Pixeldiffusionsmodulen: einem Basismodell, das anhand eines Text-Prompts Bilder mit 64x64 px erzeugt, sowie zwei Superauflösungsmodellen für Bilder mit 256x256 px und 1024x1024 px. Alle Stufen verwenden einen auf dem T5-Transformer basierenden eingefrorenen Text-Encoder zur Extraktion von Text-Embeddings. Diese werden einer UNet-Architektur mit Cross-Attention und Attention-Pooling zugeführt. Das Modell übertrifft aktuelle State-of-the-Art-Modelle und erreicht auf dem COCO-Datensatz einen Zero-Shot-FID-Wert von 6.66. Dies unterstreicht das Potenzial größerer UNet-Architekturen in der ersten Stufe kaskadierter Diffusionsmodelle.

Modi und Anwendungsfälle

  1. Dream (Text-zu-Bild): erzeugt Bilder anhand von Text-Prompts mit anpassbaren Parametern wie guidance_scale und sample_timestep_respacing.
  2. Zero-Shot-Bild-zu-Bild-Übersetzung: Die Ausgabe des Prompts wird im Stil von support_pil_img erzeugt, mit Unterstützung für Stile wie professionelles Origami, Ölkunst, Kunststoffbausteine und klassischen Anime.
  3. Superauflösung: IF-II, IF-III oder Stable x4 können auf ein Bild angewendet werden, das nicht zwingend mit IF erzeugt worden sein muss, um Bilder mit niedriger Auflösung hochzuskalieren.
  4. Zero-Shot-Inpainting: führt lokales Neuzeichnen auf Grundlage des bereitgestellten Originalbilds, der Inpainting-Maske und des Text-Prompts durch.

Nutzung und Integration

  • Die Integration erfolgt über die Hugging Face Diffusers-Bibliothek. Durch CPU-Offloading des Modells lässt sich die gesamte IF-Pipeline mit nur 14 GB VRAM ausführen. Bei torch>=2.0.0 müssen alle Funktionen enable_xformers_memory_efficient_attention() entfernt werden.
  • Erforderlich sind ein Hugging-Face-Konto, die Zustimmung zur Lizenz auf der Modellkarte und eine lokale Anmeldung mit huggingface_hub und einem Zugriffstoken.
  • Eine lokale Installation über die Python-Bibliothek deepfloyd_if ist ebenfalls möglich und benötigt xformers und CLIP.

Hardwareanforderungen

  • Für IF-I-XL (4.3B) und IF-II-L (1.2B) werden mindestens 16GB VRAM benötigt. Für den zusätzlichen Stable-x4-Upscaler bis 1024x1024 sind 24GB VRAM erforderlich. Außerdem werden xformers und die Umgebungsvariable FORCE_MEM_EFFICIENT_ATTN=1 benötigt.

Modellzoo und Umfang

Enthalten sind Modelle mit unterschiedlichen Parametergrößen, darunter IF-I-M (400M), IF-I-L (900M), IF-I-XL (4.3B), IF-II-M (450M), IF-II-L (1.2B) und IF-III-L (700M).

Preis und Lizenz

Der Code wird unter einer eigenen Lizenz mit bestimmten Einschränkungen veröffentlicht. Die erste Veröffentlichung des IF-Modells steht vorübergehend unter einer eingeschränkten Lizenz ausschließlich für Forschungszwecke. Später soll ein vollständig quelloffenes Modell veröffentlicht werden. Die Modellgewichte sind über Hugging Face kostenlos zugänglich.

Traffic-Analyse

Traffic-, Ranking- und Engagement-Signale für dieses Tool.

Globaler Rang ##76
Länder-Ranking #113
Monatliche Besuche 416,3M

Besuchstrend

Keine Trenddaten

Engagement

  • Absprungrate--
  • Seiten pro Besuch--
  • Durchschnittliche Dauer--

Traffic-Quellen

Keine Quelldaten

Top-Länder

Keine Länderdaten

Interface-Vorschau

Nutzerbewertungen