Generatore di immagini
Deep floyd
DeepFloyd IF è un modello modulare composto da un encoder di testo congelato e tre moduli di diffusione dei pixel in cascata: un modello di base che genera immagini da 64x64 px a partire da un prompt testuale e due modelli di super-risoluzione per immagini da 256x256 px e 1024x1024 px.
Informazioni su questo strumento
Caratteristiche principali
DeepFloyd IF è un modello modulare composto da un encoder di testo congelato e tre moduli di diffusione dei pixel in cascata: un modello di base che genera immagini da 64x64 px in base a un prompt testuale e due modelli di super-risoluzione progettati per generare immagini da 256x256 px e 1024x1024 px. Tutte le fasi utilizzano un encoder di testo congelato basato sul transformer T5 per estrarre gli embedding testuali, che vengono poi inviati a un'architettura UNet potenziata con attenzione incrociata e attention pooling. Il modello supera gli attuali modelli all'avanguardia e raggiunge un punteggio FID zero-shot di 6.66 sul dataset COCO, evidenziando il potenziale di architetture UNet più grandi nella prima fase dei modelli di diffusione in cascata.
Modalità e casi d'uso
- Dream (da testo a immagine): genera immagini a partire da prompt testuali con parametri personalizzabili come
guidance_scaleesample_timestep_respacing. - Traduzione zero-shot da immagine a immagine: l'output del prompt viene creato nello stile di
support_pil_img, con supporto a stili come origami professionale, arte a olio, mattoncini da costruzione in plastica e anime classico. - Super-risoluzione: è possibile eseguire IF-II, IF-III o Stable x4 su un'immagine non necessariamente generata da IF per portare immagini a bassa risoluzione a una risoluzione maggiore.
- Inpainting zero-shot: esegue il ridisegno locale in base all'immagine originale, alla maschera di inpainting e al prompt testuale forniti.
Utilizzo e integrazione
- È integrato con la libreria Hugging Face Diffusers e utilizza il trasferimento del modello sulla CPU per eseguire l'intera pipeline IF con appena 14 GB di VRAM. Se si usa
torch>=2.0.0, tutte le funzionienable_xformers_memory_efficient_attention()devono essere eliminate. - È necessario avere un account Hugging Face, accettare la licenza nella scheda del modello ed effettuare l'accesso localmente tramite
huggingface_hubcon un token di accesso. - È disponibile anche l'installazione locale tramite la libreria Python
deepfloyd_if, che richiedexformerse CLIP.
Requisiti hardware
- Sono necessari almeno 16GB di VRAM per IF-I-XL (4.3B) e IF-II-L (1.2B), mentre servono 24GB di VRAM per includere anche l'upscaler Stable x4 fino a 1024x1024. Sono richiesti
xformerse la variabile d'ambienteFORCE_MEM_EFFICIENT_ATTN=1.
Zoo dei modelli e dimensioni
Include modelli con diverse dimensioni dei parametri, tra cui IF-I-M (400M), IF-I-L (900M), IF-I-XL (4.3B), IF-II-M (450M), IF-II-L (1.2B) e IF-III-L (700M).
Prezzi e licenza
Il codice è rilasciato con una licenza specifica che include alcune restrizioni. Il rilascio iniziale del modello IF è temporaneamente soggetto a una licenza limitata ai soli scopi di ricerca, con l'intenzione di pubblicare in seguito un modello completamente open source. I pesi del modello sono disponibili gratuitamente tramite Hugging Face.
Analisi del traffico
Segnali di traffico, ranking e coinvolgimento per questo strumento.
Tendenza delle visite
Nessun dato sulla tendenza
Coinvolgimento
- Frequenza di rimbalzo--
- Pagine per visita--
- Durata media--
Fonti di traffico
Nessun dato sulle fonti
Paesi principali
Nessun dato sui paesi