Generador de imágenes
Deep floyd
DeepFloyd IF es un modelo modular compuesto por un codificador de texto congelado y tres módulos de difusión de píxeles en cascada: un modelo base que genera imágenes de 64x64 px a partir de un prompt de texto y dos modelos de superresolución que generan imágenes de 256x256 px y 1024x1024 px.
Acerca de esta herramienta
Características principales
DeepFloyd IF es un modelo modular compuesto por un codificador de texto congelado y tres módulos de difusión de píxeles en cascada: un modelo base que genera imágenes de 64x64 px a partir de un prompt de texto y dos modelos de superresolución diseñados para generar imágenes de 256x256 px y 1024x1024 px. Todas las etapas utilizan un codificador de texto congelado basado en el transformador T5 para extraer embeddings de texto, que se introducen en una arquitectura UNet mejorada con atención cruzada y agrupación de atención. El modelo supera a los modelos actuales de vanguardia y alcanza una puntuación FID zero-shot de 6.66 en el conjunto de datos COCO, lo que subraya el potencial de arquitecturas UNet más grandes en la primera etapa de los modelos de difusión en cascada.
Modos y casos de uso
- Dream (texto a imagen): genera imágenes a partir de prompts de texto con parámetros personalizables como
guidance_scaleysample_timestep_respacing. - Traducción de imagen a imagen zero-shot: la salida del prompt adopta el estilo de
support_pil_img, con estilos como origami profesional, arte al óleo, bloques de construcción de plástico y anime clásico. - Superresolución: permite ejecutar IF-II, IF-III o Stable x4 sobre una imagen que no tiene que haber sido generada por IF para ampliar imágenes de baja resolución a alta resolución.
- Relleno zero-shot: realiza un repintado local basándose en la imagen original, la máscara de relleno y el prompt de texto proporcionados.
Uso e integración
- Está integrado con la biblioteca Hugging Face Diffusers y utiliza la descarga de modelos a la CPU para ejecutar todo el flujo IF con tan solo 14 GB de VRAM. Con
torch>=2.0.0, deben eliminarse todas las funcionesenable_xformers_memory_efficient_attention(). - Es necesario tener una cuenta de Hugging Face, aceptar la licencia en la tarjeta del modelo e iniciar sesión localmente con
huggingface_hubmediante un token de acceso. - También está disponible la instalación local mediante la biblioteca Python
deepfloyd_if, que requierexformersy CLIP.
Requisitos de hardware
- Se necesitan como mínimo 16GB de VRAM para IF-I-XL (4.3B) e IF-II-L (1.2B), y 24GB de VRAM para incluir también el escalador Stable x4 hasta 1024x1024. Se requiere
xformersy configurar la variable de entornoFORCE_MEM_EFFICIENT_ATTN=1.
Zoo de modelos y escala
Incluye modelos con distintos tamaños de parámetros, como IF-I-M (400M), IF-I-L (900M), IF-I-XL (4.3B), IF-II-M (450M), IF-II-L (1.2B) e IF-III-L (700M).
Precio y licencia
El código se distribuye bajo una licencia específica con ciertos puntos restringidos. El lanzamiento inicial del modelo IF está temporalmente sujeto a una licencia limitada exclusivamente a fines de investigación, con la intención de publicar posteriormente un modelo completamente de código abierto. Los pesos del modelo están disponibles gratuitamente a través de Hugging Face.
Análisis del tráfico
Señales de tráfico, clasificación y participación de esta herramienta.
Tendencia de visitas
No hay datos de tendencia
Interacción
- Tasa de rebote--
- Páginas por visita--
- Duración media--
Fuentes de tráfico
No hay datos de fuentes
Principales países
No hay datos por país