Generador de imágenes

Deep floyd

DeepFloyd IF es un modelo modular compuesto por un codificador de texto congelado y tres módulos de difusión de píxeles en cascada: un modelo base que genera imágenes de 64x64 px a partir de un prompt de texto y dos modelos de superresolución que generan imágenes de 256x256 px y 1024x1024 px.

Vistas 416,3M
Visitas mensuales 416,3M
Posición global ##76
Votos 0

Acerca de esta herramienta

Características principales

DeepFloyd IF es un modelo modular compuesto por un codificador de texto congelado y tres módulos de difusión de píxeles en cascada: un modelo base que genera imágenes de 64x64 px a partir de un prompt de texto y dos modelos de superresolución diseñados para generar imágenes de 256x256 px y 1024x1024 px. Todas las etapas utilizan un codificador de texto congelado basado en el transformador T5 para extraer embeddings de texto, que se introducen en una arquitectura UNet mejorada con atención cruzada y agrupación de atención. El modelo supera a los modelos actuales de vanguardia y alcanza una puntuación FID zero-shot de 6.66 en el conjunto de datos COCO, lo que subraya el potencial de arquitecturas UNet más grandes en la primera etapa de los modelos de difusión en cascada.

Modos y casos de uso

  1. Dream (texto a imagen): genera imágenes a partir de prompts de texto con parámetros personalizables como guidance_scale y sample_timestep_respacing.
  2. Traducción de imagen a imagen zero-shot: la salida del prompt adopta el estilo de support_pil_img, con estilos como origami profesional, arte al óleo, bloques de construcción de plástico y anime clásico.
  3. Superresolución: permite ejecutar IF-II, IF-III o Stable x4 sobre una imagen que no tiene que haber sido generada por IF para ampliar imágenes de baja resolución a alta resolución.
  4. Relleno zero-shot: realiza un repintado local basándose en la imagen original, la máscara de relleno y el prompt de texto proporcionados.

Uso e integración

  • Está integrado con la biblioteca Hugging Face Diffusers y utiliza la descarga de modelos a la CPU para ejecutar todo el flujo IF con tan solo 14 GB de VRAM. Con torch>=2.0.0, deben eliminarse todas las funciones enable_xformers_memory_efficient_attention().
  • Es necesario tener una cuenta de Hugging Face, aceptar la licencia en la tarjeta del modelo e iniciar sesión localmente con huggingface_hub mediante un token de acceso.
  • También está disponible la instalación local mediante la biblioteca Python deepfloyd_if, que requiere xformers y CLIP.

Requisitos de hardware

  • Se necesitan como mínimo 16GB de VRAM para IF-I-XL (4.3B) e IF-II-L (1.2B), y 24GB de VRAM para incluir también el escalador Stable x4 hasta 1024x1024. Se requiere xformers y configurar la variable de entorno FORCE_MEM_EFFICIENT_ATTN=1.

Zoo de modelos y escala

Incluye modelos con distintos tamaños de parámetros, como IF-I-M (400M), IF-I-L (900M), IF-I-XL (4.3B), IF-II-M (450M), IF-II-L (1.2B) e IF-III-L (700M).

Precio y licencia

El código se distribuye bajo una licencia específica con ciertos puntos restringidos. El lanzamiento inicial del modelo IF está temporalmente sujeto a una licencia limitada exclusivamente a fines de investigación, con la intención de publicar posteriormente un modelo completamente de código abierto. Los pesos del modelo están disponibles gratuitamente a través de Hugging Face.

Análisis del tráfico

Señales de tráfico, clasificación y participación de esta herramienta.

Posición global ##76
Clasificación por país #113
Visitas mensuales 416,3M

Tendencia de visitas

No hay datos de tendencia

Interacción

  • Tasa de rebote--
  • Páginas por visita--
  • Duración media--

Fuentes de tráfico

No hay datos de fuentes

Principales países

No hay datos por país

Vista previa de la interfaz

Reseñas de usuarios