Gerador de imagens

Deep floyd

O DeepFloyd IF é um modelo modular composto por um codificador de texto congelado e três módulos de difusão de pixels em cascata: um modelo base que gera imagens de 64x64 px a partir de um prompt de texto e dois modelos de super-resolução que geram imagens de 256x256 px e 1024x1024 px.

Visualizações 416,3M
Visitas mensais 416,3M
Classificação global ##76
Votos 0

Sobre esta ferramenta

Principais recursos e características

O DeepFloyd IF é um modelo modular composto por um codificador de texto congelado e três módulos de difusão de pixels em cascata: um modelo base que gera imagens de 64x64 px a partir de um prompt de texto e dois modelos de super-resolução projetados para gerar imagens de 256x256 px e 1024x1024 px. Todas as etapas usam um codificador de texto congelado baseado no transformador T5 para extrair embeddings de texto, que são enviados a uma arquitetura UNet aprimorada com atenção cruzada e agrupamento de atenção. O modelo supera os modelos de última geração atuais e alcança uma pontuação FID zero-shot de 6.66 no conjunto de dados COCO, destacando o potencial de arquiteturas UNet maiores na primeira etapa de modelos de difusão em cascata.

Principais modos e casos de uso

  1. Dream (texto para imagem): gera imagens com base em prompts de texto e parâmetros personalizáveis, como guidance_scale e sample_timestep_respacing.
  2. Tradução zero-shot de imagem para imagem: a saída do prompt assume o estilo de support_pil_img, com suporte a estilos como origami profissional, arte a óleo, blocos de construção de plástico e anime clássico.
  3. Super-resolução: permite executar IF-II, IF-III ou Stable x4 em uma imagem que não precisa ter sido gerada pelo IF para ampliar imagens de baixa resolução para alta resolução.
  4. Inpainting zero-shot: realiza a repintura local com base na imagem original, na máscara de inpainting e no prompt de texto fornecidos.

Uso e integração

  • É integrado à biblioteca Hugging Face Diffusers e usa descarregamento do modelo para a CPU para executar todo o pipeline IF com apenas 14 GB de VRAM. Ao usar torch>=2.0.0, todas as funções enable_xformers_memory_efficient_attention() devem ser excluídas.
  • É necessário ter uma conta Hugging Face, aceitar a licença no cartão do modelo e fazer login localmente usando huggingface_hub com um token de acesso.
  • A instalação local pela biblioteca Python deepfloyd_if também está disponível e requer xformers e CLIP.

Requisitos de hardware

  • São necessários no mínimo 16GB de VRAM para IF-I-XL (4.3B) e IF-II-L (1.2B), e 24GB de VRAM para incluir também o upscaler Stable x4 até 1024x1024. É necessário usar xformers e definir a variável de ambiente FORCE_MEM_EFFICIENT_ATTN=1.

Zoo de modelos e escala

Inclui modelos com diferentes tamanhos de parâmetros, como IF-I-M (400M), IF-I-L (900M), IF-I-XL (4.3B), IF-II-M (450M), IF-II-L (1.2B) e IF-III-L (700M).

Preço e licença

O código é distribuído sob uma licença específica, com alguns pontos restritos. O lançamento inicial do modelo IF está temporariamente sob uma licença limitada exclusivamente a fins de pesquisa, com a intenção de lançar posteriormente um modelo totalmente de código aberto. Os pesos do modelo estão disponíveis gratuitamente pelo Hugging Face.

Análise de tráfego

Sinais de tráfego, classificação e engajamento desta ferramenta.

Classificação global ##76
Classificação por país #113
Visitas mensais 416,3M

Tendência de visitas

Não há dados de tendência

Engajamento

  • Taxa de rejeição--
  • Páginas por visita--
  • Duração média--

Fontes de tráfego

Não há dados de origem

Principais países

Não há dados por país

Prévia da interface

Avaliações de usuários