Gerador de imagens
Deep floyd
O DeepFloyd IF é um modelo modular composto por um codificador de texto congelado e três módulos de difusão de pixels em cascata: um modelo base que gera imagens de 64x64 px a partir de um prompt de texto e dois modelos de super-resolução que geram imagens de 256x256 px e 1024x1024 px.
Sobre esta ferramenta
Principais recursos e características
O DeepFloyd IF é um modelo modular composto por um codificador de texto congelado e três módulos de difusão de pixels em cascata: um modelo base que gera imagens de 64x64 px a partir de um prompt de texto e dois modelos de super-resolução projetados para gerar imagens de 256x256 px e 1024x1024 px. Todas as etapas usam um codificador de texto congelado baseado no transformador T5 para extrair embeddings de texto, que são enviados a uma arquitetura UNet aprimorada com atenção cruzada e agrupamento de atenção. O modelo supera os modelos de última geração atuais e alcança uma pontuação FID zero-shot de 6.66 no conjunto de dados COCO, destacando o potencial de arquiteturas UNet maiores na primeira etapa de modelos de difusão em cascata.
Principais modos e casos de uso
- Dream (texto para imagem): gera imagens com base em prompts de texto e parâmetros personalizáveis, como
guidance_scaleesample_timestep_respacing. - Tradução zero-shot de imagem para imagem: a saída do prompt assume o estilo de
support_pil_img, com suporte a estilos como origami profissional, arte a óleo, blocos de construção de plástico e anime clássico. - Super-resolução: permite executar IF-II, IF-III ou Stable x4 em uma imagem que não precisa ter sido gerada pelo IF para ampliar imagens de baixa resolução para alta resolução.
- Inpainting zero-shot: realiza a repintura local com base na imagem original, na máscara de inpainting e no prompt de texto fornecidos.
Uso e integração
- É integrado à biblioteca Hugging Face Diffusers e usa descarregamento do modelo para a CPU para executar todo o pipeline IF com apenas 14 GB de VRAM. Ao usar
torch>=2.0.0, todas as funçõesenable_xformers_memory_efficient_attention()devem ser excluídas. - É necessário ter uma conta Hugging Face, aceitar a licença no cartão do modelo e fazer login localmente usando
huggingface_hubcom um token de acesso. - A instalação local pela biblioteca Python
deepfloyd_iftambém está disponível e requerxformerse CLIP.
Requisitos de hardware
- São necessários no mínimo 16GB de VRAM para IF-I-XL (4.3B) e IF-II-L (1.2B), e 24GB de VRAM para incluir também o upscaler Stable x4 até 1024x1024. É necessário usar
xformerse definir a variável de ambienteFORCE_MEM_EFFICIENT_ATTN=1.
Zoo de modelos e escala
Inclui modelos com diferentes tamanhos de parâmetros, como IF-I-M (400M), IF-I-L (900M), IF-I-XL (4.3B), IF-II-M (450M), IF-II-L (1.2B) e IF-III-L (700M).
Preço e licença
O código é distribuído sob uma licença específica, com alguns pontos restritos. O lançamento inicial do modelo IF está temporariamente sob uma licença limitada exclusivamente a fins de pesquisa, com a intenção de lançar posteriormente um modelo totalmente de código aberto. Os pesos do modelo estão disponíveis gratuitamente pelo Hugging Face.
Análise de tráfego
Sinais de tráfego, classificação e engajamento desta ferramenta.
Tendência de visitas
Não há dados de tendência
Engajamento
- Taxa de rejeição--
- Páginas por visita--
- Duração média--
Fontes de tráfego
Não há dados de origem
Principais países
Não há dados por país