Генератор изображений

Deep floyd

DeepFloyd IF — модульная система с замороженным текстовым энкодером и тремя каскадными пиксельными diffusion-модулями: базовой моделью для изображений 64x64 px и двумя моделями super-resolution для 256x256 px и 1024x1024 px.

Просмотры 416,3M
Ежемесячные посещения 416,3M
Глобальный рейтинг ##76
Голоса 0

Об этом инструменте

Основные возможности и характеристики

DeepFloyd IF — модульная система с замороженным текстовым энкодером и тремя каскадными пиксельными diffusion-модулями. Базовая модель создает изображения 64x64 px по текстовому промпту, а две модели super-resolution повышают разрешение до 256x256 px и 1024x1024 px. На всех этапах используется замороженный текстовый энкодер на базе трансформера T5 для извлечения текстовых эмбеддингов, которые передаются в архитектуру UNet с cross-attention и attention pooling. Модель превосходит современные решения и достигает zero-shot FID 6.66 на наборе COCO.

Основные режимы и сценарии

  1. Dream (Text-to-Image): создает изображения по текстовым промптам с настраиваемыми параметрами guidance_scale и sample_timestep_respacing.
  2. Zero-shot Image-to-Image Translation (Style Transfer): результат создается в стиле support_pil_img; поддерживаются professional origami, oil art, plastic building bricks и classic anime.
  3. Super Resolution: IF-II и IF-III или Stable x4 можно запускать даже на изображениях, созданных не IF, чтобы увеличивать их разрешение.
  4. Zero-shot Inpainting: выполняет локальную перерисовку на основе исходного изображения, маски inpainting и текстового промпта.

Использование и интеграция

  • Интегрируется с библиотекой Hugging Face Diffusers. Благодаря выгрузке вычислений на CPU весь IF pipeline можно запустить всего с 14 GB VRAM. При использовании torch>=2.0.0 необходимо удалить все функции enable_xformers_memory_efficient_attention().
  • Пользователям нужны аккаунт Hugging Face, принятый на model card лицензией и локальный вход в huggingface_hub с access token.
  • Доступна локальная установка через Python-библиотеку deepfloyd_if, для которой требуются xformers и CLIP.

Требования к оборудованию

Для IF-I-XL (4.3B) и IF-II-L (1.2B) требуется минимум 16GB VRAM. Для Stable x4 upscaler до 1024x1024 необходимо 24GB VRAM. Также нужны xformers и переменная окружения FORCE_MEM_EFFICIENT_ATTN=1.

Зоопарк моделей и масштаб

Включены модели разных размеров: IF-I-M (400M), IF-I-L (900M), IF-I-XL (4.3B), IF-II-M (450M), IF-II-L (1.2B) и IF-III-L (700M).

Цена и лицензия

Код выпущен по специальной лицензии с отдельными ограничениями. Первоначальная версия модели IF временно распространяется по ограничительной лицензии только для исследовательских целей; в дальнейшем планируется выпуск полностью открытой модели. Веса моделей бесплатно доступны через Hugging Face.

Анализ трафика

Данные о трафике, рейтинге и вовлечённости этого инструмента.

Глобальный рейтинг ##76
Рейтинг по стране #113
Ежемесячные посещения 416,3M

Динамика посещений

Нет данных о динамике

Вовлечённость

  • Показатель отказов--
  • Страниц за посещение--
  • Средняя длительность--

Источники трафика

Нет данных об источниках

Основные страны

Нет данных по странам

Предпросмотр интерфейса

Отзывы пользователей