Генератор изображений
Deep floyd
DeepFloyd IF — модульная система с замороженным текстовым энкодером и тремя каскадными пиксельными diffusion-модулями: базовой моделью для изображений 64x64 px и двумя моделями super-resolution для 256x256 px и 1024x1024 px.
Об этом инструменте
Основные возможности и характеристики
DeepFloyd IF — модульная система с замороженным текстовым энкодером и тремя каскадными пиксельными diffusion-модулями. Базовая модель создает изображения 64x64 px по текстовому промпту, а две модели super-resolution повышают разрешение до 256x256 px и 1024x1024 px. На всех этапах используется замороженный текстовый энкодер на базе трансформера T5 для извлечения текстовых эмбеддингов, которые передаются в архитектуру UNet с cross-attention и attention pooling. Модель превосходит современные решения и достигает zero-shot FID 6.66 на наборе COCO.
Основные режимы и сценарии
- Dream (Text-to-Image): создает изображения по текстовым промптам с настраиваемыми параметрами
guidance_scaleиsample_timestep_respacing. - Zero-shot Image-to-Image Translation (Style Transfer): результат создается в стиле
support_pil_img; поддерживаются professional origami, oil art, plastic building bricks и classic anime. - Super Resolution: IF-II и IF-III или Stable x4 можно запускать даже на изображениях, созданных не IF, чтобы увеличивать их разрешение.
- Zero-shot Inpainting: выполняет локальную перерисовку на основе исходного изображения, маски inpainting и текстового промпта.
Использование и интеграция
- Интегрируется с библиотекой Hugging Face Diffusers. Благодаря выгрузке вычислений на CPU весь IF pipeline можно запустить всего с 14 GB VRAM. При использовании
torch>=2.0.0необходимо удалить все функцииenable_xformers_memory_efficient_attention(). - Пользователям нужны аккаунт Hugging Face, принятый на model card лицензией и локальный вход в
huggingface_hubс access token. - Доступна локальная установка через Python-библиотеку
deepfloyd_if, для которой требуютсяxformersи CLIP.
Требования к оборудованию
Для IF-I-XL (4.3B) и IF-II-L (1.2B) требуется минимум 16GB VRAM. Для Stable x4 upscaler до 1024x1024 необходимо 24GB VRAM. Также нужны xformers и переменная окружения FORCE_MEM_EFFICIENT_ATTN=1.
Зоопарк моделей и масштаб
Включены модели разных размеров: IF-I-M (400M), IF-I-L (900M), IF-I-XL (4.3B), IF-II-M (450M), IF-II-L (1.2B) и IF-III-L (700M).
Цена и лицензия
Код выпущен по специальной лицензии с отдельными ограничениями. Первоначальная версия модели IF временно распространяется по ограничительной лицензии только для исследовательских целей; в дальнейшем планируется выпуск полностью открытой модели. Веса моделей бесплатно доступны через Hugging Face.
Анализ трафика
Данные о трафике, рейтинге и вовлечённости этого инструмента.
Динамика посещений
Нет данных о динамике
Вовлечённость
- Показатель отказов--
- Страниц за посещение--
- Средняя длительность--
Источники трафика
Нет данных об источниках
Основные страны
Нет данных по странам