تصویر جنریٹر
Deep floyd
DeepFloyd IF ایک ماڈیولر نظام ہے جس میں frozen text encoder اور تین cascaded pixel diffusion modules شامل ہیں: 64x64 px تصاویر بنانے والا base model اور 256x256 px اور 1024x1024 px کے لیے دو super-resolution models۔
اس ٹول کے بارے میں
بنیادی خصوصیات
DeepFloyd IF ایک ماڈیولر نظام ہے جس میں frozen text encoder اور تین cascaded pixel diffusion modules شامل ہیں۔ Base model ٹیکسٹ پرامپٹ کی بنیاد پر 64x64 px تصاویر بناتا ہے، جبکہ دو super-resolution models بالترتیب 256x256 px اور 1024x1024 px ریزولوشن کی تصاویر بناتے ہیں۔ تمام مراحل T5 transformer پر مبنی frozen text encoder سے text embeddings نکالتے ہیں، جنہیں cross-attention اور attention pooling سے بہتر بنائے گئے UNet architecture میں بھیجا جاتا ہے۔ یہ ماڈل موجودہ جدید ماڈلز سے بہتر کارکردگی دکھاتا ہے اور COCO dataset پر 6.66 کا zero-shot FID score حاصل کرتا ہے۔
اہم موڈز اور استعمال
- Dream (Text-to-Image):
guidance_scaleاورsample_timestep_respacingجیسے قابلِ تخصیص پیرامیٹرز کے ساتھ ٹیکسٹ پرامپٹس سے تصاویر بناتا ہے۔ - Zero-shot Image-to-Image Translation (Style Transfer): پرامپٹ کا آؤٹ پٹ
support_pil_imgکے اسٹائل میں آتا ہے؛ professional origami، oil art، plastic building bricks اور classic anime جیسے اسٹائلز معاونت یافتہ ہیں۔ - Super Resolution: IF سے نہ بنائی گئی تصویر پر بھی IF-II اور IF-III یا Stable x4 چلا کر کم ریزولوشن تصاویر کو اعلیٰ ریزولوشن میں تبدیل کیا جا سکتا ہے۔
- Zero-shot Inpainting: اصل تصویر، inpainting mask اور ٹیکسٹ پرامپٹ کی بنیاد پر مقامی تصویر کی دوبارہ پینٹنگ کرتا ہے۔
استعمال اور انضمام
- Hugging Face Diffusers library کے ساتھ مربوط ہے۔ CPU offloading کے ذریعے مکمل IF pipeline صرف 14 GB VRAM میں چلائی جا سکتی ہے۔ اگر
torch>=2.0.0استعمال ہو تو تمامenable_xformers_memory_efficient_attention()functions حذف کرنا ہوں گے۔ - صارفین کے پاس Hugging Face account ہونا، model card پر license قبول کرنا اور access token کے ذریعے مقامی طور پر
huggingface_hubمیں login کرنا ضروری ہے۔ deepfloyd_ifPython library کے ذریعے مقامی installation بھی دستیاب ہے، جس کے لیےxformersاور CLIP درکار ہیں۔
ہارڈویئر کی ضروریات
IF-I-XL (4.3B) اور IF-II-L (1.2B) کے لیے کم از کم 16GB VRAM درکار ہے۔ Stable x4 upscaler کو 1024x1024 تک شامل کرنے کے لیے 24GB VRAM درکار ہے۔ xformers اور environment variable FORCE_MEM_EFFICIENT_ATTN=1 بھی درکار ہیں۔
ماڈل زو اور پیمانہ
اس میں مختلف parameter sizes والے ماڈلز شامل ہیں، جیسے IF-I-M (400M)، IF-I-L (900M)، IF-I-XL (4.3B)، IF-II-M (450M)، IF-II-L (1.2B) اور IF-III-L (700M)۔
قیمت اور لائسنس
کوڈ ایک مخصوص license کے تحت جاری کیا گیا ہے جس میں کچھ پابند نکات شامل ہیں۔ IF model کی ابتدائی release فی الحال صرف research purposes کے لیے restricted license کے تحت ہے، جبکہ بعد میں مکمل open-source model جاری کرنے کا ارادہ ہے۔ Model weights Hugging Face کے ذریعے مفت دستیاب ہیں۔
ٹریفک کا تجزیہ
اس ٹول کے ٹریفک، رینکنگ اور انگیجمنٹ کے اشارے۔
وزٹس کا رجحان
رجحان کا کوئی ڈیٹا نہیں
انگیجمنٹ
- باؤنس ریٹ--
- فی وزٹ صفحات--
- اوسط دورانیہ--
ٹریفک کے ذرائع
ذرائع کا کوئی ڈیٹا نہیں
سرفہرست ممالک
ممالک کا کوئی ڈیٹا نہیں