छवि जनरेटर

Deep floyd

DeepFloyd IF एक मॉड्यूलर मॉडल है जिसमें frozen text encoder और तीन cascaded pixel diffusion मॉड्यूल हैं: टेक्स्ट प्रॉम्प्ट से 64x64 px इमेज बनाने वाला base model तथा 256x256 px और 1024x1024 px रिज़ॉल्यूशन के लिए दो super-resolution मॉडल।

व्यूज़ 416.3M
मासिक विज़िट 416.3M
वैश्विक रैंक ##76
वोट 0

इस टूल के बारे में

मुख्य सुविधाएँ और विशेषताएँ

DeepFloyd IF एक मॉड्यूलर सिस्टम है जिसमें frozen text encoder और तीन cascaded pixel diffusion मॉड्यूल शामिल हैं। Base model टेक्स्ट प्रॉम्प्ट के आधार पर 64x64 px इमेज बनाता है, जबकि दो super-resolution मॉडल क्रमशः 256x256 px और 1024x1024 px रिज़ॉल्यूशन की इमेज बनाते हैं। सभी चरण T5 transformer पर आधारित frozen text encoder से text embeddings निकालते हैं, जिन्हें cross-attention और attention pooling से उन्नत UNet architecture में भेजा जाता है। यह मॉडल COCO dataset पर 6.66 का zero-shot FID score प्राप्त करता है और वर्तमान अत्याधुनिक मॉडलों से बेहतर प्रदर्शन करता है।

मुख्य मोड और उपयोग

  1. Dream (Text-to-Image): guidance_scale और sample_timestep_respacing जैसे अनुकूलन योग्य पैरामीटरों के साथ टेक्स्ट प्रॉम्प्ट से इमेज बनाता है।
  2. Zero-shot Image-to-Image Translation (Style Transfer): प्रॉम्प्ट का आउटपुट support_pil_img की शैली में आता है; professional origami, oil art, plastic building bricks और classic anime जैसी शैलियाँ समर्थित हैं।
  3. Super Resolution: उपयोगकर्ता IF से न बनी इमेज पर भी IF-II और IF-III या Stable x4 चला कर कम-रिज़ॉल्यूशन इमेज को उच्च-रिज़ॉल्यूशन में बदल सकते हैं।
  4. Zero-shot Inpainting: मूल इमेज, inpainting mask और टेक्स्ट प्रॉम्प्ट के आधार पर स्थानीय इमेज पुनः-चित्रण करता है।

उपयोग और एकीकरण

  • Hugging Face Diffusers library के साथ एकीकृत है। CPU offloading के उपयोग से पूरा IF pipeline कम से कम 14 GB VRAM में चलाया जा सकता है। यदि torch>=2.0.0 उपयोग हो, तो सभी enable_xformers_memory_efficient_attention() फ़ंक्शन हटाने होंगे।
  • उपयोगकर्ताओं के पास Hugging Face खाता होना चाहिए, model card पर लाइसेंस स्वीकार करना चाहिए और access token के साथ huggingface_hub में स्थानीय रूप से लॉगिन करना चाहिए।
  • deepfloyd_if Python library के माध्यम से स्थानीय इंस्टॉलेशन उपलब्ध है; इसके लिए xformers और CLIP आवश्यक हैं।

हार्डवेयर आवश्यकताएँ

IF-I-XL (4.3B) और IF-II-L (1.2B) के लिए न्यूनतम 16GB VRAM आवश्यक है। Stable x4 upscaler को 1024x1024 तक शामिल करने के लिए 24GB VRAM चाहिए। xformers और FORCE_MEM_EFFICIENT_ATTN=1 पर्यावरण चर सेट करना आवश्यक है।

मॉडल ज़ू और पैमाना

इसमें IF-I-M (400M), IF-I-L (900M), IF-I-XL (4.3B), IF-II-M (450M), IF-II-L (1.2B) और IF-III-L (700M) जैसे विभिन्न पैरामीटर आकार वाले मॉडल शामिल हैं।

मूल्य निर्धारण और लाइसेंस

कोड एक विशेष लाइसेंस के अंतर्गत जारी किया गया है, जिसमें कुछ प्रतिबंधित बिंदु हैं। IF मॉडल की प्रारंभिक रिलीज़ फिलहाल केवल शोध उद्देश्यों के लिए प्रतिबंधित लाइसेंस के अंतर्गत है और बाद में पूरी तरह ओपन-सोर्स मॉडल जारी करने का इरादा है। मॉडल वेट Hugging Face के माध्यम से निःशुल्क उपलब्ध हैं।

ट्रैफ़िक विश्लेषण

इस टूल के ट्रैफ़िक, रैंकिंग और सहभागिता के संकेतक।

वैश्विक रैंक ##76
देश की रैंकिंग #113
मासिक विज़िट 416.3M

विज़िट का रुझान

रुझान का कोई डेटा नहीं

सहभागिता

  • बाउंस दर--
  • प्रति विज़िट पृष्ठ--
  • औसत अवधि--

ट्रैफ़िक स्रोत

स्रोत का कोई डेटा नहीं

शीर्ष देश

देशों का कोई डेटा नहीं

इंटरफ़ेस पूर्वावलोकन

उपयोगकर्ता समीक्षाएँ