छवि जनरेटर
Deep floyd
DeepFloyd IF एक मॉड्यूलर मॉडल है जिसमें frozen text encoder और तीन cascaded pixel diffusion मॉड्यूल हैं: टेक्स्ट प्रॉम्प्ट से 64x64 px इमेज बनाने वाला base model तथा 256x256 px और 1024x1024 px रिज़ॉल्यूशन के लिए दो super-resolution मॉडल।
इस टूल के बारे में
मुख्य सुविधाएँ और विशेषताएँ
DeepFloyd IF एक मॉड्यूलर सिस्टम है जिसमें frozen text encoder और तीन cascaded pixel diffusion मॉड्यूल शामिल हैं। Base model टेक्स्ट प्रॉम्प्ट के आधार पर 64x64 px इमेज बनाता है, जबकि दो super-resolution मॉडल क्रमशः 256x256 px और 1024x1024 px रिज़ॉल्यूशन की इमेज बनाते हैं। सभी चरण T5 transformer पर आधारित frozen text encoder से text embeddings निकालते हैं, जिन्हें cross-attention और attention pooling से उन्नत UNet architecture में भेजा जाता है। यह मॉडल COCO dataset पर 6.66 का zero-shot FID score प्राप्त करता है और वर्तमान अत्याधुनिक मॉडलों से बेहतर प्रदर्शन करता है।
मुख्य मोड और उपयोग
- Dream (Text-to-Image):
guidance_scaleऔरsample_timestep_respacingजैसे अनुकूलन योग्य पैरामीटरों के साथ टेक्स्ट प्रॉम्प्ट से इमेज बनाता है। - Zero-shot Image-to-Image Translation (Style Transfer): प्रॉम्प्ट का आउटपुट
support_pil_imgकी शैली में आता है; professional origami, oil art, plastic building bricks और classic anime जैसी शैलियाँ समर्थित हैं। - Super Resolution: उपयोगकर्ता IF से न बनी इमेज पर भी IF-II और IF-III या Stable x4 चला कर कम-रिज़ॉल्यूशन इमेज को उच्च-रिज़ॉल्यूशन में बदल सकते हैं।
- Zero-shot Inpainting: मूल इमेज, inpainting mask और टेक्स्ट प्रॉम्प्ट के आधार पर स्थानीय इमेज पुनः-चित्रण करता है।
उपयोग और एकीकरण
- Hugging Face Diffusers library के साथ एकीकृत है। CPU offloading के उपयोग से पूरा IF pipeline कम से कम 14 GB VRAM में चलाया जा सकता है। यदि
torch>=2.0.0उपयोग हो, तो सभीenable_xformers_memory_efficient_attention()फ़ंक्शन हटाने होंगे। - उपयोगकर्ताओं के पास Hugging Face खाता होना चाहिए, model card पर लाइसेंस स्वीकार करना चाहिए और access token के साथ
huggingface_hubमें स्थानीय रूप से लॉगिन करना चाहिए। deepfloyd_ifPython library के माध्यम से स्थानीय इंस्टॉलेशन उपलब्ध है; इसके लिएxformersऔर CLIP आवश्यक हैं।
हार्डवेयर आवश्यकताएँ
IF-I-XL (4.3B) और IF-II-L (1.2B) के लिए न्यूनतम 16GB VRAM आवश्यक है। Stable x4 upscaler को 1024x1024 तक शामिल करने के लिए 24GB VRAM चाहिए। xformers और FORCE_MEM_EFFICIENT_ATTN=1 पर्यावरण चर सेट करना आवश्यक है।
मॉडल ज़ू और पैमाना
इसमें IF-I-M (400M), IF-I-L (900M), IF-I-XL (4.3B), IF-II-M (450M), IF-II-L (1.2B) और IF-III-L (700M) जैसे विभिन्न पैरामीटर आकार वाले मॉडल शामिल हैं।
मूल्य निर्धारण और लाइसेंस
कोड एक विशेष लाइसेंस के अंतर्गत जारी किया गया है, जिसमें कुछ प्रतिबंधित बिंदु हैं। IF मॉडल की प्रारंभिक रिलीज़ फिलहाल केवल शोध उद्देश्यों के लिए प्रतिबंधित लाइसेंस के अंतर्गत है और बाद में पूरी तरह ओपन-सोर्स मॉडल जारी करने का इरादा है। मॉडल वेट Hugging Face के माध्यम से निःशुल्क उपलब्ध हैं।
ट्रैफ़िक विश्लेषण
इस टूल के ट्रैफ़िक, रैंकिंग और सहभागिता के संकेतक।
विज़िट का रुझान
रुझान का कोई डेटा नहीं
सहभागिता
- बाउंस दर--
- प्रति विज़िट पृष्ठ--
- औसत अवधि--
ट्रैफ़िक स्रोत
स्रोत का कोई डेटा नहीं
शीर्ष देश
देशों का कोई डेटा नहीं