कला
ControlNet Pose
इनपुट इमेज जैसी ही मुद्रा वाली इमेज बनाने का टूल।
इस टूल के बारे में
मुख्य विशेषताएँ
jagilley/controlnet-pose मॉडल का उपयोग मुद्रा पहचान के साथ मानव आकृतियों वाली इमेज को संशोधित करने के लिए किया जाता है। एक इमेज और प्रॉम्प्ट दें; Stable Diffusion की तरह मॉडल इमेज बनाएगा और Openpose आपकी मुद्रा का पता लगाएगा।
मॉडल विवरण
ControlNet एक न्यूरल नेटवर्क संरचना है, जो पहले से प्रशिक्षित बड़े डिफ्यूज़न मॉडलों को प्रॉम्प्ट के अतिरिक्त इनपुट स्थितियों का समर्थन करने देती है। ControlNet कार्य-विशिष्ट स्थितियों को एंड-टू-एंड तरीके से सीखता है और छोटा प्रशिक्षण डेटासेट (< 50k नमूने) होने पर भी सीखना मजबूत रहता है। Stable Diffusion जैसे बड़े डिफ्यूज़न मॉडलों में ControlNet जोड़कर एज मैप, सेगमेंटेशन मैप, कीपॉइंट आदि सशर्त इनपुट सक्षम किए जा सकते हैं।
इनपुट पैरामीटर
image: इनपुट इमेज (आवश्यक)।prompt: मॉडल के लिए प्रॉम्प्ट (आवश्यक; डिफ़ॉल्टan astronaut on the moon, digital art)।num_samples: सैंपल की संख्या; अधिक मान OOM का कारण बन सकते हैं (डिफ़ॉल्ट1)।image_resolution: बनाई जाने वाली इमेज का रिज़ॉल्यूशन (डिफ़ॉल्ट512)।low_threshold/high_threshold: Canny लाइन पहचान की निम्न/उच्च सीमा (डिफ़ॉल्ट 100/200)।ddim_steps: चरणों की संख्या (डिफ़ॉल्ट 20)।scale: classifier-free guidance का स्केल (डिफ़ॉल्ट 9)।seed: सीड।eta: denoising diffusion प्रक्रिया में जोड़े जाने वाले शोर की मात्रा नियंत्रित करता है; अधिक मान का अर्थ अधिक शोर है (डिफ़ॉल्ट 0)।a_prompt: प्रॉम्प्ट के अंत में जोड़ा जाने वाला अतिरिक्त टेक्स्ट (डिफ़ॉल्टbest quality, extremely detailed)।n_prompt: नकारात्मक प्रॉम्प्ट (डिफ़ॉल्टlongbody, lowres, bad anatomy...)।detect_resolution: वह रिज़ॉल्यूशन जिस पर पहचान विधि लागू होगी (डिफ़ॉल्ट 512)।
उपयोग
इसे Replicate पर Node.js, Python और HTTP API के माध्यम से चलाया जा सकता है, या Cog और Docker का उपयोग करके स्थानीय रूप से चलाया जा सकता है।
लक्षित उपयोगकर्ता और मुख्य लाभ
यह AI डेवलपरों और इमेज जनरेशन के शौकीनों के लिए है। इसका मुख्य लाभ टेक्स्ट प्रॉम्प्ट के आधार पर उच्च-गुणवत्ता वाली नई इमेज बनाते हुए इनपुट इमेज की मानव मुद्रा को सख्ती से बनाए रखना है। यह Stable Diffusion की जनरेशन क्षमता को ControlNet के सटीक मुद्रा नियंत्रण के साथ जोड़ता है।
कीमत और लागत
Replicate पर इस मॉडल को चलाने की अनुमानित लागत $0.15 है (या $1 में 6 रन), जो इनपुट के अनुसार बदल सकती है। यह Nvidia A100 (80GB) GPU हार्डवेयर पर चलता है। प्रेडिक्शन आमतौर पर 108 सेकंड में पूरा होता है। पहली API कॉल में मॉडल को cold boot करना पड़ता है और इसमें अधिक समय लग सकता है।
ट्रैफ़िक विश्लेषण
इस टूल के ट्रैफ़िक, रैंकिंग और सहभागिता के संकेतक।
विज़िट का रुझान
रुझान का कोई डेटा नहीं
सहभागिता
- बाउंस दर--
- प्रति विज़िट पृष्ठ--
- औसत अवधि--
ट्रैफ़िक स्रोत
स्रोत का कोई डेटा नहीं
शीर्ष देश
देशों का कोई डेटा नहीं