डिज़ाइन सहायक
Segment Anything (Meta)
एक ओपन-सोर्स प्रोजेक्ट जो किसी भी छवि में किसी भी वस्तु को अलग कर सकता है।
इस टूल के बारे में
मुख्य कार्य और विशेषताएँ
Segment Anything Model (SAM) Meta AI का एक AI मॉडल है, जो एक क्लिक में किसी भी छवि में किसी भी वस्तु को अलग कर सकता है। यह एक प्रॉम्प्ट-आधारित सेगमेंटेशन सिस्टम है, जो अतिरिक्त प्रशिक्षण के बिना अपरिचित वस्तुओं और छवियों पर zero-shot generalization प्रदान करता है।
इनपुट प्रॉम्प्ट की विविधता: छवि में सेगमेंट करने वाली वस्तु बताने वाले प्रॉम्प्ट अतिरिक्त प्रशिक्षण के बिना कई सेगमेंटेशन कार्यों की अनुमति देते हैं। समर्थित प्रकारों में अग्रभूमि/पृष्ठभूमि बिंदु, bounding box और mask शामिल हैं। पेपर में टेक्स्ट प्रॉम्प्ट पर चर्चा की गई है, लेकिन यह क्षमता जारी नहीं की गई है।
लचीला एकीकरण: SAM अन्य सिस्टम से इनपुट प्रॉम्प्ट ले सकता है, जैसे AR/VR हेडसेट से उपयोगकर्ता की दृष्टि लेकर वस्तु चुनना या object detector के bounding box प्रॉम्प्ट से text-to-object segmentation सक्षम करना।
विस्तार योग्य आउटपुट: आउटपुट masks को अन्य AI सिस्टम में इनपुट के रूप में इस्तेमाल किया जा सकता है। उदाहरण के लिए, वस्तु masks को वीडियो में ट्रैक किया जा सकता है, इमेज एडिटिंग ऐप्लिकेशन में उपयोग किया जा सकता है, 3D में बदला जा सकता है या collaging जैसे रचनात्मक कार्यों में लगाया जा सकता है।
कुशल और लचीला मॉडल डिज़ाइन: SAM को अपने data engine को चलाने के लिए पर्याप्त कुशल बनाया गया है। मॉडल दो भागों में विभाजित है: एक one-time image encoder, जो ViT-H पर आधारित है, इसमें 632M parameters हैं और NVIDIA A100 GPU पर लगभग 0.15 सेकंड लगते हैं; तथा एक हल्का mask decoder, जो Transformer पर आधारित है, prompt encoder के साथ कुल 4M parameters रखता है और multithreaded SIMD execution का उपयोग करते हुए ब्राउज़र में CPU पर लगभग 50ms लेता है। Image encoder PyTorch में लागू है और GPU की आवश्यकता होती है। Prompt encoder और mask decoder PyTorch के साथ चल सकते हैं या ONNX में बदलकर ONNX runtime समर्थित प्लेटफ़ॉर्म पर CPU या GPU में चलाए जा सकते हैं। मॉडल को 256 A100 GPUs पर 3–5 दिनों तक प्रशिक्षित किया गया।
Data Engine और Dataset
SAM की क्षमताएँ model-in-the-loop data engine के माध्यम से एकत्र की गई लाखों छवियों और masks पर प्रशिक्षण का परिणाम हैं। शोधकर्ताओं ने SAM और उसके डेटा से छवियों को इंटरैक्टिव रूप से annotate किया और मॉडल को अपडेट किया। पर्याप्त masks annotate करने के बाद, उन्होंने छवि पर points की grid देकर SAM से हर बिंदु पर सब कुछ segment कराया और नई छवियों को पूरी तरह स्वचालित रूप से annotate किया। अंतिम dataset SA-1B में लगभग 11 मिलियन licensed और privacy-preserving छवियों से एकत्र किए गए 1.1 बिलियन से अधिक segmentation masks हैं।
अक्सर पूछे जाने वाले प्रश्न
- क्या मॉडल mask labels बनाता है? नहीं। मॉडल केवल object masks का अनुमान लगाता है और labels उत्पन्न नहीं करता।
- क्या मॉडल वीडियो पर काम करता है? फिलहाल केवल छवियों या वीडियो के व्यक्तिगत frames का समर्थन है।
- कोड कहाँ मिलेगा? कोड GitHub पर उपलब्ध है।
मूल्य निर्धारण
पेज पर मूल्य निर्धारण की जानकारी नहीं दी गई है; मॉडल कोड और dataset निःशुल्क उपलब्ध हैं।
ट्रैफ़िक विश्लेषण
इस टूल के ट्रैफ़िक, रैंकिंग और सहभागिता के संकेतक।
विज़िट का रुझान
रुझान का कोई डेटा नहीं
सहभागिता
- बाउंस दर--
- प्रति विज़िट पृष्ठ--
- औसत अवधि--
ट्रैफ़िक स्रोत
स्रोत का कोई डेटा नहीं
शीर्ष देश
देशों का कोई डेटा नहीं