Asisten desain

Segment Anything (Meta)

Proyek sumber terbuka untuk memotong objek apa pun dari gambar apa pun.

Tayangan 499,6K
Kunjungan bulanan 499,6K
Peringkat global ##132,501
Suara 0

Tentang alat ini

Fungsi dan fitur utama

Segment Anything Model (SAM) adalah model AI baru dari Meta AI yang dapat memotong objek apa pun dari gambar apa pun hanya dengan satu klik. SAM adalah sistem segmentasi yang dapat diarahkan dengan prompt, dengan generalisasi zero-shot ke objek dan gambar yang belum dikenal tanpa pelatihan tambahan.

Beragam prompt masukan: prompt yang menentukan bagian yang akan disegmentasi memungkinkan berbagai tugas segmentasi tanpa pelatihan tambahan. Jenis prompt yang didukung meliputi titik latar depan atau latar belakang, kotak pembatas, dan mask. Prompt teks dibahas dalam makalah, tetapi kemampuannya belum dirilis.

Integrasi fleksibel: desain SAM yang dapat diarahkan dengan prompt memungkinkan integrasi fleksibel dengan sistem lain. SAM dapat menerima prompt dari sistem lain, seperti arah pandangan pengguna dari headset AR/VR untuk memilih objek, atau prompt kotak pembatas dari detektor objek untuk mengaktifkan segmentasi teks-ke-objek.

Output yang dapat diperluas: mask keluaran dapat digunakan sebagai masukan untuk sistem AI lain. Misalnya, mask objek dapat dilacak dalam video, mendukung aplikasi penyuntingan gambar, diangkat ke 3D, atau digunakan untuk tugas kreatif seperti membuat kolase.

Generalisasi zero-shot: SAM telah mempelajari pemahaman umum tentang objek, sehingga dapat melakukan generalisasi zero-shot ke objek dan gambar yang belum dikenal tanpa pelatihan tambahan.

Desain model yang efisien dan fleksibel: SAM dirancang cukup efisien untuk menjalankan mesin datanya. Model ini dipisahkan menjadi encoder gambar berbasis ViT-H yang dijalankan satu kali, dengan 632 juta parameter dan waktu sekitar 0,15 detik pada GPU NVIDIA A100, serta decoder mask ringan berbasis Transformer dengan 4 juta parameter bersama encoder prompt, yang membutuhkan sekitar 50 ms pada CPU di browser menggunakan eksekusi SIMD multithread. Encoder gambar diimplementasikan dalam PyTorch dan memerlukan GPU. Encoder prompt dan decoder mask dapat dijalankan langsung dengan PyTorch atau dikonversi ke ONNX agar berjalan efisien pada CPU atau GPU di berbagai platform yang mendukung ONNX Runtime. Model ini dilatih selama 3-5 hari menggunakan 256 GPU A100.

Mesin data dan dataset

Kemampuan canggih SAM merupakan hasil pelatihan pada jutaan gambar dan mask yang dikumpulkan melalui mesin data dengan model sebagai bagian dari proses. Para peneliti menggunakan SAM dan datanya untuk memberi anotasi gambar secara interaktif serta memperbarui model, lalu mengulangi siklus tersebut untuk meningkatkan keduanya. Setelah cukup banyak mask diberi anotasi dengan bantuan SAM, mereka memanfaatkan desain SAM yang sadar ambiguitas untuk memberi anotasi pada gambar baru secara otomatis: SAM diberi grid titik pada sebuah gambar dan diminta melakukan segmentasi pada setiap titik. Dataset final, SA-1B, mencakup lebih dari 1,1 miliar mask segmentasi yang dikumpulkan dari sekitar 11 juta gambar berlisensi dan yang menjaga privasi.

Pertanyaan umum

  • Apakah model menghasilkan label mask? Tidak. Model hanya memprediksi mask objek dan tidak menghasilkan label.
  • Apakah model dapat digunakan untuk video? Saat ini model hanya mendukung gambar atau frame individual dari video.
  • Di mana kode tersedia? Kode tersedia di GitHub.

Informasi harga

Halaman tersebut tidak menyebutkan informasi harga; kode model dan dataset tersedia secara gratis.

#Image Scanning

Analisis traffic

Sinyal lalu lintas, peringkat, dan interaksi untuk alat ini.

Peringkat global ##132,501
Peringkat negara #49,462
Kunjungan bulanan 499,6K

Tren kunjungan

Tidak ada data tren

Interaksi

  • Rasio pentalan--
  • Halaman per kunjungan--
  • Durasi rata-rata--

Sumber traffic

Tidak ada data sumber

Negara teratas

Tidak ada data negara

Pratinjau antarmuka

Ulasan pengguna