Assistant de conception

Segment Anything (Meta)

Un projet open source capable de détourer n’importe quel objet dans n’importe quelle image.

Vues 499,6K
Visites mensuelles 499,6K
Classement mondial ##132,501
Votes 0

À propos de cet outil

Fonctions et caractéristiques principales

Segment Anything Model (SAM) est un nouveau modèle d’IA de Meta AI capable de « détourer » n’importe quel objet dans n’importe quelle image en un seul clic. SAM est un système de segmentation guidé par des invites, avec une généralisation sans apprentissage supplémentaire à des objets et images inconnus.

Variété des invites d’entrée : les invites indiquant ce qu’il faut segmenter dans une image permettent d’effectuer de nombreuses tâches de segmentation sans apprentissage supplémentaire. Les types pris en charge comprennent les points de premier plan et d’arrière-plan, la boîte englobante et le masque. Les invites textuelles sont étudiées dans l’article, mais cette fonctionnalité n’est pas publiée.

Intégration flexible : la conception de SAM, guidée par des invites, permet une intégration flexible avec d’autres systèmes. Il peut recevoir des invites provenant d’autres systèmes, par exemple le regard d’un utilisateur capté par un casque AR/VR pour sélectionner un objet, ou des boîtes englobantes fournies par un détecteur d’objets pour permettre une segmentation texte-objet.

Sorties extensibles : les masques produits peuvent servir d’entrées à d’autres systèmes d’IA. Les masques d’objets peuvent notamment être suivis dans des vidéos, permettre des applications de retouche d’image, être convertis en données 3D ou servir à des tâches créatives comme le collage.

Généralisation sans apprentissage : SAM a appris une notion générale de ce que sont les objets. Cette compréhension lui permet de se généraliser à des objets et images inconnus sans nécessiter d’apprentissage supplémentaire.

Conception efficace et flexible du modèle : SAM est conçu pour être suffisamment efficace pour alimenter son moteur de données. Le modèle est séparé en deux parties : 1) un encodeur d’image exécuté une seule fois, basé sur ViT-H, comprenant 632 millions de paramètres et prenant environ 0,15 seconde sur un GPU NVIDIA A100 ; et 2) un décodeur de masques léger, basé sur Transformer, comprenant 4 millions de paramètres avec l’encodeur d’invites et prenant environ 50 ms sur le processeur dans le navigateur grâce à l’exécution SIMD multithreadée. Pour les plateformes, l’encodeur d’image est implémenté dans PyTorch et nécessite un GPU. L’encodeur d’invites et le décodeur de masques peuvent fonctionner directement avec PyTorch ou être convertis en ONNX et exécutés efficacement sur CPU ou GPU sur les plateformes compatibles avec le runtime ONNX. Le modèle a été entraîné pendant 3 à 5 jours sur 256 GPU A100.

Moteur de données et jeu de données

Les capacités avancées de SAM résultent de son entraînement sur des millions d’images et de masques collectés grâce à un « moteur de données » intégré au modèle. Les chercheurs ont utilisé SAM et ses données pour annoter des images de manière interactive et mettre à jour le modèle, en répétant ce cycle afin d’améliorer les deux. Après avoir annoté suffisamment de masques avec l’aide de SAM, ils ont exploité sa conception sophistiquée, consciente de l’ambiguïté, pour annoter automatiquement de nouvelles images en présentant à SAM une grille de points sur une image et en lui demandant de segmenter chaque élément à chaque point. Le jeu de données final, SA-1B, comprend plus de 1,1 milliard de masques de segmentation collectés sur environ 11 millions d’images sous licence et préservant la confidentialité.

Foire aux questions

  • Le modèle produit-il des étiquettes de masque ? Non. Le modèle prédit uniquement des masques d’objets et ne génère pas d’étiquettes.
  • Le modèle fonctionne-t-il sur les vidéos ? Actuellement, il prend uniquement en charge les images ou les images individuelles extraites de vidéos.
  • Où trouver le code ? Le code est disponible sur GitHub.

Tarification

Aucune information tarifaire n’est mentionnée sur la page ; le code du modèle et le jeu de données sont disponibles gratuitement.

#Image Scanning

Analyse du trafic

Signaux de trafic, de classement et d’engagement pour cet outil.

Classement mondial ##132,501
Classement par pays #49,462
Visites mensuelles 499,6K

Tendance des visites

Aucune donnée de tendance

Engagement

  • Taux de rebond--
  • Pages par visite--
  • Durée moyenne--

Sources de trafic

Aucune donnée sur les sources

Principaux pays

Aucune donnée par pays

Aperçu de l’interface

Avis des utilisateurs