Design-Assistent

Segment Anything (Meta)

Open-Source-Projekt zum Ausschneiden beliebiger Objekte aus beliebigen Bildern.

Aufrufe 499,6K
Monatliche Besuche 499,6K
Globaler Rang ##132,501
Stimmen 0

Über dieses Tool

Zentrale Funktionen und Merkmale

Das Segment Anything Model (SAM) ist ein neues KI-Modell von Meta AI, das mit einem einzigen Klick beliebige Objekte aus beliebigen Bildern ausschneiden kann. SAM ist ein durch Prompts steuerbares Segmentierungssystem mit Zero-Shot-Verallgemeinerung auf unbekannte Objekte und Bilder, ohne zusätzliches Training.

Vielfältige Eingabe-Prompts: Prompts, die angeben, was in einem Bild segmentiert werden soll, ermöglichen zahlreiche Segmentierungsaufgaben ohne zusätzliches Training. Unterstützt werden Punkte für Vorder- oder Hintergrund, Bounding-Boxen und Masken. Text-Prompts werden im Paper untersucht, die Funktion ist jedoch nicht veröffentlicht.

Flexible Integration: Das promptbasierte Design von SAM ermöglicht eine flexible Integration in andere Systeme. Es kann Eingabe-Prompts aus anderen Systemen übernehmen, etwa den Blick eines Nutzers über ein AR/VR-Headset zur Objektauswahl oder Bounding-Box-Prompts eines Objektdetektors für die Segmentierung von Text zu Objekt.

Erweiterbare Ausgaben: Ausgabemasken können als Eingaben für andere KI-Systeme dienen. So lassen sich Objektmasken in Videos verfolgen, für Bildbearbeitungsanwendungen nutzen, in 3D übertragen oder für kreative Aufgaben wie Collagen einsetzen.

Zero-Shot-Verallgemeinerung: SAM hat ein allgemeines Verständnis davon gelernt, was Objekte sind. Dadurch kann es ohne zusätzliches Training auf unbekannte Objekte und Bilder verallgemeinern.

Effizientes und flexibles Modelldesign: SAM wurde so entwickelt, dass es effizient genug für den Betrieb seiner Daten-Engine ist. Das Modell besteht aus einem einmalig ausgeführten, auf ViT-H basierenden Bild-Encoder mit 632 Millionen Parametern, der auf einer NVIDIA-A100-GPU etwa 0,15 Sekunden benötigt, und einem leichten, Transformer-basierten Masken-Decoder mit 4 Millionen Parametern zusammen mit dem Prompt-Encoder, der im Browser auf der CPU durch multithreaded SIMD-Ausführung etwa 50 ms benötigt. Der Bild-Encoder ist in PyTorch implementiert und erfordert eine GPU. Prompt-Encoder und Masken-Decoder können direkt mit PyTorch ausgeführt oder in ONNX konvertiert werden, um auf Plattformen mit ONNX Runtime effizient auf CPU oder GPU zu laufen. Das Modell wurde 3-5 Tage lang auf 256 A100-GPUs trainiert.

Daten-Engine und Datensatz

Die fortschrittlichen Fähigkeiten von SAM sind das Ergebnis des Trainings mit Millionen von Bildern und Masken, die über eine Model-in-the-Loop-Daten-Engine gesammelt wurden. Forschende nutzten SAM und die zugehörigen Daten, um Bilder interaktiv zu annotieren und das Modell zu aktualisieren, und wiederholten diesen Zyklus zur Verbesserung beider Komponenten. Nachdem mit SAM genügend Masken annotiert worden waren, nutzten sie das ausgefeilte, ambiguitätsbewusste Design von SAM, um neue Bilder vollständig automatisch zu annotieren: Sie legten SAM ein Raster aus Punkten auf einem Bild vor und forderten es auf, an jedem Punkt alles zu segmentieren. Der endgültige Datensatz SA-1B umfasst mehr als 1,1 Milliarden Segmentierungsmasken aus etwa 11 Millionen lizenzierten und die Privatsphäre schützenden Bildern.

Häufig gestellte Fragen

  • Erzeugt das Modell Maskenbeschriftungen? Nein. Das Modell sagt nur Objektmasken voraus und erzeugt keine Beschriftungen.
  • Funktioniert das Modell mit Videos? Derzeit unterstützt es nur Bilder oder einzelne Videoframes.
  • Wo finde ich den Code? Der Code ist auf GitHub verfügbar.

Preisinformationen

Auf der Seite werden keine Preisinformationen genannt; der Modellcode und der Datensatz sind kostenlos verfügbar.

#Image Scanning

Traffic-Analyse

Traffic-, Ranking- und Engagement-Signale für dieses Tool.

Globaler Rang ##132,501
Länder-Ranking #49,462
Monatliche Besuche 499,6K

Besuchstrend

Keine Trenddaten

Engagement

  • Absprungrate--
  • Seiten pro Besuch--
  • Durchschnittliche Dauer--

Traffic-Quellen

Keine Quelldaten

Top-Länder

Keine Länderdaten

Interface-Vorschau

Nutzerbewertungen