Design-Assistent
Segment Anything (Meta)
Open-Source-Projekt zum Ausschneiden beliebiger Objekte aus beliebigen Bildern.
Über dieses Tool
Zentrale Funktionen und Merkmale
Das Segment Anything Model (SAM) ist ein neues KI-Modell von Meta AI, das mit einem einzigen Klick beliebige Objekte aus beliebigen Bildern ausschneiden kann. SAM ist ein durch Prompts steuerbares Segmentierungssystem mit Zero-Shot-Verallgemeinerung auf unbekannte Objekte und Bilder, ohne zusätzliches Training.
Vielfältige Eingabe-Prompts: Prompts, die angeben, was in einem Bild segmentiert werden soll, ermöglichen zahlreiche Segmentierungsaufgaben ohne zusätzliches Training. Unterstützt werden Punkte für Vorder- oder Hintergrund, Bounding-Boxen und Masken. Text-Prompts werden im Paper untersucht, die Funktion ist jedoch nicht veröffentlicht.
Flexible Integration: Das promptbasierte Design von SAM ermöglicht eine flexible Integration in andere Systeme. Es kann Eingabe-Prompts aus anderen Systemen übernehmen, etwa den Blick eines Nutzers über ein AR/VR-Headset zur Objektauswahl oder Bounding-Box-Prompts eines Objektdetektors für die Segmentierung von Text zu Objekt.
Erweiterbare Ausgaben: Ausgabemasken können als Eingaben für andere KI-Systeme dienen. So lassen sich Objektmasken in Videos verfolgen, für Bildbearbeitungsanwendungen nutzen, in 3D übertragen oder für kreative Aufgaben wie Collagen einsetzen.
Zero-Shot-Verallgemeinerung: SAM hat ein allgemeines Verständnis davon gelernt, was Objekte sind. Dadurch kann es ohne zusätzliches Training auf unbekannte Objekte und Bilder verallgemeinern.
Effizientes und flexibles Modelldesign: SAM wurde so entwickelt, dass es effizient genug für den Betrieb seiner Daten-Engine ist. Das Modell besteht aus einem einmalig ausgeführten, auf ViT-H basierenden Bild-Encoder mit 632 Millionen Parametern, der auf einer NVIDIA-A100-GPU etwa 0,15 Sekunden benötigt, und einem leichten, Transformer-basierten Masken-Decoder mit 4 Millionen Parametern zusammen mit dem Prompt-Encoder, der im Browser auf der CPU durch multithreaded SIMD-Ausführung etwa 50 ms benötigt. Der Bild-Encoder ist in PyTorch implementiert und erfordert eine GPU. Prompt-Encoder und Masken-Decoder können direkt mit PyTorch ausgeführt oder in ONNX konvertiert werden, um auf Plattformen mit ONNX Runtime effizient auf CPU oder GPU zu laufen. Das Modell wurde 3-5 Tage lang auf 256 A100-GPUs trainiert.
Daten-Engine und Datensatz
Die fortschrittlichen Fähigkeiten von SAM sind das Ergebnis des Trainings mit Millionen von Bildern und Masken, die über eine Model-in-the-Loop-Daten-Engine gesammelt wurden. Forschende nutzten SAM und die zugehörigen Daten, um Bilder interaktiv zu annotieren und das Modell zu aktualisieren, und wiederholten diesen Zyklus zur Verbesserung beider Komponenten. Nachdem mit SAM genügend Masken annotiert worden waren, nutzten sie das ausgefeilte, ambiguitätsbewusste Design von SAM, um neue Bilder vollständig automatisch zu annotieren: Sie legten SAM ein Raster aus Punkten auf einem Bild vor und forderten es auf, an jedem Punkt alles zu segmentieren. Der endgültige Datensatz SA-1B umfasst mehr als 1,1 Milliarden Segmentierungsmasken aus etwa 11 Millionen lizenzierten und die Privatsphäre schützenden Bildern.
Häufig gestellte Fragen
- Erzeugt das Modell Maskenbeschriftungen? Nein. Das Modell sagt nur Objektmasken voraus und erzeugt keine Beschriftungen.
- Funktioniert das Modell mit Videos? Derzeit unterstützt es nur Bilder oder einzelne Videoframes.
- Wo finde ich den Code? Der Code ist auf GitHub verfügbar.
Preisinformationen
Auf der Seite werden keine Preisinformationen genannt; der Modellcode und der Datensatz sind kostenlos verfügbar.
Traffic-Analyse
Traffic-, Ranking- und Engagement-Signale für dieses Tool.
Besuchstrend
Keine Trenddaten
Engagement
- Absprungrate--
- Seiten pro Besuch--
- Durchschnittliche Dauer--
Traffic-Quellen
Keine Quelldaten
Top-Länder
Keine Länderdaten