Asistente de diseño

Segment Anything (Meta)

Proyecto de código abierto que recorta cualquier objeto en cualquier imagen.

Vistas 499,6K
Visitas mensuales 499,6K
Posición global ##132,501
Votos 0

Acerca de esta herramienta

Funciones y características principales

Segment Anything Model (SAM) es un modelo de IA de Meta AI que puede recortar cualquier objeto de cualquier imagen con un solo clic. SAM es un sistema de segmentación guiado por indicaciones, con generalización zero-shot a objetos e imágenes desconocidos sin entrenamiento adicional.

Variedad de indicaciones de entrada: las indicaciones que especifican qué segmentar permiten realizar muchas tareas de segmentación sin entrenamiento adicional. Admite puntos de primer plano o fondo, cuadros delimitadores y máscaras. Las indicaciones de texto se exploran en el artículo, pero esta capacidad no está disponible.

Integración flexible: el diseño de SAM permite integrarlo con otros sistemas. Puede recibir indicaciones de otros sistemas, como la mirada de un usuario desde un visor de RA/RV para seleccionar un objeto o cuadros delimitadores de un detector de objetos para habilitar la segmentación de texto a objeto.

Salidas extensibles: las máscaras generadas pueden servir como entrada para otros sistemas de IA. Por ejemplo, pueden rastrearse objetos en vídeos, habilitar aplicaciones de edición de imágenes, convertirse en elementos 3D o utilizarse en tareas creativas como la creación de collages.

Generalización zero-shot: SAM ha aprendido una noción general de lo que son los objetos, lo que permite generalizar a objetos e imágenes desconocidos sin entrenamiento adicional.

Diseño eficiente y flexible: SAM está diseñado para impulsar su motor de datos. El modelo se divide en un codificador de imágenes que se ejecuta una sola vez, basado en ViT-H, con 632 millones de parámetros y un tiempo aproximado de 0,15 segundos en una GPU NVIDIA A100, y un decodificador ligero de máscaras basado en Transformer, con 4 millones de parámetros junto con el codificador de indicaciones, que tarda unos 50 ms en la CPU del navegador mediante ejecución SIMD multihilo. El codificador de imágenes está implementado en PyTorch y requiere una GPU. El codificador de indicaciones y el decodificador de máscaras pueden ejecutarse con PyTorch o convertirse a ONNX para funcionar eficientemente en CPU o GPU en plataformas compatibles con ONNX Runtime. El modelo se entrenó durante 3-5 días en 256 GPU A100.

Motor de datos y conjunto de datos

Las capacidades avanzadas de SAM son el resultado de su entrenamiento con millones de imágenes y máscaras recopiladas mediante un motor de datos con intervención del modelo. Los investigadores usaron SAM y sus datos para anotar imágenes de forma interactiva y actualizar el modelo, repitiendo el ciclo para mejorar ambos. Tras anotar suficientes máscaras con ayuda de SAM, aprovecharon su diseño avanzado consciente de la ambigüedad para anotar automáticamente nuevas imágenes: presentaron a SAM una cuadrícula de puntos y le pidieron segmentar todo en cada punto. El conjunto final, SA-1B, incluye más de 1.100 millones de máscaras de segmentación recopiladas en aproximadamente 11 millones de imágenes con licencia y protección de la privacidad.

Preguntas frecuentes

  • ¿El modelo produce etiquetas para las máscaras? No. Solo predice máscaras de objetos y no genera etiquetas.
  • ¿Funciona con vídeos? Actualmente solo admite imágenes o fotogramas individuales de vídeos.
  • ¿Dónde está disponible el código? El código está disponible en GitHub.

Información de precios

No se menciona información de precios en la página; el código del modelo y el conjunto de datos están disponibles de forma gratuita.

#Image Scanning

Análisis del tráfico

Señales de tráfico, clasificación y participación de esta herramienta.

Posición global ##132,501
Clasificación por país #49,462
Visitas mensuales 499,6K

Tendencia de visitas

No hay datos de tendencia

Interacción

  • Tasa de rebote--
  • Páginas por visita--
  • Duración media--

Fuentes de tráfico

No hay datos de fuentes

Principales países

No hay datos por país

Vista previa de la interfaz

Reseñas de usuarios