Assistente de design
Segment Anything (Meta)
Projeto de código aberto que recorta qualquer objeto em qualquer imagem.
Sobre esta ferramenta
Principais funções e recursos
O Segment Anything Model (SAM) é um modelo de IA da Meta AI que pode recortar qualquer objeto em qualquer imagem com um único clique. O SAM é um sistema de segmentação orientado por prompts, com generalização zero-shot para objetos e imagens desconhecidos, sem necessidade de treinamento adicional.
Variedade de prompts de entrada: prompts que especificam o que segmentar permitem realizar uma ampla variedade de tarefas de segmentação sem treinamento adicional. Os tipos compatíveis incluem pontos de primeiro plano ou plano de fundo, caixa delimitadora e máscara. Prompts de texto são explorados no artigo, mas esse recurso não foi lançado.
Integração flexível: o design orientado por prompts do SAM permite uma integração flexível com outros sistemas. Ele pode receber prompts de outros sistemas, como o olhar do usuário de um headset de RA/RV para selecionar um objeto ou caixas delimitadoras de um detector de objetos para permitir a segmentação de texto para objeto.
Saídas extensíveis: as máscaras de saída podem ser usadas como entradas para outros sistemas de IA. Por exemplo, máscaras de objetos podem ser rastreadas em vídeos, habilitar aplicações de edição de imagens, ser convertidas em elementos 3D ou usadas em tarefas criativas, como colagens.
Generalização zero-shot: o SAM aprendeu uma noção geral do que são os objetos, o que permite a generalização zero-shot para objetos e imagens desconhecidos sem treinamento adicional.
Design eficiente e flexível: o SAM foi projetado para ser eficiente o suficiente para alimentar seu mecanismo de dados. O modelo é separado em um codificador de imagens executado uma única vez, baseado em ViT-H, com 632 milhões de parâmetros e duração aproximada de 0,15 segundo em uma GPU NVIDIA A100, e um decodificador leve de máscaras baseado em Transformer, com 4 milhões de parâmetros combinados ao codificador de prompts, que leva cerca de 50 ms na CPU do navegador usando execução SIMD multithread. O codificador de imagens é implementado em PyTorch e requer uma GPU. O codificador de prompts e o decodificador de máscaras podem ser executados diretamente com PyTorch ou convertidos para ONNX, funcionando com eficiência em CPU ou GPU em plataformas compatíveis com ONNX Runtime. O modelo foi treinado durante 3-5 dias em 256 GPUs A100.
Mecanismo de dados e conjunto de dados
Os recursos avançados do SAM resultam de seu treinamento com milhões de imagens e máscaras coletadas por meio de um mecanismo de dados com participação do modelo. Os pesquisadores usaram o SAM e seus dados para anotar imagens de forma interativa e atualizar o modelo, repetindo o ciclo para aprimorar ambos. Depois de anotar máscaras suficientes com a ajuda do SAM, aproveitaram seu design sofisticado, consciente de ambiguidades, para anotar novas imagens automaticamente: apresentaram ao SAM uma grade de pontos em uma imagem e solicitaram a segmentação de tudo em cada ponto. O conjunto de dados final, SA-1B, inclui mais de 1,1 bilhão de máscaras de segmentação coletadas em aproximadamente 11 milhões de imagens licenciadas e com preservação da privacidade.
Perguntas frequentes
- O modelo produz rótulos de máscaras? Não. O modelo prevê apenas máscaras de objetos e não gera rótulos.
- O modelo funciona com vídeos? Atualmente, ele é compatível apenas com imagens ou quadros individuais de vídeos.
- Onde encontro o código? O código está disponível no GitHub.
Informações de preço
Não há informações de preço mencionadas na página; o código do modelo e o conjunto de dados estão disponíveis gratuitamente.
Análise de tráfego
Sinais de tráfego, classificação e engajamento desta ferramenta.
Tendência de visitas
Não há dados de tendência
Engajamento
- Taxa de rejeição--
- Páginas por visita--
- Duração média--
Fontes de tráfego
Não há dados de origem
Principais países
Não há dados por país