디자인 어시스턴트

Segment Anything (Meta)

모든 이미지에서 원하는 객체를 잘라낼 수 있는 오픈 소스 프로젝트입니다.

조회수 499.6K
월간 방문 수 499.6K
글로벌 순위 ##132,501
투표 수 0

이 도구 정보

주요 기능 및 특징

Segment Anything Model(SAM)은 Meta AI가 개발한 새로운 AI 모델로, 한 번의 클릭으로 어떤 이미지에서든 원하는 객체를 ‘잘라낼’ 수 있습니다. SAM은 프롬프트 기반 세그멘테이션 시스템으로, 추가 학습 없이 익숙하지 않은 객체와 이미지에도 제로샷 일반화를 수행합니다.

다양한 입력 프롬프트: 이미지에서 분할할 대상을 지정하는 프롬프트를 사용하면 추가 학습 없이 다양한 세그멘테이션 작업을 수행할 수 있습니다. 지원되는 프롬프트 유형에는 전경·배경 포인트, 바운딩 박스, 마스크가 있습니다. 텍스트 프롬프트는 논문에서 검토되었지만 해당 기능은 공개되지 않았습니다.

유연한 통합: SAM의 프롬프트 기반 설계는 다른 시스템과의 유연한 통합을 지원합니다. 예를 들어 AR/VR 헤드셋에서 사용자의 시선을 입력받아 객체를 선택하거나, 객체 탐지기의 바운딩 박스 프롬프트를 사용해 텍스트에서 객체를 찾는 세그멘테이션을 구현할 수 있습니다.

확장 가능한 출력: 출력 마스크는 다른 AI 시스템의 입력으로 사용할 수 있습니다. 예를 들어 동영상에서 객체 마스크를 추적하고, 이미지 편집 애플리케이션을 활성화하며, 3D로 확장하거나 콜라주 같은 창작 작업에 활용할 수 있습니다.

제로샷 일반화: SAM은 객체가 무엇인지에 대한 일반적인 개념을 학습했습니다. 이러한 이해를 바탕으로 추가 학습 없이 익숙하지 않은 객체와 이미지에도 제로샷 일반화를 수행합니다.

효율적이고 유연한 모델 설계: SAM은 데이터 엔진을 구동할 수 있을 만큼 효율적으로 설계되었습니다. 모델은 1) 한 번만 실행되는 이미지 인코더와 2) 경량 마스크 디코더로 분리됩니다. 이미지 인코더는 ViT-H 기반이며 632M개의 파라미터를 사용하고 NVIDIA A100 GPU에서 약 0.15초가 걸립니다. 마스크 디코더는 Transformer 기반으로, 프롬프트 인코더와 함께 4M개의 파라미터를 사용하며 멀티스레드 SIMD 실행을 이용하면 브라우저의 CPU에서 약 50ms 만에 실행됩니다. 플랫폼 측면에서 이미지 인코더는 PyTorch로 구현되어 GPU가 필요합니다. 프롬프트 인코더와 마스크 디코더는 PyTorch에서 직접 실행하거나 ONNX로 변환해 ONNX 런타임을 지원하는 플랫폼의 CPU 또는 GPU에서 효율적으로 실행할 수 있습니다. 모델은 256개의 A100 GPU에서 3~5일 동안 학습되었습니다.

데이터 엔진 및 데이터셋

SAM의 고급 기능은 모델을 활용하는 ‘데이터 엔진’을 통해 수집한 수백만 개의 이미지와 마스크로 학습한 결과입니다. 연구진은 SAM과 데이터를 사용해 이미지를 대화형으로 주석 처리하고 모델을 업데이트하는 과정을 반복하며 두 요소를 모두 개선했습니다. SAM의 도움으로 충분한 마스크에 주석을 단 후에는, 모호성을 인식하는 SAM의 정교한 설계를 활용했습니다. 이미지에 포인트 그리드를 제시하고 각 포인트에서 모든 대상을 분할하도록 SAM에 요청해 새 이미지를 완전히 자동으로 주석 처리한 것입니다. 최종 데이터셋인 SA-1B에는 약 1,100만 개의 라이선스 취득 및 개인정보 보호 이미지에서 수집한 11억 개 이상의 세그멘테이션 마스크가 포함되어 있습니다.

자주 묻는 질문

  • 모델이 마스크 라벨을 생성하나요? 아니요. 모델은 객체 마스크만 예측하며 라벨은 생성하지 않습니다.
  • 동영상에서 작동하나요? 현재 모델은 이미지 또는 동영상의 개별 프레임만 지원합니다.
  • 코드는 어디에서 찾을 수 있나요? 코드는 GitHub에서 제공됩니다.

요금 정보

페이지에는 요금 정보가 언급되어 있지 않습니다. 모델 코드와 데이터셋은 무료로 제공됩니다.

#Image Scanning

트래픽 분석

이 도구의 트래픽, 순위 및 참여도 지표입니다.

글로벌 순위 ##132,501
국가 순위 #49,462
월간 방문 수 499.6K

방문 추이

추이 데이터 없음

참여도

  • 이탈률--
  • 방문당 페이지 수--
  • 평균 체류 시간--

트래픽 소스

소스 데이터 없음

주요 국가

국가 데이터 없음

인터페이스 미리보기

사용자 리뷰