디자인 어시스턴트
Segment Anything (Meta)
모든 이미지에서 원하는 객체를 잘라낼 수 있는 오픈 소스 프로젝트입니다.
이 도구 정보
주요 기능 및 특징
Segment Anything Model(SAM)은 Meta AI가 개발한 새로운 AI 모델로, 한 번의 클릭으로 어떤 이미지에서든 원하는 객체를 ‘잘라낼’ 수 있습니다. SAM은 프롬프트 기반 세그멘테이션 시스템으로, 추가 학습 없이 익숙하지 않은 객체와 이미지에도 제로샷 일반화를 수행합니다.
다양한 입력 프롬프트: 이미지에서 분할할 대상을 지정하는 프롬프트를 사용하면 추가 학습 없이 다양한 세그멘테이션 작업을 수행할 수 있습니다. 지원되는 프롬프트 유형에는 전경·배경 포인트, 바운딩 박스, 마스크가 있습니다. 텍스트 프롬프트는 논문에서 검토되었지만 해당 기능은 공개되지 않았습니다.
유연한 통합: SAM의 프롬프트 기반 설계는 다른 시스템과의 유연한 통합을 지원합니다. 예를 들어 AR/VR 헤드셋에서 사용자의 시선을 입력받아 객체를 선택하거나, 객체 탐지기의 바운딩 박스 프롬프트를 사용해 텍스트에서 객체를 찾는 세그멘테이션을 구현할 수 있습니다.
확장 가능한 출력: 출력 마스크는 다른 AI 시스템의 입력으로 사용할 수 있습니다. 예를 들어 동영상에서 객체 마스크를 추적하고, 이미지 편집 애플리케이션을 활성화하며, 3D로 확장하거나 콜라주 같은 창작 작업에 활용할 수 있습니다.
제로샷 일반화: SAM은 객체가 무엇인지에 대한 일반적인 개념을 학습했습니다. 이러한 이해를 바탕으로 추가 학습 없이 익숙하지 않은 객체와 이미지에도 제로샷 일반화를 수행합니다.
효율적이고 유연한 모델 설계: SAM은 데이터 엔진을 구동할 수 있을 만큼 효율적으로 설계되었습니다. 모델은 1) 한 번만 실행되는 이미지 인코더와 2) 경량 마스크 디코더로 분리됩니다. 이미지 인코더는 ViT-H 기반이며 632M개의 파라미터를 사용하고 NVIDIA A100 GPU에서 약 0.15초가 걸립니다. 마스크 디코더는 Transformer 기반으로, 프롬프트 인코더와 함께 4M개의 파라미터를 사용하며 멀티스레드 SIMD 실행을 이용하면 브라우저의 CPU에서 약 50ms 만에 실행됩니다. 플랫폼 측면에서 이미지 인코더는 PyTorch로 구현되어 GPU가 필요합니다. 프롬프트 인코더와 마스크 디코더는 PyTorch에서 직접 실행하거나 ONNX로 변환해 ONNX 런타임을 지원하는 플랫폼의 CPU 또는 GPU에서 효율적으로 실행할 수 있습니다. 모델은 256개의 A100 GPU에서 3~5일 동안 학습되었습니다.
데이터 엔진 및 데이터셋
SAM의 고급 기능은 모델을 활용하는 ‘데이터 엔진’을 통해 수집한 수백만 개의 이미지와 마스크로 학습한 결과입니다. 연구진은 SAM과 데이터를 사용해 이미지를 대화형으로 주석 처리하고 모델을 업데이트하는 과정을 반복하며 두 요소를 모두 개선했습니다. SAM의 도움으로 충분한 마스크에 주석을 단 후에는, 모호성을 인식하는 SAM의 정교한 설계를 활용했습니다. 이미지에 포인트 그리드를 제시하고 각 포인트에서 모든 대상을 분할하도록 SAM에 요청해 새 이미지를 완전히 자동으로 주석 처리한 것입니다. 최종 데이터셋인 SA-1B에는 약 1,100만 개의 라이선스 취득 및 개인정보 보호 이미지에서 수집한 11억 개 이상의 세그멘테이션 마스크가 포함되어 있습니다.
자주 묻는 질문
- 모델이 마스크 라벨을 생성하나요? 아니요. 모델은 객체 마스크만 예측하며 라벨은 생성하지 않습니다.
- 동영상에서 작동하나요? 현재 모델은 이미지 또는 동영상의 개별 프레임만 지원합니다.
- 코드는 어디에서 찾을 수 있나요? 코드는 GitHub에서 제공됩니다.
요금 정보
페이지에는 요금 정보가 언급되어 있지 않습니다. 모델 코드와 데이터셋은 무료로 제공됩니다.
트래픽 분석
이 도구의 트래픽, 순위 및 참여도 지표입니다.
방문 추이
추이 데이터 없음
참여도
- 이탈률--
- 방문당 페이지 수--
- 평균 체류 시간--
트래픽 소스
소스 데이터 없음
주요 국가
국가 데이터 없음