Помощник по дизайну

Segment Anything (Meta)

Проект с открытым исходным кодом для выделения любых объектов на любых изображениях.

Просмотры 499,6K
Ежемесячные посещения 499,6K
Глобальный рейтинг ##132,501
Голоса 0

Об этом инструменте

Основные функции и возможности

Segment Anything Model (SAM) — модель ИИ от Meta AI, которая позволяет одним щелчком выделять любой объект на любом изображении. Это система сегментации с поддержкой подсказок и zero-shot generalization для незнакомых объектов и изображений без дополнительного обучения.

Разные типы подсказок: подсказки, указывающие, что нужно сегментировать, позволяют выполнять широкий спектр задач без дополнительного обучения. Поддерживаются точки переднего плана и фона, bounding box и mask. Текстовые подсказки рассматриваются в статье, но эта возможность не выпущена.

Гибкая интеграция: SAM может получать подсказки от других систем — например, использовать направление взгляда пользователя с AR/VR-гарнитуры для выбора объекта или bounding box от детектора объектов для text-to-object segmentation.

Расширяемые результаты: выходные masks можно передавать другим системам ИИ. Например, masks объектов можно отслеживать в видео, использовать в приложениях для редактирования изображений, преобразовывать в 3D или применять в творческих задачах, таких как создание коллажей.

Эффективная и гибкая архитектура: SAM разработан достаточно эффективно для работы его data engine. Модель разделена на одноразовый image encoder на базе ViT-H с 632M параметров, работающий около 0,15 секунды на GPU NVIDIA A100, и лёгкий mask decoder на базе Transformer. Вместе с prompt encoder он содержит 4M параметров и работает около 50 мс на CPU в браузере при многопоточном SIMD-выполнении. Image encoder реализован в PyTorch и требует GPU. Prompt encoder и mask decoder могут работать напрямую в PyTorch или быть преобразованы в ONNX для эффективной работы на CPU или GPU на платформах с поддержкой ONNX runtime. Модель обучалась 3–5 дней на 256 GPU A100.

Data Engine и Dataset

Возможности SAM стали результатом обучения на миллионах изображений и masks, собранных с помощью model-in-the-loop data engine. Исследователи интерактивно аннотировали изображения с помощью SAM и его данных, обновляя модель в повторяющемся цикле. После разметки достаточного количества masks они использовали дизайн SAM с учётом неоднозначности: подавали модели сетку точек на изображении и просили сегментировать всё в каждой точке. Итоговый dataset SA-1B включает более 1,1 миллиарда segmentation masks, собранных примерно из 11 миллионов лицензированных изображений с сохранением конфиденциальности.

Часто задаваемые вопросы

  • Создаёт ли модель labels для masks? Нет, модель предсказывает только object masks и не создаёт labels.
  • Работает ли модель с видео? Сейчас поддерживаются только изображения или отдельные кадры видео.
  • Где найти код? Код доступен на GitHub.

Информация о ценах

На странице нет информации о ценах; код модели и dataset доступны бесплатно.

#Image Scanning

Анализ трафика

Данные о трафике, рейтинге и вовлечённости этого инструмента.

Глобальный рейтинг ##132,501
Рейтинг по стране #49,462
Ежемесячные посещения 499,6K

Динамика посещений

Нет данных о динамике

Вовлечённость

  • Показатель отказов--
  • Страниц за посещение--
  • Средняя длительность--

Источники трафика

Нет данных об источниках

Основные страны

Нет данных по странам

Предпросмотр интерфейса

Отзывы пользователей