Помощник по дизайну
Segment Anything (Meta)
Проект с открытым исходным кодом для выделения любых объектов на любых изображениях.
Об этом инструменте
Основные функции и возможности
Segment Anything Model (SAM) — модель ИИ от Meta AI, которая позволяет одним щелчком выделять любой объект на любом изображении. Это система сегментации с поддержкой подсказок и zero-shot generalization для незнакомых объектов и изображений без дополнительного обучения.
Разные типы подсказок: подсказки, указывающие, что нужно сегментировать, позволяют выполнять широкий спектр задач без дополнительного обучения. Поддерживаются точки переднего плана и фона, bounding box и mask. Текстовые подсказки рассматриваются в статье, но эта возможность не выпущена.
Гибкая интеграция: SAM может получать подсказки от других систем — например, использовать направление взгляда пользователя с AR/VR-гарнитуры для выбора объекта или bounding box от детектора объектов для text-to-object segmentation.
Расширяемые результаты: выходные masks можно передавать другим системам ИИ. Например, masks объектов можно отслеживать в видео, использовать в приложениях для редактирования изображений, преобразовывать в 3D или применять в творческих задачах, таких как создание коллажей.
Эффективная и гибкая архитектура: SAM разработан достаточно эффективно для работы его data engine. Модель разделена на одноразовый image encoder на базе ViT-H с 632M параметров, работающий около 0,15 секунды на GPU NVIDIA A100, и лёгкий mask decoder на базе Transformer. Вместе с prompt encoder он содержит 4M параметров и работает около 50 мс на CPU в браузере при многопоточном SIMD-выполнении. Image encoder реализован в PyTorch и требует GPU. Prompt encoder и mask decoder могут работать напрямую в PyTorch или быть преобразованы в ONNX для эффективной работы на CPU или GPU на платформах с поддержкой ONNX runtime. Модель обучалась 3–5 дней на 256 GPU A100.
Data Engine и Dataset
Возможности SAM стали результатом обучения на миллионах изображений и masks, собранных с помощью model-in-the-loop data engine. Исследователи интерактивно аннотировали изображения с помощью SAM и его данных, обновляя модель в повторяющемся цикле. После разметки достаточного количества masks они использовали дизайн SAM с учётом неоднозначности: подавали модели сетку точек на изображении и просили сегментировать всё в каждой точке. Итоговый dataset SA-1B включает более 1,1 миллиарда segmentation masks, собранных примерно из 11 миллионов лицензированных изображений с сохранением конфиденциальности.
Часто задаваемые вопросы
- Создаёт ли модель labels для masks? Нет, модель предсказывает только object masks и не создаёт labels.
- Работает ли модель с видео? Сейчас поддерживаются только изображения или отдельные кадры видео.
- Где найти код? Код доступен на GitHub.
Информация о ценах
На странице нет информации о ценах; код модели и dataset доступны бесплатно.
Анализ трафика
Данные о трафике, рейтинге и вовлечённости этого инструмента.
Динамика посещений
Нет данных о динамике
Вовлечённость
- Показатель отказов--
- Страниц за посещение--
- Средняя длительность--
Источники трафика
Нет данных об источниках
Основные страны
Нет данных по странам