Trợ lý thiết kế
Segment Anything (Meta)
Dự án mã nguồn mở giúp tách bất kỳ đối tượng nào khỏi bất kỳ hình ảnh nào.
Giới thiệu về công cụ này
Chức năng và tính năng chính
Segment Anything Model (SAM) là mô hình AI mới của Meta AI, có thể tách bất kỳ đối tượng nào trong bất kỳ hình ảnh nào chỉ bằng một cú nhấp. SAM là hệ thống phân đoạn có thể điều khiển bằng prompt, với khả năng khái quát zero-shot sang các đối tượng và hình ảnh chưa từng gặp mà không cần huấn luyện bổ sung.
Đa dạng prompt đầu vào: các prompt chỉ rõ nội dung cần phân đoạn trong hình ảnh cho phép thực hiện nhiều tác vụ phân đoạn mà không cần huấn luyện thêm. Các loại prompt được hỗ trợ gồm điểm tiền cảnh/hậu cảnh, hộp giới hạn và mask. Prompt văn bản được đề cập trong bài báo nhưng tính năng này chưa được phát hành.
Tích hợp linh hoạt: thiết kế có thể điều khiển bằng prompt của SAM cho phép tích hợp linh hoạt với các hệ thống khác. SAM có thể nhận prompt từ hệ thống khác, chẳng hạn hướng nhìn của người dùng từ kính AR/VR để chọn đối tượng hoặc prompt hộp giới hạn từ bộ phát hiện đối tượng nhằm hỗ trợ phân đoạn từ văn bản đến đối tượng.
Đầu ra có thể mở rộng: các mask đầu ra có thể được dùng làm đầu vào cho những hệ thống AI khác. Ví dụ, mask đối tượng có thể được theo dõi trong video, hỗ trợ ứng dụng chỉnh sửa hình ảnh, chuyển thành dữ liệu 3D hoặc dùng cho các tác vụ sáng tạo như ghép ảnh.
Khái quát zero-shot: SAM đã học được khái niệm tổng quát về đối tượng, nhờ đó có thể khái quát zero-shot sang các đối tượng và hình ảnh chưa quen thuộc mà không cần huấn luyện bổ sung.
Thiết kế mô hình hiệu quả và linh hoạt: SAM được thiết kế đủ hiệu quả để vận hành công cụ dữ liệu của mình. Mô hình gồm bộ mã hóa hình ảnh dựa trên ViT-H, chỉ chạy một lần, có 632 triệu tham số và mất khoảng 0,15 giây trên GPU NVIDIA A100; cùng bộ giải mã mask nhẹ dựa trên Transformer, có 4 triệu tham số khi kết hợp với bộ mã hóa prompt và mất khoảng 50 ms trên CPU trong trình duyệt nhờ thực thi SIMD đa luồng. Bộ mã hóa hình ảnh được triển khai bằng PyTorch và yêu cầu GPU. Bộ mã hóa prompt và bộ giải mã mask có thể chạy trực tiếp bằng PyTorch hoặc chuyển đổi sang ONNX để chạy hiệu quả trên CPU hoặc GPU trên các nền tảng hỗ trợ ONNX Runtime. Mô hình được huấn luyện trong 3-5 ngày trên 256 GPU A100.
Công cụ dữ liệu và bộ dữ liệu
Các khả năng nâng cao của SAM là kết quả của việc huấn luyện trên hàng triệu hình ảnh và mask được thu thập thông qua một công cụ dữ liệu có mô hình tham gia vào quy trình. Các nhà nghiên cứu dùng SAM và dữ liệu của nó để chú thích hình ảnh tương tác và cập nhật mô hình, lặp lại chu trình này để cải thiện cả hai. Sau khi chú thích đủ mask với sự hỗ trợ của SAM, họ tận dụng thiết kế nhận biết tính mơ hồ của SAM để tự động chú thích hoàn toàn các hình ảnh mới bằng cách cung cấp cho SAM một lưới điểm trên hình ảnh và yêu cầu phân đoạn mọi thứ tại mỗi điểm. Bộ dữ liệu cuối cùng, SA-1B, gồm hơn 1,1 tỷ mask phân đoạn được thu thập từ khoảng 11 triệu hình ảnh được cấp phép và bảo vệ quyền riêng tư.
Câu hỏi thường gặp
- Mô hình có tạo nhãn cho mask không? Không. Mô hình chỉ dự đoán mask đối tượng và không tạo nhãn.
- Mô hình có hoạt động với video không? Hiện tại mô hình chỉ hỗ trợ hình ảnh hoặc từng khung hình riêng lẻ của video.
- Có thể tìm mã nguồn ở đâu? Mã nguồn có trên GitHub.
Thông tin giá
Trang này không đề cập thông tin giá; mã nguồn mô hình và bộ dữ liệu được cung cấp miễn phí.
Phân tích lưu lượng truy cập
Các chỉ số về lưu lượng truy cập, thứ hạng và mức độ tương tác của công cụ này.
Xu hướng lượt truy cập
Không có dữ liệu xu hướng
Mức độ tương tác
- Tỷ lệ thoát--
- Số trang mỗi lượt truy cập--
- Thời lượng trung bình--
Nguồn lưu lượng truy cập
Không có dữ liệu nguồn
Các quốc gia hàng đầu
Không có dữ liệu quốc gia