Nghệ thuật
ControlNet Pose
Tạo hình ảnh có cùng tư thế với hình ảnh đầu vào.
Giới thiệu về công cụ này
Tính năng chính
Sử dụng mô hình jagilley/controlnet-pose để chỉnh sửa hình ảnh có người bằng tính năng phát hiện tư thế. Nhập một hình ảnh và prompt để tạo hình như với Stable Diffusion; Openpose sẽ tự động phát hiện tư thế.
Mô tả mô hình
ControlNet là một cấu trúc mạng nơ-ron cho phép kiểm soát các mô hình khuếch tán lớn đã được huấn luyện trước, đồng thời hỗ trợ thêm các điều kiện đầu vào ngoài prompt. ControlNet học các điều kiện dành riêng cho từng tác vụ theo phương thức end-to-end và vẫn học ổn định ngay cả khi tập dữ liệu huấn luyện nhỏ (< 50k mẫu). Các mô hình khuếch tán lớn như Stable Diffusion có thể được bổ sung ControlNet để hỗ trợ đầu vào có điều kiện như bản đồ cạnh, bản đồ phân đoạn và keypoint.
Tham số đầu vào
image: hình ảnh đầu vào (bắt buộc).prompt: prompt cho mô hình (bắt buộc; mặc định: “an astronaut on the moon, digital art”).num_samples: số lượng mẫu; giá trị cao hơn có thể gây OOM (mặc định: “1”).image_resolution: độ phân giải hình ảnh được tạo (mặc định: “512”).low_threshold/high_threshold: ngưỡng thấp/cao để phát hiện đường Canny (mặc định: 100/200).ddim_steps: số bước (mặc định: 20).scale: hệ số hướng dẫn không phân loại (mặc định: 9).seed: seed.eta: kiểm soát lượng nhiễu được thêm vào trong quá trình khuếch tán khử nhiễu; giá trị cao hơn tạo ra nhiều nhiễu hơn (mặc định: 0).a_prompt: văn bản bổ sung được thêm vào prompt (mặc định: “best quality, extremely detailed”).n_prompt: prompt phủ định (mặc định: “longbody, lowres, bad anatomy...”)detect_resolution: độ phân giải áp dụng phương pháp phát hiện (mặc định: 512).
Cách dùng và chi phí
Có thể chạy trên Replicate qua Node.js, Python và HTTP API, hoặc chạy cục bộ bằng Cog và Docker. Mô hình hướng đến các nhà phát triển AI và người yêu thích tạo ảnh. Ưu điểm chính là tạo hình ảnh chất lượng cao từ prompt văn bản trong khi vẫn giữ nguyên tư thế của người trong hình ảnh đầu vào.
Chi phí trên Replicate khoảng $0.15 mỗi lần chạy, tương đương 6 lần chạy với $1, tùy thuộc vào đầu vào. Mô hình chạy trên GPU Nvidia A100 (80GB). Dự đoán thường hoàn tất trong 108 giây. Lần gọi API đầu tiên sẽ khởi động mô hình đang ở trạng thái lạnh và có thể lâu hơn.
Phân tích lưu lượng truy cập
Các chỉ số về lưu lượng truy cập, thứ hạng và mức độ tương tác của công cụ này.
Xu hướng lượt truy cập
Không có dữ liệu xu hướng
Mức độ tương tác
- Tỷ lệ thoát--
- Số trang mỗi lượt truy cập--
- Thời lượng trung bình--
Nguồn lưu lượng truy cập
Không có dữ liệu nguồn
Các quốc gia hàng đầu
Không có dữ liệu quốc gia