Trình tạo hình ảnh
Deep floyd
DeepFloyd IF là mô hình mô-đun gồm một bộ mã hóa văn bản đóng băng và ba mô-đun khuếch tán pixel xếp tầng: mô hình cơ sở tạo ảnh 64x64 px từ prompt văn bản và hai mô hình siêu phân giải tạo ảnh 256x256 px và 1024x1024 px.
Giới thiệu về công cụ này
Tính năng và đặc điểm chính
DeepFloyd IF là mô hình mô-đun gồm một bộ mã hóa văn bản đóng băng và ba mô-đun khuếch tán pixel xếp tầng: mô hình cơ sở tạo ảnh 64x64 px dựa trên prompt văn bản và hai mô hình siêu phân giải được thiết kế để tạo ảnh 256x256 px và 1024x1024 px. Tất cả các giai đoạn đều sử dụng bộ mã hóa văn bản đóng băng dựa trên transformer T5 để trích xuất embedding văn bản, sau đó đưa vào kiến trúc UNet được tăng cường bằng cross-attention và attention pooling. Mô hình vượt qua các mô hình hiện đại hiện nay và đạt điểm FID zero-shot 6.66 trên tập dữ liệu COCO, cho thấy tiềm năng của các kiến trúc UNet lớn hơn trong giai đoạn đầu của mô hình khuếch tán xếp tầng.
Chế độ và trường hợp sử dụng
- Dream (văn bản thành hình ảnh): tạo ảnh dựa trên prompt văn bản với các tham số có thể tùy chỉnh như
guidance_scalevàsample_timestep_respacing. - Dịch hình ảnh sang hình ảnh zero-shot: đầu ra của prompt được tạo theo phong cách của
support_pil_img, hỗ trợ các phong cách như origami chuyên nghiệp, tranh sơn dầu, khối nhựa xây dựng và anime cổ điển. - Siêu phân giải: người dùng có thể chạy IF-II, IF-III hoặc Stable x4 trên một hình ảnh không nhất thiết được tạo bởi IF để nâng cấp ảnh độ phân giải thấp lên độ phân giải cao.
- Inpainting zero-shot: thực hiện tô vẽ lại cục bộ dựa trên ảnh gốc, mặt nạ inpainting và prompt văn bản được cung cấp.
Sử dụng và tích hợp
- Tích hợp với thư viện Hugging Face Diffusers và sử dụng cơ chế chuyển tải mô hình sang CPU để chạy toàn bộ pipeline IF với chỉ 14 GB VRAM. Khi dùng
torch>=2.0.0, phải xóa tất cả các hàmenable_xformers_memory_efficient_attention(). - Người dùng cần có tài khoản Hugging Face, chấp nhận giấy phép trên thẻ mô hình và đăng nhập cục bộ bằng
huggingface_hubvới access token. - Cũng có thể cài đặt cục bộ qua thư viện Python
deepfloyd_if, yêu cầuxformersvà CLIP.
Yêu cầu phần cứng
- Cần tối thiểu 16GB VRAM cho IF-I-XL (4.3B) và IF-II-L (1.2B); cần 24GB VRAM nếu muốn thêm bộ nâng cấp Stable x4 lên 1024x1024. Cần có
xformersvà đặt biến môi trườngFORCE_MEM_EFFICIENT_ATTN=1.
Model zoo và quy mô
Bao gồm các mô hình với nhiều kích thước tham số như IF-I-M (400M), IF-I-L (900M), IF-I-XL (4.3B), IF-II-M (450M), IF-II-L (1.2B) và IF-III-L (700M).
Giá và giấy phép
Mã nguồn được phát hành theo một giấy phép riêng với một số điều khoản hạn chế. Bản phát hành ban đầu của mô hình IF tạm thời được cấp phép giới hạn chỉ cho mục đích nghiên cứu, với dự định phát hành một mô hình hoàn toàn mã nguồn mở sau này. Có thể truy cập miễn phí trọng số mô hình qua Hugging Face.
Phân tích lưu lượng truy cập
Các chỉ số về lưu lượng truy cập, thứ hạng và mức độ tương tác của công cụ này.
Xu hướng lượt truy cập
Không có dữ liệu xu hướng
Mức độ tương tác
- Tỷ lệ thoát--
- Số trang mỗi lượt truy cập--
- Thời lượng trung bình--
Nguồn lưu lượng truy cập
Không có dữ liệu nguồn
Các quốc gia hàng đầu
Không có dữ liệu quốc gia