Trình tạo hình ảnh

Deep floyd

DeepFloyd IF là mô hình mô-đun gồm một bộ mã hóa văn bản đóng băng và ba mô-đun khuếch tán pixel xếp tầng: mô hình cơ sở tạo ảnh 64x64 px từ prompt văn bản và hai mô hình siêu phân giải tạo ảnh 256x256 px và 1024x1024 px.

Lượt xem 416,3M
Lượt truy cập hàng tháng 416,3M
Xếp hạng toàn cầu ##76
Lượt bình chọn 0

Giới thiệu về công cụ này

Tính năng và đặc điểm chính

DeepFloyd IF là mô hình mô-đun gồm một bộ mã hóa văn bản đóng băng và ba mô-đun khuếch tán pixel xếp tầng: mô hình cơ sở tạo ảnh 64x64 px dựa trên prompt văn bản và hai mô hình siêu phân giải được thiết kế để tạo ảnh 256x256 px và 1024x1024 px. Tất cả các giai đoạn đều sử dụng bộ mã hóa văn bản đóng băng dựa trên transformer T5 để trích xuất embedding văn bản, sau đó đưa vào kiến trúc UNet được tăng cường bằng cross-attention và attention pooling. Mô hình vượt qua các mô hình hiện đại hiện nay và đạt điểm FID zero-shot 6.66 trên tập dữ liệu COCO, cho thấy tiềm năng của các kiến trúc UNet lớn hơn trong giai đoạn đầu của mô hình khuếch tán xếp tầng.

Chế độ và trường hợp sử dụng

  1. Dream (văn bản thành hình ảnh): tạo ảnh dựa trên prompt văn bản với các tham số có thể tùy chỉnh như guidance_scalesample_timestep_respacing.
  2. Dịch hình ảnh sang hình ảnh zero-shot: đầu ra của prompt được tạo theo phong cách của support_pil_img, hỗ trợ các phong cách như origami chuyên nghiệp, tranh sơn dầu, khối nhựa xây dựng và anime cổ điển.
  3. Siêu phân giải: người dùng có thể chạy IF-II, IF-III hoặc Stable x4 trên một hình ảnh không nhất thiết được tạo bởi IF để nâng cấp ảnh độ phân giải thấp lên độ phân giải cao.
  4. Inpainting zero-shot: thực hiện tô vẽ lại cục bộ dựa trên ảnh gốc, mặt nạ inpainting và prompt văn bản được cung cấp.

Sử dụng và tích hợp

  • Tích hợp với thư viện Hugging Face Diffusers và sử dụng cơ chế chuyển tải mô hình sang CPU để chạy toàn bộ pipeline IF với chỉ 14 GB VRAM. Khi dùng torch>=2.0.0, phải xóa tất cả các hàm enable_xformers_memory_efficient_attention().
  • Người dùng cần có tài khoản Hugging Face, chấp nhận giấy phép trên thẻ mô hình và đăng nhập cục bộ bằng huggingface_hub với access token.
  • Cũng có thể cài đặt cục bộ qua thư viện Python deepfloyd_if, yêu cầu xformers và CLIP.

Yêu cầu phần cứng

  • Cần tối thiểu 16GB VRAM cho IF-I-XL (4.3B) và IF-II-L (1.2B); cần 24GB VRAM nếu muốn thêm bộ nâng cấp Stable x4 lên 1024x1024. Cần có xformers và đặt biến môi trường FORCE_MEM_EFFICIENT_ATTN=1.

Model zoo và quy mô

Bao gồm các mô hình với nhiều kích thước tham số như IF-I-M (400M), IF-I-L (900M), IF-I-XL (4.3B), IF-II-M (450M), IF-II-L (1.2B) và IF-III-L (700M).

Giá và giấy phép

Mã nguồn được phát hành theo một giấy phép riêng với một số điều khoản hạn chế. Bản phát hành ban đầu của mô hình IF tạm thời được cấp phép giới hạn chỉ cho mục đích nghiên cứu, với dự định phát hành một mô hình hoàn toàn mã nguồn mở sau này. Có thể truy cập miễn phí trọng số mô hình qua Hugging Face.

Phân tích lưu lượng truy cập

Các chỉ số về lưu lượng truy cập, thứ hạng và mức độ tương tác của công cụ này.

Xếp hạng toàn cầu ##76
Xếp hạng theo quốc gia #113
Lượt truy cập hàng tháng 416,3M

Xu hướng lượt truy cập

Không có dữ liệu xu hướng

Mức độ tương tác

  • Tỷ lệ thoát--
  • Số trang mỗi lượt truy cập--
  • Thời lượng trung bình--

Nguồn lưu lượng truy cập

Không có dữ liệu nguồn

Các quốc gia hàng đầu

Không có dữ liệu quốc gia

Bản xem trước giao diện

Đánh giá của người dùng