ছবি জেনারেটর

Deep floyd

DeepFloyd IF একটি মডুলার সিস্টেম, যাতে একটি frozen text encoder এবং তিনটি cascaded pixel diffusion module রয়েছে: 64x64 px ছবি তৈরির base model এবং 256x256 px ও 1024x1024 px-এর জন্য দুটি super-resolution model।

ভিউ 416.3M
মাসিক ভিজিট 416.3M
বৈশ্বিক র‍্যাঙ্ক ##76
ভোট 0

এই টুল সম্পর্কে

মূল বৈশিষ্ট্য

DeepFloyd IF একটি মডুলার সিস্টেম, যাতে একটি frozen text encoder এবং তিনটি cascaded pixel diffusion module রয়েছে। Base model টেক্সট প্রম্পটের ভিত্তিতে 64x64 px ছবি তৈরি করে, আর দুটি super-resolution model যথাক্রমে 256x256 px ও 1024x1024 px রেজোলিউশনের ছবি তৈরি করে। সব ধাপে T5 transformer-ভিত্তিক frozen text encoder ব্যবহার করে text embeddings বের করা হয়; এগুলো cross-attention ও attention pooling-সমৃদ্ধ UNet architecture-এ পাঠানো হয়। মডেলটি বর্তমান state-of-the-art মডেলগুলোর চেয়ে ভালো ফল করে এবং COCO dataset-এ 6.66 zero-shot FID score অর্জন করে।

প্রধান মোড ও ব্যবহার

  1. Dream (Text-to-Image): guidance_scalesample_timestep_respacing-এর মতো কাস্টমাইজযোগ্য প্যারামিটার দিয়ে টেক্সট প্রম্পট থেকে ছবি তৈরি করে।
  2. Zero-shot Image-to-Image Translation (Style Transfer): প্রম্পটের আউটপুট support_pil_img-এর স্টাইলে তৈরি হয়; professional origami, oil art, plastic building bricks ও classic anime-এর মতো স্টাইল সমর্থিত।
  3. Super Resolution: IF দিয়ে তৈরি নয় এমন ছবিতেও IF-II ও IF-III বা Stable x4 চালিয়ে কম-রেজোলিউশনের ছবি উচ্চ রেজোলিউশনে উন্নীত করা যায়।
  4. Zero-shot Inpainting: মূল ছবি, inpainting mask ও টেক্সট প্রম্পটের ভিত্তিতে ছবির নির্দিষ্ট অংশ পুনরায় আঁকে।

ব্যবহার ও ইন্টিগ্রেশন

  • Hugging Face Diffusers library-এর সঙ্গে ইন্টিগ্রেটেড। CPU offloading ব্যবহার করে মাত্র 14 GB VRAM-এ সম্পূর্ণ IF pipeline চালানো যায়। torch>=2.0.0 ব্যবহার করলে সব enable_xformers_memory_efficient_attention() ফাংশন মুছে ফেলতে হবে।
  • ব্যবহারকারীর Hugging Face account থাকতে হবে, model card-এর license গ্রহণ করতে হবে এবং access token ব্যবহার করে স্থানীয়ভাবে huggingface_hub-এ login করতে হবে।
  • deepfloyd_if Python library দিয়ে স্থানীয় installation-ও সম্ভব; এর জন্য xformers ও CLIP প্রয়োজন।

হার্ডওয়্যার প্রয়োজনীয়তা

IF-I-XL (4.3B) ও IF-II-L (1.2B)-এর জন্য কমপক্ষে 16GB VRAM প্রয়োজন। Stable x4 upscaler-সহ 1024x1024 পর্যন্ত যেতে 24GB VRAM দরকার। xformers এবং FORCE_MEM_EFFICIENT_ATTN=1 environment variable সেট করাও প্রয়োজন।

মডেল জু ও স্কেল

এতে বিভিন্ন parameter size-এর মডেল রয়েছে, যেমন IF-I-M (400M), IF-I-L (900M), IF-I-XL (4.3B), IF-II-M (450M), IF-II-L (1.2B) এবং IF-III-L (700M)।

মূল্য ও লাইসেন্স

কোডটি একটি বিশেষ license-এর অধীনে প্রকাশিত, যাতে নির্দিষ্ট কিছু বিধিনিষেধ রয়েছে। IF model-এর প্রাথমিক release সাময়িকভাবে শুধু গবেষণার উদ্দেশ্যে সীমাবদ্ধ license-এর অধীনে রয়েছে; পরে সম্পূর্ণ open-source model প্রকাশের পরিকল্পনা আছে। Model weights Hugging Face-এর মাধ্যমে বিনামূল্যে পাওয়া যায়।

ট্রাফিক বিশ্লেষণ

এই টুলের ট্রাফিক, র‍্যাঙ্কিং ও এনগেজমেন্টের সংকেত।

বৈশ্বিক র‍্যাঙ্ক ##76
দেশের র‍্যাঙ্কিং #113
মাসিক ভিজিট 416.3M

ভিজিটের প্রবণতা

প্রবণতার কোনো ডেটা নেই

এনগেজমেন্ট

  • বাউন্স রেট--
  • প্রতি ভিজিটে পৃষ্ঠা--
  • গড় সময়কাল--

ট্রাফিকের উৎস

উৎসের কোনো ডেটা নেই

শীর্ষ দেশসমূহ

দেশের কোনো ডেটা নেই

ইন্টারফেসের প্রিভিউ

ব্যবহারকারীর রিভিউ