Arte
ControlNet Pose
Crea immagini con la stessa posa dell'immagine di input.
Informazioni su questo strumento
Funzionalità principali
Utilizza il modello jagilley/controlnet-pose per modificare immagini con persone tramite il rilevamento della posa. Inserisci un'immagine e un prompt per generare un'immagine come con Stable Diffusion; Openpose rileverà automaticamente la posa.
Descrizione del modello
ControlNet è una struttura di rete neurale che consente di controllare grandi modelli di diffusione preaddestrati e di supportare condizioni di input aggiuntive oltre ai prompt. ControlNet apprende condizioni specifiche per l'attività end-to-end e mantiene un apprendimento robusto anche con un set di dati di addestramento ridotto (< 50k campioni). I grandi modelli di diffusione come Stable Diffusion possono essere ampliati con ControlNet per supportare input condizionali quali mappe dei bordi, mappe di segmentazione e keypoint.
Parametri di input
image: immagine di input (obbligatoria).prompt: prompt per il modello (obbligatorio; predefinito: “an astronaut on the moon, digital art”).num_samples: numero di campioni; valori più alti possono causare OOM (predefinito: “1”).image_resolution: risoluzione dell'immagine generata (predefinita: “512”).low_threshold/high_threshold: soglia bassa/alta per il rilevamento delle linee Canny (predefinita: 100/200).ddim_steps: passaggi (predefinito: 20).scale: scala per la guida senza classificatore (predefinita: 9).seed: seed.eta: controlla la quantità di rumore aggiunta durante il processo di diffusione con denoising; un valore più alto aggiunge più rumore (predefinito: 0).a_prompt: testo aggiuntivo da aggiungere al prompt (predefinito: “best quality, extremely detailed”).n_prompt: prompt negativo (predefinito: “longbody, lowres, bad anatomy...”)detect_resolution: risoluzione alla quale applicare il metodo di rilevamento (predefinita: 512).
Utilizzo e costi
Può essere eseguito su Replicate tramite Node.js, Python e API HTTP, oppure localmente con Cog e Docker. È rivolto a sviluppatori di IA e appassionati di generazione di immagini. Il vantaggio principale è generare immagini di alta qualità da prompt testuali preservando rigorosamente la posa umana dell'immagine di input.
Su Replicate il modello costa circa $0.15 per esecuzione, ovvero 6 esecuzioni per $1, a seconda degli input. Funziona su una GPU Nvidia A100 (80GB). Le predizioni vengono generalmente completate entro 108 secondi. La prima chiamata API avvia il modello a freddo e potrebbe richiedere più tempo.
Analisi del traffico
Segnali di traffico, ranking e coinvolgimento per questo strumento.
Tendenza delle visite
Nessun dato sulla tendenza
Coinvolgimento
- Frequenza di rimbalzo--
- Pagine per visita--
- Durata media--
Fonti di traffico
Nessun dato sulle fonti
Paesi principali
Nessun dato sui paesi