Arte
ControlNet Pose
Crea imágenes con la misma pose que la imagen de entrada.
Acerca de esta herramienta
Características principales
Utiliza el modelo jagilley/controlnet-pose para modificar imágenes con personas mediante detección de poses. Introduce una imagen y un prompt para generar una imagen como en Stable Diffusion; Openpose detectará la pose automáticamente.
Descripción del modelo
ControlNet es una estructura de red neuronal que permite controlar grandes modelos de difusión preentrenados y admitir condiciones de entrada adicionales a los prompts. Aprende condiciones específicas de cada tarea de extremo a extremo y mantiene un aprendizaje robusto incluso con conjuntos de datos pequeños (< 50k muestras). Los modelos de difusión grandes, como Stable Diffusion, pueden complementarse con ControlNets para admitir entradas condicionales como mapas de bordes, mapas de segmentación y puntos clave.
Parámetros de entrada
image: imagen de entrada (obligatoria).prompt: prompt para el modelo (obligatorio; valor predeterminado: “an astronaut on the moon, digital art”).num_samples: número de muestras; los valores altos pueden provocar OOM (valor predeterminado: “1”).image_resolution: resolución de la imagen generada (valor predeterminado: “512”).low_threshold/high_threshold: umbrales bajo y alto para la detección de líneas Canny (valor predeterminado: 100/200).ddim_steps: pasos (valor predeterminado: 20).scale: escala para la guía sin clasificador (valor predeterminado: 9).seed: semilla.eta: controla la cantidad de ruido añadido durante la difusión de eliminación de ruido; un valor mayor implica más ruido (valor predeterminado: 0).a_prompt: texto adicional que se añade al prompt (valor predeterminado: “best quality, extremely detailed”).n_prompt: prompt negativo (valor predeterminado: “longbody, lowres, bad anatomy...”)detect_resolution: resolución a la que se aplica el método de detección (valor predeterminado: 512).
Uso y coste
Puede ejecutarse en Replicate mediante Node.js, Python y la API HTTP, o localmente con Cog y Docker. Está dirigido a desarrolladores de IA y aficionados a la generación de imágenes. Su principal ventaja es generar imágenes de alta calidad a partir de prompts de texto mientras conserva estrictamente la pose humana de la imagen de entrada.
El modelo cuesta aproximadamente $0.15 por ejecución en Replicate, o 6 ejecuciones por $1, según las entradas. Utiliza una GPU Nvidia A100 (80GB). Las predicciones suelen completarse en 108 segundos. La primera llamada a la API inicia el modelo en frío y puede tardar más.
Análisis del tráfico
Señales de tráfico, clasificación y participación de esta herramienta.
Tendencia de visitas
No hay datos de tendencia
Interacción
- Tasa de rebote--
- Páginas por visita--
- Duración media--
Fuentes de tráfico
No hay datos de fuentes
Principales países
No hay datos por país