Kunst

ControlNet Pose

Erstellt Bilder mit derselben Pose wie im Eingabebild.

Aufrufe 9,0M
Monatliche Besuche 9,0M
Globaler Rang ##7,083
Stimmen 0

Über dieses Tool

Wichtigste Funktionen

Verwendet das Modell jagilley/controlnet-pose, um Bilder mit Menschen mithilfe der Pose-Erkennung zu bearbeiten. Geben Sie ein Bild und einen Prompt ein, um wie bei Stable Diffusion ein Bild zu erzeugen; Openpose erkennt die Pose automatisch.

Modellbeschreibung

ControlNet ist eine neuronale Netzwerkstruktur, mit der sich vortrainierte große Diffusionsmodelle steuern und um zusätzliche Eingabebedingungen über Prompts hinaus erweitern lassen. ControlNet lernt aufgabenbezogene Bedingungen durchgängig und bleibt auch bei kleinen Trainingsdatensätzen (< 50k Beispiele) robust. Große Diffusionsmodelle wie Stable Diffusion können durch ControlNets bedingte Eingaben wie Kantenkarten, Segmentierungskarten und Keypoints unterstützen.

Eingabeparameter

  • image: Eingabebild (erforderlich).
  • prompt: Prompt für das Modell (erforderlich; Standard: „an astronaut on the moon, digital art“).
  • num_samples: Anzahl der Samples; höhere Werte können OOM verursachen (Standard: „1“).
  • image_resolution: Auflösung des erzeugten Bildes (Standard: „512“).
  • low_threshold / high_threshold: niedriger/hoher Schwellenwert für die Canny-Linienerkennung (Standard: 100/200).
  • ddim_steps: Schritte (Standard: 20).
  • scale: Maßstab für die klassifikatorfreie Führung (Standard: 9).
  • seed: Seed.
  • eta: Steuert die während der Diffusion zur Entrauschung hinzugefügte Rauschmenge; ein höherer Wert bedeutet mehr Rauschen (Standard: 0).
  • a_prompt: zusätzlicher Text, der an den Prompt angehängt wird (Standard: „best quality, extremely detailed“).
  • n_prompt: negativer Prompt (Standard: „longbody, lowres, bad anatomy...“)
  • detect_resolution: Auflösung, bei der die Erkennung angewendet wird (Standard: 512).

Nutzung und Kosten

Kann über Node.js, Python und die HTTP-API auf Replicate oder lokal mit Cog und Docker ausgeführt werden. Das Modell richtet sich an KI-Entwickler und Fans der Bildgenerierung. Der zentrale Vorteil ist die Erzeugung hochwertiger Bilder aus Text-Prompts bei gleichzeitiger strikter Beibehaltung der menschlichen Pose aus dem Eingabebild.

Die Ausführung auf Replicate kostet ungefähr $0.15 pro Lauf beziehungsweise 6 Läufe pro $1, abhängig von den Eingaben. Das Modell läuft auf einer Nvidia-A100-GPU (80GB). Vorhersagen werden typischerweise innerhalb von 108 Sekunden abgeschlossen. Der erste API-Aufruf startet das kalte Modell und kann länger dauern.

#Generative Art

Traffic-Analyse

Traffic-, Ranking- und Engagement-Signale für dieses Tool.

Globaler Rang ##7,083
Länder-Ranking #463
Monatliche Besuche 9,0M

Besuchstrend

Keine Trenddaten

Engagement

  • Absprungrate--
  • Seiten pro Besuch--
  • Durchschnittliche Dauer--

Traffic-Quellen

Keine Quelldaten

Top-Länder

Keine Länderdaten

Interface-Vorschau

Nutzerbewertungen