Hoe je realistische avatars maakt met Stable Diffusion en ComfyUI

Laatste update: 21/10/2025

  • IP-Adapter/InstantID en LoRA vormen de meest robuuste combinatie voor het vaststellen van de identiteit met variaties in houding, licht en achtergrond.
  • Door denoise, CFG en seed onder controle te houden, kun je de gezichtsconsistentie tussen shots behouden.
  • Eén foto is voldoende, maar een LoRA met 10–30 afbeeldingen verhoogt de consistentie aanzienlijk.
  • De /r/StableDiffusion- en ComfyUI-community's bieden streams en ondersteuning onder SFW-regels en een vriendelijke behandeling.

Hoe je realistische avatars maakt met Stable Diffusion + ComfyUI

¿Hoe maak je realistische avatars met Stable Diffusion + ComfyUI? Het creëren van een realistische en consistente avatar met Stable Diffusion en ComfyUI is een steeds haalbaarder doel, maar het vereist een beetje techniek en een goed beoordelingsvermogen. Het belangrijkste is om de identiteit (gezichtskenmerken, kapsel, structuur) te behouden, terwijl je de achtergrond, belichting en gezichtsuitdrukkingen varieert., waarvoor vaak een combinatie van workflow, specifieke knooppunten en soms hulpmodellen zoals LoRA of embeddings nodig is.

Veel gebruikers hebben last van dit probleem: met een referentiefoto lijkt de ene keer dat er een goede gelijkenis is, maar in de volgende opname verandert het kapsel of de kleur van de ogen. U hebt vast wel eens gehoord van embedding (tekstinversie), LoRA en ControlNet, en het is logisch dat u zich afvraagt ​​welke aanpak het beste bij u past.; Daarnaast blijven opties zoals IP-Adapter en InstantID opduiken om de gezichtsconsistentie te verbeteren. In dit artikel behandelen we de meest voorkomende vragen: of één referentie voldoende is, of het beter is om een ​​LoRA te configureren of embeddings te gebruiken, en welke nodes/configuraties het beste werken in ComfyUI om stabiele avatars te verkrijgen.

Wat bedoelen we met consistentie in een avatar?

Als we het over consistentie hebben, bedoelen we dat het personage herkenbaar blijft op meerdere afbeeldingen. Het gaat om het behouden van de essentiële kenmerken (vorm van het gezicht, ogen, neus, lippen, haar) en het ‘gevoel’ van het onderwerp zelfs als we spelen met pose, mondopening, hard licht of complexe achtergronden.

Deze samenhang ontstaat door de identiteit te ‘verankeren’ in het generatieproces. Als het model niet voldoende signalen ontvangt over wie het onderwerp is, zal het de neiging hebben om te improviseren en af ​​te wijken.; daarom is het zinvol om visuele referenties, identiteitsmodules of kleine aanpassingen (LoRA, embeddings) te gebruiken om de gelijkenis te versterken.

Bovendien is het noodzakelijk om onderscheid te maken tussen welke elementen kunnen veranderen zonder de identiteit te verbreken en welke niet. Achtergrond, kleding, uitdrukking en verlichtingsschema zijn veilige variabelen; oogvorm, iriskleur, haarlijn en botstructuur, niet zozeer. Het verfijnen van die grens is een belangrijk onderdeel van het werk.

Is het mogelijk om dit te bereiken met één enkele afbeelding in ComfyUI?

Het antwoord is kort: ja, met nuances. Als u gezichtsherkenningstechnieken zoals IP-Adapter (FaceID) of InstantID gebruikt en het ruisniveau onder controle houdt, kan één foto voldoende zijn. in img2img of de sterkte van de conditionering. Uiteraard moet de foto helder, goed belicht en frontaal of semi-profiel zijn, met duidelijke gelaatstrekken.

Bij ComfyUI is een typische aanpak het combineren van een gezichtsreferentieknooppunt met een goed gedefinieerde prompt en een stabiele sampler. Visuele conditionering ‘duwt’ het model om de kenmerken te respecteren, terwijl de prompt de stijl, achtergrond of belichting dicteertAls u veel variatie in de houding nodig hebt, kunt u vertrouwen op ControlNet (OpenPose) om de houding te bepalen zonder het gezicht te vervormen.

Eén enkele afbeelding heeft echter zijn beperkingen: de specifieke uitdrukking of belichting op de foto kan ‘overleren’. Als u op zoek bent naar maximale getrouwheid en veelzijdigheid, verbeteren 6–20 referentiebeelden de generalisatie.en indien nodig zorgt een lichtgewicht LoRA op uw foto's voor superieure consistentie van opname tot opname.

Embeddings, LoRA of Fine-Tuning: hoe kiest u?

Er zijn drie hoofdroutes voor identiteitsaanpassing: embedding (tekstuele inversie), LoRA en volledige fine-tuning. Met insluitingen leert CLIP een nieuw token dat uw onderwerp vertegenwoordigt., met weinig MB en een redelijk snelle training, maar de kracht ervan is beperkt vergeleken met LoRA.

Exclusieve inhoud - Klik hier  Hoe wijzig ik de beheerder van een Google Familiegroep?

Een goed getrainde LoRA daarentegen injecteert capaciteit in de verschillende lagen van het model, waardoor kenmerken nauwkeuriger kunnen worden vastgelegd. Met 10–30 portretten met verschillende hoeken (hoeken, gezichtsuitdrukkingen, licht) en een gemiddelde training kun je een zeer hoge consistentie bereiken. in SD 1.5 of SDXL, met behoud van een kleine bestandsgrootte (tientallen MB). Dit is voor de meeste mensen de ideale grootte.

Het volledig verfijnen van het controlepunt is voorbehouden aan heel specifieke producties. Het is duur, data-intensief en overschrijft de algehele stijl van het model.In de praktijk is voor persoonlijke avatars een lichtgewicht LoRA of een goede gezichtsreferentie-pipeline doorgaans voldoende.

Aanbevolen knooppunten en blokken in ComfyUI

Een typische grafiek voor consistentie combineert het basiscontrolepunt, tekst-encoders, een stabiele sampler en identiteits-/controlemodules. Dit zijn de meest bruikbare blokken en hoe ze samenwerken:

  • Controlepunt + VAE: Laad SD 1.5 of SDXL (afhankelijk van uw esthetische voorkeuren en de benodigde bronnen). SDXL biedt details, maar vereist meer VRAM.
  • CLIP Tekstcodering (positief/negatief): Duidelijke prompts, met vermelding van het onderwerp-token (bij gebruik van LoRA of embedding) en stijl-/scène-instructies.
  • KSampler: DPM++ 2M Karras stabiele sampler, 20–35 stappen, CFG 4–7 op SDXL (6–9 op SD1.5), vaste seed voor reproduceerbaarheid.
  • IP-adapter / InstantID: conditionering door gezicht om eigenschappen te behouden; pas de sterkte (0.6–0.9) aan op basis van afwijkingen.
  • ControlNet (OpenPose/Diepte/Canny): Bepaalt de houding, het volume en de contouren, terwijl de identiteit behouden blijft via de IP-Adapter/LoRA.
  • LoRA-lader: Injecteer de LoRA van uw onderwerp met gewichten van 0.6–1.0; als het de stijl verstoort, verlaag dan het gewicht of verklein de CFG.
  • Img2Img / Tegelen: Voor zachte variaties gebruikt u denoise 0.2–0.45; hogere waarden vernietigen de identiteit.

Op deze basis is de meest stabiele combinatie doorgaans: Onderwerp LoRA + FaceID IP-Adapter + Pose ControlNetLoRA definieert het karakter, IP-Adapter corrigeert fijne kenmerken en ControlNet geeft u de vrijheid om uw kadrering en houding te variëren.

Basis stapsgewijze flow (ComfyUI)

Om te beginnen kunt u een minimale, robuuste stroom bouwen. Het is bruikbaar ongeacht of u met pure tekst begint of kleine variaties op een afbeelding aanbrengt.:

  1. Laadcontrolepunt (SDXL of SD1.5) en Laad VAE.
  2. CLIP Tekstcodering (positief): Beschrijf het onderwerp met hun token of, als er geen LoRA is, met kenmerken: «jongvolwassene, kort bruin haar, groene ogen, ovaal gezicht» + gewenste stijl («cinematisch portret, zacht keylight»).
  3. CLIP Tekstcodering (negatief): bevat artefacten die vermeden moeten worden ("wazig, misvormd, extra vingers, inconsistente ogen, verkeerde haarkleur").
  4. IP-adapter / InstantID: Verbind de referentiefoto en stel de beginsterkte in op 0.75 (pas aan tussen 0.6 en 0.9). Als u slechts één foto gebruikt, snijd deze dan bij tot het gezicht en zorg voor een goede belichting.
  5. ControlNet-houding (optioneel): definieer pose als u verschillende uitdrukkingen/gebaren wilt zonder de identiteit te verliezen.
  6. KSampler: DPM++ 2M Karras, 28–32 stappen, CFG 5.5–7 (SDXL: neigt naar een iets lagere CFG). Vaste seed voor vergelijkbare producten.
  7. VAE-decodering en indien nodig een upscaler (4x-UltraSharp, ESRGAN of SDXL Refiner voor fijne details).

Als je al een LoRA van het onderwerp, voeg het toe vóór de sampler met gewicht 0.8 (begin laag en ga omhoog als er geen gelijkenis is). Met solide LoRA kunt u de sterkte van de IP-adapter verminderen, waarbij de LoRA de identiteit afhandelt en de IP-Adapter alleen maar “corrigeert”.

Parameters die het verschil maken

Bij het afstemmen van consistentie zijn kleine parameterwijzigingen doorslaggevend. Door de conditioneringssterkte, ruisonderdrukking en het zaad te controleren, krijgt u echte stabiliteit:

  • Denoise in img2img: 0.2–0.45 behoudt kenmerken en maakt variërende belichting/achtergrond mogelijk. Vanaf 0.55 verdwijnt de identiteit.
  • CFG-schaalAls het beeld 'geforceerd' en vervormd is, verlaag dan de CFG. Als het model uw prompt negeert, verhoog hem dan met een half punt.
  • Sampler/Stappen: DPM++ 2M Karras of SDE Karras met 24–32 stappen geven doorgaans consistente resultaten zonder artefacten.
  • Zaad: Stelt de seed voor vergelijkingen in. Gebruik voor milde variatie een "variatieseed" met een sterkte van 0.1–0.3.
  • Oplossing: 768–1024 aan de langere kant accentueert fijne gelaatstrekken. Bij SDXL is 1024 de ideale maat voor details.
Exclusieve inhoud - Klik hier  Hoe gebruik je een Android-apparaat als tweede scherm op Windows?

Als de haar- of oogkleur verandert, voeg dan "verkeerde haarkleur, kleurverschuiving, inconsistente oogkleur" toe als ontkenning en herhaal dit. Het helpt ook om kleur te introduceren als positief onderdeel van elke opname. om te voorkomen dat het model ‘vergeten’ wordt.

Uitdrukkingen, achtergronden en belichting zonder verlies van identiteit

Voor variabele uitdrukkingen (glimlach, verrassing, open mond) kunt u vertrouwen op ControlNet OpenPose of, nog beter, een preprocessor van gezichtsherkenningspunten zodra deze beschikbaar is. Door de geometrie van het vlak te controleren, worden vervormingen verminderd en wordt voorkomen dat het model kenmerken verzint..

Formuleer bij belichting het schema duidelijk: "softbox van links", "randlicht", "gouden uur". Het gebruik van omgevingsreferenties (mentale HDRI, studiobeschrijvingen) stuurt schaduwen zonder de identiteit te beïnvloedenAls de huidtint verschuift, voegt u 'huidtintconsistentie' toe of stelt u de kleurtemperatuur in de prompt in.

Voor complexe achtergronden gebruikt u ControlNet Depth of Canny met een lage sterkte (0.35–0.55) en beschrijft u de omgeving bij de prompt. De IP-Adapter/LoRA moet meer gewicht hebben dan het ControlNet op de achtergrond zodat het gezicht niet vervuild wordt door vreemde contouren.

Wanneer u uw look (kleding/accessoires) wilt veranderen, voer deze dan tekstueel in en verzacht het gewicht van de LoRA als deze altijd dezelfde outfit 'sleept'. LoRA's kunnen esthetische details overschrijven en gewichten aanpassen zodat er nieuwe prompts worden verzonden..

Trainen of niet trainen: praktische richtlijnen voor LoRA/embeddings

Als een gezichtsreferentie niet voldoende is, kunt u een LoRA van het onderwerp overwegen. Gebruik 10-30 foto's met verschillende hoeken, gezichtsuitdrukkingen, achtergronden en belichtingen (maar zorg dat je gezicht schoon en scherp blijft).Snijd de korte zijde bij tot 512–768 px, zorg voor een evenwicht tussen man en vrouw als je een generalist bent en noteer de tokennaam.

Begeleidende trainingsparameters (SD1.5): rang 4–8, alfa gelijk aan rang, leertempo 1e-4 tot 5e-5, 2k–6k stappen met kleine batch. Vermijd overtraining. Als u een 'kloon' van één foto ziet, verminder dan het aantal stappen of voeg meer variatie toe.Gebruik op SDXL hogere resoluties en neem meer VRAM in beslag.

Voor inbeddingen (tekstuele omkering) werken 3-10 foto's, maar voor stabiliteit hebt u meer stappen nodig. Inbeddingen hebben minder invloed op de algehele esthetiek en wegen nauwelijks., ideaal als u een herbruikbare token wilt zonder LoRA te beheren.

Kwaliteit, schaling en retouchering

Zodra de basisafbeelding is gegenereerd, past u een 2-4x scaler (ESRGAN, 4x UltraSharp) of de SDXL-refiner toe voor gezichtsdetails. De verfijner kan de huid en ogen corrigeren zonder artefacten te introduceren, vooral als je het zaad en dezelfde prompt behoudt.

Om specifieke ogen/monden te corrigeren, kunt u ADetailer of gezichtsherstelknooppunten gebruiken. Corrigeer lokale fouten terwijl de rest van de compositie behouden blijftVermijd agressieve filters die de huid 'plastisch' maken en stel in plaats daarvan de scherpte en microcontrastinstellingen nauwkeurig af.

Veelvoorkomende problemen oplossen

Als het kapsel tussen de takes verandert, is het probleem meestal te wijten aan overmatig ruis of onduidelijke prompts. Verlaag denoise/CFG, versterk "kort bruin haar" of specificeer een specifiek kapsel in elke promptAls u LoRA gebruikt, verhoog dan het gewicht met 0.1.

Als de ogen in kleur verschillen, voeg dan toe "groene ogen, consistente oogkleur" en schrijf "inconsistente oogkleur, heterochromie" in de ontkenning. IP-Adapter/InstantID helpt ook met irisdetails als de referentie heel duidelijk is.

Als de stijl de identiteit 'opeet' (bijvoorbeeld een sterke LoRA-stijl), verlaag dan het gewicht ervan of verhoog het gewicht van de onderwerp-LoRA. Het is belangrijk om de gewichten in evenwicht te brengen om te voorkomen dat de gelijkenis verloren gaat.Een andere optie is om de CFG te verlagen, zodat het model de stijl niet zo veel forceert.

Als de variaties minimaal zijn, verhoog dan de denoise lichtjes (0.05–0.1) of gebruik variatiezaad. Een beetje willekeur creëert variatie zonder dat functies kapot gaan.

Communities en standaarden: waar u kunt leren en delen

De Stable Diffusion-community op Reddit is enorm en erg actief. In /r/StableDiffusion kun je kunst posten, vragen stellen, discussiëren en bijdragen aan nieuwe open technieken.Het is geen officieel forum, maar de bedoeling is om het open source-ecosysteem te ondersteunen en jou te helpen verbeteren.

Exclusieve inhoud - Klik hier  Welke AI-processen kun je uitschakelen zonder je Android-telefoon te beschadigen?

De ComfyUI-subreddit, ook community/onofficieel, is een geweldige plek om workflows, vragen en tips te delen. Houd uw berichten SFW, promoot geen betaalde streams, blijf on-topic en wees vooral aardig.Als u de resultaten van anderen negeert, wordt u verbannen. Het is bovendien raadzaam om uw feed niet te vol te proppen met te veel berichten achter elkaar.

Het verkennen van threads waaraan grafieken en parameters zijn gekoppeld, is een geweldige manier om uw leerproces te versnellen. Door benchmarks met vaste seeds, LoRA-gewichten en referentiebeelden te bekijken, ziet u welke instellingen daadwerkelijk werken. in praktijk.

Van foto naar video met audio: StableAvatar

Als je nog een stap verder wilt gaan en een avatar wilt hebben die 'spreekt' met behulp van audio, bekijk dan StableAvatar. Het is een raamwerk voor het genereren van hoogwaardige, tijdelijk consistente praatvideo's, mogelijk van onbeperkte lengte., beginnend met een audiotrack.

Volgens de auteurs heeft het basismodel met –GPU_memory_mode=»model_full_load» voor een clip van 5 seconden op 480x832 en 25 fps ongeveer 18 GB VRAM nodig en is de video op een 4090 GPU in ongeveer 3 minuten klaar. Dit geeft een duidelijk beeld van de benodigde bronnen en de mogelijke prestaties op moderne hardware.Code en model zijn beschikbaar op: https://github.com/Francis-Rings/StableAvatar

Het team is van mening dat er LoRA/fijnafstemming specifiek voor het systeem zal plaatsvinden. Dit biedt de mogelijkheid om de avatar en zijn gezichtsuitdrukking verder aan te passen., waarbij we de identiteit verankeren zoals we dat doen in statische beelden, maar dan in samenhangende videosequenties.

Directe antwoorden op de drie kernvragen

Wetten van Californië IA

1) Kan ik consistente avatars rechtstreeks in ComfyUI aanmaken met alleen een referentieafbeelding? Ja, met behulp van een IP-adapter (FaceID) of InstantID en een robuuste flow met gecontroleerde denoise en een vaste seed. De foto moet duidelijk en frontaal zijn; bij een enkele referentie zijn er grenzen aan extreme variatie, maar bij portretten en gematigde veranderingen werkt het heel goed.

2) Moet ik finetuning of embedding overwegen? Als je maximale robuustheid in meerdere scènes zoekt, is een lichtgewicht LoRA-object de beste optie. betere inspanning/resultaatverhoudingEmbeddings (tekstuele inversie) zijn lichter, maar vangen minder nuances. Volledige fine-tuning is zelden nodig, behalve voor zeer specifieke producties.

3) Wat zijn de aanbevolen knooppuntconfiguraties of -technieken in ComfyUI? Checkpoint + VAE + CLIP Text Encode (pos/negatief) + KSampler (DPM++ 2M Karras, 24-32 stappen, CFG 5-7) + IP-adapter/InstantID + ControlNet (pose/diepte afhankelijk van de scène). Laad LoRA van het onderwerp met gewicht 0.6–1.0 en verlaag het vermogen van de IP-adapter een beetje, zodat beide elkaar aanvullen.

4) Wat betekent stabiele diffusie en waar is het voor? In dit artikel vertellen we je er nog meer over.

Vergeet niet dat de /r/StableDiffusion- en ComfyUI-community's open ruimtes zijn waar je voorbeelden kunt delen, om feedback kunt vragen en nieuwe trucs kunt ontdekken. Houd je content SFW, vermijd het promoten van betaalde streams en wees voorzichtig met je toon bij beginners.; het niveau tussen hen allen stijgt zeer snel.

Met een goed startpunt (IP-adapter/Instant ID), een vaste seed, duidelijke prompts en ruisonderdrukking kunt u nu consistente portretten maken door instellingen, gebaren en belichting te wijzigen. Als je een LoRA ook traint met 10–30 verschillende foto’s, neemt de gelijkenis aanzienlijk toe., en met wat oefening, het finetunen van ControlNet en nabewerking levert u solide resultaten op, zelfs bij hoge resolutie. Voor degenen die verder willen gaan, laat StableAvatar zien dat hetzelfde idee van consistente identiteit kan worden toegepast op audiogestuurde video met de juiste middelen.