Fragen Sie zehn KI-Künstler, wie sie dafür sorgen, dass ihre Arbeiten nach ihnen aussehen, fällt früher oder später ein Wort: LoRA. Kleine Dateien, oft nur ein paar Dutzend Megabyte, trainiert auf einer Handvoll Bilder. Sie ersetzen das Basismodell nicht. Sie stupsen es an. Und in diesem Stups steckt heute ein großer Teil des wiedererkennbaren persönlichen Stils in der KI-Kunst.
Das Kürzel steht für Low-Rank Adaptation. Es stammt aus einem Microsoft-Paper von 2021 über das günstige Feintuning großer Sprachmodelle und sprang auf Bildmodelle über, sobald Stable Diffusion die Tür öffnete. Die Idee ist auf angenehme Weise knauserig: Statt Milliarden Gewichte neu zu trainieren, trainieren Sie zwei kleine Matrizen, die multipliziert die gewünschte Änderung annähern. Winziger Fußabdruck, große Reichweite. Ein vollständiges Checkpoint-Modell wiegt 2 bis 7 Gigabyte. Eine LoRA, die demselben Modell ein bestimmtes Gesicht, einen Pinselstrich, eine Lichtstimmung beibringt, kommt mit 18 Megabyte aus.
Was eine LoRA tatsächlich macht
Stellen Sie sich das Basismodell als Musiker vor, der alles spielen kann, aber keinen eigenen Geschmack hat. Eine LoRA ist eine kurze, intensive Probe an einer Art von Stück. Trainieren Sie sie auf vierzig Fotos der Glasuren einer Keramikerin, und das Modell greift von selbst nach diesen rissigen, matten Oberflächen — sogar bei einem völlig anderen Motiv. Trainieren Sie sie auf Ihren eigenen Gemälden, lernt sie Ihre Farbpalette, Ihre Kanten, die Art, wie Sie einen Horizont absichtlich verunglücken lassen.
Der Mechanismus ist wichtig, weil er die Kontrolle erklärt. Wenn Sie eine LoRA beim Generieren laden, setzen Sie ein Gewicht — meist zwischen 0 und 1, manchmal darüber hinaus. Bei 0,4 ist der Einfluss ein Vorschlag. Bei 0,9 kann er das Bild beherrschen, gelegentlich bis zum Punkt, an dem alles zu Matsch verbrennt. Künstler verbringen echte Zeit damit, die Zahl zu finden, bei der der Stil klar durchkommt, die Komposition aber noch atmet. Diese Suche ist Handwerk, kein Knopfdruck.

Training ohne Serverfarm
Hier liegt der Teil, der verändert hat, wer das überhaupt tun kann. Eine brauchbare Stil-LoRA trainieren Sie auf einer einzigen Consumer-GPU in unter einer Stunde. Werkzeuge wie Kohyas sd-scripts, OneTrainer und die diversen Trainer von civitai und Replicate machten aus einer Forschungstechnik eine Wochenendgewohnheit. Der Datensatz ist bewusst klein — 15 bis 50 Bilder für einen Stil, für ein Gesicht manchmal weniger. Beschriften Sie jedes Bild, wählen Sie ein Triggerwort, setzen Sie eine Lernrate, lassen Sie es laufen.
Die Fehlerbilder sind ehrlich und schnell zu erkennen. Zu wenige Bilder oder zu viele Trainingsschritte, und die LoRA merkt sich alles, statt zu verallgemeinern — sie spuckt Ihre Trainingsfotos leicht verzerrt wieder aus, ein Problem, das man Overfitting nennt. Zu wenige Schritte, und nichts bleibt hängen. Zu vage Beschriftungen bringen dem Modell das Falsche bei; beschriften Sie ein Porträt nur mit „Frau“, entscheidet die LoRA still, dass die Frisur Ihres Modells zum Konzept „Frau“ gehört, und schweißt sie jedem an. Gute Beschriftung ist unglamourös und macht die halbe Miete aus.
Stapeln: hier wird es spannend
Eine LoRA ist ein Werkzeug. Mehrere gleichzeitig sind ein Atelier. Weil jeder Adapter unabhängig ist, können Sie eine Charakter-LoRA, eine Licht-LoRA und eine Aquarell-Textur-LoRA in derselben Generierung laden und jede auf ihr eigenes Gewicht drehen. Ein Porträtkünstler fährt sein Gesichtsmodell vielleicht auf 0,8, eine LoRA für weiches Streiflicht auf 0,5 und eine Korn-LoRA auf 0,3, um den plastikhaften KI-Glanz zu töten. Das Ergebnis sieht nach keiner dieser Dateien aus. Es sieht komponiert aus.
Beim Stapeln verbrennt man sich aber auch. Zwei LoRAs, die auf überlappenden Konzepten trainiert wurden, kämpfen gegeneinander — laden Sie zwei verschiedene „Anime-Stil“-Adapter, bekommen Sie oft einen verschmierten Durchschnitt aus beiden, schlechter als jeder einzeln. Gewichte wirken nicht-linear zusammen, also fällt eine Kombination, die bei einem Satz Zahlen glänzt, auseinander, sobald Sie einen einzigen Regler bewegen. Der praktische Weg: Adapter einzeln einführen, ein Gewicht fixieren, dann den nächsten hinzunehmen. Bildhauer machen es mit Ton genauso — auftragen, zurücktreten, schauen, wieder auftragen.
Die Ethik, die niemand überspringen kann
Eine Technik, die so billig und mit so wenigen Bildern zu trainieren ist, läuft direkt in die Frage der Einwilligung. Trainieren Sie eine LoRA auf dem Portfolio einer lebenden Illustratorin, haben Sie eine Maschine gebaut, die eine konkrete, arbeitende Künstlerin namentlich imitiert — ungefragt. Das passiert ständig, und es ist die hässlichste Ecke der ganzen Szene. Manche Plattformen verbieten inzwischen Stil-LoRAs benannter Künstler oder verlangen die Erlaubnis der Betroffenen; die Durchsetzung ist lückenhaft. Die ehrlichen Künstler, auf die ich verweisen würde, trainieren auf ihrer eigenen Arbeit, auf gemeinfreiem Material oder auf selbst fotografierten Aufnahmen — und sie sagen es dazu.

Es gibt auch einen defensiven Gebrauch. Immer mehr Kreative trainieren LoRAs auf ihrem eigenen Katalog, gerade damit ihnen der Adapter gehört, statt ihren Stil verstreut in fremden gescrapten Datensätzen zu lassen. Eine seltsame Umkehrung: Dasselbe Werkzeug, das Imitation ermöglicht, lässt eine Künstlerin auch einzäunen und festhalten, was ihre Arbeit zu ihrer macht.
Warum es sich gehalten hat
Größere Basismodelle kommen laufend hinzu — Flux, SDXL und der Rest — und jedes Mal sorgten sich die Leute, LoRAs würden überflüssig. Sind sie nicht. Der Grund ist banal und haltbar: Allgemeinheit ist der Feind des Stils. Ein auf alles trainiertes Basismodell mittelt zur Mitte hin. Stil lebt an den Rändern, im Konkreten, in den Macken, die ein kleiner Datensatz mitträgt. Solange Künstler wollen, dass ihre Arbeit nach einer Entscheidung aussieht und nicht nach einer Voreinstellung, schlägt der kleine Adapter das riesige Modell.
Wollen Sie den Unterschied spüren, generieren Sie denselben Prompt zweimal — einmal nackt, einmal mit einer Stil-LoRA, die Sie auf fünf eigenen Bildern bei Gewicht 0,7 trainiert haben. Das zweite Bild wird in irgendeiner technischen Hinsicht schlechter sein und in jeder Hinsicht, die zählt, weit interessanter. Dieser Abstand ist das ganze Argument.
Möchten Sie LoRA-getriebene Stile in fertigen Arbeiten sehen oder Ihren eigenen Look bauen? Entdecken Sie Galerie und Werkzeuge auf ai-art-designer.de.
Bilder: AI-Designed
Dieser Beitrag ist auch verfügbar auf:
Deutsch

