Wenn KI ins fliegende Klassenzimmer kommt: Ein Seminar über KI-gestützte Filmproduktion

Was passiert, wenn man angehende Filmemacher und Filmemacherinnen für ein paar Tage von der klassischen Pipeline löst und ihnen einen Werkzeugkasten voller KI-Tools in die Hand drückt? Genau das haben wir in einem Seminar an der HFF München ausprobiert.

Was passiert, wenn man angehende Filmemacher und Filmemacherinnen für ein paar Tage von der klassischen Pipeline löst und ihnen einen Werkzeugkasten voller KI-Tools in die Hand drückt? Genau das haben wir in einem Seminar zusammen mit dem KI-Lab der HFF, an der HFF München ausprobiert. Das Ziel: KI-Tools in einem geschützten Rahmen ausprobieren und überprüfen was funktioniert und was nicht. Wie weit kommt man, wenn man Charaktere, Storyboards und erste bewegte Bilder fast vollständig mit KI baut?

Schritt eins: Von der Idee zur Figur

Am Anfang steht der Charakter und seine Hintergründe. Statt direkt zu zeichnen, fingen wir mit einem Elevator Pitch an, in dem die Figur in zwei, drei Sätzen auf den Punkt gebracht werden sollte. Wie ist ihr Name? Was ist ihre Motivation? Welcher innere Konflikt brodelt in ihr?

Dieses Konzept diente als Basis für die Visualisierungen. Aus handgezeichneten Skizzen und Prompts wurden mit ChatGPT und Magnific, Bilder generiert, die der Figur ein Gesicht und eine prägnante Silhouette verliehen. Aus den Referenzbildern erstellten wir mit Tripo AI ein echtes 3D-Modell (Image-to-Model). Dieses Modell ließ sich anschließend automatisch riggen, d.h. mit einem beweglichen „Skelett“ versehen. Dazu wurde das Auto-Rigging von Tripo AI und Mixamo genutzt. Für Freiwillige bestand am Ende auch die Möglichkeit die Figur über Image-to-Video zu animieren.  

Schritt zwei: Storyboard und Previs

Mit den fertigen Figuren ging es ans Erzählen. Hier wurde der Workflow vielschichtiger. Zuerst importierten wir die Charaktere als Assets in Magnific und bauten die Szenen mit Referenzen basierend auf Google Street View oder Bildern, in dem sich unsere Figuren bewegen konnten. Beim Set-Design wurden bei Bedarf zusätzliche Props generiert, die Charaktere positioniert und in Pose gebracht. Mit der virtuellen Kamera sichteten wir in der 3D Szenen-Ansicht die ersten Stills. 

Und dann wurde es lebendig. Aus den Referenzbildern entstanden Videos, über verschiedene Wege: Motion-2-Video mit selbstgedrehten Referenzvideos, in denen Bewegungen vorgespielt wurden, dazu Text- und Image-2-Video-Ansätze, für die wir Prompts vorbereiteten. Bilder, die nicht zur Stimmung passten, ließen wir per Relightneu ausleuchten. Abschließend wurden Charaktere mit passenden Lippenbewegungen synchronisiert und mit Sound-FXsowie Musik vertont.

Je nach Anwendungsfall wurden verschiedenste Kombinationen von Workflows verwendet und experimentiert bis ein zufriedenstellendes Ergebnis herauskam. Am Ende entstand etwas, das einem echten Previs-Clip schon erstaunlich nahekam; inklusive Bild, Bewegung und Klang.

Die Tools im Überblick

Das Rückgrat bildeten Magnific und ChatGPTMagnific hat uns die Flexibilität gegeben, schnell zwischen verschiedenen Formaten und Workflows zu wechseln ohne zwischen verschiedenen Webtools wechseln zu müssen. Demnach haben wir uns auf Webtools konzentriert, statt auf lokale Workflows mit ComfyUI für eine leichtere Zugänglichkeit der Arbeitsmittel.

Hier ist eine kurze Auflistung der verwendeten Tools plus Anwendungsgebiet:

  • Bild: Magnific, ChatGPT
  • Prompt-Optimierung: ChatGPT
  • 3D Model: Tripo AI, Magnific
  • Video: Magnific
  • Synchronisation, Sound FX, Musik: Magnific

Was wir gelernt haben

So beeindruckend die Ergebnisse waren, ganz reibungslos lief es nicht. Hier möchten wir teilen, was wir in dem Prozess, über die Erstellung von Storyboards und Previs Clips mit Hilfe von KI-Tools, gelernt haben.

Schnell, aber nicht immer steuerbar. Die KI liefert in Minuten, wofür man früher Stunden brauchte. Nur folgt sie nicht immer dem, was man eigentlich im Kopf hatte. Wer eine ganz bestimmte Vision hat, muss oft hartnäckig dranbleiben. Gelegentlich gelingt es auch schon mit dem ersten Prompt.

Stark in der frühen Phase. Für die Pre-Preproduction oder für Videomaterial, das nicht dem Anspruch eines Kinofilms entsprechen muss, ist der Prozess sehr gut nutzbar. Überall dort, wo es ums schnelle Ausprobieren von Ideen geht, nicht um den finalen, perfekt kontrollierten Shot, kann der Einsatz von KI, effizient zu einem Ergebnis kommen. Es ist nicht auszuschließen, dass mit mehr Zeit und Credits auch bessere Ergebnisse produziert werden können, aber unser Fazit ist, dass diese Tools (Stand heute) noch lange nicht dem Qualitätsstandard von professionellen Filmproduktionen entsprechen.

Vorsicht vor dem Bias. Die Modelle tragen die Bilder in sich, mit denen sie trainiert wurden. Ein Drachendesign sah verdächtig nach „Drachenzähmen leicht gemacht“ aus – ein guter Reminder, dass KI gern recycelt, was sie schon kennt. Hier ist auch Vorsicht geboten: vor allem bei stereotypischen Darstellungen von Charakteren und Kopien von anderen Künstlerstilen.

Prompt-Optimierung. Wenige Worte sind manchmal mehr. Die KI kann aber auch keine Gedanken lesen. Die Qualität des Prompts hat erhebliche Auswirkungen auf die generierten Inhalte. In unserem Prozess hat es sich bewährt nach Tippfehlern Ausschau zu halten und ChatGPT zu nutzen, um jeden Prompt für den jeweiligen Output, nochmal zu optimieren. 

Eigene Skizzen schlagen reine Prompts. Eine der schönsten Erkenntnisse: Selbstgezeichnete Referenzen führten oft zu deutlich besseren Ergebnissen als bloße Textbeschreibungen. Der menschliche Pinselstrich bleibt wertvoll.

Der 3D-Raum ist Gold wert. In Magnific ist es möglich 3D Szenen zu generieren und darin Objekte und virtuelle Kameras für Bildaufnahmen zu positionieren wie in einem Puppenhaus. Gerade für die Shot-Planung war es hilfreich, die Szene tatsächlich räumlich aufzubauen und die Kameraeinstellung frei einzustellen. Es wäre mit reinem Prompting viel schwieriger gewesen, schlüssig im Raum zu erzählen.

Nicht jeder Workflow funktioniert immer. Nicht jeder Workflow funktioniert für jede kreative Idee. Was für fotorealistische Shots wunderbar klappt, kann für 2D Animationsclips furchtbar aussehen. Motion 2 Video z.B. funktioniert nur mit korrekt ausgerichteten Referenzvideos und mit humanoiden, nicht zu stark stilisierten Figuren. Ein tanzender Fantasy-Charakter? Schwierig. Eine menschenähnliche Figur mit sauberer Referenz? Klappt super.

Das filmische Gestalten bleibt menschlich. Filmische Gestaltungsprinzipien wie Einstellungsgrößen, Perspektiven, goldener Schnitt und die 180°-Regel, sind der KI nur rudimentär bekannt. Es bleibt in der Verantwortung der Filmschaffenden, mit welchen Bildern erzählt wird.

Fazit

KI ersetzt nicht das Filmemachen, aber sie kann dort Prozesse beschleunigen, wo sie für die Kommunikation von Ideen zählt: in der kreativen Frühphase und Planung. Statt bei null zu starten, kann man heute in kürzester Zeit eine Figur, eine Szene und einen ersten bewegten Eindruck visualisieren und von dort aus weiterdenken. Genau das macht diese Tools für diese explorierende Phase so spannend.

Die Technik liefert Tempo, aber die wichtigen und kreativen Entscheidungen trifft weiterhin der Mensch. Doch für den Filmschaffenden Menschen ist es wichtig, sich mit diesen Tools auseinanderzusetzen, um die Möglichkeiten und Herausforderungen zu kennen; ohne den eigenen Workflow sofort über Bord zu werfen. Und manchmal ist der beste „Prompt“ eben doch eine schnell hingeworfene Skizze mit Bleistift und Papier.

Weitere Posts