AIQORA Reference Modus Tutorial: Konsistente Dokumentationen & Videos auf Knopfdruck
Erfahre Schritt für Schritt, wie der neue AIQORA Reference Modus mit konsistenten Charakteren, Orten und Objekten die KI-Videoproduktion revolutioniert.
Einleitung
Bisher standen Creator bei KI-generierten Langformaten wie YouTube-Dokumentationen, TikTok-Dramen oder Storytelling-Videos vor einer gewaltigen Hürde: der visuellen Inkonsistenz. Wechselnde Gesichter, ständig mutierende Kulissen und unpassende Requisiten machten längere narrative Projekte zu einem mühsamen Flickwerk, das oft Tage oder Wochen manueller Nachbearbeitung erforderte.
Mit dem Launch des neuen Reference Modus innerhalb der AIQORA KI-Plattform gehört dieses Problem endgültig der Vergangenheit an. Was früher spezialisierten Schnitt- und Regieteams vorbehalten war, lässt sich jetzt aus einer simplen Idee oder Audiodatei per One-Click-Workflow direkt in eine sendefertige Dokumentation verwandeln.
In diesem Tutorial zeigen wir dir anhand eines realen Praxisbeispiels – der packenden Entstehungsgeschichte von Nintendo und den Ursprüngen im japanischen Untergrund –, wie du den Reference Modus optimal einsetzt, visuelle Kontinuität garantierst und deine Produktionen massiv skalierst.
Das Wichtigste in Kürze
* Vollständige visuelle Konsistenz: Der Reference Modus sorgt dafür, dass Charaktere, Schlüsselorte und wiederkehrende Objekte über alle Segmente und Story-Beats hinweg identisch bleiben.
* Deep-Audio-Analyse via Gemini: Die Engine analysiert das Skript und extrahiert automatisch narrative Beats sowie wiederkehrende Story-Elemente.
* Modernste Model-Pipeline: Nahtloses Zusammenspiel aus Text-to-Speech (ElevenLabs v3), optimierter Prompt-Verteilung (MiniMax H3 Prompt Guide) und High-End-Videogenerierung.
* Zero-Cut-to-Render: Vom ersten Text-Prompt bis zum fertigen Mastervideo („Create Final Video“) sind nur wenige Klicks nötig.
* Stand: September 2026 setzt AIQORA damit einen neuen Standard für autonome Video-Agents im Creator-Bereich.
Was ist der AIQORA Reference Modus?
Der Reference Modus ist ein elementarer Baustein unseres hauseigenen Cinema Agents auf der AIQORA-Plattform. Während herkömmliche KI-Video-Tools jeden Prompt isoliert betrachten, verknüpft der Reference Modus die narrative Ebene fest mit einem globalen visuellen Gedächtnis.
Das System identifiziert eigenständig Personen, wiederkehrende Räume (wie das verrauchte Kyōtoer Hinterzimmer der 1890er Jahre) und zentrale Objekte (wie die versiegelten Hanafuda-Kartendecks oder einen lackierten Tisch) und verankert diese als visuelle Referenzen. Bei der anschließenden Videoerstellung werden diese Assets präzise in die jeweiligen Prompt-Segmente eingesteuert.
Schritt-für-Schritt-Tutorial: Deine erste Dokumentation erstellen
Im folgenden Walkthrough führen wir dich durch die Produktion einer professionellen Mini-Dokumentation im Stil erfolgreicher Kanäle wie Simplicissimus oder Fern.
Schritt 1: Skript aus einem einzigen Prompt generieren
Alles beginnt mit einem einfachen Gedanken oder einem vorbereiteten Text. Gib im System lediglich deine Grundidee ein, beispielsweise:
„Erzähle die Geschichte, wie die japanische Unterwelt vor 130 Jahren das Fundament für Nintendo legte und warum das Unternehmen jahrzehntelang versuchte, diese Historie zu verschweigen.“
Die Text-Engine generiert daraus unmittelbar ein strukturiertes, fesselndes Skript inklusive Spannungsbogen und narrativen Abschnitten. Du kannst den Text direkt übernehmen oder nach Belieben feinjustieren.
Schritt 2: Vertonung mit ElevenLabs v3
Sobald das Skript steht, wählst du den passenden Sprecher. Über die direkte Schnittstelle zu modernsten Text-to-Speech-Engines (wie ElevenLabs v3) wählst du eine Stimme mit der gewünschten Tonalität – von investigativ und düster bis sachlich-dokumentarisch.
Mit einem Klick auf Generate wird die Audiospur berechnet. Falls du Musik oder ergänzende Soundscapes integrieren möchtest, kannst du parallel unseren /music-generator nutzen, um passende Hintergrund-Tracks zu erstellen.
Schritt 3: Visual Narrative & Story Beats festlegen
Im nächsten Schritt analysiert der Agent die Audiospur und zerlegt das Skript in logische visuelle Abschnitte (Story Beats):
* Visual Narrative: Steuert den thematischen Bildfluss. Verhindert monotone Darstellungen (z. B. endlose Serverräume bei Tech-Themen) und sorgt für lebendige, dramaturgisch abgestimmte Szenen.
* Seitenverhältnis: Wähle zwischen 16:9 (für YouTube & TV) oder 9:16 (für TikTok, Reels & Shorts).
* Casting & Personen: Entscheide, ob vordefinierte Avatare besetzt werden oder ob die Figuren dynamisch aus dem Skript-Kontext entstehen sollen.
Schritt 4: Global Visual Style definieren
Um einen einheitlichen Filmlook zu gewährleisten, wird der Global Visual Style hinterlegt. Er definiert:
* Den virtuellen Kameratyp und Objektiveigenschaften (z. B. anamorphe Linsen, körniger 35mm-Filmlook),
* die Farbkorrektur (Color Grading, z. B. gedeckte Töne der Meiji-Ära),
* die Lichtstimmung und Textur.
Tipp: Generiere an dieser Stelle ein Style-Testbild über den AIQORA /images-Bereich. Dieses Testbild dient rein zur Überprüfung der Farb- und Lichtästhetik und taucht nicht zwingend im Video auf.
Schritt 5: Reference Mode aktivieren & Assets extrahieren
Nun folgt das Herzstück der Produktion:
- Aktiviere den Schalter Reference Mode.
- Das System analysiert das Audiomaterial und schlägt automatisch wiederkehrende Kern-Elemente vor:
* Locations: Das Kyōtoer Hinterzimmer von 1889, das moderne Weihnachtszimmer in Ohio etc.
* Personen: Der Kartendealer, Yakuza-Motive, Familien der Gegenwart.
* Objekte: Der lackierte Spieltisch, frische Hanafuda-Kartendecks, moderne Handheld-Konsolen.
- Eigene Referenzen vorschlagen: Du kannst jederzeit weitere Gegenstände ergänzen (z. B. gezielt nach dem Tisch suchen lassen). Die KI lokalisiert die passenden Stellen im Audio-Skript.
- Klicke auf Generate All Assets, um alle visuellen Referenzen auf einmal vorzubereiten.
Schritt 6: Produktion & MiniMax H3 Prompt Guide
Wechsle in das Produktions-Modul. Hier geschieht das automatisierte Prompt-Engineering:
* Die KI verteilt alle Prompts segmentspezifisch und optimiert sie über den MiniMax H3 Prompt Guide.
* Segmente mit wichtigen Story-Ankern erhalten automatisch die passenden Referenz-IDs zugewiesen.
* Reine B-Roll- oder Metapher-Sequenzen bleiben referenzfrei, was Rechenzeit und Token spart.
Prüfe die Prompts kurz gegen und klicke auf Generate All Videos im /video-Modus.
Schritt 7: Finales Rendering mit einem Klick
Sobald alle Video-Clips gerendert sind, klickst du auf Create Final Video. AIQORA fügt Video-Slices, Tonspuren, Schnitte und Übergänge vollautomatisch zusammen und rendert den finalen Mastercut.
Das Resultat ist eine kinoreife Dokumentation mit perfekter visueller Kontinuität – realisiert in wenigen Minuten statt mehrerer Produktionswochen.
Einsatzbereiche: Was du mit dem Cinema Agent erstellen kannst
Dank der flexiblen Kombination aus Story-Beats und Referenz-Tracking eignet sich der Workflow für unterschiedlichste Content-Formate:
* YouTube-Dokus: Tiefgründige Recherchen zu Wirtschaftskrimis, Tech-Entwicklungen oder historischen Begebenheiten.
* Kurzdramen für TikTok & Shorts: Dramatische Mini-Serien im 9:16-Format mit festem Figuren-Cast über mehrere Episoden hinweg.
* Musikvideos & Story-Visuals: Synchronisiere Musik aus unserem /music-generator mit narrativen Bildwelten.
* Corporate Storytelling: Fallstudien und Brand-Stories, bei denen Produkte und Gebäude exakt wiedererkennbar bleiben müssen.
FAQ
Was unterscheidet den Reference Modus von herkömmlichen KI-Video-Generatoren?
Klassische Generatoren berechnen jede Szene isoliert. Dadurch verändern sich Gesichter, Kleidung oder Raumarchitekturen von Schnitt zu Schnitt. Der Reference Modus extrahiert vorab wiederkehrende Entitäten (Personen, Orte, Objekte) und zwingt das nachgelagerte Videomodell dazu, diese Merkmale über das gesamte Video hinweg exakt beizubehalten.
Benötige ich ein fertiges Skript oder funktioniert der Workflow auch mit reinen Ideen?
Du kannst beides nutzen: Gibst du lediglich einen kurzen Prompt (wie „Die Entstehung von Nintendo“) ein, übernimmt AIQORA die Recherche und Skripterstellung komplett. Alternativ kannst du eine fertige Audioaufnahme hochladen – das Tool analysiert die Datei und baut das visuelle Konzept nahtlos darauf auf.
Kann ich nachträglich eigene Bildreferenzen hochladen?
Ja. Du kannst entweder die von der KI generierten Assets nutzen, bereits in deiner Bibliothek vorhandene Projekt-Referenzen wiederverwenden oder eigene Fotos und Produktbilder als Referenz einfügen, damit reale Produkte exakt dargestellt werden.