So erstellen Sie 8-Sekunden-Videos mit Ton mithilfe von Veo 3 von Gemini

Letzte Aktualisierung: 21/05/2026

  • Mit Veo 3.1 und Gemini können Sie kurze 8-Sekunden-Videos mit vollständig generativem Audio erstellen.
  • Die API bietet Kontrolle über Seitenverhältnis, Auflösung, Dauer und Referenzbilder.
  • Es können Text-zu-Video-, Bild-zu-Video-, Interpolations- und Erweiterungsfunktionen für bereits vorhandene Videos genutzt werden.
  • Es gibt Sicherheitsbeschränkungen, Aufbewahrungspflichten und Modellversionen, die die erweiterte Nutzung einschränken.

So erstellen Sie 8-Sekunden-Videos mit Ton mithilfe von Veo 3 von Gemini

¿Wie erstellt man mit Veo 3 von Gemini 8-Sekunden-Videos mit Ton? Wenn Sie wissen möchten, wie Erstellen Sie mit Veo 3 von Gemini 8-Sekunden-Videos mit Ton.Hier sind Sie genau richtig. Google hat mit Veo 3.x ein leistungsstarkes Ökosystem für Video und Gemini zur Steuerung aller Funktionen entwickelt. Offizielle Informationen sind jedoch verstreut und mitunter zu technisch. Hier finden Sie eine klare und übersichtliche Erklärung in Standardspanisch (Spanien), damit Sie verstehen, was möglich ist, wie es funktioniert und wo die Grenzen liegen.

In den folgenden Zeilen werden Sie sehen Wie man Videos mit Audio aus Text, Bildern oder sogar anderen Videos erstelltWie Sie Dauer, Format und Auflösung steuern, wie Sie asynchrone API-Operationen handhaben und welche erweiterten Parameter Ihnen mehr kreative Kontrolle bieten. Außerdem kann ich Ihnen sagen, dass Gemini Pro-Nutzer derzeit eine begrenzte Anzahl von Videos pro Woche direkt über die Benutzeroberfläche generieren können, ohne Code bearbeiten zu müssen, und dass Gemini Omni nach und nach die Funktionen von Veo innerhalb der App übernehmen wird.

Gemini, Omni und Veo 3: Wie alles zusammenpasst

Gemini WhatsApp

Google fusioniert Gemini und Veo zunehmend. Um den kreativen Prozess zu vereinfachen, wird in der Gemini-App das Omni-Modell Veo als Hauptschnittstelle schrittweise ersetzen. Im Hintergrund werden jedoch weiterhin Videomodelle der Veo 3.x-Familie verwendet: Veo 3.1, Veo 3.1 Fast, Veo 3.1 Lite, Veo 3 und seine Fast-Varianten sowie in bestimmten Fällen Veo 2.

Omni kombiniert die Geminis multimodale Intelligenz mit fortschrittlichen generativen MedienfähigkeitenEs generiert Videos aus Text, wandelt Bilder in animierte Clips um und bietet KI-gestützte Videobearbeitung und -analyse. Es erfasst Kontext, Audio, Bilder und Text gleichzeitig und ermöglicht so eine präzisere Feinabstimmung des Endprodukts. Damit konkurriert es mit KI-Video-Feeds wie Meta Vibes.

Wenn Sie die Gemini-API verwenden, greifen Sie über folgende Wege auf diese Videomodelle zu: spezifische Modellcodes (Zum Beispiel „veo-3.1-generate-preview“ für die neueste Vorschauversion). Als Pro-Nutzer der gemini.google.com-Oberfläche haben Sie derzeit direkten Zugriff auf Veo 3, um bis zu 10 achtsekündige Videos pro Woche zu generieren, ohne Code schreiben zu müssen. Alternativ gibt es weitere Möglichkeiten wie … Bing Video Creator.

Zusammenfassend: Gemini ist das Tor, Omni ist das einheitliche Erlebnis innerhalb der App sind und Veo 3.x die spezialisierten Engines, die die Videos mit Ton erzeugen und Parameter wie Seitenverhältnis, Dauer, Auflösung, Referenzbilder, Interpolation oder Erweiterung steuern.

Was ist Veo 3.1 und warum ist es so wichtig für 8-Sekunden-Videos mit Ton?

Veo 3.1 ist Googles neueste Generation von Videokameras. innerhalb des Gemini-Ökosystems. Es wurde entwickelt, um kurze 8-Sekunden-Clips (und auch 4- oder 6-Sekunden-Clips) in bis zu 4K-Qualität und, was sehr wichtig ist, mit nativ generiertem, mit der Szene synchronisiertem Audio zu erzeugen.

Mit diesem Modell können Sie produzieren 8-Sekunden-Videos in 720p, 1080p oder 4KEs unterstützt sowohl das horizontale 16:9- als auch das vertikale 9:16-Format. Es eignet sich besonders für filmische Stile, kreative Animationen und Videos mit Dialogen und Soundeffekten und bietet mehrere erweiterte Funktionen: vertikale Videos, Verlängerung vorheriger Videos, Festlegung des ersten und letzten Frames sowie Referenzbilder.

In der Praxis, wenn Sie die Gemini-API mit dem Modell „veo-3.1-generate-preview„Sie können eine einfache Texteingabe an die Text-zu-Video-Konvertierung übergeben oder diese mit Bild- oder Videoeingaben kombinieren, um komplexere Fälle zu realisieren: Bild-zu-Video, Interpolation zwischen Einzelbildern oder Erweiterung von bereits vorhandenem, zuvor mit Veo erzeugtem Filmmaterial.“

Darüber hinaus erzeugt Veo 3.1 immer Video mit integriertem Audioohne dass der Soundtrack separat zusammengestellt werden muss. Dies umfasst Dialoge, Soundeffekte und Umgebungsgeräusche, die stets den Sicherheitsfiltern des Systems unterliegen.

Grundlegende Modi: Text zu Video, Bild zu Video und Video zu Video

Die direkteste Verwendungsmöglichkeit ist der Modus Text zu VideoSie geben dem Modell eine detaillierte Beschreibung Ihrer Wünsche, einschließlich der Frage, ob Sie Dialoge, Soundeffekte und Umgebungsgeräusche wünschen, und erhalten ein 8-sekündiges Video. In der API geschieht dies durch einen Aufruf von Videos generieren (Python, JavaScript, Go, Java) oder die REST-Route predictLongRunning des Veo-Modells.

Sie können beispielsweise eine Nahaufnahme von zwei Personen anfordern, die eine Zeichnung an einer Wand betrachten, während eine Taschenlampe blinkt und ein kurzer Dialog stattfindet. Das Modell generiert sowohl die visuelle Szene als auch das Gemurmel und die Umgebungsgeräusche so, wie es dem von Ihnen beschriebenen Text entspricht.

Die zweite Methode ist die Bild-zu-Video-Konvertierung. Dabei wird ein Bild als Ausgangsbild bereitgestellt. Veo nutzt dieses als Ausgangspunkt und erzeugt darauf basierend Bewegung und Ton. Ein typisches Beispiel: Zuerst wird ein Bild mit „gemini-3.1-flash-image-preview“ (intern als Nano Banana 2 bekanntes Bildmodell) erstellt und anschließend an Veo 3.1 zur Animation übergeben. Das Ergebnis ist ein Clip, in dem die Szene für 8 Sekunden zum Leben erwacht.

Schließlich gibt es noch den Modus Video zu Video (Erweiterung)Exklusiv in Veo 3.1 und Veo 3.1 Fast: Sie liefern ein zuvor von Veo generiertes Video, das dann um einige Sekunden Handlung erweitert wird, wobei Stil und Erzählweise erhalten bleiben. Ideal, wenn Sie bereits einen 8-Sekunden-Clip haben und die Sequenz nahtlos fortsetzen möchten.

Exklusiver Inhalt – Klicken Sie hier  So ändern Sie den Google Chrome-Avatar

Seitenverhältnis einstellen: horizontal und vertikal

Damit deine Videos auf YouTube gut aussehen, ist es beim Bearbeiten von Videos in TikTok, Reels oder Shorts entscheidend, die folgenden Fähigkeiten zu beherrschen: SeitenverhältnisVeo 3.1 ermöglicht die Auswahl zwischen dem horizontalen 16:9-Format (Standard) und dem vertikalen 9:16-Format mithilfe des Parameters. Seitenverhältnis in der Generationskonfiguration.

In Clientbibliotheken (z. B. Python) definieren Sie einfach Seitenverhältnis="9:16" Für die Konfiguration eines vertikalen Videos verwendet JavaScript das `aspectRatio`-Objekt im `config`-Objekt, während REST das `aspectRatio`-Objekt in den `parameters` verwendet. Wird kein Wert angegeben, wird ein herkömmliches 16:9-Breitbildvideo generiert.

Ein typisches Beispiel wäre ein Food-Video mit einer vertikalen Montage, die einen Koch bei der Zubereitung einer Pizza zeigt, untermalt mit elektronischer Musik. In diesem Fall geben Sie ein Seitenverhältnis von 9:16 an, und Veo generiert den Clip für vertikale Netzwerke, wobei die für Mobilgeräte vorgesehene Bildkomposition und der Bildausschnitt berücksichtigt werden.

Diese Flexibilität ermöglicht Ihnen die Gestaltung spezifische Inhalte für jede Plattform ohne dass eine nachträgliche Anpassung nötig ist. Sie passen einfach die Parameter an, und das Modell kümmert sich darum, alle Aktionen in das gewünschte Format einzufügen.

Wählen Sie die Auflösung: 720p, 1080p und 4K

Ein weiterer wichtiger Faktor ist die VideoauflösungDie Auflösung steuern Sie über den Parameter „Resolution“. Veo 3.1 kann Clips direkt in 720p, 1080p und 4K generieren (4K ist in Veo 3.1 Lite nicht verfügbar). Standardmäßig verwenden die meisten Beispiele 720p, aber für hochwertige Videos können Sie 1080p oder 4K anfordern, sofern die Dauer 8 Sekunden beträgt.

Es gibt einige Dinge zu beachten: Höhere Auflösung bedeutet höhere Latenz und höhere KostenDie Erstellung von 4K-Videos dauert länger und der Preis pro Anruf steigt ebenfalls. Daher ist es sinnvoll, dieses Format für wichtige Beiträge oder Material zu reservieren, das in maximaler Auflösung benötigt wird.

Darüber hinaus ist die Funktion von Die Videoerweiterung ist auf 720p beschränkt.Wenn Sie einen Clip später verlängern möchten, erstellen Sie ihn am besten gleich in dieser Auflösung. Veo 3 und Veo 3.1 unterstützen nur 4K- und 1080p-Clips mit einer Länge von 8 Sekunden, was gut zu dem hier relevanten Szenario mit kurzen Videos und Ton passt.

In der API geben Sie einfach die Auflösung an: „4k“ oder „1080p“, abhängig von der Client-Sprache. In REST wird dies über die Parameter übergeben. Wenn Sie nichts angeben, erhalten Sie einen 720p-Clip, der für soziale Medien und Prototyping in der Regel ausreicht.

Verwenden Sie Bilder als Eingabe und als Referenz.

Eine der leistungsstärksten Funktionen von Veo 3.1 ist, dass Akzeptiert bis zu drei Referenzbilder Dieses System dient der Steuerung von Stil und Inhalt des Videos. Es arbeitet parallel zum Hauptbild (wenn dieses als erstes Bild verwendet wird) und sorgt für Konsistenz bei Charakteren, Kleidung oder Produkten im gesamten Clip.

Stellen Sie sich vor, Sie haben mit Gemini 3.1 Flash Image drei Bilder erstellt: ein auffälliges Kleid, eine herzförmige Sonnenbrille und ein Porträt des Models. Diese Bilder können Sie Veo 3.1 als Referenzobjekte übergeben und als „Asset“ deklarieren. Das Model verwendet diese Bilder, sodass die Frau im Video beim Durchqueren einer türkisfarbenen Lagune immer dasselbe Gesicht, dasselbe Federkleid und dieselbe Sonnenbrille trägt.

Diese Technik ist sehr nützlich für kreative Kampagnen mit wiederkehrenden Charakteren oder ProduktenDadurch wird sichergestellt, dass das animierte Ergebnis dem zuvor in einem Standbild erstellten Design entspricht. In der Generierungskonfiguration fügen Sie einfach ein Array von „reference_images“ oder „referenceImages“ (je nach Sprache) hinzu, das jedes der kodierten Bilder enthält (üblicherweise Base64-kodiert oder als Bildobjekt aus der Clientbibliothek).

Darüber hinaus können Sie ein einzelnes Bild verwenden als erstes Bild Ohne zusätzliche Referenzen, wenn Sie die Szene einfach nur genau so animieren möchten, wie sie ist, verwendet Veo die Bildkomposition und verlängert sie im Laufe der Zeit, wobei Bewegung und Ton gemäß der Textanweisung erzeugt werden.

Steuerung des ersten und letzten Frames (Interpolation)

Veo 3.1 ermöglicht etwas besonders Interessantes für fortgeschrittene Benutzer: die Generierung eines Videos durch explizite Definition der Anfangsbild und EndbildDiese für die Interpolation entwickelte Funktionalität ermöglicht Ihnen eine sehr hohe Kontrolle darüber, wie die Sequenz genau beginnt und endet.

Der Vorgang ist einfach: Sie übergeben ein Ausgangsbild als Hauptparameter „image“ und geben in der Konfiguration ein Endbild als „lastFrame“ oder „last_frame“ an. Das Modell generiert die 8 Sekunden Videomaterial durch konsistente Interpolation zwischen den beiden Bildern und berücksichtigt dabei die Textbeschreibung des dazwischenliegenden Geschehens.

Ein typisches Beispiel wäre eine Szene mit subtilem Horror: Eine geisterhafte Gestalt schaukelt unter einem knorrigen Baum auf einer nebligen Lichtung. Die Anfangseinstellung zeigt die geisterhafte Frau auf der Schaukel; die Schlusseinstellung die leere Schaukel, die sich von selbst hin und her bewegt. Veo 3.1 steuert die Bewegung des Nebels, das allmähliche Verschwinden der Gestalt und die unheimlichen Soundeffekte, die diesen Wandel begleiten.

Diese Interpolation ermöglicht Ihnen Die genaue Komposition von Vorder- und Hintergrund treffen.Dies ist sehr nützlich, wenn Sie Konzeptzeichnungen berücksichtigen oder das Video in eine größere Sequenz integrieren möchten, in der diese spezifischen Einzelbilder von entscheidender Bedeutung sind.

Mit Veo erstellte Videos verlängern

Ein weiteres herausragendes Merkmal von Veo 3.1 und Veo 3.1 Fast ist die VideoerweiterungSie können einen bereits mit Veo erstellten Clip (bis zu 141 Sekunden) in 7-Sekunden-Schritten verlängern, bis zu einer maximalen Gesamtlänge von 148 Sekunden. Die API fügt das Originalvideo und den verlängerten Teil zu einer einzigen Datei zusammen.

Exklusiver Inhalt – Klicken Sie hier  So machen Sie die Aktion in Google Kalender rückgängig

Es gibt mehrere Einschränkungen: Das Eingangsvideo muss folgende Eigenschaften haben: 720p-Auflösung, 16:9- oder 9:16-Seitenverhältnis und eine maximale Dauer von 141 SekundenDarüber hinaus können Sie nur Videos verlängern, die von Veo generiert und auf dem Server gespeichert wurden und die letzten zwei Tage gültig sind (wenn Sie sie als Eingabe verwenden, wird der Zähler auf diese zwei Tage zurückgesetzt).

Ein praktisches Anwendungsbeispiel sähe etwa so aus: Man erstellt einen Clip, in dem ein Origami-Schmetterling in einen Garten fliegt, und erweitert ihn dann, sodass der Schmetterling auf einer Blume landet und ein verspielter Welpe erscheint. Beim Aufruf der Erweiterung übergibt man das vorherige Video als Eingabe und fügt eine neue Textanweisung hinzu, die erklärt, was als Nächstes passieren soll.

Diese Funktion ist ideal, wenn Sie möchten eine bereits funktionierende Idee weiterentwickeln. o lange Videos in virale Clips verwandeln, ohne bei Null anzufangen und Stil, Farbpalette und Atmosphäre beizubehalten.

Wie asynchrone API-Operationen funktionieren

Die Videogenerierung ist eine rechenintensive Aufgabe, daher arbeitet die Gemini API für Veo mit langfristige OperationenDas heißt, Sie senden die Anfrage, erhalten sofort ein "Operations"-Objekt und müssen dann dessen Status so lange überprüfen, bis das Feld "done" den Wert "true" hat.

Das Muster ist in Python, JavaScript, Go, Java und REST ähnlich: Man startet die Generierung mit `generate_videos` oder dem REST-Aufruf `predictLongRunning`, speichert den Operationsnamen und richtet dann eine Schleife ein, die in regelmäßigen Abständen (z. B. alle 10 Sekunden) abfragt, indem man … operations.get oder die REST-Route für Operationen mit diesem Namen.

Sobald der Vorgang als abgeschlossen angezeigt wird, enthält das Antwortobjekt Folgendes: die Liste der generierten VideosIn den meisten Beispielen arbeiten Sie mit einem einzelnen Video (Position 0), das Sie über den Dateiclient der Bibliothek oder mithilfe der in der Antwort angegebenen Download-URI zusammen mit Ihrem API-Schlüssel herunterladen können.

Das System rechnet mit einer minimalen Latenz von ca. 11 Sekunden und einer maximalen Latenz von bis zu 6 Minuten während der Spitzenzeiten. Es empfiehlt sich, die Abfragen mit etwas Geduld zu planen und Netzwerkfehler oder -ausfälle entsprechend Ihren Backend-Anforderungen zu behandeln.

Wichtige Parameter der Veo 3.x API

Um Veo 3.1 und seine Varianten optimal nutzen zu können, ist es wichtig, die folgenden Punkte zu kennen: Parameter, die Sie in jeder Anfrage anpassen könnenGrob gesagt lassen sie sich in zwei Gruppen unterteilen: die „Instanzen“ (Eingaben) und die Generierungsparameter.

Unterstützte Eingaben umfassen: Textaufforderung (die Videobeschreibung inklusive Audiotracks), Bild (ein Ausgangsbild), letzter Frame (Endbild für die Interpolation, kombiniert mit dem Bild), Referenzbilder (bis zu drei Referenzbilder, wie bereits erwähnt) und Video (nur in Veo 3.1 / 3.1 Fast, für zuvor generierte Videoerweiterungen).

Hinsichtlich der Erzeugungsparameter sind folgende am relevantesten: Seitenverhältnis (16:9 oder 9:16), Dauer in Sekunden (4, 6 oder 8, wobei die Anzahl 8 sein muss, wenn Erweiterungen, Referenzbilder oder 1080p- und 4K-Auflösungen vorliegen), Personengeneration (welches die Generierung von Personen unter Berücksichtigung regionaler Beschränkungen steuert), und Auflösung (720p, 1080p, 4K je nach Modell und Gehäuse).

Des Weiteren gibt es einen Parameter Samen Veo 3 und Veo 3.1 bieten eine Funktion, die eine leicht verbesserte Konsistenz zwischen den Generationen ermöglicht, jedoch keine perfekte Deterministik garantiert. Sie ist nützlich, wenn Sie eine Idee mit ähnlichen Variationen wiederholen möchten, ohne dass das Ergebnis völlig vom erwarteten abweicht.

Veo-Versionen und ihre wichtigsten Unterschiede

Innerhalb des Sternzeichens Gemini gibt es mehrere Veo-ModellversionenJedes Modell ist auf eine andere Kombination aus Qualität, Geschwindigkeit und Verfügbarkeit ausgelegt:

Veo 3.1 ("veo-3.1-generate-preview") ist die fortschrittlichste Version in der Vorschauphase. Akzeptiert Text und Bilder als Eingabe und erzeugt Video mit Ton. Es behält ein Texteingabelimit von 1.024 Zeichen bei und ist auf maximale Qualität und volle Funktionalität ausgelegt (einschließlich 720p-Erweiterung, 4K bei 8 Sekunden usw.).

Veo 3.1 Fast („veo-3.1-fast-generate-preview“) priorisiert Geschwindigkeit versus maximale QualitätEs erzeugt aber weiterhin Videos mit Ton. Es ist ideal für Unternehmen, die schnell viele Varianten für A/B-Tests, Werbung oder Social-Media-Inhalte erstellen müssen.

Veo 3.1 Lite ("veo-3.1-lite-generate-preview") bietet ein schlankeres Profil: Text und Bild als Eingabe, Video mit Ton, aber ohne 4K und mit gewissen Einschränkungen im Anwendungsbereich. Es eignet sich zur Reduzierung von Kosten oder Latenz in weniger anspruchsvollen Szenarien.

Neben der 3.1-Serie gibt es noch Veo 3 ("veo-3.0-generate-001") und Veo 3 Fast ("veo-3.0-fast-generate-001"), beide stabil, die Text- und Bildeingabe sowie Videoausgabe mit Audio unterstützen, mit Auflösungen bis zu 1080p und Funktionen, die denen der 3.1-Serie ähneln, jedoch mit einem geringeren Umfang der neuesten Funktionen.

Darunter befindet sich Veo 2 ("veo-2.0-generate-001"), welches Es akzeptiert Text und Bilder als Eingabe. Es erzeugt jedoch Videos ohne eingebetteten Ton, mit einer Auflösung von bis zu 720p und einigen Unterschieden in der Darstellung von Personen. Für bestimmte Arbeitsabläufe, bei denen kein Ton benötigt wird, ist es dennoch nützlich.

Einschränkungen, Sicherheit und Wasserzeichen

Wie jedes System zur Inhaltsgenerierung unterliegt auch Veo 3.x folgenden Bedingungen: Sicherheitsfilter und NutzungsbeschränkungenGemini wendet Filter an, um anstößige oder gegen die Richtlinien verstoßende Inhalte zu verhindern, und blockiert Aufforderungen, die gegen die Nutzungsbedingungen oder Nutzungsrichtlinien verstoßen.

Was die Generationen der Menschen betrifft, so gibt es sehr klare regionale BeschränkungenIn der EU, Großbritannien, der Schweiz und der MENA-Region unterstützen die Veo-Modelle 3 und 3.1 für die Personengenerierung ausschließlich den Modus „allow_adult“. Veo 2 hingegen unterstützt sowohl „dont_allow“ als auch „allow_adult“, wobei „dont_allow“ die Standardeinstellung ist. Dies wirkt sich auf die Beschreibung menschlicher Charaktere in Ihren Eingabeaufforderungen aus.

Exklusiver Inhalt – Klicken Sie hier  Googles Chromecast ist Geschichte: Das Kultgerät wurde eingestellt

Das System implementiert außerdem einen Mechanismus für vorübergehende Speicherung von VideosDie generierten Clips werden zwei Tage lang auf Googles Servern gespeichert. Danach werden sie gelöscht. Wenn Sie sie behalten möchten, müssen Sie sie innerhalb dieses Zeitraums herunterladen. Wenn Sie ein Video als Eingabe für eine Erweiterung verwenden, wird es als neues Video betrachtet und der Timer beginnt von neuem.

Schließlich beinhalten alle mit Veo generierten Videos Folgendes: SynthID-WasserzeichenGoogles firmeneigene Technologie bettet unsichtbare Signale ein, um KI-generierte Inhalte zu identifizieren. Dieses Label kann mithilfe der Verifizierungsplattform von SynthID überprüft werden, was Transparenz und Nachvollziehbarkeit gewährleistet.

Wie man gute Prompts für Veo schreibt

VEo 3.1 in vertikal

Wenn Sie Veo 3.1 optimal für Ihre 8-Sekunden-Videos mit Ton nutzen möchten, müssen Sie besonders sorgfältig vorgehen. prompte QualitätDie besten Anweisungen sind klar, beschreibend und verwenden Fachbegriffe der audiovisuellen Sprache.

Es gibt mehrere Elemente, die berücksichtigt werden sollten: die Affäre (was beispielsweise eine futuristische Stadt oder ein Welpe erscheint), die Aktion (was die Person tut: gehen, rennen, in die Kamera schauen), die Stil (Film Noir, Science-Fiction, 3D-Animation, Scherenschnitt usw.), die Kamerabewegung und -positionierung (Weitwinkelaufnahme, Nahaufnahme, Luftaufnahme, Dollyfahrt, subjektive Kamera), die Linseneffekte (Schärfentiefe, Makro, Weitwinkel) und die Licht- und Farbatmosphäre (kühle Farbtöne, warmer Sonnenuntergang, natürliches Licht, Neonlichter usw.).

Ein Beispiel für eine verbesserte Aufgabenstellung wäre die Änderung von „Mann telefoniert“ zu einer Beschreibung wie: eine filmische Nahaufnahme eines verzweifelten Mannes in einem abgetragenen grünen Mantel, der vor einer schmutzigen Backsteinmauer, beleuchtet von grünem Neonlicht, mit geringer Schärfentiefe auf seiner faltigen Stirn und der Wählscheibe telefoniert, während der Hintergrund in einem Lichtermeer verschwimmt. Je mehr relevante Details Sie angeben, desto besser. Veo wird es dadurch leichter verstehen, welchen Ton und welche Ästhetik Sie sich wünschen..

Sie können das Seitenverhältnis auch direkt im Text festlegen und angeben, ob Sie ein „Breitbild“-Video oder ein für vertikale Mobilgeräte optimiertes Video wünschen. Für eine höhere Präzision empfiehlt es sich jedoch, dies mit dem technischen Parameter „aspectRatio“ zu kombinieren.

Audio anfordern: Dialoge, Effekte und Atmosphäre

Ich sehe 3.1

Einer der Hauptvorteile von Veo 3.1 gegenüber Videomodellen ohne Ton ist, dass akzeptiert ausdrückliche Anweisungen bezüglich des AudiosSie können bestimmte Dialoge, bestimmte Soundeffekte und die Hintergrundgeräuschkulisse direkt in der Aufgabenstellung beschreiben.

Für die DialogEs wird empfohlen, wörtliche Rede in Anführungszeichen zu setzen: zum Beispiel: „Das muss der Schlüssel sein“, murmelte er. Dadurch wird im Modell klar unterschieden, welche Teile gesprochener Text und welche Beschreibung sind. Im Falle des SoundeffekteAm besten benennt man sie direkt: quietschende Reifen, aufheulender Motor, brechende Äste, Schritte auf nassem Boden usw.

El Umgebungsgeräusche Auch die Musik spielt eine wichtige Rolle: ein geheimnisvolles Hintergrundrauschen, das ferne Murmeln der Stadt, der gelegentliche Gesang eines einsamen Vogels… Diese Nuancen tragen dazu bei, dass der generierte Soundtrack die von Ihnen beschriebene visuelle Atmosphäre ergänzt.

In der Praxis können Sie den Detailgrad schrittweise erhöhen. Eine minimalistische Eingabeaufforderung gibt lediglich die Stimmlage und einen Satz an; eine erweiterte beschreibt Tonfall, Pausen, Klangtexturen und Atmosphäre. Das Modell synchronisiert die Ausgabe mit dem Videogeschehen, sodass Sie Ihre Videos automatisch untertiteln können, um Barrierefreiheit und Verbreitung zu gewährleisten.

Verwendung von Referenzbildern und Interpolation in der Praxis

Neben Stil- und Charakterreferenzen ermöglicht Veo Ihnen die Verwendung von Bilder als Grundlage für die Erstellung von Anregungen und GeschichtenMan kann mit einem surrealen Makrofoto beginnen (zum Beispiel winzige Surfer, die in einem steinernen Waschbecken surfen) und eine Aufgabenstellung entwickeln, die beschreibt, wie sich die Kamera langsam durch die Szene bewegt, wie das Wasser aus dem Wasserhahn tropft und wie die türkisfarbenen Wellen funkeln.

In anderen Fällen lassen sich mehrere Referenzen zu kuriosen Mischungen kombinieren: ein bedrohlich wirkender Tiefseefisch, ein rosa Prinzessinnenkostüm mit Zauberstab und Tiara und die Aufforderung, eine Cartoon-Version des Fisches in diesem Kostüm mit Zauberstab darzustellen. Die visuellen Referenzen geben dem Charakterdesign die Grundlage, während der Text die Geschichte leitet.

Durch die Interpolation mit dem ersten und letzten Frame werden diese Möglichkeiten erweitert: Sie definieren genau, wie die Anfangsaufnahme aussieht (zum Beispiel eine rote Katze, die ein rotes Cabriolet an der französischen Riviera fährt) und wie die Endaufnahme aussieht (das Auto, das von einer Klippe stürzt), und lassen Veo die zusammenhängende Zwischensequenz in 8 Sekunden erstellen.

Zusammen machen diese Werkzeuge Veo 3.1 zu einem Eine hochflexible Engine für kurze visuelle Geschichtenwo Sie detailliertes statisches Design (erstellt mit Bildmodellen) mit KI-generierter Animation und Ton kombinieren können, ohne die Kontrolle über wichtige Elemente zu verlieren.

All dies macht die Verwendung von Veo 3 von Gemini zu einer der umfassendsten Möglichkeiten, kurze Videos mit Ton programmatisch oder direkt aus der App heraus zu erstellen: Sie haben die Kontrolle über Dauer, Format, Auflösung, Charaktere, visuellen Stil, Audio und sogar darüber, wie sich ein bestehender Clip bei aufeinanderfolgenden Verlängerungen weiterentwickelt, solange Sie die von der Plattform auferlegten Sicherheits-, Aufbewahrungs- und technischen Parameter einhalten.

Ich sehe 2 auf Youtube Shorts-9
Verwandter Artikel:
YouTube Shorts enthält Veo 2, Googles neue KI zum Generieren von Videos