Gemini Omni Flash Test: Googles schnelles, günstiges KI-Videomodell

Alicia Kirana Utomo
Geschrieben von

Alicia Kirana Utomo

Katelin Teen
Geprüft von

Katelin Teen

Zuletzt bearbeitet July 10, 2026

Expertengeprüft
Gemini Omni Flash Test Hero-Banner in Google-Blau

Was Gemini Omni Flash tatsächlich ist

Gemini Omni Flash ist das erste Modell in Google DeepMinds neuer "Gemini Omni"-Familie, die die Modellkarte als "nächsten Schritt hin zu Modellen, die aus jedem Input heraus alles erstellen und bearbeiten können, angefangen mit Video" beschreibt. Auf einfache Worte gebracht: Es ist ein nativ multimodales Modell, das Text, Bilder, Audio und Video akzeptiert und hochauflösendes Video mit Ton ausgibt.

Googles eigener Einzeiler ist die klarste Beschreibung, die ich gesehen habe: "Stellen Sie sich Gemini Omni wie Nano Banana vor, nur für Video." Wenn Sie Googles Nano-Banana-Bildeditor genutzt haben, bei dem Sie ein Bild mit aufeinanderfolgenden Prompts anstoßen, ist genau das die Erfahrung, die hier auf Video übertragen wird.

Die Modellkarte ging am 19. Mai 2026 online, die Verbraucherversion rollte zunächst über die Gemini-App und YouTube aus, und Entwickler erhielten am 30. Juni 2026 API-Zugriff unter der Modell-ID gemini-omni-flash-preview. Es steht klar in derselben Liga wie Runway, Pika und ByteDances Seedance, und eine Stufe unter Googles eigenem Flaggschiff Veo.

Wie Gemini Omni Flash funktioniert: jeder Input hinein, 720p-Video heraus, mit einer konversationellen Bearbeitungsschleife
Wie Gemini Omni Flash funktioniert: jeder Input hinein, 720p-Video heraus, mit einer konversationellen Bearbeitungsschleife

Wie Gemini Omni Flash funktioniert

Unter der Haube ist es ein transformerbasiertes Modell mit nativer Unterstützung für Text, Bild, Video und Audio, trainiert auf Googles TPUs. Googles Verkaufsargument ist, dass es generative Medien mit Geminis Weltwissen paart, sodass der Output "physikalisch und logisch kohärent statt nur stilistisch plausibel" sein soll, gestützt auf ein "Verständnis von Physik" sowie Wissen über Geschichte, Wissenschaft und Kultur.

Die API stellt fünf Fähigkeits-Familien bereit: Text-zu-Video-Audio, Bild-zu-Video-Audio, Referenz-zu-Video-Audio, Videobearbeitung und Bildgenerierung. Ein Vorbehalt, den man klar aussprechen sollte: Google hat für keine davon Evaluationswerte veröffentlicht. Die Modellkarte verschiebt Benchmarks offen auf später und sagt, sie "werden geteilt, sobald wir für Entwickler und Unternehmenskunden über APIs ausrollen." Wer also behauptet, Omni Flash schlage einen Konkurrenten bei den Zahlen, rät nur, weil die Zahlen noch nicht existieren.

Konversationelle Bearbeitung ist die eigentliche Schlagzeile

Wenn ein Feature den Launch rechtfertigt, dann ist es das zustandsbehaftete Bearbeiten. Statt jedes Mal einen riesigen Prompt neu zu schreiben, wenn Sie eine Änderung wollen, erzeugen Sie einen Clip und verfeinern ihn dann Anweisung für Anweisung, während sich das Modell an den Rest der Szene erinnert.

Es läuft über Googles Interactions API, und der Mechanismus ist ein einziges Feld, previous_interaction_id, das eine Folgeanweisung an ein vorheriges Ergebnis anknüpft, "ohne das vorherige Video erneut hochzuladen." Googles eigenes durchgerechnetes Beispiel macht die Schleife deutlich:

Python
# Turn 1: Generate initial video
res1 = client.interactions.create(model="gemini-omni-flash-preview", input="A woman playing violin outdoors.")

# Turn 2: Edit the previous video
res2 = client.interactions.create(
    model="gemini-omni-flash-preview",
    previous_interaction_id=res1.id,
    input="Make the violin invisible."
)

Googles Prompting-Hinweise folgen derselben Idee: Bearbeitungen kurz halten ("Make this video anime", "Change the lighting to be more dramatic"), "Keep everything else the same" hinzufügen, um die Szene festzuhalten, und Entfernen der Über-Beschreibung vorziehen ("Make the phone invisible" schlägt einen ganzen Absatz). Es ist ein wirklich schönes Denkmodell, und das Nächste, was es gibt, um Video so zu bearbeiten, wie man ein Dokument bearbeiten würde.

Zwei Stolperfallen würde ich markieren, bevor Sie darauf aufbauen. Erstens: Wenn Sie store=false setzen, um die Generierung zu beschleunigen, ist der Clip in späteren Runden nicht mehr bearbeitbar, was den ganzen Sinn der Sache still und leise zunichtemacht. Zweitens: Das Bearbeiten selbst hochgeladener Videos ist im EWR, in der Schweiz und im Vereinigten Königreich nicht verfügbar, auch wenn das Bearbeiten modellgenerierter Clips überall funktioniert. Diese regionale Sperre übersieht man leicht, bis ein europäischer Nutzer darauf stößt.

Was Gemini Omni Flash kostet

Hier die reale Zahl vorab: Video-Output wird mit 17,50 $ pro 1 Mio. Token abgerechnet, und Google bepreist 720p-Video mit 5.792 Token pro Sekunde, was bei Standardpreisen auf etwa 0,10 $ pro Sekunde hinausläuft. Input über alle Modalitäten hinweg kostet pauschal 1,50 $ pro 1 Mio. Token.

PostenKostenlose StufeBezahlte Stufe
Input (Text / Bild / Video / Audio)Nicht verfügbar1,50 $ / 1 Mio. Token
Output (Text)Nicht verfügbar9,00 $ / 1 Mio. Token
Output (Video)Nicht verfügbar17,50 $ / 1 Mio. Token (≈ 0,10 $/Sek. bei 720p)
Batch- / Flex- / Priority-RabattKeinerKeiner gelistet
Bereitgestellter DurchsatzNicht unterstütztNicht unterstützt
Wird zur Verbesserung von Googles Produkten genutztJaNein

Einiges sticht hervor. Es gibt keine kostenlose Stufe, Sie können also nicht ohne bezahlten Schlüssel experimentieren. Es gibt zudem keine Batch-, Flex- oder Priority-Tabelle für dieses Modell, anders als beim Großteil der Gemini-3.x-Reihe, sodass es keinen dokumentierten 50-%-Batch-Rabatt gibt, auf den man sich für Massenaufträge stützen könnte. Der Satz von 0,10 $/Sek. selbst ist vernünftig, aber es ist ein Meter pro Sekunde, der sich im großen Maßstab schnell summiert.

Was 0,10 $ pro Sekunde tatsächlich kostet: ein 10-sekündiger Clip kostet etwa 1 $, ein 60-sekündiger Clip etwa 6 $, begrenzt auf 720p ohne kostenlose Stufe
Was 0,10 $ pro Sekunde tatsächlich kostet: ein 10-sekündiger Clip kostet etwa 1 $, ein 60-sekündiger Clip etwa 6 $, begrenzt auf 720p ohne kostenlose Stufe

Zur Einordnung: Ein 10-sekündiger Clip kostet etwa 1 $, ein 30-sekündiger Clip etwa 3 $, und eine Minute Video rund 6 $, noch bevor Sie die Neu-Generierungen mitzählen, die jeder KI-Video-Workflow braucht. Beim Launch beschrieb Google eine Obergrenze von 10 Sekunden pro Generierung, wobei längere Laufzeiten "demnächst" kommen sollen, sodass dies heute ein Werkzeug für kurze Clips ist, nicht für ganze Szenen. Wenn Sie das breitere Preisbild vergleichen möchten, deckt mein Überblick über die Gemini-, OpenAI- und Anthropic-APIs ab, wie sich diese Abrechnungsmodelle zueinander verhalten.

Wo es einzuordnen ist: nicht Googles bestes Videomodell

Das ist die Einordnung, der ich in der Launch-Berichterstattung am stärksten widersprechen würde. Omni Flash wird ausdrücklich als die schnelle, erschwingliche Stufe positioniert, wobei Google anmerkt, dass der Satz von 0,10 $/Sek. Veo 3.1 Fast entspricht. "Fast" ist der Verräter: Das ist nicht das Modell, zu dem man greift, wenn man Googles absolut beste Bildqualität will, das ist Veo. Und gegen die aktuelle unabhängige Spitzengruppe war die Resonanz gedämpft.

Positionierungs-Quadrant: Gemini Omni Flash sitzt in der günstigeren, einen Schritt hinter der Spitzengruppe liegenden Ecke, unterhalb von Seedance und Veo
Positionierungs-Quadrant: Gemini Omni Flash sitzt in der günstigeren, einen Schritt hinter der Spitzengruppe liegenden Ecke, unterhalb von Seedance und Veo

Das lauteste Thema im Hacker-News-Launch-Thread (323 Punkte) war, dass Intensivnutzer es abwertend mit ByteDances Seedance verglichen. Jemand, der angibt, Tausende für Seedance ausgegeben zu haben, war unverblümt:

Hacker News

"Beim ersten Gebrauch bin ich nicht beeindruckt. Ich habe wohl bislang ein paar tausend Dollar für Seedance 2 ausgegeben, und ich kann nichts finden, was Googles Omni Flash bei ein paar Testläufen besser macht als Seedance."

Ein anderer stimmte zu und merkte an, dass Seedances nächste Version schon nahe ist:

Hacker News

"Wer Seedance 2.0 etwas benutzt hat, merkt, dass Gemini etwas hinterherhinkt, und Seedance 2.1 steht schon am Horizont."

Das ist das ehrliche Wettbewerbsbild: ein solides, günstiges Modell, das Intensivnutzer derzeit hinter der Spitzengruppe einordnen, verkauft über Workflow und Preis statt über rohe Qualität.

Die Einschränkungen, die man kennen sollte

Google ist in der Modellkarte erfrischend offen und nennt drei offene Herausforderungen: Konsistenz über Bearbeitungen hinweg beibehalten, komplexe Bewegung erzeugen und akkuraten Bildschirmtext darstellen. Die Community fand die scharfen Kanten schnell. Ein Entwickler, der beruflich Physiksimulationen schreibt, führte seinen Standardtest durch:

Hacker News

"'Ein Video eines Jenga-Turms, der umfällt, während ein Stein entfernt wird. Die Physik jedes Steins muss realistisch sein.' Es lieferte mir ein Video, in dem Steine plötzlich verschwinden oder ineinander übergehen."

Ein anderer wies auf das tiefere Problem hinter dem Wackeln hin:

Hacker News

"Subtile räumliche Fehler und Geometrie, die sich ändert, während sie außer Sicht gerät und zurückkommt, deuten darauf hin, dass Google das Problem des tiefen räumlichen Verständnisses noch nicht gelöst hat."

Über die Qualität hinaus prägen drei praktische Grenzen, was Sie bauen können. Es gibt keine Stimm- oder Sprachbearbeitung: Das Modell könnte technisch ändern, was Menschen sagen, aber Google schränkt das bewusst ein, als Schutzmaßnahme gegen Identitätsmanipulation. Es gibt keine Videoverlängerung oder -interpolation, sodass man für das Zusammenfügen von Szenen auf Veo 3.1 verwiesen wird. Und es gibt noch kein Multi-Video-Reasoning oder Audio-Referenz-Upload. Auf der Sicherheitsseite trägt jeder Clip ein unsichtbares SynthID-Wasserzeichen, das sich programmatisch erkennen lässt, ein echter Pluspunkt für die Herkunftskennzeichnung.

Es gibt auch eine schlichte Marken-Beschwerde, die immer wieder aufkam, und sie ist berechtigt:

Hacker News

"Ihre Produkte sind auch ziemlich unübersichtlich. Veo, Gemini Omni Flash, Spark, Flow, Duo .... Eine Menge verwirrender und konkurrierender Produktlinien."

Omni Flash startete zusammen mit einem Schwester-Bildmodell, Nano Banana 2 Lite, das sich in Googles gestufte "Lite / Standard / Pro"-Bildreihe einfügt, dieselbe "günstig-schnell versus teuer-gut"-Aufteilung, die Omni Flash für Video darstellt.

Googles Nano-Banana-Bildmodell-Stufen, die Schwesterreihe, die zusammen mit Omni Flash gestartet wurde, wie auf der Google-DeepMind-Ankündigung gezeigt
Googles Nano-Banana-Bildmodell-Stufen, die Schwesterreihe, die zusammen mit Omni Flash gestartet wurde, wie auf der Google-DeepMind-Ankündigung gezeigt

Also, sollten Sie es nutzen?

Wenn Sie kreative Tools oder Video-Werkzeuge entwickeln und ein günstiges Modell mit einer wirklich angenehmen konversationellen Bearbeitungsschleife wollen, lohnt sich Omni Flash zum Ausprobieren, besonders wenn kurze 720p-Clips zu Ihrem Anwendungsfall passen und Sie ohne kostenlose Stufe auskommen. Wenn Ihr Maßstab erstklassige Detailtreue, komplexe Physik oder lange Szenen ist, legen die eigenen Tests der Community nahe, dass Sie mit Veo für Googles beste Qualität oder mit Seedance für die aktuelle unabhängige Spitzengruppe glücklicher werden. Und es ist früh: keine Benchmarks, ein Preview-Label, und eine Roadmap voller "demnächst"-Features bedeuten, dass sich das heutige Urteil noch verschieben könnte.

Ein HN-Kommentator brachte das Ganze auf den Punkt, und ich stimme dem Geist nach zu:

Hacker News

"Es ist urkomisch, wie viele Leute erwarten, dass KI Dinge einfach im ersten Versuch perfekt hinbekommt."

Behandeln Sie es als iterativen Bearbeitungspartner, nicht als Ein-Schuss-Orakel, dann ist es eine solide, erschwingliche Option. Verwechseln Sie nur nicht die schnelle Stufe mit Googles bester.

eesel: KI für die Arbeit, die Videomodelle nicht anfassen können

Eine kurze ehrliche Anmerkung, da dies ein eesel-Blog ist. Omni Flash ist ein Medienmodell, und es gibt nichts, was es für eine Support-Warteschlange bringt. Aber genau dieser Instinkt "KI, die sich einbindet und den langweiligen Teil erledigt" ist das, woran ich bei eesel arbeite, nur auf Kundensupport statt auf Video ausgerichtet.

Wo Omni Flash Clips erzeugt, bindet sich eesels KI-Agent in Ihr bestehendes Helpdesk ein (Zendesk, Freshdesk, Gorgias und mehr), lernt aus Ihren vergangenen Tickets und Ihrem Hilfe-Center und löst reale Kundengespräche eigenständig. Wir betreiben seit Jahren KI auf echten Support-Warteschlangen, was uns gelehrt hat, jeden Rollout gegen historische Tickets zu simulieren, bevor er einen echten Kunden erreicht, die wenig glamouröse Ingenieursarbeit, die ein Demovideo nie zeigt. Es ist kostenlos zu testen, und anders als bei Omni Flash gibt es tatsächlich einen kostenlosen Weg, um zu starten.

Das eesel-KI-Helpdesk-Dashboard, in dem ein KI-Agent echte Kundentickets löst
Das eesel-KI-Helpdesk-Dashboard, in dem ein KI-Agent echte Kundentickets löst

Häufig gestellte Fragen

Was ist Gemini Omni Flash?
Gemini Omni Flash ist Google DeepMinds KI-Modell zur Videogenerierung und -bearbeitung, das erste in der neuen "Gemini Omni"-Familie. Es nimmt Text, Bilder, Audio und Video als Input und gibt 720p-Video mit Ton aus, und es erlaubt Ihnen, dieses Video per Konversation zu bearbeiten, eine Anweisung in einfachem Englisch nach der anderen. Es läuft in der bezahlten Stufe der Gemini API als gemini-omni-flash-preview.
Wie viel kostet Gemini Omni Flash?
Video-Output wird mit 17,50 $ pro 1 Mio. Token abgerechnet, was etwa 0,10 $ pro Sekunde 720p-Video entspricht, zuzüglich 1,50 $ pro 1 Mio. Input-Token. Für dieses Modell gibt es weder eine kostenlose Stufe noch einen Batch-Rabatt. Ein 10-sekündiger Clip kostet rund 1 $, ein 60-sekündiger Clip rund 6 $.
Ist Gemini Omni Flash besser als andere KI-Videomodelle?
Nicht eindeutig. Intensivnutzer von KI-Video auf Hacker News bewerten es hinter ByteDances Seedance 2.0/2.1, was die rohe Qualität angeht, und Google hat noch keine Benchmark-Werte veröffentlicht. Sein eigentlicher Vorteil ist die günstige, schnelle, konversationelle Bearbeitung statt klassenführende Detailtreue.
Kann Gemini Omni Flash meine eigenen hochgeladenen Videos bearbeiten?
Ja, über die Files API, allerdings mit Einschränkungen: Die Bearbeitung hochgeladener Videos ist im EWR, in der Schweiz und im Vereinigten Königreich nicht verfügbar, und die Bearbeitung von Stimme/Sprache ist bewusst eingeschränkt. Jeder Output trägt zudem ein unsichtbares SynthID-Wasserzeichen zur Herkunftskennzeichnung.
Sollten Unternehmen Gemini Omni Flash für den Support einsetzen?
Es ist ein kreatives Medienmodell, kein Support-Tool. Um tatsächlich Kundenanfragen zu lösen, brauchen Sie einen zweckgebauten KI-Agenten wie eesel, der sich in Ihr Helpdesk einbindet und aus Ihrem eigenen Wissen heraus antwortet, keinen Videogenerator.

Share this article

Alicia Kirana Utomo

Article by

Alicia Kirana Utomo

Kira is a writer at eesel AI with a Computer Science background and over a year of hands-on experience evaluating AI-powered customer service tools. She focuses on breaking down how helpdesk platforms and AI agents actually work so that support teams can make better buying decisions.

Related Posts

All posts →
Gemini 3.5 Pro Test Hero-Banner in Google-Blau
Trending

Gemini 3.5 Pro im Test: der ehrliche Stand von Googles Flaggschiff

Ein ehrlicher Gemini 3.5 Pro Test: Es ist noch nicht erschienen. Hier ist, was Google bestätigt hat, warum es sich verzögert, welche Benchmarks es wirklich gibt und was du heute nutzen solltest.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 21, 2026
GPT-5.6 gegen Gemini 3 Vergleichs-Hero-Illustration, zwei KI-Modellfamilien im Gleichgewicht gegeneinander
Trending

GPT-5.6 vs Gemini 3: welches KI-Modell gewinnt 2026?

GPT-5.6 vs Gemini 3 im Vergleich: Sol, Terra und Luna gegen Gemini 3.5 Flash und 3.1 Pro bei Preis, Benchmarks, Kontext und Eignung für KI-Support-Agenten.

Rama Adi NugrahaRama Adi NugrahaJul 10, 2026
Hero-Banner zum Claude Sonnet 5 Test mit dem Anthropic-Logo
Guides

Claude Sonnet 5 im Test: Ist es das Modell, das man wirklich nutzen sollte?

Ein Praxistest von Claude Sonnet 5: die Benchmarks, der Preishaken, wie es sich gegen Opus 4.8 schlägt und ob es das Claude-Modell ist, das du standardmäßig nutzen solltest.

Kurnia Kharisma Agung SamiadjieKurnia Kharisma Agung SamiadjieJul 2, 2026
Illustration zur sekundenbasierten Preisgestaltung der KI-Videogenerierung von Gemini Omni Flash
Guides

Gemini Omni Flash Preise: Was ein Video wirklich kostet

Gemini Omni Flash berechnet Video-Output mit 17,50 $ pro 1 Mio. Token, also rund 0,10 $ pro Sekunde, ganz ohne kostenlose Stufe und ohne Batch-Rabatt. Hier ist die vollständige Aufschlüsselung.

Alicia Kirana UtomoAlicia Kirana UtomoJul 3, 2026
Ein Tester blickt auf eine Bewertungskarte mit zwei Aufwand-Reglern, beschriftet mit niedrig und maximal, neben dem DeepSeek-Wal
Trending

DeepSeek V4 Flash im Test: ein Modell, zwei Persönlichkeiten

Ein DeepSeek V4 Flash Test, der auf den Zahlen beruht, die beide Scoreboards veröffentlichen. Der billige Lauf und der clevere Lauf sind dieselben Gewichte, und das verändert das Urteil.

Riellvriany IndriawanRiellvriany IndriawanAug 4, 2026
Illustration eines Entwicklers, der mit Bild-, Video- und Dokumentpanels arbeitet, mit dem Qwen-Logo
Trending

Qwen 3.7 Flash im Test: ein 0,03-Dollar-Vision-Modell mit Haken

Qwen 3.7 Flash ist das günstigste Vision-Modell, das man kaufen kann. Ich habe mir die Preisstufen, den einzigen unabhängigen Benchmark und das angeschaut, worüber niemand spricht.

Rama Adi NugrahaRama Adi NugrahaJul 31, 2026
Redaktionelle Illustration zum Test von Nano Banana 2 Lite, Googles schnellem KI-Bildgenerierungsmodell, in Google-Blau
Guides

Nano Banana 2 Lite im Test: Ist Googles schnellstes Bildmodell wirklich gut?

Nano Banana 2 Lite generiert Bilder in 4 Sekunden für 0,034 $ pro Bild. Wir haben Googles eigene Benchmarks, Vergleichsbilder und erstes Feedback von Entwicklern durchleuchtet, um herauszufinden, ob die Geschwindigkeit auf Kosten der Qualität geht.

Rama Adi NugrahaRama Adi NugrahaJul 3, 2026
Handgezeichnete Illustration mit dem Grok-Logo und einer Bewertungskarte mit gemischten Sternebewertungen in verschiedenen Kategorien
Trending

Grok 4.6 im Test: Was die Eval-Tabelle wirklich sagt, wenn man die Verlierer-Zeilen liest

Grok 4.6 zieht mit GPT-5.6 Sol gleich – zu einem Drittel des Preises – und verliert zwei Benchmarks deutlich. Ich habe xAIs eigene Eval-Tabelle Zeile für Zeile gelesen und dann die Zahl geprüft, die der Launch-Post ausgelassen hat.

Alicia Kirana UtomoAlicia Kirana UtomoAug 13, 2026
DeepSeek V4 Flash Preise: was dir wirklich in Rechnung gestellt wird
Trending

DeepSeek V4 Flash Preise: was dir wirklich in Rechnung gestellt wird

DeepSeek V4 Flash listet mit $0.14 Eingabe und $0.28 Ausgabe pro Million Tokens. Echte Nutzer haben Mischraten unter einem Cent gepostet. Hier ist, was entscheidet, welche davon dich trifft.

Alicia Kirana UtomoAlicia Kirana UtomoAug 4, 2026

Bereit, Ihren KI-Teamkollegen einzustellen?

In Minuten eingerichtet. Keine Kreditkarte erforderlich.

Kostenlos starten