Laut den Notizen zu „Video 1.5“ von xAI rendert Grok Imagine ein sechssekündiges 720p-Video in etwa 25 Sekunden. Diese Geschwindigkeit beseitigt den alten Engpass, nämlich das Warten auf den Rendering-Vorgang. Allerdings entsteht dadurch ein neuer Engpass: Wer Grok Imagine gut zu nutzen weiß, kann markengerechte Ergebnisse liefern, bevor das Limit durch fast gelungene, aber nicht ganz perfekte Ergebnisse aufgebraucht ist.
Die meisten Nutzer öffnen das tool, geben eine Eingabe ein und generieren direkt ein Video. Das ist die falsche Reihenfolge. Videos verbrauchen weitaus mehr von Ihrem Limit als Bilder, und ein überstürzter Versuch kann mehrere Anläufe kosten, bevor Sie überhaupt sehen, ob das Konzept funktioniert. Wer gute Ergebnisse erzielt, behandelt Videos als letzten Schritt.
TL;DR
Der Arbeitsablauf: Erstellen Sie eine Reihe kostengünstiger Standbilder, um das Konzept auf Herz und Nieren zu prüfen, wählen Sie das überzeugendste aus und verfeinern Sie es durch Bearbeitungen in einfacher Sprache. Wechseln Sie dabei für alles, was Text oder feine Details enthält, in den Qualitätsmodus. Erst dann animieren Sie mit einer zurückhaltenden Bewegungsanweisung und verlängern den Clip in Schritten, wobei Sie Kleidungs-, Beleuchtungs- und Kamerahinweise beibehalten, damit die Szene stimmig bleibt. Speichern Sie die Eingabeanweisung bei jedem erfolgreichen Ergebnis. Bei kostenpflichtigen Plänen teilt sich „Imagine“ einen wöchentlichen Pool mit „Chat“ und „Voice“, sodass jede fehlgeschlagene Video-Erstellung, die Sie überspringen, Kapazität ist, die Sie behalten.
Was ist Grok Imagine?

Grok Imagine ist das Tool von xAI zur Erstellung von Bildern und Videos. Es wandelt Text-Prompts in Bilder um, führt die Bearbeitung vorhandener Bilder anhand von Anweisungen in einfacher Sprache durch und animiert Standbilder in einem einzigen Durchgang zu kurzen Clips mit Ton. Es handelt sich dabei jedoch nicht um den Grok-Chatbot. Beide teilen zwar die Marke und den Login, doch Imagine ist ein eigenständiger kreativer Raum mit eigener Benutzeroberfläche, eigenen Modellen und eigenen Limiten.
Bilder werden mit Grok Imagine Image 2.0 verarbeitet, das auf Aurora, der hauseigenen Bild-Engine von xAI, basiert. Videos werden mit Grok Imagine Video 1.5 verarbeitet, das seit Juni 2026 allgemein verfügbar ist. Es begann als Bild-zu-Video-Modell. Sie geben ein Startbild und eine Bewegungsanweisung ein, und das Modell setzt die Szene in Bewegung, wobei die Belichtung und die Details Ihres Ausgangsbildes erhalten bleiben. Mit einem Update im Juli 2026 wurde die Text-zu-Video-Funktion hinzugefügt, sodass Sie das Startbild nun überspringen können. Außerdem wurden native 1080p-Auflösung sowie Bild- und Sprachreferenzen eingeführt. Darüber hinaus stehen Ihnen eine Arbeitsfläche im Agent-Modus, Projekte, parallele Läufe und eine durchsuchbare Bibliothek zur Verfügung.
Wenn Sie sehen möchten, wie sich der Ausgabestil von Grok Imagine im Vergleich zu anderen KI-Kunstgeneratoren darstellt, schauen Sie sich diese Anleitung an:
So greifen Sie auf Grok Imagine zu (kostenlos und kostenpflichtig)
Sie können über das Web unter grok.com/imagine, über die Grok-App für iOS oder Android sowie über Grok auf X auf Grok Imagine zugreifen. Sie benötigen kein separates Imagine-Konto: Grok unterstützt die Anmeldung entweder mit einem X-Konto oder einer E-Mail-Adresse. Entwickler können außerdem die xAI-API nutzen, wo „grok-imagine-video-1.5“ allgemein verfügbar ist.
Preise für Grok Imagine
- Kostenlos (Eingeschränkter Zugriff auf Grok, einschließlich Limit bei der Bildgenerierung)
- SuperGrok (Einzelabonnement): 30 $/Monat (Beinhaltet die Erstellung von Bildern und Videos mit höheren Limiten für alle Grok-Features)
- SuperGrok Plus (Einzelabonnement): 100 $/Monat (bietet deutlich höhere Nutzungslimits, Priorität beim Zugriff und die Erstellung von 1080p-Videos)
- Business (Team): 30 $/Monat (Beinhaltet Zugriff auf Grok Build, Verwaltung von Team-Plätzen, Analysen für Benutzer usw.)
Wenn Sie regelmäßig Inhalte erstellen, bietet Ihnen ein kostenpflichtiges Abonnement mehr Spielraum, bevor Sie die Limite erreichen.
Welche Limite und Videolängen gibt es bei Grok Imagine?
In der Grok-App und im Web wählen Sie vor der Generierung im Composer die Clip-Länge und Auflösung aus: 6, 10 oder 15 Sekunden bei 480p oder 720p. Über die xAI-API akzeptiert „grok-imagine-video-1.5“ jede auf ganze Sekunden gerundete Länge von 1 bis 15 und erreicht bei der Umwandlung von Bildern in Videos eine Auflösung von 1080p, während die Umwandlung von Referenzbildern in Videos maximal 720p erreicht.
In der Verbraucher-App
Der Composer zeigt allen Nutzern die Schaltflächen für Länge und Auflösung an, aber Ihre Kontostufe entscheidet darüber, welche davon tatsächlich verfügbar sind. Mit kostenlosen Konten können keine Videos generiert werden, und die Bildgenerierung unterliegt starken Beschränkungen. Bei einem Standard-SuperGrok-Plan werden Ihnen die beiden Optionen 480p und 720p angezeigt. Die Ausgabe in 1080p ist ein Feature von SuperGrok Plus.
Bezahlte Pläne greifen zudem auf ein gemeinsames wöchentliches Nutzungskontingent zurück, das „Imagine“, „Chat“, „Voice“ und „Build“ gemeinsam abdeckt. Rechenintensive Aufgaben wie lange 720p-Videos verbrauchen einen größeren Anteil davon als ein schnelles Bild. Ihr verbleibendes Kontingent und das Datum der Neufüllung finden Sie in den Einstellungen Ihres Kontos.
Über die API
Der API-Zugriff wird pro Generierung abgerechnet und separat von jeglichem Abonnement in Rechnung gestellt, sodass der wöchentliche Pool vollständig umgangen wird. Das macht ihn zur besseren Wahl für die Stapelverarbeitung, auch wenn Sie dabei auf die interaktive Bearbeitungsschleife verzichten müssen, die Ihnen die App bietet.
Einige Limite sollten Sie bei Ihrem Plan berücksichtigen:
- Die Auflösung wird bei jeder Generierung neu festgelegt und ist keine Einstellung, die man einfach vergisst: Überprüfen Sie vor der Generierung, welche Schaltfläche aktiv ist, und vergewissern Sie sich über die Ausgabeauflösung, bevor Sie einen Clip in ein endgültiges Asset einfügen.
- Längere Sequenzen erfordern mehrere Generierungen: Ein Clip ist auf etwa 15 Sekunden begrenzt; nutzen Sie daher die Video-Erweiterung, um eine Szene über diesen Punkt hinaus einzufügen.
- Ihr Nutzungspool umfasst mehr als nur Imagine: Ein nachmittags intensiver Einsatz von 720p-Videos kann dazu führen, dass Sie später in der Woche beim Chatten mit Grok einem Ratenlimit unterliegen.
- Sicherheitsregeln können die Generierung unterbinden: Grok kann Eingabeaufforderungen blockieren, die außerhalb seiner Sicherheitsvorkehrungen liegen, und ein Verstoß gegen die Nutzungsrichtlinien von xAI kann das Ergebnis sein, dass Maßnahmen gegen Ihr Konto ergriffen werden, bis hin zur Sperrung oder Kündigung.
Die Modi von Grok Imagine erklärt
Grok Imagine verfügt über verschiedene Generierungseinstellungen, die jedoch nicht alle denselben Zweck erfüllen. Der Qualitätsmodus steuert die Bildqualität und die Bearbeitung, während die Optionen für schnellere Generierung und Video-Voreinstellungen beeinflussen, wie schnell oder kreativ Imagine ein Ergebnis erzeugt.
| Modus oder Einstellung | Funktionsweise | Am besten geeignet für |
|---|---|---|
| Qualitätsmodus | Läuft mit Imagine Image 2.0 und bietet eine verbesserte Befehlsbefolgung, Typografie, visuelle Details und präzise Bearbeitung | Produktbilder, Anzeigen, Infografiken, Design-Elemente und detaillierte Bearbeitungen |
| Schnelle Erstellung | Setzt auf Geschwindigkeit, wenn Sie Ideen ausprobieren oder schnell Variationen erstellen möchten | Frühe Konzepte, Test von Eingabeaufforderungen und umfangreiche Experimente |
| Normal | Hält die Video-Bewegungen relativ zurückhaltend und nah am Original | Realistische Animationen und unkomplizierte Bild-zu-Video-Clips |
| Spaß | Verleiht Videos verspieltere oder übertriebene Bewegungen | Memes, stilisierte Clips und lockere Social-Media-Inhalte |
| Benutzerdefiniert | Bietet Ihnen mehr direkte Kontrolle durch schriftliche Bewegungs- und Szenenanweisungen | Kamerabewegungen, choreografierte Aktionen und inszenierte Sequenzen |
| Spicy | Wendet, sofern verfügbar, eine freizügigere kreative Einstellung an, wobei die Inhalte weiterhin einer Moderation unterliegen. | Experimente mit nicht jugendfreien Inhalten, sofern der entsprechende Modus verfügbar ist |
Der Qualitätsmodus bietet die meisten nützlichen Steuerungsmöglichkeiten für die Bildbearbeitung. xAI hat Imagine Image 2.0 im August 2026 zum Standard-Qualitätsmodus gemacht, mit Tools wie der Bearbeitung mit dem Zauberstab, Segmentierung, Hintergrundentfernung, „Smart Resize“ und Unterstützung für bis zu fünf Referenzbilder pro Generierung.
Die anderen Beschreibungen sind weniger fest definiert. Videovoreinstellungen wie „Normal“, „Fun“, „benutzerdefiniert“ und „Spicy“ haben sich über verschiedene Versionen und Plattformen hinweg verändert, und xAI legt in Video 1.5 nun größeren Wert auf die promptgesteuerte Steuerung. Wenn die Benutzeroberfläche die Option „benutzerdefiniert“ anbietet, ist dies in der Regel die beste Wahl, wenn Sie bereits wissen, wie sich das Motiv, die Kamera und die Szene bewegen sollen.
So nutzen Sie Grok Imagine: Schritt für Schritt
Um Grok Imagine zu nutzen, öffnen Sie es im Web oder in der App, generieren Sie eine Reihe von Bildern, führen Sie eine Bearbeitung des besten davon mit benutzerdefinierten Anweisungen durch, animieren Sie es mithilfe einer Bewegungsanweisung zu einem Video, laden Sie es anschließend herunter und speichern Sie die Eingabeanweisung. Im Detail:
Schritt 1: Öffnen Sie Imagine und wählen Sie Ihren Ausgangspunkt aus
Gehen Sie zu grok.com/imagine oder öffnen Sie „Imagine“ in der Grok-App. Von dort aus können Sie über die Leiste für Eingaben eine neue Generierung starten und Beispiele in der „Imagine“-Oberfläche durchsehen. Bevor Sie Ihre eigene Eingabeformulierung verfassen, sehen Sie sich einige Generierungen an, die Ihren Vorstellungen nahekommen, und analysieren Sie, wie deren Eingabeformulierungen das Motiv, den Stil, den Bildausschnitt und die Beleuchtung beschreiben.

Schritt 2: Erstellen Sie eine Reihe von Bildern
Geben Sie eine beschreibende Eingabe ein und generieren Sie einige Varianten. Überprüfen Sie anhand der ersten Ergebnisse, ob Imagine das Motiv, die Einstellungen, die Komposition, das Thema, die Beleuchtung und den Gesamtstil richtig verstanden hat. Wählen Sie das Ergebnis aus, das Ihrer Vorstellung am besten entspricht, und verfeinern Sie diese Version in der nächsten Runde.

Ein paar Entscheidungen, die Sie hier treffen, können Ihnen später Zeit sparen:
- Legen Sie das Seitenverhältnis frühzeitig fest: Wählen Sie das Format entsprechend dem Ort, an dem das Bild erscheinen soll. Verwenden Sie 16:9 für breite Layouts oder Video-Rahmen, 9:16 für vertikale Inhalte und 1:1 für quadratische Beiträge. Wenn Sie die Form frühzeitig festlegen, können Sie sich bei späteren Bearbeitungen ganz auf das Bild selbst konzentrieren.
- Geben Sie dem Modell visuelle Anweisungen: Fügen Sie Details wie Einstellung, Stimmung, Bildausschnitt, Beleuchtung und Stil hinzu, wenn diese von Bedeutung sind. Image 2.0 ist darauf ausgelegt, detaillierte, mehrteilige Anweisungen zu befolgen, weshalb eine Eingabeaufforderung wie „Frau, die in einem ruhigen Café liest, sanftes Fensterlicht, Porträt bis zur Taille, natürliche Fotografie“ nützlicher ist als eine allgemeine Themenbeschreibung.
Schritt 3: Bearbeitung des besten Bildes mit einfacher Sprache
Öffnen Sie das aussagekräftigste Bild aus Ihrem Stapel und beschreiben Sie in Alltagssprache, was Sie ändern möchten. Sie können Imagine bitten, den Hintergrund, die Beleuchtung, die Farben, Objekte oder Personen anzupassen, während der Rest des Bildes unverändert bleibt.
Laut xAI ist Image 2.0 so konzipiert, dass der Ausgangsinhalt bei allen Schritten der Bearbeitung erhalten bleibt. Das ist besonders nützlich, wenn die Komposition bereits weitgehend Ihren Vorstellungen entspricht.

Einige Gewohnheiten machen den Zyklus der Bearbeitung vorhersehbarer:
- Geben Sie an, was sich ändern soll und was gleich bleiben soll: Eine Eingabeaufforderung wie „Ersetze den Bürohintergrund durch ein Lagerhaus, aber behalte die Person, die Pose, die Kleidung und den Kamerawinkel unverändert“ gibt dem Modell klare Grenzen vor.
- Fassen Sie zusammengehörige Bearbeitungen zu Gruppen zusammen: Sie können Änderungen, die zur selben Überarbeitung gehören, kombinieren, z. B. das Aufhellen der Szene, das Erwärmen der Farbe und das Entfernen eines Objekts aus dem Hintergrund. Für größere kreative Veränderungen nehmen Sie zunächst eine Änderung vor und überprüfen Sie das Ergebnis, bevor Sie weitere hinzufügen.
- Wechseln Sie für anspruchsvollere Bearbeitungen in den Qualitätsmodus: Imagine Image 2.0 ist als „Qualitätsmodus“ im Web, auf iOS und Android verfügbar. Nutzen Sie ihn, wenn Sie eine genauere Befolgung der Anweisungen, saubereren Text oder detailliertere Bearbeitungen benötigen.

Wenn Sie Ideen für die Formulierung von Bearbeitungen oder die Erstellung aussagekräftigerer visueller Eingabeaufforderungen benötigen, finden Sie in unserem Leitfaden zu KI-Bild-Eingabeaufforderungen über 50 Beispiele, die Sie anpassen können.
Schritt 4: Das Bild in ein Video animieren
Sobald das Standbild gut aussieht, wandeln Sie es in ein Video um und beschreiben Sie, was als Nächstes passieren soll. Grok Imagine Video 1.5 verwendet das Bild als Startbild und überträgt dessen Beleuchtung, Bildkomposition und visuelle Details in den generierten Clip.

An dieser Stelle sollte sich Ihr Prompt von der Beschreibung des Aussehens hin zur Beschreibung der Handlung verlagern. Beschreiben Sie genau, was die Person tut, wie sich die Kamera bewegt und was im Hintergrund geschieht.
Beispiel: „Die Radfahrerin setzt sich in Bewegung, während die Kamera ihre Nachverfolgung fortsetzt, und dann zoomt die Kamera zurück, um die Straße zu zeigen.“
Sie können auch Ton in dieselbe Eingabeaufforderung einfügen. Video 1.5 generiert Dialoge, Umgebungsgeräusche und Soundeffekte passend zu den Bildern. So kann eine Café-Szene leise Unterhaltungen und das Klirren von Tassen enthalten, während eine Straßenaufnahme Verkehrslärm und Schritte wiedergeben kann.
Schneller Tipp: Halten Sie die erste Bewegungsanweisung relativ zurückhaltend. Eine klare Handlung der Figur plus eine Kamerabewegung lassen sich leichter steuern als eine Anweisung voller Schwenks, Zooms, Dialoge, Hintergrundaktionen und Szenenwechsel. Sobald die Bewegung stimmt, steigern Sie die Komplexität in der nächsten Generation.
Schritt 5: Clips zu längeren Sequenzen erweitern
Wenn ein Clip zu kurz ist, verlängern Sie ihn ab dem Punkt, an dem die Handlung endet. Grok Imagine unterstützt Video-Erweiterungen, die einen bestehenden Clip ab seinem letzten Bild fortsetzen und das neue Filmmaterial mit dem Original kombinieren. So erhalten Sie auf einfachere Weise längere Sequenzen, ohne ein Bild manuell exportieren und die Szene neu zusammenstellen zu müssen.

Die Kontinuität hängt stark davon ab, was Sie in der Eingabeanweisung wiederholen. Achten Sie darauf, dass wiederkehrende Details wie Kleidung, Beleuchtung, Ort, Kamerastil und Tageszeit von einer Erweiterung zur nächsten konsistent bleiben. Wenn im ersten Clip „warmes Abendlicht, Handkamera, belebter Markt“ steht, übernehmen Sie diese Hinweise in die nächste Eingabeanweisung, es sei denn, Sie möchten, dass sich die Szene ändert.
Bei einer längeren Sequenz sollten Sie jede Erweiterung um einen neuen Rhythmus herum planen. Lassen Sie den ersten Clip die Szene etablieren, nutzen Sie den nächsten, um Bewegung oder Dialog hinzuzufügen, und heben Sie sich größere Änderungen an Kamera oder Einstellung für ein späteres Segment auf. Dadurch muss das Modell weniger bewegliche Teile auf einmal in Einklang bringen.
Schritt 6: Herunterladen, die Eingabeaufforderung protokollieren und die Rechte prüfen
Laden Sie die Versionen herunter, die Sie behalten möchten, und speichern Sie die Eingabeanweisung zusammen mit jeder Datei. So lässt sich ein bestimmter Stil leichter reproduzieren, können Sie später passende Inhalte erstellen oder nachvollziehen, welche Formulierung zu einem überzeugenden Ergebnis geführt hat.
Bevor Sie kommerzielle Arbeiten veröffentlichen, sollten Sie die aktuellen Nutzungsbedingungen und -regeln von xAI prüfen. Auch die Datenschutzrichtlinie spielt eine Rolle, wenn Sie Referenzbilder hochladen. Für die Verbraucher-Version von Grok gilt laut xAI, dass von Ihnen eingereichte Eingabeaufforderungen und andere Inhalte zur Verbesserung der Modelle verwendet werden dürfen, es sei denn, Sie deaktivieren das Training in den Dateneinstellungen oder nutzen den privaten Chat. Für die Produktions-API gilt eine andere Richtlinie: xAI gibt an, dass über die Enterprise-API übermittelte Daten nicht zum Training der Modelle verwendet werden.
Behandeln Sie bei sensiblen Aufgaben das Hochladen von Referenzmaterial mit derselben Sorgfalt wie bei jedem anderen externen KI-Dienst. Kundenentwürfe, unveröffentlichte Produktfotos, interne Kampagneninhalte und anderes vertrauliches Material sollten nur dann in Grok hochgeladen werden, wenn die Datenrichtlinien Ihres Unternehmens dies zulassen.
Lesen Sie auch: Alternativen zu Grok KI
Wie verfasst man funktionierende Eingabeaufforderungen für Grok Imagine?
Effektive Eingabeaufforderungen für Grok Imagine umfassen in der Regel fünf Aspekte: Motiv, Handlung, Umgebung, Kamera und Stil. Bei Videos sollten Sie Ton und Tempo hinzufügen, sofern diese die Szene beeinflussen. Es geht darum, den Inhalt der Szene davon zu trennen, wie das Modell sie aufnehmen soll.
Hier ist der Unterschied:
- Thema: Wer oder was ist in der Szene zu sehen?
- Aktion: Was die Person gerade zu erledigen hat
- Umgebung: Wo spielt die Szene statt und was umgibt sie?
- Kamera: Wie die Aufnahme komponiert ist oder sich bewegt
- Stil: Die visuelle Gestaltung, z. B. Filmstil, Beleuchtung oder Illustrationsstil
- Ton: Dialoge, Umgebungsgeräusche oder Effekte für Videos
Auf eine Arbeitsdatei angewendet, sieht das dann so aus:
„Ein Barista in einer grünen Schürze [Motiv], der in Zeitlupe [Handlung] Latte-Art an einer sonnendurchfluteten Café-Theke mit Pflanzen im Hintergrund [Umgebung] gießt. Langsame Nahaufnahme auf die Tasse [Kamera]. Warmer Film-Look mit sanfter Körnung [Stil]. Das Zischen der Espressomaschine und leises Café-Geplauder [Ton].“
Die Kamerarichtung ist besonders bei Videos nützlich, da sie bestimmt, wie der Betrachter das Geschehen wahrnimmt. „Ein Radfahrer, der durch eine Stadtstraße fährt“ lässt Raum für Interpretationen. „Ein Radfahrer, der durch eine Stadtstraße fährt, von der Seite auf Lenkerhöhe durch Nachverfolgung gefilmt“ gibt Grok einen viel klareren visuellen Plan. Begriffe wie „statische Stativaufnahme“, „langsame Nahaufnahme“, „Fahrkamera“ und „Kameraumlauf“ können die Bewegung und den Bildausschnitt steuern.
Konsistenz ist wichtig, wenn das gleiche Zeichen oder das gleiche Produkt in mehreren Szenen vorkommt. Wiederholen Sie die Details, die es auszeichnen: Farbe der Jacke, Frisur, Beschaffenheit des Produkts, Beleuchtung, Kamerawinkel oder andere visuelle Ankerpunkte. Wenn der Text von der Vorlage abweicht, verwenden Sie Referenzbilder.
Verzichten Sie auf vage Formulierungen wie „4K“, „Meisterwerk“ oder „hochwertig“, wenn eine konkrete visuelle Anweisung mehr zu erledigen hat.
Lesen Sie auch: Leonardo-KI-Prompts
Grok Imagine – Spickzettel für Eingabeaufforderungen
Nutzen Sie dies als Wortschatz, wenn Sie wissen, was Sie wollen, aber nicht wissen, wie Sie es beschreiben sollen.
| Wenn Sie die Kontrolle behalten möchten… | Probieren Sie Wörter wie … |
|---|---|
| Bildgröße | Nahaufnahme, extreme Nahaufnahme, Mittelaufnahme, Halbfigur, Ganzkörperaufnahme, Totale, Einstellungsaufnahme |
| Kamerawinkel | Augenhöhe, Low-Angle, High-Angle, von oben, von oben nach unten, über die Schulter, Dreiviertelansicht |
| Kamerabewegung | Langsames Heranzoomen, Zurückzoomen, Nachverfolgung, Dolly-Aufnahme, Schwenken nach links, Neigen nach oben, Handkamera, statisches Stativ, Kameraumlauf |
| Komposition | Zentriert, symmetrisch, Drittelregel, Motiv links, Negativraum, Einrahmung durch den Vordergrund, geringe Schärfentiefe |
| Beleuchtung | Weiches Fensterlicht, Golden Hour, Gegenlicht, Konturlicht, diffuses Studiolicht, grelles Mittagssonnenlicht, Neonlicht, Low-Key-Beleuchtung |
| Lens/Look | Weitwinkel, Tele, Makro, geringe Schärfentiefe, große Schärfentiefe, Fischauge, filmische Schärfentiefe |
| Bewegung | Geht langsam, dreht sich zur Kamera, Stoff weht im Wind, Dampf steigt auf, Menschenmenge bewegt sich im Hintergrund, leichte Kopfbewegung |
| Tempo | Langsam und bedächtig, sanfte Bewegung, rasante, plötzliche Bewegung, fließende, kontinuierliche Bewegung, Zeitlupe |
| Visueller Stil | Dokumentarfotografie, redaktionelle Modefotografie, Produktfotografie, Analogfilm, Aquarell, 3D-Rendering, handgezeichnete Illustrationen |
| Textur/Oberfläche | Feine Körnung, glänzend, matt, verwittert, gebürstetes Metall, durchscheinendes Glas, strukturiertes Papier, natürliche Hauttextur |
| Stimmung | Ruhig, angespannt, intim, verspielt, unheimlich, nostalgisch, energiegeladen, zurückhaltend |
| Ton für Videos | Schritte, Raumgeräusche, Verkehrslärm, Regen auf Glas, Café-Gespräche, Stoffrascheln, mechanisches Brummen, geflüsterte Dialoge |
Eine einfache Möglichkeit, darauf aufzubauen, ist:
[Motiv] + [Aktion] + [Umgebung] + [Aufnahme/Kamera] + [Beleuchtung/Stil] + [Ton für Video]
[Motiv] + [Aktion] + [Umgebung] + [Aufnahme/Kamera] + [Beleuchtung/Stil] + [Ton für Video]
Beispiel: „Eine silberne Smartwatch, die sich langsam auf einem schwarzen Steinsockel dreht, dunkler Studiohintergrund, Produkt-Nahaufnahme mit langsamer Kamerabewegung, sanfte Konturbeleuchtung und glänzende Reflexionen, leises mechanisches Summen.“

Profi-Tipp: Beginnen Sie mit den Details, die den Bildausschnitt am stärksten beeinflussen. Ein Kamerawinkel, die Lichtrichtung oder eine bestimmte Handlung verändern das Ergebnis stärker als eine Anhäufung von Adjektiven wie „schön“, „atemberaubend“ oder „hochwertig“.
Wie schneidet Grok Imagine im Vergleich zu Sora 2, Veo 3.1 und Kling 3.0 ab?
Grok Imagine überzeugt durch Geschwindigkeit, Kosten und originalgetreue Wiedergabe des Ausgangsbildes. Veo 3.1 ist führend in Sachen Qualität und Kamerasteuerung; Kling 3.0 bietet die höchste Auflösung und die besten Multi-Shot-Sequenzen; und Sora 2 gehört der Vergangenheit an. Wenn Sie eine große Menge kurzer Social-Media-Clips aus bereits vorhandenen Standbildern erstellen müssen, ist Grok die günstigste Option auf dieser Liste.
| Bereich | Grok Imagine Video 1. 5 | Sora 2 | Veo 3.1 | Kling 3.0 |
|---|---|---|---|---|
| Maximale Clip-Länge | 1 bis 15 Sekunden | 4, 8 oder 12 Sekunden; bis zu 25 Sekunden auf Sora 2 Pro | 8 Sekunden pro Durchlauf, erweiterbar auf etwa 148 | 15 Sekunden |
| Auflösungsgrenze | 1080p bei „Bild zu Video“, 720p bei „Referenz zu Video“ | 720p als Standard, 1024p und 1080p in der Pro-Version | Native 1080p-Auflösung, 4K-Stufe verfügbar | Natives 4K bei 60 fps |
| Natives Audio | Ja, in einem Durchgang generiert | Ja, Dialoge und Effekte sind synchronisiert | Ja, Dialoge und Umgebungsgeräusche in einem Durchgang | Ja, variiert je nach Modus |
| API-Kosten, 720p | 0,08 $ pro Sekunde | 0,10 $ pro Sekunde; ab 0,30 $ bei der Pro-Version | Premium-Stufe, etwa die Hälfte der Kosten bei deaktiviertem Ton | 0,075 $ pro Sekunde |
| Besondere Stärken | Animieren eines festgelegten Standbilds unter Beibehaltung von Licht und Details, mit einer Dauer von etwa 25 Sekunden pro 6-Sekunden-Clip in 720p | Physik und Gewicht bei komplexen Bewegungen | Kinoreifer Look und detaillierte Kameraführung | Szenen mit mehreren Aufnahmen, bis zu sechs Aufnahmen mit wiederverwendbaren Zeichen |
Notiz: OpenAI hat die Sora-App für Endverbraucher im April 2026 eingestellt und die Sora-2-API für den 24. September 2026 zur Abschaltung vorgesehen, ohne dass eine Liste mit Ersatz-Tools veröffentlicht wurde. Betrachten Sie das Ganze als Maßstab, nicht als ein tool, das Sie einsetzen sollten.
Die Auswahl ist derzeit der eigentliche Engpass
Mit Grok Imagine lassen sich mühelos mehr Optionen erstellen, als Sie realistisch nutzen können. Eine einzige Sitzung kann Dutzende von Bildern, Bearbeitungen und kurzen Clips hervorbringen. An diesem Punkt ist die Generierungsgeschwindigkeit weniger wichtig als die Entscheidung, welche Version zutreffend, markengerecht, verfeinerungswürdig und sicher zur Veröffentlichung geeignet ist.
Diese Herausforderung geht über kreative KI hinaus. Die McKinsey-Umfrage „State of AI 2025“ unter 1.993 Befragten ergab, dass 88 % der Unternehmen KI in mindestens einer Funktion des Geschäfts einsetzen, doch fast zwei Drittel haben noch nicht damit begonnen, KI unternehmensweit zu skalieren. Derselbe Bericht ergab, dass Unternehmen, die die besten Ergebnisse erzielen, eher dazu neigen, ihre Workflows rund um KI neu zu gestalten und neue Prozesse aufzubauen, anstatt Tools einfach an alte anzuhängen.
Ethan Mollick, Professor an der Wharton School, bringt die menschliche Seite dieser Herausforderung auf den Punkt:
Zu wissen, wann man KI einsetzen sollte, erweist sich als eine Form von Weisheit und nicht nur als technisches Wissen. Wie die meiste Weisheit ist auch diese etwas paradox: KI ist oft dort am nützlichsten, wo wir bereits fachlich versiert genug sind, um ihre Fehler zu erkennen, und am wenigsten hilfreich bei der tiefgehenden Arbeit, die uns überhaupt erst zu Experten gemacht hat.
Zu wissen, wann man KI einsetzen sollte, erweist sich als eine Form von Weisheit und nicht nur als technisches Wissen. Wie die meiste Weisheit ist auch diese etwas paradox: KI ist oft dort am nützlichsten, wo wir bereits fachkundig genug sind, um ihre Fehler zu erkennen, und am wenigsten hilfreich bei der konzentrierten Arbeit, die uns überhaupt erst zu Experten gemacht hat.
Für Grok Imagine bedeutet das: Der nützliche Workflow endet nicht, sobald das Modell ein ansprechendes Bild oder Video erzeugt hat. Es muss immer noch jemand die verschiedenen Versionen vergleichen und verzerrten Text oder Fehler in der Kontinuität aufspüren. Er muss die Markendetails überprüfen, die beste Variante auswählen und protokollieren, was genehmigt wurde.
Für Teams ist ein einfaches Überprüfungssystem hilfreich. Speichern Sie vielversprechende Ergebnisse zusammen mit der Eingabeaufforderung, mit der sie erstellt wurden. Halten Sie abgelehnte Varianten aus der endgültigen Asset-Bibliothek fern. Legen Sie fest, wer die endgültige Freigabe erteilt, bevor ein Bild oder ein Clip veröffentlicht wird. Je schneller die Generierung wird, desto wertvoller wird diese Ebene der Beurteilung.
So verwalten Teams die Arbeit mit Grok Imagine in ClickUp
Sobald ein Team damit beginnt, Dutzende von Bildern und Clips zu generieren, verlagert sich das Problem von der Erstellung hin zur Koordination. Jemand muss wissen, welche Eingabeaufforderung die aktuelle Version hervorgebracht hat, wer sie überprüft, was geändert werden muss und welche Datei tatsächlich freigegeben ist.
Geben Sie jedem Asset einen Platz
Ein einfaches Setup besteht darin, jeden Stapel von Bildern, Videos oder Assets als ClickUp Aufgabe zu behandeln. Speichern Sie dort das Briefing, die Eingabeaufforderung, Referenzen, das Fälligkeitsdatum und den endgültigen Export. Verwenden Sie anschließend Benutzerdefinierte Felder für Details, nach denen Sie später filtern möchten, wie z. B. Kampagne, Format, Seitenverhältnis oder Phase der Genehmigung.

Das ist hilfreich, wenn eine Kampagne mehrere Versionen desselben Assets enthält. So können Sie erkennen, welche Version gerade geprüft wird, ohne fünf Ordner mit dem Namen „final_v2_revised“ öffnen zu müssen.
Verknüpfen Sie Feedback immer mit der Version, auf die es sich bezieht als Anhang
Generierte Medien können verwirrend sein, wenn Kommentare im Chat stehen und die Dateien an einem anderen Ort gespeichert sind. Mit ClickUp Prüfung können Sie jedoch Feedback direkt auf Bildern und Videos hinterlassen. Videokommentare lassen sich zudem mit bestimmten Zeitstempeln verknüpfen.

So erhalten Sie einen zuverlässigen Überblick vom ersten Eingabebefehl bis zur endgültigen Freigabe. Wenn jemand die Kampagne drei Monate später noch einmal betrachtet, kann er immer noch nachvollziehen, warum eine Version ausgewählt und eine andere verworfen wurde.
Machen Sie den Freigabeprozess sichtbar
Sie benötigen kein aufwendiges Creative-Ops-System. Nutzen Sie benutzerdefinierte ClickUp-Status wie „In Bearbeitung“, „Prüfung“, „Überarbeitung“ und „Genehmigt“, um anzuzeigen, in welcher Phase sich das Asset gerade befindet.
Für wiederholbare Übergaben können ClickUp-Automatisierungen als Auslöser verwendet werden, wenn sich ein Status oder ein Benutzerdefiniertes Feld ändert. Dies kann Aktionen wie die Zuweisung eines Prüfers umfassen, wenn ein Asset in den Status „Prüfung“ wechselt, oder das Verschieben genehmigter Arbeiten in die nächste Phase.
Wenn Sie Generierung und Projektmanagement aus einer Hand benötigen
Die größte Herausforderung, auf die die meisten Teams bei eigenständigen Generatoren stoßen, ist alles, was nach der Erstellung des Assets passiert. Man lädt es herunter, lädt es in einen Aufgaben-Tracker hoch, versieht es mit dem richtigen Kampagnen-Tag, benachrichtigt den Prüfer in einem separaten Chat und hofft, dass niemand die genehmigte Version mit einer älteren Datei überschreibt.
Je mehr Inhalte Sie produzieren, desto mehr zehrt das Zusammenfügen an der Zeit, die Sie bei der Erstellung eingespart haben.
Wenn Ihnen diese Schwierigkeiten bekannt vorkommen: ClickUp Brain kann Bilder, Videos, Präsentationen, interaktive Prototypen, Dashboards und visuelle Elemente direkt in dem Workspace erstellen, in dem sich bereits Ihre Briefings, Ihr Feedback und Ihre Kampagnendaten befinden.

Die Ergebnisse bleiben mit der Aufgabe verknüpft, für die sie angefordert wurden. Kein Herunterladen, erneutes Hochladen oder Abgleichen zwischen verschiedenen tools.
Wo es an seine Grenzen stößt: ClickUp ist eine Projekt- und Arbeitsmanagement-Plattform mit integrierter konvergenter KI. Wenn Ihr Workflow bereits fest etabliert ist und Sie lediglich ein Tool zur Erstellung von Inhalten benötigen, macht es keinen Sinn, nur dafür eine ganze Plattform einzuführen. Dies eignet sich für Teams, die die Erstellung und Koordination an einem Ort bündeln möchten.
Fünf Fehler bei Grok Imagine, die Ihre Generierungen verschwenden
Die fünf häufigsten Fehler bei Grok Imagine, die zu verschwendeten Generierungen führen, sind: zu viel von einem Clip zu erledigen, einen Clip zu verlängern, bevor man die letzten Frames überprüft hat, ein Referenzbild zu beschreiben, das man hochladen könnte, bei jedem Experiment die höchste Einstellung zu verwenden und die Miniaturansicht zu genehmigen, ohne das gesamte Asset zu überprüfen.
1. Zu viel von einem Clip zu erledigen. Drei Aktionen der Zeichen, zwei Kamerabewegungen, Dialog, eine Beleuchtungsänderung und ein Szenenwechsel in einer einzigen Eingabeaufforderung überfordern das Modell, da es zu viele Elemente gleichzeitig verarbeiten muss. Teilen Sie komplexe Sequenzen stattdessen in kleinere Abschnitte auf. Stellen Sie zunächst eine Aktion und eine Kamerabewegung sicher, und setzen Sie die Szene dann im nächsten Clip fort.
2. Einen Clip erweitern, bevor Sie die letzten Bilder überprüfen. Die Video-Erweiterung knüpft an das bereits Erstellte an. Wenn das Gesicht des Zeichens, die Form des Produkts, die Beleuchtung oder der Hintergrund gegen Ende abweichen, wird dieser Fehler zum Ausgangspunkt für das nächste Segment. Um dies zu vermeiden, sollten Sie sich die letzten Sekunden vor der Erweiterung genau ansehen. Erstellen Sie den schwachen Abschnitt neu, solange der Austausch noch kostengünstig ist.
3. Beschreiben Sie ein Referenzbild, das Sie einfach hochladen könnten. Text eignet sich gut für allgemeine Vorgaben, reicht jedoch nicht aus, wenn ein bestimmtes Produkt, ein Zeichen oder eine visuelle Identität über mehrere Generationen hinweg beibehalten werden soll. Image 2.0 unterstützt mehrere Referenzbilder. Auch Video 1.5 verfügt über eine referenzbasierte Generierung. Geben Sie Grok die visuellen Informationen direkt, wann immer dies möglich ist.
4. Verwenden Sie bei jedem Experiment die höchste Einstellung. Bei den ersten Generierungen geht es in der Regel darum, die Idee zu finden, sie zu konkretisieren und die Richtung vorzugeben. Sparen Sie sich den „Save Quality“-Modus und Videos mit höherer Auflösung für Versionen auf, die bereits nahezu einsatzfähig sind. Bei der Grok-Version für Privatanwender gelten für Generierungen mit höherer Auflösung stufenweise Kontingente.
5. Genehmigen Sie die Miniaturansicht, nicht das Asset. Auf den ersten Blick übersehen Sie mehr KI-Fehler, als Sie erwarten würden. Öffnen Sie Bilder in voller Größe. Sehen Sie sich jedes Video mit Ton vollständig an, bevor Sie es genehmigen. Überprüfen Sie Text, Hände, Logos, Spiegelungen, Gesichter im Hintergrund, die Kontinuität von Objekten, die Lippensynchronisierung und die letzten Einzelbilder. Ein ausgefeilter erster Eindruck kann Mängel verbergen, die erst nach der Veröffentlichung des Assets offensichtlich werden.
Nutzen Sie Grok Imagine auch über die erste Generation hinaus
Der Einstieg in Grok Imagine ist einfach. Um jedoch konsistente, brauchbare Arbeiten zu erzielen, ist etwas mehr Disziplin erforderlich: Fixieren Sie eine Komposition im Bildmodus, bevor Sie sie animieren, formulieren Sie Kamerabewegungen als explizite Anweisungen (anstatt darauf zu hoffen, dass das Modell sie selbst ableitet) und speichern Sie die Eingabeanweisung zusammen mit jeder Ausgabe, die Sie möglicherweise wiederverwenden möchten.
Für Teams beginnt die größere Herausforderung erst nach der Erstellung. Jemand muss immer noch die Optionen prüfen, Feedback einholen, die richtige Version freigeben und dafür sorgen, dass das endgültige Ergebnis später leicht zu finden ist. Testen Sie ClickUp kostenlos, um diesen gesamten Workflow (Eingabeaufforderungen, Dateien und Freigaben) an einem Ort zu bündeln.
Häufig gestellte Fragen zu Grok Imagine
Teilweise. Bei kostenlosen Grok-Konten ist die Bildgenerierung begrenzt, Videos sind jedoch nicht möglich. Für Videos ist „SuperGrok“ für 30 $/Monat erforderlich, und für 1080p-Videos ist „SuperGrok Plus“ für 100 $/Monat erforderlich ( x.ai/pricing ). Entwickler können Abonnements komplett umgehen und über die xAI-API pro Generierung bezahlen, wobei „grok-imagine-video-1.5“ pro Sekunde Ausgabe abgerechnet wird. Wenn Sie nur gelegentlich Standbilder zum Testen von Eingabeaufforderungen benötigen, reicht die kostenlose Stufe für den Einstieg aus.
Grok Imagine fügt den generierten Bildern und Videos als Herkunftsmarkierung ein kleines Wasserzeichen in einer Ecke hinzu, das als Standard in den für Verbraucher bestimmten Ausgaben erscheint. Das Verhalten variiert je nach Tarif, Plattform und API. Überprüfen Sie daher einen tatsächlichen Export aus Ihrem eigenen Konto, bevor Sie darauf basierend ein für Kunden bestimmtes Ergebnis erstellen.
Ja, gemäß den allgemeinen Vertragsbedingungen von xAI, aber im Gegensatz zu Adobe Firefly oder Midjourney hat xAI keine expliziten Richtlinien zur kommerziellen Nutzung veröffentlicht, sodass Fragen zu den Rechten auf die allgemeine Formulierung der Vertragsbedingungen zurückfallen. Unabhängig davon vertritt das US-Urheberrechtsamt die Auffassung, dass rein KI-generierte Arbeiten nicht urheberrechtlich geschützt sind, was bedeutet, dass Sie ein Asset veröffentlichen können, aber möglicherweise nicht verhindern können, dass andere es wiederverwenden. Dokumentieren Sie bei der Arbeit für Clients Ihre Eingabeaufforderungen und manuellen Bearbeitungen und überprüfen Sie die Bedingungen bei der Übergabe noch einmal.
Technisch gesehen manchmal; praktisch gesehen: lieber nicht. xAI hat nach der Deepfake-Kontroverse im Januar 2026 die Moderation verschärft, und Eingabeaufforderungen, in denen Persönlichkeiten des öffentlichen Lebens namentlich genannt werden, werden uneinheitlich blockiert, was bedeutet, dass das Bestehen der Moderation nicht gleichbedeutend mit einer Freigabe ist. Die Nutzungsrichtlinien von xAI regeln das Konto, und jegliche Darstellung von Ähnlichkeiten und Markenzeichen liegt in Ihrer Verantwortung, unabhängig davon, was das tool rendert. Verwenden Sie für Kampagnenarbeit lizenzierte Darsteller, Ihre eigenen Referenzfotos oder eigene Zeichen.
Installieren Sie die Grok-App, melden Sie sich mit Ihrem X-Konto oder Ihrer E-Mail-Adresse an, öffnen Sie dann „Imagine“ über die Erstellungsoberfläche der App und wählen Sie im Editor „Bild“ oder „Video“ aus. Der mobile Editor verfügt über dieselben Kernfunktionen wie die Webversion: Seitenverhältnis, Qualitätseinstellung, Clip-Länge und Auflösung. Referenzdateien werden aus Ihrem Fotoalbum geladen, wodurch das Smartphone der schnellere Weg für bereits vorhandene Produkt- und Standortaufnahmen ist.
„Spicy“ ist eine freizügigere Kreativeinstellung, die xAI im Jahr 2025 mit Imagine eingeführt hat, und The Verge hat dokumentiert, dass sie aus hochgeladenen Fotos nicht jugendfreie Inhalte erzeugt. Es handelt sich um einen Modus pro Generierung, nicht um eine Standard-Einstellung des Kontos; wenn Sie ihn also nicht auswählen, bleibt er inaktiv. Die Verfügbarkeit variiert je nach Plattform und Region, und alle Ergebnisse unterliegen einer Moderation. Bei allem, was mit der Arbeit zu tun hat, sollten Sie diesen Modus als tabu betrachten: Das Reputationsrisiko überwiegt jeden stilistischen Vorteil.
