Veo ist Googles KI-Modell für Text-zu-Video und Bild-zu-Video, entwickelt von Google DeepMind. Die aktuelle Generation Veo 3.1 erzeugt realistische Videoclips inklusive synchronisiertem Ton direkt aus einer Textbeschreibung und zählt neben Kling und Sora zu den führenden KI-Videomodellen.
Veo wurde erstmals auf der Google I/O 2024 vorgestellt. Der große Sprung kam mit Veo 3 auf der I/O 2025: Als erstes Google-Videomodell erzeugte es nicht nur Bild, sondern auch passenden Ton, Stimmen, Geräusche und Musik, gleichzeitig zum Video. Seit 2026 ist Veo 3.1 die aktuelle Version, verfügbar in drei Stufen: Standard für die höchste Qualität, Fast für den produktiven Alltag und Lite für besonders günstige Massenerstellung.
Für Unternehmen: Veo lässt sich über die Gemini-App, das Videotool Flow und für Entwickler:innen über die Vertex-AI-API nutzen. Alle erzeugten Videos erhalten automatisch ein unsichtbares SynthID-Wasserzeichen und sind mit dem C2PA-Standard kompatibel. (Stand: September 2026, Quelle: veo3ai.io)
Preise: Über die API kostet Veo 3.1 Fast rund 0,15 US-Dollar pro Sekunde, Standard rund 0,40 US-Dollar pro Sekunde, jeweils inklusive Ton. Für Endnutzer:innen ist Veo über die Google-Abos AI Pro und AI Ultra zugänglich, die Preise dafür beginnen deutlich niedriger als der reine API-Zugang.
🔗 Verwandte Begriffe:
Gemini, Kling, Deepfake, SynthID
Dieser Beitrag wurde mit Hilfe einer KI ausformuliert, von mir geprüft, verantwortet und veröffentlicht.
Änderungshistorie: