Längere Einstellungen, feinere Steuerung
Kling 4.0
Das nächste Videomodell von Kuaishou zielt auf längere Einstellungen und genauere Story-Steuerung.
Längere Einstellungen, feinere Steuerung
Das nächste Videomodell von Kuaishou zielt auf längere Einstellungen und genauere Story-Steuerung.
Schreibe einen Prompt oder füge ein Startbild hinzu, dann wähle Dauer, Seitenverhältnis und Auflösung.
Kling 4.0 ist für längere Clips und eine genauere Steuerung der Geschichte gebaut.
Eine einzelne Erzeugung ist mit etwa 30 Sekunden angekündigt, länger als der Bereich von 3–15 Sekunden bei Kling 3.0.
Die Berichte beschreiben eine Mischung aus Bildern, Videoclips und Motivreferenzen, genannt als 10 Bilder, 5 Videos und 7 Motive.
Story-Punkte lassen sich über den Clip setzen, nicht nur als einzelnes Start- und Endbild.
Bis zu 4K und 10-Bit-HDR, mit klareren Details in Lichtern und Schatten.
Natives Audio, genauere Lippensynchronisation und Sprache in mehreren Sprachen, Akzenten und Dialekten.
Wiederholtes Verlängern wird in Richtung von etwa zwei Minuten beschrieben. Ein 21:9-Bild wird ebenfalls erwähnt.
Seedance 2.5 liegt am nächsten an einem 30-Sekunden-Clip mit Bild- und Videoreferenzen. Kling 3.0 ist die vorherige Generation derselben Linie.
| Kling 4.0 | Kling 3.0 | Seedance 2.5 | |
|---|---|---|---|
| Länge | Etwa 30 Sekunden | 3–15 Sekunden | Bis zu 30 Sekunden |
| Referenzen | Bis zu 15 | Erstes und letztes Bild plus Elementreferenzen | Bild-, Video- und Audioreferenzen |
| Keyframes | Bis zu 10 | Start und Ende | Start, Ende und Referenzen |
| Audio | Stereo und Lippensynchronisation | Natives Audio | Natives Audio |
Ein nativer Clip dauert etwa 30 Sekunden und lässt sich verlängern.
Bis zu 15, aus Bildern, Videoclips und Motivreferenzen.
Bis zu 10 Keyframes setzen Story-Punkte über den ganzen Clip, nicht nur als einzelnes Start- und Endbild.
Seedance 2.5 liegt am nächsten an einem längeren Clip mit Bild- und Videoreferenzen und nativem Audio. Kling 3.0 ist die vorherige Generation derselben Linie.
Clips sind länger, etwa 30 Sekunden statt 3–15. Es nimmt auch mehr Referenzen und Keyframes, mit Stereoton und klarerer Lippensynchronisation.