Planos más largos, control más fino
Kling 4.0
El próximo modelo de video de Kuaishou apunta a planos más largos y un control narrativo más fino.
Planos más largos, control más fino
El próximo modelo de video de Kuaishou apunta a planos más largos y un control narrativo más fino.
Escribe un prompt o añade una imagen inicial, y luego elige duración, relación de aspecto y resolución.
Kling 4.0 está pensado para clips más largos y un control más preciso de la historia.
Una generación se anuncia en unos 30 segundos, más que el rango de 3–15 segundos de Kling 3.0.
La cobertura describe una mezcla de imágenes, clips de video y referencias de sujeto, citada como 10 imágenes, 5 videos y 7 sujetos.
Los momentos de la historia se pueden fijar a lo largo del clip, más allá de un solo fotograma inicial y final.
Hasta 4K y HDR de 10 bits, con más detalle en luces y sombras.
Audio nativo, sincronía labial más precisa y habla en varios idiomas, acentos y dialectos.
La extensión repetida se menciona hacia unos dos minutos. La cobertura también habla de un encuadre 21:9.
Seedance 2.5 es la opción más cercana para un clip de 30 segundos con referencias de imagen y video. Kling 3.0 es la generación anterior de la misma línea.
| Kling 4.0 | Kling 3.0 | Seedance 2.5 | |
|---|---|---|---|
| Duración | Unos 30 segundos | 3–15 segundos | Hasta 30 segundos |
| Referencias | Hasta 15 | Primer y último fotograma, más referencias de elementos | Referencias de imagen, video y audio |
| Fotogramas clave | Hasta 10 | Inicio y final | Inicio, final y referencias |
| Audio | Estéreo y sincronía labial | Audio nativo | Audio nativo |
Un clip nativo dura unos 30 segundos y se puede extender.
Hasta 15, combinando imágenes, clips de video y referencias de sujeto.
Hasta 10 fotogramas clave fijan los momentos de la historia a lo largo del clip, más allá de un solo inicio y final.
Seedance 2.5 es el más cercano para un clip más largo con referencias de imagen y video y audio nativo. Kling 3.0 es la generación anterior de la misma línea.
Los clips son más largos, unos 30 segundos en lugar de 3–15. También admite más referencias y fotogramas clave, con sonido estéreo y una sincronía labial más clara.