Planos mais longos, controle mais fino
Kling 4.0
O próximo modelo de vídeo da Kuaishou mira planos mais longos e um controle narrativo mais preciso.
Planos mais longos, controle mais fino
O próximo modelo de vídeo da Kuaishou mira planos mais longos e um controle narrativo mais preciso.
Escreva um prompt ou adicione uma imagem inicial, depois escolha duração, proporção e resolução.
O Kling 4.0 foi feito para clipes mais longos e um controle mais preciso da história.
Uma geração é anunciada em cerca de 30 segundos, mais do que a faixa de 3–15 segundos do Kling 3.0.
A cobertura descreve uma mistura de imagens, clipes de vídeo e referências de sujeito, citada como 10 imagens, 5 vídeos e 7 sujeitos.
Os momentos da história podem ser fixados ao longo do clipe, além de um único quadro inicial e final.
Até 4K e HDR de 10 bits, com mais detalhe nas luzes e nas sombras.
Áudio nativo, sincronia labial mais precisa e fala em vários idiomas, sotaques e dialetos.
A extensão repetida é citada em direção a cerca de dois minutos. Um quadro 21:9 também aparece na cobertura.
O Seedance 2.5 é o mais próximo para um clipe de 30 segundos com referências de imagem e vídeo. O Kling 3.0 é a geração anterior da mesma linha.
| Kling 4.0 | Kling 3.0 | Seedance 2.5 | |
|---|---|---|---|
| Duração | Cerca de 30 segundos | 3–15 segundos | Até 30 segundos |
| Referências | Até 15 | Primeiro e último quadro, mais referências de elementos | Referências de imagem, vídeo e áudio |
| Quadros-chave | Até 10 | Início e fim | Início, fim e referências |
| Áudio | Som estéreo e sincronia labial | Áudio nativo | Áudio nativo |
Um clipe nativo dura cerca de 30 segundos e pode ser estendido.
Até 15, misturando imagens, clipes de vídeo e referências de sujeito.
Até 10 quadros-chave fixam os momentos da história ao longo do clipe, além de um único início e fim.
O Seedance 2.5 é o mais próximo para um clipe mais longo com referências de imagem e vídeo e áudio nativo. O Kling 3.0 é a geração anterior da mesma linha.
Os clipes são mais longos, cerca de 30 segundos em vez de 3–15. Também aceita mais referências e quadros-chave, com som estéreo e sincronia labial mais clara.