30 s
Tempo sullo schermo
Una generazione dura fino a 30 secondi senza tagli; Kling 3.0 si fermava a 15. Una clip conclusa può poi essere estesa, fino a una durata complessiva di 2 minuti al massimo.
In arrivo
Kling 4.0 non è ancora aperto alla generazione su questo sito
I controlli di questa pagina mostrano soltanto un'anteprima del layout e non inviano nulla. Fino all'apertura di Kling 4.0 su questo sito, i modelli video riportati di seguito sono pronti all'uso.
Disponibili oggi
Kling 4.0
Da testo e immagine a video
Capacità del modello
I limiti del modello si suddividono in quattro gruppi. Ciascuno risponde a una domanda di pianificazione che si pone prima di scrivere il prompt.
30 s
Una generazione dura fino a 30 secondi senza tagli; Kling 3.0 si fermava a 15. Una clip conclusa può poi essere estesa, fino a una durata complessiva di 2 minuti al massimo.
10 keyframe
Lungo la clip si possono collocare fino a 10 immagini fisse. Ciascuna è un'immagine che il video deve raggiungere; al modello resta soltanto da stabilire come la scena passa dall'una alla successiva.
15 riferimenti
Ogni generazione può contenere 15 riferimenti. Le immagini possono occuparne fino a 10, i video fino a 5 e i soggetti fino a 7. Mantengono stabile un volto, un prodotto o uno stile visivo per tutta la durata e consentono anche di orientare modifiche a materiale già esistente.
4K HDR
L'uscita arriva a 4K, e sia l'impostazione a 1080p sia quella a 4K possono essere fornite in HDR a 10 bit. L'audio viene generato insieme al video come traccia stereo a due canali, e il movimento delle labbra segue il parlato con maggiore precisione rispetto alle versioni precedenti.
I valori sono raggruppati in base alla fase del progetto in cui risultano rilevanti.
I keyframe e la maggior parte dei riferimenti sono immagini fisse; l'aspetto di un'inquadratura può quindi essere definito prima di generare qualsiasi video. Si consiglia di seguire i passaggi nell'ordine indicato.
Create o raccogliete le immagini che l'inquadratura deve contenere: la vista di apertura, il punto di svolta e l'immagine finale. Un modello di immagini è la via più rapida per ottenere immagini fisse coerenti in un unico stile.
Creare immagini fisse con Nano Banana ProDisponete le immagini fisse come keyframe nella sequenza in cui il pubblico le vedrà. Kling 4.0 ne accetta fino a 10, sebbene un semplice movimento da A a B sia descritto per intero da due.
Aggiungete riferimenti per tutto ciò che deve restare riconoscibile: una persona, un prodotto, un luogo o un'estetica. La quota di 15 rende di più quando ogni file svolge una funzione distinta; conviene quindi escludere i quasi duplicati.
Riservate il prompt a ciò che le immagini fisse non possono mostrare: come si muovono i soggetti, dove va la camera, che cosa viene detto e che cosa si sente. Il margine di 8.000 token consente di scriverlo nell'ordine in cui accade.
Selezionate le proporzioni in base alla destinazione, per esempio verticale per i feed su smartphone o 21:9 per un'inquadratura cinematografica, e poi la risoluzione. L'HDR a 10 bit a 1080p o 4K è indicato per il materiale destinato alla correzione del colore.
Associate l'esigenza dell'inquadratura al modello. Ogni riga indica il fattore decisivo.
| L'inquadratura richiede | Modello | Motivo |
|---|---|---|
| Un'unica ripresa più lunga di 15 secondi, con immagini specifiche fissate lungo il percorso | Kling 4.0 | Generazioni fino a 30 secondi e fino a 10 keyframe. |
| Una breve clip cinematografica con audio, in qualità Standard o Pro | Kling 3 | Clip da 3, 5, 10 o 15 secondi con audio nativo, a partire da un testo o da un'immagine di riferimento. |
| Un fotogramma iniziale e uno finale, oppure modifiche a un video esistente | Kling o3 | Un modello omni con controllo del primo e dell'ultimo fotogramma e modifica dei video. |
| Un ampio insieme di materiale di riferimento eterogeneo | Seedance 2.5 | Accetta fino a 50 materiali di riferimento multimodali e produce fino a 30 secondi a una risoluzione massima di 4K. |
Kling 4.0 dispone di un'edizione più leggera. Flash privilegia la velocità e il costo per clip, mentre il modello completo privilegia il realismo e il controllo.
Ogni piano elenca separatamente le immagini fisse, i riferimenti e il prompt, perché il modello li riceve come input distinti.
Verticale · 30 secondi
21:9 · 30 secondi
Orizzontale · 15 secondi
Le clip più lunghe danno alle piccole incoerenze più tempo per manifestarsi. Cinque verifiche ne intercettano la maggior parte.
Keyframe realizzati con illuminazione, ottiche o palette differenti producono salti visibili. Generateli come un insieme e confrontateli uno accanto all'altro.
Preparate le immagini fisse nelle proporzioni del video finale. Un'immagine quadrata non può riempire un'inquadratura 21:9 senza ritagli o bordi inventati.
Un riferimento in disaccordo con un keyframe, per esempio una giacca o un'acconciatura diversa, lascia il risultato al caso. Rimuovete uno dei due.
Indicate che cosa si deve sentire e da quale lato. In una traccia a due canali, la posizione fa parte della descrizione.
Chiudete l'ultimo secondo su un'immagine stabile. Il montaggio, la riproduzione in loop e l'estensione partono da quel fotogramma.
Risposte pratiche per pianificare il lavoro intorno al modello.
L'azienda è Kuaishou; Kling AI è il nome della sua piattaforma di generazione video e della linea di modelli. Kling 4.0 è la quarta generazione di tale linea ed è disponibile in due edizioni: il modello completo e Kling 4.0 Flash.
No. I 30 secondi sono generati in modo nativo in un solo passaggio, quindi non vi sono giunzioni da nascondere. Kling 3.0 produceva al massimo 15 secondi per generazione. Quando una scena richiede più tempo, la clip conclusa può essere estesa fino a un totale di 2 minuti.
No. Kling 4.0 funziona anche con il solo testo o con una singola immagine. I keyframe sono facoltativi e diventano utili quando determinate immagini devono comparire in punti precisi; se ne possono fornire fino a 10.
Il limite si applica al totale di tutti i tipi. Al suo interno, una generazione può includere fino a 10 immagini, fino a 5 video e fino a 7 soggetti, in qualsiasi combinazione che non superi 15.
Un segnale a 10 bit registra 1.024 livelli per canale di colore, mentre uno a 8 bit ne registra 256. Cieli, ombre e incarnati mostrano quindi transizioni più morbide, e il materiale tollera una correzione del colore più marcata. Su Kling 4.0 questa modalità HDR è disponibile per l'uscita sia a 1080p sia a 4K.
Sì. L'audio viene prodotto insieme al video come traccia stereo a due canali. Il parlato non è limitato a una sola lingua: inglese, cinese, spagnolo, giapponese e coreano sono tra quelle supportate, con accenti e dialetti regionali, e il movimento delle labbra segue le parole con maggiore accuratezza rispetto alle versioni precedenti di Kling.
Sono coperte le uscite orizzontale, verticale e quadrata, alle quali si aggiunge un'inquadratura ultra-wide 21:9 per composizioni nelle proporzioni degli schermi cinematografici.
Sì, pari a 8.000 token. In pratica quel limite è raramente il vincolo; lo è la chiarezza. Scrivete gli eventi nell'ordine in cui si verificano e mantenete una sola istruzione per frase.
Flash è concepito per la rapidità e l'economia, non per la massima fedeltà. Restituisce i risultati prima e a un costo per clip inferiore, il che lo rende l'opzione pratica per provare idee e pubblicare in volume. I lavori finiti che dipendono da realismo e controllo spettano al modello completo.
Kling 3 appartiene alla stessa famiglia e genera clip da 3 a 15 secondi con audio nativo in qualità Standard o Pro. Seedance 2.5 eguaglia la durata di 30 secondi e il tetto del 4K e accetta fino a 50 materiali di riferimento multimodali. Kling o3 copre il controllo del primo e dell'ultimo fotogramma e la modifica dei video.
I modelli video di questo sito si pagano con i crediti. Per Kling 3, ad esempio, l'importo dipende dalla durata, dalla modalità di qualità e dall'attivazione dell'audio. I piani e i pacchetti di crediti sono riportati nella pagina dei prezzi.
Sì. Un keyframe è una normale immagine fissa e può quindi essere prodotto in un modello di immagini prima della fase video. Generare tutte le immagini fisse in un'unica sessione, con le stesse istruzioni di stile, le mantiene coerenti tra loro.