30秒
映像の長さ
1回の生成で、カットのない映像を最長30秒まで出力します。Kling 3.0 の上限は15秒でした。完成したクリップはさらに延長でき、合計で最長2分になります。
近日公開
当サイトでは Kling 4.0 の生成をまだ開始していません
このページの操作パネルはレイアウトのプレビューであり、何も送信されません。Kling 4.0 が当サイトで利用可能になるまでは、以下の動画モデルをご利用いただけます。
現在利用できるモデル
Kling 4.0
テキスト・画像から動画を生成
モデルの能力
モデルの上限は4つのグループに分けられます。各グループは、プロンプトを書く前に決めておくべき計画上の問いに対応しています。
30秒
1回の生成で、カットのない映像を最長30秒まで出力します。Kling 3.0 の上限は15秒でした。完成したクリップはさらに延長でき、合計で最長2分になります。
キーフレーム10枚
クリップ上に最大10枚の静止画を配置できます。いずれも動画が必ず通過する画であり、モデルが決めるのは、ある画から次の画へシーンがどう移るかだけです。
参照15件
1回の生成には参照を15件まで含められます。内訳は画像が最大10件、動画が最大5件、被写体が最大7件です。参照は人物の顔、製品、ビジュアルスタイルを全編で安定させ、既存の映像に対する変更の指示にも使えます。
4K HDR
出力は最大 4K で、1080p と 4K のいずれも 10-bit HDR で出力できます。音声は映像とともに2チャンネルのステレオで生成され、口の動きは従来のバージョンよりも正確に音声と一致します。
数値は、制作のどの段階で関わるかに応じてまとめています。
キーフレームと参照の大半は静止画です。そのため、動画を生成する前にショットの見た目を固めておくことができます。以下の手順を順番に進めてください。
ショットに必要な画を作成または収集します。冒頭の画、転換点、最後の画です。スタイルのそろった静止画を用意するには、画像モデルを使うのが最も早い方法です。
Nano Banana Pro で静止画を作成する視聴者が目にする順に、静止画をキーフレームとして並べます。Kling 4.0 は最大10枚を受け付けますが、A から B への単純な動きであれば2枚で十分に表現できます。
人物、製品、場所、全体の雰囲気など、識別できる状態を保つ必要があるものに参照を追加します。15件の枠は、各ファイルの役割が明確であるほど有効に使えるため、似通った素材は外してください。
プロンプトには、静止画では示せない内容を書きます。被写体の動き、カメラの移動、台詞、聞こえる音です。8,000 トークンの枠があるため、出来事が起こる順に記述できます。
配信先に合わせてアスペクト比を選びます。たとえばスマートフォン向けフィードには縦長、映画的な画面には 21:9 が適しています。続いて解像度を選びます。カラーグレーディングを行う映像には、1080p または 4K の 10-bit HDR が適しています。
ショットの要件に合わせてモデルを選びます。各行に、判断の決め手を示しています。
| ショットの要件 | モデル | 理由 |
|---|---|---|
| 15秒を超えるワンテイクで、途中の特定の画を固定したい | Kling 4.0 | 1回の生成で最長30秒、キーフレームは最大10枚です。 |
| 音声付きの短い映画的なクリップを、スタンダードまたはプロ品質で作りたい | Kling 3 | テキストまたは参照画像から、ネイティブオーディオ付きの3・5・10・15秒のクリップを生成します。 |
| 開始フレームと終了フレームを指定したい、または既存の動画を変更したい | Kling o3 | 最初と最後のフレームの制御と動画編集に対応するオムニモデルです。 |
| 種類の異なる参照素材を大量に使いたい | Seedance 2.5 | 最大50件のマルチモーダル参照素材を使用でき、最長30秒・最大 4K の動画を生成します。 |
Kling 4.0 には、より軽量なエディションがあります。Flash は速度とクリップあたりのコストを優先し、フルモデルはリアリズムと制御性を優先します。
各プランでは、静止画・参照・プロンプトを分けて記載しています。モデルがこれらを別々の入力として受け取るためです。
縦長・30秒
21:9・30秒
横長・15秒
クリップが長いほど、わずかな不一致が目立ちやすくなります。次の5項目を確認すれば、その大半を防げます。
照明、レンズ、配色が異なるキーフレームは、目に見える飛びを生みます。ひと組として生成し、並べて見比べてください。
静止画は完成動画のアスペクト比で用意します。正方形の画は、トリミングするか左右を補わない限り、21:9 の画面を埋められません。
参照とキーフレームが食い違う場合(上着や髪型が異なるなど)、結果は偶然に左右されます。どちらか一方を外してください。
何が聞こえるべきか、どちら側から聞こえるかを明記します。2チャンネルのトラックでは、音の位置も記述の一部です。
最後の1秒は安定した画で終えてください。編集、ループ、延長はいずれもそのフレームから始まります。
このモデルを前提に制作を計画する際の実用的な回答です。
企業としては Kuaishou です。Kling AI は、同社の動画生成プラットフォームおよびモデルシリーズの名称です。Kling 4.0 はそのシリーズの第4世代にあたり、フルモデルと Kling 4.0 Flash の2つのエディションがあります。
いいえ。30秒は1回の処理でネイティブに生成されるため、隠すべきつなぎ目はありません。Kling 3.0 では1回の生成につき最長15秒でした。シーンにさらに時間が必要な場合は、完成したクリップを合計で最長2分まで延長できます。
いいえ。Kling 4.0 はテキストのみ、または画像1枚からでも生成できます。キーフレームは任意であり、特定の画を特定の位置に登場させる必要がある場合に役立ちます。最大10枚まで指定できます。
上限は、すべての種類を合わせた合計に適用されます。その範囲内で、1回の生成に画像は最大10件、動画は最大5件、被写体は最大7件を含めることができ、合計が15件を超えない限り組み合わせは自由です。
10-bit の信号は色チャンネルごとに1,024階調を記録します。8-bit の場合は256階調です。そのため空、影、肌のグラデーションがより滑らかになり、強めの色補正にも耐えられます。Kling 4.0 では、この HDR モードを 1080p と 4K の両方の出力で利用できます。
はい。音声は映像とともに2チャンネルのステレオトラックとして生成されます。話し言葉は単一の言語に限られず、英語、中国語、スペイン語、日本語、韓国語などに対応し、地域ごとのアクセントや方言も扱えます。口の動きも、従来の Kling より正確に台詞と一致します。
横長、縦長、正方形の出力に対応し、さらに 21:9 のウルトラワイドが加わります。映画館のスクリーンに近い比率の構図に適しています。
はい、8,000 トークンです。実際には、この上限が制約になることはまれで、重要なのは明瞭さです。出来事は起こる順に書き、1文につき指示は1つにとどめてください。
Flash は最高の忠実度よりも、速度と経済性を重視して設計されています。結果が早く返り、クリップあたりのコストも低いため、アイデアの検証や大量の公開に適した選択肢です。リアリズムと制御性が求められる完成作品には、フルモデルが適しています。
Kling 3 は同じファミリーに属し、ネイティブオーディオ付きの3〜15秒のクリップを、スタンダードまたはプロ品質で生成します。Seedance 2.5 は30秒の長さと最大 4K に対応し、最大50件のマルチモーダル参照素材を使用できます。Kling o3 は最初と最後のフレームの制御と動画編集に対応します。
当サイトの動画モデルはクレジットでお支払いいただきます。たとえば Kling 3 では、必要なクレジット数は動画の長さ、画質モード、音声の有無によって決まります。プランとクレジットパックは料金ページに掲載しています。
はい。キーフレームは通常の静止画であるため、動画の工程に入る前に画像モデルで作成できます。すべての静止画を、同じスタイル指定を用いて一度の作業でまとめて生成すると、互いの一貫性を保てます。