30 秒
画面时长
单次生成可连续输出最长 30 秒且无剪辑点的画面,而 Kling 3.0 的上限为 15 秒。成片还可继续延长,总时长最长 2 分钟。
即将上线
本站暂未开放 Kling 4.0 生成
本页控件仅用于预览界面布局,不会提交任何内容。在 Kling 4.0 于本站开放之前,可先使用下列视频模型。
现已可用
Kling 4.0
文字与图片生成视频
模型能力
该模型的各项上限可归为四组,每一组对应撰写提示词之前需要先确定的一个规划问题。
30 秒
单次生成可连续输出最长 30 秒且无剪辑点的画面,而 Kling 3.0 的上限为 15 秒。成片还可继续延长,总时长最长 2 分钟。
10 个关键帧
一段视频中最多可设置 10 张静态画面。每一张都是视频必须经过的画面,模型只需处理场景如何从一张过渡到下一张。
15 个参考
每次生成可容纳 15 个参考,其中图片最多 10 个、视频最多 5 个、主体最多 7 个。参考可使人物面部、产品或视觉风格在全片保持稳定,也可用于指导对已有素材的修改。
4K HDR
输出分辨率最高为 4K,1080p 与 4K 两档均可输出 10-bit HDR。声音随视频一同生成,为双声道立体声,口型与语音的匹配程度高于此前版本。
以下数据按其在项目中发挥作用的环节分组。
关键帧与多数参考都是静态图片,因此在生成任何视频之前即可确定镜头的整体观感。请按顺序完成以下步骤。
制作或收集镜头必须包含的画面:开场画面、转折点与结尾画面。使用图像模型是获得风格统一的静态画面的最快方式。
使用 Nano Banana Pro 制作静态画面按观众看到的先后顺序将静态画面排列为关键帧。Kling 4.0 最多接受 10 个;从 A 到 B 的简单运动,两个关键帧即可完整描述。
为必须保持可辨识的对象添加参考,例如人物、产品、场地或整体风格。每个文件用途明确时,15 个名额才能得到充分利用,因此应剔除近似重复的素材。
提示词用于说明静态画面无法呈现的内容:主体如何运动、镜头如何移动、说了什么、听到什么。8,000 个 token 的长度足以按事件发生的顺序逐一写明。
根据发布渠道选择宽高比,例如手机信息流使用竖屏,电影感画面使用 21:9,然后选择分辨率。需要调色的素材适合选用 1080p 或 4K 的 10-bit HDR。
根据镜头需求选择模型,每一行列出起决定作用的因素。
| 镜头需求 | 模型 | 理由 |
|---|---|---|
| 超过 15 秒的单个长镜头,并需在途中固定若干画面 | Kling 4.0 | 单次生成最长 30 秒,最多 10 个关键帧。 |
| 带声音的电影感短片,可选标准或专业画质 | Kling 3 | 可由文字或参考图生成 3、5、10 或 15 秒的片段,并带原生音频。 |
| 指定首帧与尾帧,或修改已有视频 | Kling o3 | 全能模型,支持首尾帧控制与视频编辑。 |
| 大量不同类型的参考素材 | Seedance 2.5 | 最多可使用 50 个多模态参考素材,生成最长 30 秒、最高 4K 的视频。 |
Kling 4.0 另有一个更轻量的版本。Flash 优先考虑速度与单条成本,完整版则优先考虑真实感与可控性。
每个方案将静态画面、参考与提示词分开列出,因为模型是将它们作为不同的输入分别接收的。
竖屏 · 30 秒
21:9 · 30 秒
横屏 · 15 秒
片段越长,细小的不一致越容易显现。以下五项检查可排除其中的大部分。
光线、镜头或色调各不相同的关键帧会造成明显的跳变。应成组生成,并排对比。
按成片的宽高比准备静态画面。方形画面若不裁切或补全两侧,无法填满 21:9 的画幅。
参考与关键帧不一致(例如外套或发型不同)时,结果将难以预料。应删去其中之一。
说明应听到什么声音,以及声音来自哪一侧。对双声道音轨而言,方位本身就是描述的一部分。
最后一秒应停在稳定的画面上。剪辑、循环播放与延长都从这一帧开始。
围绕该模型规划创作时的实用解答。
出品公司为快手;Kling AI 是其视频生成平台及该模型系列的名称。Kling 4.0 是该系列的第四代,提供完整版与 Kling 4.0 Flash 两个版本。
不是。30 秒画面由模型一次原生生成,不存在需要掩饰的拼接点。Kling 3.0 单次生成最长为 15 秒。场景需要更长时间时,可延长成片,总时长最长 2 分钟。
不必。Kling 4.0 也可仅凭文字或单张图片生成。关键帧为可选项,在特定画面必须出现在特定位置时才有必要使用,最多可提供 10 个。
该上限指各类参考的总数。在此范围内,单次生成最多可包含 10 张图片、5 段视频与 7 个主体,任意组合均可,但总数不得超过 15 个。
10-bit 信号每个颜色通道可记录 1,024 级,而 8-bit 为 256 级。因此天空、阴影与肤色的过渡更平滑,素材也能承受更大幅度的调色。Kling 4.0 的 1080p 与 4K 输出均可使用该 HDR 模式。
可以。音频与视频一同生成,为双声道立体声。语音不限于单一语言,支持的语言包括英语、中文、西班牙语、日语与韩语,并涵盖各地口音与方言;口型与台词的匹配也比此前的 Kling 版本更准确。
横屏、竖屏与方形均可输出,另有 21:9 超宽画幅,适合采用影院银幕比例的构图。
有,上限为 8,000 个 token。实际使用中,限制效果的往往不是长度,而是表述是否清晰。建议按事件发生的顺序书写,每句话只包含一项指令。
Flash 侧重速度与成本,而非最高保真度。它出片更快,单条成本更低,适合验证创意和批量发布。依赖真实感与可控性的成片,应交由完整版完成。
Kling 3 属于同一系列,可生成 3 至 15 秒的片段,带原生音频,并提供标准与专业两种画质。Seedance 2.5 同样支持 30 秒时长与最高 4K 输出,并可使用最多 50 个多模态参考素材。Kling o3 支持首尾帧控制与视频编辑。
本站的视频模型以积分计费。以 Kling 3 为例,所需积分取决于时长、质量模式以及是否开启音频。订阅套餐与积分包详见定价页面。
可以。关键帧就是普通的静态图片,因此可在进入视频环节之前先用图像模型制作。在同一次创作中使用相同的风格描述生成全部静态画面,有助于保持彼此一致。