年度会员优惠升级年度会员 · 享 5 折优惠
查看套餐
Nano Banana Pro
首页首页
Nano Banana Series
Nano Banana Pro
RECOMMENDED

根据文本描述生成高质量图像

Nano Banana 2

新一代 · Google 搜索 · 14张输入图

Nano Banana 2 Lite

Nano Banana 2 的轻量快速版

GPT Image Series
GPT Image 2.5
RECOMMENDED

自然光影 · 丰富质感 · 精细细节呈现

GPT Image 2

照片级真实感 · 精准文本渲染 · 像素级编辑

GPT Image 1.5

搭载最新 GPT 5.2 技术的图像生成

Seedream SeriesRELAXED
Seedream 5 Pro
NEW

效果比肩 Nano Banana 2,精准编辑,图层自由

Seedream 5 Lite

最新 Seedream 模型,4K 画质,8 种宽高比

Seedream 4.0

4K分辨率支持,宽松的内容政策,批量生成功能

Qwen Image
Qwen Image 3.0

复杂图文排版 · 清晰文字渲染 · 细腻写实

Creative Tools
图像增强

提升图像分辨率,优化细节表现

电商套图

上传产品图,生成主流商城完整套图

Nano Banana Pro 抽卡

一次生成多张卡片网格图

GPT Image 2 抽卡

基于 GPT Image 2 一次生成多张卡片网格图

Z-Image
Z-图像

快速生成逼真图像,内容限制宽松

Seedance Series
Seedance 2.5
NEW

30 秒 4K 视频生成,支持原生音频与高级控制

Seedance 2
HOT

影院级视频,原生音频,最长15秒,文生视频/图生视频

Seedance 2 Mini
HOT

高性价比 Seedance 2,原生音频,4-15秒,720p/1080p

Seedance 1.5 Pro

支持首尾帧、文生视频/图生视频模式,性价比高

Kling Series
Kling 3
HOT

原生音频支持的电影级4K生成

Kling o3

全能模型,支持首尾帧控制

Kling 2.6

电影级画质,原生音频生成

Wan Series
Wan 3.0
NEW

标准与高速 Prime 同一工作台

Wan 2.7
HOT

文生、图生、参考生成和视频编辑模式

Wan 2.6

宽松内容政策

Wan 2.5

较为宽松的内容政策,保持高创作自由度

Google Series
Gemini Omni

多模态输入 × 原生音频,电影级可控视频生成

Veo 3.1

支持首尾帧视频、多图像参考视频生成

Grok Series
Grok Imagine 1.5

xAI Grok 图生视频,支持多种比例,最长15秒

Grok

生成速度更快,提示词遵循度较弱,支持辣味模式

Hailuo AI Series
H3 Max / Turbo

高性价比的 MiniMax H3 Max 视频工作台,支持文生视频、图生视频、多模态参考生成与原生音频。

MiniMax H3(Hailuo 03)

Hailuo 03:支持文本、首尾帧和多模态参考视频

海螺AI

MiniMax Hailuo视频:支持文字/图像生成视频,首尾帧效果出众。

OmniHuman 1.5
OmniHuman 1.5

单张图片加音频生成数字人视频

V2V Lip Sync

用目标音频同步现有视频口型

AI聊天
AI Audio
NEW

Generate dialogue, ambience, sound effects, and background music

AI音乐
NEW

创作具有自定义歌词和风格的原创歌曲

创作记录创作记录
定价定价
提示词库

探索和发现高质量的 AI 提示词

Nano Banana 提示词案例

探索 Nano Banana Pro 的高质量提示词案例

GPT Image 2 提示词案例
NEW

浏览适合社交帖子、海报、商品视觉等场景的 GPT Image 2 提示词

Seedance 2.0 视频提示词案例

浏览精选 Seedance 2.0 视频案例,包含视频、作者、发布时间和互动数据。

提示词构建

提示词构建工具与指南

AI 图片提示词构建器
NEW

通过可视化界面轻松构建复杂的提示词

Seedance 2 提示词指南

深入了解高级功能和最佳实践

API
NEW

将 Nano Banana Pro 的能力集成到您的应用中

Nano Banana Pro
AI ImageAI Video

Nano Banana Pro

Nano Banana Pro 是革命性的 AI 驱动图像生成和编辑平台,提供一致的角色编辑和场景保持,性能卓越。

Email: support@nanobananapro.site

  • 邮箱

产品

  • 首页
  • 功能特点
  • 案例展示
  • 电商
  • 定价

其他服务

  • AI 图像增强器
  • Grok
  • Veo3.1
  • Wan2.5
  • Kling 4.0

其他

  • 博客
  • 关于我们
  • 除碳计划

© 2026 bananapro.site. 保留所有权利。

  • 隐私政策
  • 服务条款
  • 退款政策
  • Referral Program
  • Invoice Management
🇺🇸 English🇨🇳 中文🇰🇷 한국어🇯🇵 日本語🇪🇸 Español🇩🇪 Deutsch🇫🇷 Français🇷🇺 Русский🇸🇦 العربية🇧🇷 Português🇮🇹 Italiano
定价创作

Kling 4.0:从静态画面到 30 秒 4K HDR 视频

30 秒长镜头 • 关键帧控制 • 双声道音频

Kling 4.0 可在一次生成中容纳一个完整场景:最长 30 秒的连续画面,由静态画面与参考素材引导,并配有双声道音频,最高输出 4K。本页说明该模型接受哪些输入、输出什么内容,以及应如何准备。

即将上线

本站暂未开放 Kling 4.0 生成

本页控件仅用于预览界面布局,不会提交任何内容。在 Kling 4.0 于本站开放之前,可先使用下列视频模型。

现已可用

前往 Kling 3前往 Seedance 2.5

Kling 4.0

文字与图片生成视频

即将上线
Kling 4.0 控件预览(已禁用)

生成模式

时长

宽高比

分辨率

原生音频

模型能力

Kling 4.0 一次生成可兼顾的四个方面

该模型的各项上限可归为四组,每一组对应撰写提示词之前需要先确定的一个规划问题。

30 秒

画面时长

单次生成可连续输出最长 30 秒且无剪辑点的画面,而 Kling 3.0 的上限为 15 秒。成片还可继续延长,总时长最长 2 分钟。

10 个关键帧

固定画面

一段视频中最多可设置 10 张静态画面。每一张都是视频必须经过的画面,模型只需处理场景如何从一张过渡到下一张。

15 个参考

贯穿全片的主体

每次生成可容纳 15 个参考,其中图片最多 10 个、视频最多 5 个、主体最多 7 个。参考可使人物面部、产品或视觉风格在全片保持稳定,也可用于指导对已有素材的修改。

4K HDR

画面与声音

输出分辨率最高为 4K,1080p 与 4K 两档均可输出 10-bit HDR。声音随视频一同生成,为双声道立体声,口型与语音的匹配程度高于此前版本。

Kling 4.0 的上限与格式

以下数据按其在项目中发挥作用的环节分组。

输入

提示词长度上限
8,000 个 token
关键帧数量上限
10 张静态图片
参考数量上限
每次生成 15 个
参考构成
图片最多 10 个、视频最多 5 个、主体最多 7 个

输出

单次生成时长上限
30 秒
延长后时长上限
2 分钟
最高分辨率
4K
色深
10-bit HDR,适用于 1080p 与 4K 输出
画幅
横屏、竖屏与方形,另有 21:9 超宽画幅

声音与运动

音轨
双声道立体声,与画面同步生成
语音
支持多种语言、口音与方言,口型同步更准确
运动表现
高速动作与复杂运镜更为稳定

模型系列

出品方
快手(Kling AI)
版本
Kling 4.0 与更轻量的 Kling 4.0 Flash

以图为先:Kling 4.0 镜头的准备方法

关键帧与多数参考都是静态图片,因此在生成任何视频之前即可确定镜头的整体观感。请按顺序完成以下步骤。

  1. 01

    设计静态画面

    制作或收集镜头必须包含的画面:开场画面、转折点与结尾画面。使用图像模型是获得风格统一的静态画面的最快方式。

    使用 Nano Banana Pro 制作静态画面
  2. 02

    排列顺序

    按观众看到的先后顺序将静态画面排列为关键帧。Kling 4.0 最多接受 10 个;从 A 到 B 的简单运动,两个关键帧即可完整描述。

  3. 03

    让每个参考各司其职

    为必须保持可辨识的对象添加参考,例如人物、产品、场地或整体风格。每个文件用途明确时,15 个名额才能得到充分利用,因此应剔除近似重复的素材。

  4. 04

    描述运动与声音

    提示词用于说明静态画面无法呈现的内容:主体如何运动、镜头如何移动、说了什么、听到什么。8,000 个 token 的长度足以按事件发生的顺序逐一写明。

  5. 05

    选择画幅与成片规格

    根据发布渠道选择宽高比,例如手机信息流使用竖屏,电影感画面使用 21:9,然后选择分辨率。需要调色的素材适合选用 1080p 或 4K 的 10-bit HDR。

选择 Kling 4.0,还是本站其他视频模型?

根据镜头需求选择模型,每一行列出起决定作用的因素。

镜头需求模型理由
超过 15 秒的单个长镜头,并需在途中固定若干画面Kling 4.0单次生成最长 30 秒,最多 10 个关键帧。
带声音的电影感短片,可选标准或专业画质Kling 3可由文字或参考图生成 3、5、10 或 15 秒的片段,并带原生音频。
指定首帧与尾帧,或修改已有视频Kling o3全能模型,支持首尾帧控制与视频编辑。
大量不同类型的参考素材Seedance 2.5最多可使用 50 个多模态参考素材,生成最长 30 秒、最高 4K 的视频。

Kling 4.0 Flash 的定位

Kling 4.0 另有一个更轻量的版本。Flash 优先考虑速度与单条成本,完整版则优先考虑真实感与可控性。

Kling 4.0 适用于

  • 用于正式发布的最终版本
  • 以真实感与精细控制为首要要求的场景
  • 需要用足模型各项上限的作品

Kling 4.0 Flash 适用于

  • 初稿与提示词测试
  • 需要定期大量产出的片段
  • 在使用完整版生成之前先验证创意

三个 Kling 4.0 分镜方案

每个方案将静态画面、参考与提示词分开列出,因为模型是将它们作为不同的输入分别接收的。

竖屏 · 30 秒

美食短片

关键帧
四张静态画面:案板上的生食材、烧热的平底锅、装盘的成品、叉子挑起第一口。
参考
一张成品图,用于确定色彩与点缀;一张厨房台面图。
提示词
双手切碎香草并拨入锅中;蒸汽升起,镜头自灶台向上摇起;盘子放下并转动四分之一圈;镜头缓慢推近叉子。
声音
刀落在木板上的声音、热油的滋滋声、盘子落桌的声音。不加配乐。

21:9 · 30 秒

建筑漫游

关键帧
三张静态画面:清晨的临街入口、从门口望去的中庭、面向城市天际线的屋顶露台。
参考
两张建筑外观照片;一张木质外墙材质的样图。
提示词
镜头平稳向前穿过入口,经楼梯一侧在中庭内上升,随后来到露台,天光渐亮。画面中无人,全程不剪辑。
声音
石材地面上的轻微脚步声、中庭内的气流声、露台上远处的车流声。

横屏 · 15 秒

吉祥物讲解

关键帧
两张静态画面:吉祥物站在空白展板旁、吉祥物指向已完成的图示。
参考
将吉祥物设为主体,以保持其比例与配色一致;另附一张品牌色板图。
提示词
吉祥物挥手后转向展板,画出三个以箭头相连的方框,随后面向镜头,用英语说:“Three steps, and the order matters.”
声音
清晰而亲切的人声位于中央;马克笔的摩擦声来自展板一侧。

生成长视频前的检查

片段越长,细小的不一致越容易显现。以下五项检查可排除其中的大部分。

  • 所有静态画面风格统一

    光线、镜头或色调各不相同的关键帧会造成明显的跳变。应成组生成,并排对比。

  • 先确定画幅

    按成片的宽高比准备静态画面。方形画面若不裁切或补全两侧,无法填满 21:9 的画幅。

  • 素材之间没有矛盾

    参考与关键帧不一致(例如外套或发型不同)时,结果将难以预料。应删去其中之一。

  • 声音需写明,不可默认

    说明应听到什么声音,以及声音来自哪一侧。对双声道音轨而言,方位本身就是描述的一部分。

  • 结尾画面保持稳定

    最后一秒应停在稳定的画面上。剪辑、循环播放与延长都从这一帧开始。

Kling 4.0 常见问题

围绕该模型规划创作时的实用解答。

Kling 4.0 出自哪家公司?

出品公司为快手;Kling AI 是其视频生成平台及该模型系列的名称。Kling 4.0 是该系列的第四代,提供完整版与 Kling 4.0 Flash 两个版本。

Kling 4.0 的 30 秒视频是由多个短片段拼接而成的吗?

不是。30 秒画面由模型一次原生生成,不存在需要掩饰的拼接点。Kling 3.0 单次生成最长为 15 秒。场景需要更长时间时,可延长成片,总时长最长 2 分钟。

必须提供关键帧吗?

不必。Kling 4.0 也可仅凭文字或单张图片生成。关键帧为可选项,在特定画面必须出现在特定位置时才有必要使用,最多可提供 10 个。

15 个参考的上限如何计算?

该上限指各类参考的总数。在此范围内,单次生成最多可包含 10 张图片、5 段视频与 7 个主体,任意组合均可,但总数不得超过 15 个。

10-bit HDR 对画面有何提升?

10-bit 信号每个颜色通道可记录 1,024 级,而 8-bit 为 256 级。因此天空、阴影与肤色的过渡更平滑,素材也能承受更大幅度的调色。Kling 4.0 的 1080p 与 4K 输出均可使用该 HDR 模式。

Kling 4.0 能生成语音和声音吗?

可以。音频与视频一同生成,为双声道立体声。语音不限于单一语言,支持的语言包括英语、中文、西班牙语、日语与韩语,并涵盖各地口音与方言;口型与台词的匹配也比此前的 Kling 版本更准确。

可选择哪些画幅?

横屏、竖屏与方形均可输出,另有 21:9 超宽画幅,适合采用影院银幕比例的构图。

提示词长度有上限吗?

有,上限为 8,000 个 token。实际使用中,限制效果的往往不是长度,而是表述是否清晰。建议按事件发生的顺序书写,每句话只包含一项指令。

Kling 4.0 Flash 适合做什么?

Flash 侧重速度与成本,而非最高保真度。它出片更快,单条成本更低,适合验证创意和批量发布。依赖真实感与可控性的成片,应交由完整版完成。

本站哪些模型与 Kling 4.0 最为接近?

Kling 3 属于同一系列,可生成 3 至 15 秒的片段,带原生音频,并提供标准与专业两种画质。Seedance 2.5 同样支持 30 秒时长与最高 4K 输出,并可使用最多 50 个多模态参考素材。Kling o3 支持首尾帧控制与视频编辑。

本站的视频生成如何计费?

本站的视频模型以积分计费。以 Kling 3 为例,所需积分取决于时长、质量模式以及是否开启音频。订阅套餐与积分包详见定价页面。

关键帧可以用图像模型制作吗?

可以。关键帧就是普通的静态图片,因此可在进入视频环节之前先用图像模型制作。在同一次创作中使用相同的风格描述生成全部静态画面,有助于保持彼此一致。

继续浏览本站

  • 套餐与积分比较订阅套餐与积分包。
  • 图片提示词库精选图片提示词,可用于设计场景、角色与关键帧。