2000 年,李安与摄影师鲍德熹在《卧虎藏龙》里拍下了一场经典的竹林追逐:剑锋碰撞,竹海摇曳,镜头随人物身形贴地起伏,在极速运动中留下了东方武侠的张力与气韵。

大幅度动态与复杂运镜,向来是影视工业中最难驾驭的表达修辞。尽管今年已经出现全 AI 生成的 95 分钟长片,但想让 AI 制作一部诺兰水准的电影依旧有着一段距离。
这也是 AI 视频模型都在争夺的王冠,可灵也拿出了 Kling 4.0 的大版本更新,让电影级内容生成更进了一大步。
全新升级的 Kling 4.0 将于 10 月正式与大家见面,其主打「真实、可控、专业」,在画面真实感、创意可控性和叙事完整度方面实现大幅提升,并在视听表现、多关键帧、口型匹配、文字生成、创意复刻等能力上有了不小的突破。

同时,可灵 AI 还推出了 Kling 4.0 Flash, 兼具高性价比与高效的生成速度,已于 9 月 28 日率先开放小范围体验,对于有高频创作需求的用户更加实用。
APPSO 也第一时间对 Kling 4.0 进行了体验,看看它能不能把我那些天马行空的想法,变成电影镜头。
能武,为大场面而生
在影视工业中,动作戏与大场面意味着燃烧的经费与极高难度的调度。对于 AI 而言,这也是最容易暴露出算力短板与模型缺陷的灾区。高速运动、连续动作、复杂的推拉摇移,往往会让画面中的物体产生扭曲,或者让空间关系彻底乱套。
我们给 Kling 4.0 设定的第一个测试案例就是宏大的危险场面。

Kling 4.0 在推拉、摇移、跟拍、高位斜俯拍等大幅镜头运动中,做到了运镜不抽搐不闪变,过程连贯。
这种稳定不仅仅停留在宏大的破坏场面,同样适用于讲究招式与力量感的近身搏斗。
在一段以武侠电影为美学参考的片段中,我们考验了模型对极快剪辑与贴地写实打斗的理解。

场景位于黄昏的竹林,要求逆光洒落形成金色光斑。两人欺身而上时,竹叶被剑风震落的动态,剑刃连续碰撞迸发的火花,镜头随人物身形快速横移时的呼吸感,都得到了精准还原。
双方剑势卸开后退半步时的肩膀起伏,逆光勾勒出的轮廓,复刻了武侠电影中凝重的对峙感。
像这样对贴身肉搏的精准刻画,同样体现在另一个天台激斗的测试中。从无人机俯冲建立动势,到人物纵身跃过楼顶间隙,再到近景手持晃动下的拳肘格斗, Kling 4.0 在极高频的动作切换中维持了人物特征的一致性。

支撑起这些极具冲击力画面的,除了底层模型对大幅度动作的理解升级,还有一项在 AI 视频赛道中极为罕见的硬指标,那就是 10-bit HDR 与 4K 或是 1080P 分辨率的高规格输出。
市面上大部分 AI 视频生成模型输出的画面是 8-bit ,一旦进入影视工作流程,调色时一拉曲线就会出现色阶断层,暗部细节无法挽回,稍微提亮全是噪点和色块。
Kling 4.0 提供的 10-bit HDR 意味着它比普通视频多出 4 倍的色彩信息,每个通道拥有 1024 级灰阶。

因此,生成的素材可以直接导入 DaVinci Resolve 或者 Premiere Pro 等专业后期软件中,满足流媒体交付标准,为后期调色提供更充足的空间。
能文,有了更多人情味
过去可灵生成的视频堪称文戏顶流,人物细腻的画质与表现仿佛让 AI 演员有了演技。
今年全网播放量上亿、被央视和人民日报转发的 AI 短片《纸手机》,就是由两个潮汕年轻人在可灵 AI 3.0 Omni 的帮助下创作出来的。
升级后的 Kling 4.0 对动作和情感的理解更强了。它进一步提升了画面真实感与人物表现,微表情、眼神流转、呼吸节奏比以往更加细腻自然。
为了验证这一点,我们复刻了《我的前半生》的名场面。

在这段连续叙事中, Kling 4.0 单次原生生成最长可达 30 秒的能力得到了充分展现。它支持长镜头与连续叙事,让多段情节能够自然衔接,人物关系与故事节奏有更充分的空间建立和发展。

我们还试了试致敬《沙丘》里的皇宫密谋戏,输出效果依旧不错,人物的台词和微表情都十分到位。

情感的传递需要视觉与声音的精密配合。
在测试台湾新电影风格的案例时,我们模拟了一场压抑的家庭晚餐,冷蓝灰的自然光透过铁窗花洒入,胶片颗粒质感明显。这个案例的难点在于人物间疏离与欲言又止的氛围,以及粤语对白的呈现。

Kling 4.0 的语言能力大幅加强,支持中文、英语、日语、韩语、西班牙语、葡萄牙语、德语、法语、印地语等 9 种语言,涵盖北京口音、中国台湾口音、东北口音、四川方言、粤语、美式英语、英式英语、印度英语等多种口音方言。
当画面中的父亲用疲惫的语气说出「仲驶讲?做咗十几年,讲执就执」,人物的口型匹配极为准确,声音、对白与表演自然同步。伴随着双通道立体声带来的空间信息,左耳和右耳听到不同的环境音,一种极度真实的日常生活压抑感扑面而来。母亲停下筷子,手指轻轻摩挲碗边的微小动作被捕捉,表现了家庭内部的生存压力。
长期以来 AI 视频创作被戏称为抽卡游戏,创作者只能通过反复修改提示词祈祷模型生成符合心意的画面。 Kling 4.0 的出现试图终结这种盲目,将控制权交还给创作者。
在单次任务中,它支持最多 15 项参考素材,可以灵活组合最多 10 张图片、 5 段视频、 7 个主体及 3 个视频主体。你可以输入主体图、三视图、宫格图、关键帧、线框图,甚至通过输入视频来参考角色表演、运镜及叙事节奏。
我们尝试了一个极具西海岸夏日风格的公路片镜头,以达到标志性的对称构图与高饱和明快色彩。利用 Kling 4.0 最多支持 10 张关键帧输入的功能,我们自由设定了关键画面节点,精准指定人物状态与情节节点,让内容按照预设方向自然推进。

奶油色老式敞篷车在正午刺眼的阳光下行驶,跳切剪辑将车内朋友欢笑的瞬间快速拼贴。正面驶来时挡风玻璃上反射的对称街景,后视镜里倒映出的飞驰棕榈树,都丝毫不差地遵循了设定的构图逻辑。
Kling 4.0 还支持 21:9 超宽画幅,这个比例接近 2.35:1 的好莱坞电影主流宽银幕。模型在训练和输出时考虑了电影级构图,完全省去了后期二次裁切丢信息的麻烦。
得益于它进阶的提示词理解能力,Kling 4.0 进一步拓宽了创作场景的边界,覆盖电影感、动画、奇幻、像素风、毛毡、 3D 赛博、 Vlog 、写实纪录片等多元视觉风格。
APPSO 也总结了一些写出好用提示词的技巧:
我们可以考虑使用专业的摄影机运动指令,例如「一镜到底跟拍」「跳切」等。同时,通过直接引用特定导演的美学风格和特定的画面质感,锁定视频的视觉基调。

在混合使用多个参考图或参考视频时,需要制定严格的参考优先级与分工机制。例如,明确规定某段参考视频只负责提供物理运动、内部剪辑和运镜节奏。

而环境、人物五官、服装和载具外观则必须严格继承自特定的参考图片,最好在生成视频之前先生成一套详细的资产库。这能有效防止 AI 将原视频中不需要的元素带入新生成的画面中。

掌握这些技巧后,多尝试调整动词和镜头词汇,慢慢就能形成自己的提示词素材库。
在画面的文字渲染痛点上, Kling 4.0 支持多语种文字、 Emoji 与 Logo 清晰稳定生成。即使在画面运动与场景切换等动态变化中,文字也能保持清晰稳定,告别了店招乱码与字幕鬼画符。
针对高频创作场景,目前推出了 Kling 4.0 Flash 版本,它生成速度更快,极具性价比,大幅降低了视频创作门槛。配合视频精准编辑功能,创作者可以针对原视频中的角色表情、肢体动作、镜头机位、整体风格和视频背景进行精准修改增加或删除,保持画面其余部分稳定,减少反复生成。
创意复刻功能支持对参考视频的叙事节奏与镜头编排进行借鉴,替换其中的商品与角色,将成熟创意快速转化为自有内容。 Kling 4.0 正在将 AI 视频从猎奇向专业的电影级创作流程平稳过渡。
100% 忠于自我的电影时代
最近,有采访问戴锦华老师:您始终没有真正投身于电影工业里面,而是选择留在学校,研究、教学,这算是一种遗憾吗?
戴锦华老师回答说:不遗憾。首先是因为创作没诱惑过我。我很清楚地知道我不能成为优秀的创作者,而我不想做末流的事。其次,电影的创作是一个集体性的创作,说得直白一点,是需要统治术的。后者是我的身心所拒绝的。
电影也是一门「妥协的艺术」,因为每多一个人参与,创作者脑海中那个让人起鸡皮疙瘩的初始创意就会在传递中损耗一分。
以往我们惯常谈制作成本的下降以及模型能力的提升如何让更多人成为了「草根导演」(这里的制作成本指时间与金钱),但这句话背后有着更复杂的面向。
一方面,AI 也消解了创作中的沟通成本。对于那些性格内向、不懂得或不愿与人周旋合作的创作者来说,AI 赋予了他们默默创作的可能。他们不再需要去修炼令人生厌的「管理学」,可以更少地妥协,百分之百地听从自己内心的声音。
通过 Kling 4.0 全面进阶的模型能力,创作者只需凭借自身,就能与 AI 共同组建起一支「全能的创作班底」。从多关键帧的精准调度,到最多 15 项素材的全能参考,再到针对各种细节的精准编辑,它在创作的每一个环节都给到了全方位的支持。
另一方面,制作成本的下降以及模型能力的提升不会使得更多人平白无故产生了创作热情,而是让那些本身就很有表达欲和好奇心的人的热情更大地迸发出来。
那些曾会轻易摧毁创作热情的因素变得越来越弱了。
当创作不再需要妥协,当脑海中那个让你兴奋的 idea 终于能被完整看见,一个属于个体的、100% 忠于自我的电影时代,才刚刚开始。
