快手可灵AI 2.6版推音画同出模型,大幅提升视频创作效率

admin 百科 13

近日,快手旗下可灵ai正式发布2.6版本,推出业内首个音画同出模型,支持“文生音画”与“图生音画”双模态创作方式,可一次性生成高清画面、自然流畅的语音、精准匹配的动作音效及沉浸式环境氛围音。该模型以“听见画面,看见声音”为产品内核,依托全球首创的音画同步生成技术,突破ai视频长期存在的视听割裂瓶颈,在算法能力与商业应用两个维度实现跨越式升级。

在底层架构上,可灵2.6深度融合扩散变换器(Diffusion Transformer)与3D时空联合注意力机制,在维持10秒1080P高清视频稳定输出的前提下,显著优化算力消耗——生成5秒视频仅需25积分,相较前代降低30%。模型核心能力完成三项关键跃迁:复杂语义指令的理解与响应效率提升15%;跨镜头角色一致性达行业领先水平;在与Seedance 1.0的匿名盲测中,胜率达285%,确立明显技术代差优势。

快手可灵AI 2.6版推音画同出模型,大幅提升视频创作效率-第1张图片-佛山资讯网

本次更新最具颠覆性的“音画同出”功能,彻底重构传统AI视频生产流程——告别“先画面后配音”的分步模式,单次推理即可输出含中英双语对白、动作音效、环境氛围音的完整音视频成品。同步升级文生音画与图生音画两大主干能力,创作者无需额外搜寻、剪辑或合成音频素材,真正实现从创意到成片的一键闭环。

该能力已覆盖多类高频创作场景,包括:

  • 单人独白类(商品种草、生活Vlog、新闻播报、公开演讲)
  • 旁白解说类(产品讲解、体育赛事解说、人文纪录片、有声故事)
  • 多人对白类(访谈对话、竖屏短剧、情景演绎)
  • 音乐表演类(清唱/说唱、多人合唱、乐器独奏与合奏)

显著压缩内容制作周期,为全量创作者提供开箱即用的专业级视听生产力工具。

可灵2.6提供两条低门槛创作路径:
? 文生音画——输入一句话描述,自动生成带语音、音效与画面的完整视频;
? 图生音画——让静态图片“开口说话、自主运动”,赋予图像动态表达力。
官方特别强调,用户可在生成过程中对语音语调、语速节奏、音效类型、环境声场等要素进行精细化调节,实现真正的可控创作。

在商业化落地上,可灵2.6将首批接入Artlist等国际主流专业创作平台,并开放场景延展接口与多元素协同编辑API,深度适配影视工业化流程、短剧工业化开发、品牌广告创意、MV全流程制作等高要求场景。技术演进路线图同步公布:2026年Q1将上线4K分辨率+60帧超高清版本,并开放自定义声线库,进一步拉低专业级AI视频创作门槛。

据第三方行业研报显示,该模型成功补全AI视频技术栈最后一环,可将传统后期配音与音效剪辑环节压缩50%以上,释放高达3倍的内容产能,加速AI创作工具由轻量娱乐“玩具”向硬核生产力“装备”跃迁。

标签: 可灵ai 工具 快手 ai 音乐 ai工具 智能手机 ai视频 短剧

发布评论 0条评论)

还木有评论哦,快来抢沙发吧~