
透明立方体舞台表演视频预览,展示灯光节奏、表演者连续性、镜头方向和最终主画面。
透明立方体舞台视频简报:开场 / 表演揭示 / 镜头路径 / 灯光连续性 / 主画面收尾 / 复核要点
Kling AI Avatar Pro 是 Rivya 里的高保真 AI 数字人口播模型,适合把 1 张人物图和 1 段音频生成更精致的主持人视频。

示例输出
透明立方体舞台表演预览,重点检查场景设置、镜头路径、灯光连续性、可编辑细节和最终主画面。
数字人口播 · 图片+音频驱动

示例输出
透明立方体舞台表演预览,重点检查场景设置、镜头路径、灯光连续性、可编辑细节和最终主画面。
适合任务
支持能力
在线试用
生成结果
Kling AI Avatar Pro 是 Rivya 里的高保真 AI 数字人口播模型,适合把 1 张人物图和 1 段音频生成更精致的主持人视频。
暂时还没有结果,提交提示词后即可开始一次生成。
提示词起步
当你不想从空白输入开始时,可以先用已经映射到 Kling AI Avatar Pro 的模板,再按自己的任务改写。
模型示例
先用上方在线试用区开始生成,再结合这些示例结果判断成品质感、输出节奏和任务适配度,然后决定是否继续在完整工作台里投入更多积分。
主示例
透明立方体舞台表演视频预览,展示灯光节奏、表演者连续性、镜头方向和最终主画面。
输入
1 张图片 + 1 段音频
看点提示
透明立方体舞台表演视频预览,展示灯光节奏、表演者连续性、镜头方向和最终主画面。
每次消耗积分
16 积分 / 次
为什么它适合
固定图片 + 音频驱动的高质量数字人口播流程
当前固定 16 积分
更适合质量优先的口型同步视频
最适合的任务
模型示例
决策确认
决策确认
适合任务
任务接近这些情况时使用
安静事实
提供商
Kuaishou
类别
视频
能力标签
数字人口播 · 图片+音频驱动
积分模式
16 积分 / 次
输入方式
1 张图片 + 1 段音频
提示设置
可选
Kling AI Avatar Pro 常见问题
Kling AI Avatar Pro 更适合希望用 1 张人物图加 1 段音频,直接产出更高规格主持人口播或品牌解说视频的任务。它特别适合质量优先的出镜人物短片、品牌讲解和完成度更高的数字人短视频,而不是只追求最低成本的初步试用。
在 Rivya 里,这个选项使用固定的 1 张人物图、1 段音频,再加一条可选提示词。当前固定为 16 积分 / 次,因此它是简单但规格更高的数字人口型同步选项,而不是按时长计费的说话视频项目。
这里最该确认的,通常不是参数,而是人物图和音频本身够不够支撑 Pro 这档。因为公开控制面很轻,所以结果很大程度上取决于人物图是不是正脸、够不够干净,音频是不是清楚,以及你到底值不值得为更高完成度付这档固定成本。
当前为固定 16 积分 / 次。更适合你需要更高规格的主持人口播或品牌讲解结果,而不是只想压低每一轮成本的场景。
如果更低成本的固定价 avatar 试用就够用,那更适合用 Kling AI Avatar Standard;如果你更希望费用跟音频时长直接挂钩,那更适合看 Infinitalk。只有当你仍然想保留简单的图片 + 音频项目,但又希望结果比 Standard 更精致时,Kling AI Avatar Pro 才是更对的选择。
如果你这一轮最想确认的是:1 张人物图和 1 段音频能不能先直接跑出高完成度的主持人口播结果,这页就是很合适的起点。它特别适合品牌讲解、角色解说和更高规格的 avatar 短片。
这页当前使用固定的 1 张人物图、1 段音频,再加一条可选提示词,价格为 16 积分 / 次。它不是参数繁多的说话视频选项,而是规格更高的数字人口型同步入口。
开始前确认人物图是否为正脸并足够清楚,音频是否为最终要保留的版本,再判断可选提示词是否只需补充少量语气要求。对这个模型来说,源素材质量往往比调整更多参数更重要。
这页可以公开查看并准备人物图与音频,但提交视频生成前仍需要先登录。当前为固定 16 积分 / 次,你可以先把人物图、音频和语气方向理顺,再登录执行。
如果你现在只是要验证 1 组人物图 + 音频的 Pro 初步效果,继续留在这页就够了。等任务开始需要保存多个版本、管理多组 avatar 资产,或者围绕同一主持人或角色做更长的视频流程时,再切到完整创作工作台会更顺。
比较替代模型
字节跳动完整版 Seedance 2.0 视频模型,当前在 Rivya 里完整接入了文生视频、首帧/首尾帧驱动,以及多模态参考生视频三类场景。产品层保留了与文档一致的角色拆分,避免把首尾帧和参考图/参考视频/参考音频混成一个模糊上传桶。
为什么考虑它
当下一个任务需要提示词、首尾帧,或图片/视频/音频参考时,可以考虑它。
字节跳动更快的 Seedance 2.0 视频模型,当前在 Rivya 里完整接入了文生视频、首帧/首尾帧驱动,以及多模态参考生视频三类场景。为了避免首尾帧和参考图/参考视频/参考音频的角色混淆,产品层保持了与文档一致的显式场景拆分。
为什么考虑它
当下一个任务需要提示词、首尾帧,或图片/视频/音频参考时,可以考虑它。
支持文生视频、图生视频和原生音视频同步的 Seedance 视频模型,提供 480p–1080p、4–12 秒片段、6 种宽高比、动态或固定镜头控制,以及唇形同步。
为什么考虑它
当下一个任务需要提示词 + 可选图片时,可以考虑它。