
透明立方体舞台表演视频预览,展示灯光节奏、表演者连续性、镜头方向和最终主画面。
透明立方体舞台视频简报:开场 / 表演揭示 / 镜头路径 / 灯光连续性 / 主画面收尾 / 复核要点
Kling AI Avatar Pro 是 Rivya 里的高保真 AI 数字人口播模型,适合把 1 张人物图和 1 段音频生成更精致的主持人视频。
任务最终消耗向上取整到整数积分。

示例输出
示例,生成模型尚未核实 · 透明立方体舞台表演预览,重点检查场景设置、镜头路径、灯光连续性、可编辑细节和最终主画面。
数字人口播 · 图片+音频驱动

示例输出
示例,生成模型尚未核实 · 透明立方体舞台表演预览,重点检查场景设置、镜头路径、灯光连续性、可编辑细节和最终主画面。
适合任务
支持能力
在线试用
暂时还没有可显示的结果。
提示词起步
模型示例
浏览模板预览,寻找创作方向。每条说明会标明是否已核实由该模型生成。
示例,生成模型尚未核实 · 透明立方体舞台表演预览,重点检查场景设置、镜头路径、灯光连续性、可编辑细节和最终主画面。
示例,生成模型尚未核实 · 雨夜街头 Vlog 数字人开场,重点控制手持 POV、延迟对焦、近镜头细节和自然表情。
示例,生成模型尚未核实 · 夕阳河畔数字人 Vlog 预览,重点呈现手持自拍、夕阳风景分享和温暖近景连续性。
示例,生成模型尚未核实 · 黑白聚光数字人舞蹈简报预览,聚焦受控动作、肢体可读性、聚光稳定性和干净剪影画面。
决策确认
决策确认
Kling AI Avatar Pro 常见问题
Kling AI Avatar Pro 更适合希望用 1 张人物图加 1 段音频,直接产出更高规格主持人口播或品牌解说视频的任务。它特别适合质量优先的出镜人物短片、品牌讲解和完成度更高的数字人短视频,而不是只追求最低成本的初步试用。
在 Rivya 里,这个选项使用 1 张人物图、最长 300 秒的 1 段音频,再加一条可选提示词。系统按经验证的音频时长以 16 积分 / 秒计费,总积分向上取整。
这里最该确认的,通常不是参数,而是人物图和音频本身够不够支撑 Pro 这档。因为公开控制面很轻,所以结果很大程度上取决于人物图是不是正脸、够不够干净,音频是不是清楚,以及更高完成度是否值得 16 积分 / 秒的 Pro 费率。
Rivya 按经验证的音频时长以 16 积分 / 秒计费,音频最长 300 秒,总积分向上取整。它更适合你需要更高规格的主持人口播或品牌讲解结果,而不是只想压低成本的场景。
如果较低的 8 积分 / 秒档位就够用,可以选择 Kling AI Avatar Standard。若仍想保留简单的图片 + 音频项目,但希望结果比 Standard 更精致,则可以选择 16 积分 / 秒的 Kling AI Avatar Pro。两个档位都按经验证的音频时长计费,最长 300 秒。
如果你这一轮最想确认的是:1 张人物图和 1 段音频能不能先直接跑出高完成度的主持人口播结果,这页就是很合适的起点。它特别适合品牌讲解、角色解说和更高规格的 avatar 短片。
这页使用 1 张人物图、最长 300 秒的 1 段音频,再加一条可选提示词。它按经验证的音频时长以 16 积分 / 秒计费,是一个设置简洁但规格更高的数字人口型同步入口。
开始前确认人物图是否为正脸并足够清楚,音频是否为最终要保留的版本,再判断可选提示词是否只需补充少量语气要求。对这个模型来说,源素材质量往往比调整更多参数更重要。
这页可以公开查看并准备人物图与音频,但提交视频生成前仍需要先登录。Rivya 按经验证的音频时长以 16 积分 / 秒计费,最长 300 秒且总积分向上取整;你可以先把人物图、音频和语气方向理顺,再登录执行。
如果你现在只是要验证 1 组人物图 + 音频的 Pro 初步效果,继续留在这页就够了。等任务开始需要保存多个版本、管理多组 avatar 资产,或者围绕同一主持人或角色做更长的视频流程时,再切到完整创作工作台会更顺。
比较替代模型
Seedance 2.5 是 Rivya 上规模更大的 Seedance 工作流,支持纯提示词视频、首尾帧引导、多模态参考和视频引导转换。相较 Mini,它增加了 1080p 档、最长 30 秒输出、自动时长、MP4 或 MOV 输出,并显著扩大了图片、视频与音频参考容量。
为什么考虑它
当下一个任务需要最多 50 个参考素材时,可以考虑它。
字节跳动完整版 Seedance 2.0 视频模型,当前在 Rivya 里完整接入了文生视频、首帧/首尾帧驱动,以及多模态参考生视频三类场景。产品层保留了与文档一致的角色拆分,避免把首尾帧和参考图/参考视频/参考音频混成一个模糊上传桶。
为什么考虑它
当下一个任务需要提示词、首尾帧,或图片/视频/音频参考时,可以考虑它。
字节跳动更快的 Seedance 2.0 视频模型,当前在 Rivya 里完整接入了文生视频、首帧/首尾帧驱动,以及多模态参考生视频三类场景。为了避免首尾帧和参考图/参考视频/参考音频的角色混淆,产品层保持了与文档一致的显式场景拆分。
为什么考虑它
当下一个任务需要提示词、首尾帧,或图片/视频/音频参考时,可以考虑它。
适合任务
任务接近这些情况时使用
模型参数
提供商
Kuaishou
类别
视频
能力标签
数字人口播 · 图片+音频驱动
积分模式
积分费率: 16 / 秒输入
输入方式
1 张图片 + 1 段音频
提示设置
可选