Seedance 2.0
字节跳动完整版 Seedance 2.0 视频模型,当前在 Rivya 里完整接入了文生视频、首帧/首尾帧驱动,以及多模态参考生视频三类场景。产品层保留了与文档一致的角色拆分,避免把首尾帧和参考图/参考视频/参考音频混成一个模糊上传桶。
为什么考虑它
当下一个任务需要提示词、首尾帧,或图片/视频/音频参考时,可以考虑它。
当源视频中的人物、构图和动作都已符合要求,但口部动作需要跟随另一段语音录音时,可使用 Volcengine Video Lip Sync。
示例输出
Volcengine Video Lip Sync
视频与音频生视频
示例输出
Volcengine Video Lip Sync
适合任务
支持能力
在线试用
生成结果
当源视频中的人物、构图和动作都已符合要求,但口部动作需要跟随另一段语音录音时,可使用 Volcengine Video Lip Sync。
暂时还没有结果,提交提示词后即可开始一次生成。
决策确认
决策确认
适合任务
任务接近这些情况时使用
安静事实
提供商
Volcengine
类别
视频
能力标签
视频与音频生视频
积分模式
per_input_second · default=8 · ⌈total⌉
输入方式
最多 2 个参考素材
提示设置
提示词驱动
Volcengine Video Lip Sync 常见问题
当源视频的视觉效果已经符合要求,只有说话表演需要跟随另一条人声轨道时,可以使用它。这是视频加音频的口型同步工作流,并不是提示词驱动的视频生成器或肖像动画模型。
请上传恰好一个 MP4 或 MOV 视频,大小不超过 95 MB,以及一个 MP3、M4A、WAV、AAC 或 OGG 音频文件,大小不超过 10 MB。视频必须符合受支持的 360p 至 1080p 画面尺寸范围、24 至 60 fps 帧率和 1 至 30 Mbps 码率,并且两个文件的验签时长都必须为正数。
对于正对镜头的单人画面,如果需要更快处理和音频到视频的对齐设置,请选择 Lite。对于更复杂的单人场景,尤其是需要场景分段和说话人识别时,请选择 Basic。
在 Lite 模式中,当目标音频长于源画面时,音频对齐可以循环播放视频。只有开启对齐后才能使用反向循环;模板开始时间用于选择源序列的起点。Basic 模式不使用这些设置。
Rivya 按验签音频每秒 8 积分计费,输出时长跟随该音频。音频的小数时长会保留并参与完整计算,仅在任务预留总额处向上取整为整数积分。若收到的实际用量有效且不高于预留值,Rivya 会按实际用量结算;如果实际用量缺失、无效或高于预留值,任务会进入对账,而不会触发未说明的额外扣费。
将一个现有的单人视频与一条目标人声轨道配对,使画面中的说话动作跟随新音频,同时保留源视频作为视觉基础。
请使用说话人清晰可见且格式受支持的 MP4 或 MOV 文件,并准备一条清晰的人声轨道。检查视频大小不超过 95 MB,且分辨率、帧率和码率均在列出的限制内。
简单的正对镜头画面可先使用 Lite。场景较复杂,或需要场景分段和说话人识别时,请使用 Basic。
模型详情可公开查看,但上传素材和生成视频需要登录。验签音频每秒需要 8 积分,结果跟随音频时长,仅最终计算总额向上取整。
测试一个源视频与一条语音轨道可以留在此页面。当你需要保存多版配音、反复处理不同语言或录音版本、开展对比工作,或进行更长的本地化流程时,请打开 Studio。
比较替代模型
字节跳动完整版 Seedance 2.0 视频模型,当前在 Rivya 里完整接入了文生视频、首帧/首尾帧驱动,以及多模态参考生视频三类场景。产品层保留了与文档一致的角色拆分,避免把首尾帧和参考图/参考视频/参考音频混成一个模糊上传桶。
为什么考虑它
当下一个任务需要提示词、首尾帧,或图片/视频/音频参考时,可以考虑它。
字节跳动更快的 Seedance 2.0 视频模型,当前在 Rivya 里完整接入了文生视频、首帧/首尾帧驱动,以及多模态参考生视频三类场景。为了避免首尾帧和参考图/参考视频/参考音频的角色混淆,产品层保持了与文档一致的显式场景拆分。
为什么考虑它
当下一个任务需要提示词、首尾帧,或图片/视频/音频参考时,可以考虑它。
支持文生视频、图生视频和原生音视频同步的 Seedance 视频模型,提供 480p–1080p、4–12 秒片段、6 种宽高比、动态或固定镜头控制,以及唇形同步。
为什么考虑它
当下一个任务需要提示词 + 可选图片时,可以考虑它。