Seedance 2.0
字节跳动完整版 Seedance 2.0 视频模型,当前在 Rivya 里完整接入了文生视频、首帧/首尾帧驱动,以及多模态参考生视频三类场景。产品层保留了与文档一致的角色拆分,避免把首尾帧和参考图/参考视频/参考音频混成一个模糊上传桶。
为什么考虑它
当下一个任务需要提示词、首尾帧,或图片/视频/音频参考时,可以考虑它。
当人物、宠物或插画角色需要跟随已经完成的语音轨道表演,并以源肖像作为视觉基准时,可使用 OmniHuman 1.5。本页面目前不提供人物识别、主体检测或基于蒙版的主体选择。
示例输出
OmniHuman 1.5
图像与音频生视频
示例输出
OmniHuman 1.5
适合任务
支持能力
在线试用
生成结果
当人物、宠物或插画角色需要跟随已经完成的语音轨道表演,并以源肖像作为视觉基准时,可使用 OmniHuman 1.5。本页面目前不提供人物识别、主体检测或基于蒙版的主体选择。
暂时还没有结果,提交提示词后即可开始一次生成。
决策确认
决策确认
适合任务
任务接近这些情况时使用
安静事实
提供商
ByteDance
类别
视频
能力标签
图像与音频生视频
积分模式
per_input_second · default=27 · ⌈total⌉
输入方式
1 张图片 + 1 段音频
提示设置
最多 300 字
OmniHuman 1.5 常见问题
OmniHuman 1.5 专为聚焦的图片加音频工作流设计:一张肖像提供主体,一条语音轨道驱动最终表演。相比通用的提示词生成视频任务,它更适合出镜讲解、角色旁白和简短的说话主体视频。
请上传恰好一张 JPEG、PNG 或 WebP 图片,大小不超过 10 MB,以及一个 MP3、M4A、WAV、AAC 或 OGG 音频文件,大小不超过 10 MB。验签后的音频时长必须大于零秒且严格小于 60 秒。
Rivya 按验签音频每秒 27 积分计费。音频的小数时长会保留并参与完整计算,仅在任务预留总额处向上取整为整数积分。若收到的实际用量有效且不高于预留值,Rivya 会按实际用量结算;如果实际用量缺失、无效或高于预留值,任务会进入对账,而不会触发未说明的额外扣费。
快速模式优先缩短处理时间,但可能需要在质量上作出取舍。质量优先时请保持关闭;早期测试更看重出结果速度时,可以开启该模式。
可以,但提示词是可选项,在 Rivya 上最多为 300 个字符。当前提示词支持中文、英语、日语、韩语、西班牙语或印度尼西亚语文本;肖像和音频仍是必需输入。
使用恰好一张肖像图片和一段音频,创作音频驱动的角色视频。主体可以是人物、宠物或插画角色,输出可选择 720p 或 1080p。
选择一张能清晰呈现目标主体的肖像,再准备最终版语音。音频必须小于 60 秒,并且两个文件都必须先通过上传检查才能生成。
选择 720p 或 1080p,确定是否使用快速处理选项;除非需要更易复现的比较,否则 seed 保持为 -1 以获得随机结果。
模型详情可公开查看,但上传素材和生成视频需要登录。OmniHuman 1.5 按验签音频每秒 27 积分计费,仅最终计算总额向上取整。
测试一张肖像和一条语音轨道可以留在此页面。当你需要保存多个版本、使用多个角色、反复尝试不同语音版本,或开展更长的制作流程时,请打开 Studio。
比较替代模型
字节跳动完整版 Seedance 2.0 视频模型,当前在 Rivya 里完整接入了文生视频、首帧/首尾帧驱动,以及多模态参考生视频三类场景。产品层保留了与文档一致的角色拆分,避免把首尾帧和参考图/参考视频/参考音频混成一个模糊上传桶。
为什么考虑它
当下一个任务需要提示词、首尾帧,或图片/视频/音频参考时,可以考虑它。
字节跳动更快的 Seedance 2.0 视频模型,当前在 Rivya 里完整接入了文生视频、首帧/首尾帧驱动,以及多模态参考生视频三类场景。为了避免首尾帧和参考图/参考视频/参考音频的角色混淆,产品层保持了与文档一致的显式场景拆分。
为什么考虑它
当下一个任务需要提示词、首尾帧,或图片/视频/音频参考时,可以考虑它。
支持文生视频、图生视频和原生音视频同步的 Seedance 视频模型,提供 480p–1080p、4–12 秒片段、6 种宽高比、动态或固定镜头控制,以及唇形同步。
为什么考虑它
当下一个任务需要提示词 + 可选图片时,可以考虑它。