Dùng OmniHuman 1.5 khi một người, thú cưng hoặc nhân vật minh họa cần biểu diễn theo bản thu giọng đã hoàn thiện, trong khi chân dung nguồn vẫn là điểm neo hình ảnh. Tính năng nhận dạng người, phát hiện chủ thể và chọn theo mặt nạ không khả dụng trên trang này.
Đúng một ảnh chân dung và một bản âm thanh giúp quy trình tập trungHoạt động với người, thú cưng và chủ thể minh họa hoặc phong cách anime
Đầu ra 720p và 1080p có thể chọn
Đầu vào
1 ảnh + 1 âm thanh
Đầu ra
Trình tạo video AI
Tín dụng
per_input_second · default=27 · ⌈total⌉
Phù hợp nhất cho
Video người thuyết trình dẫn bằng bản thu giọng đã hoàn thiện
Kiểm tra đầu vào, đầu ra, tín dụng và kết quả ví dụ, rồi thử mô hình này trực tiếp trên trang. Chuyển vào Studio khi bạn cần lịch sử đã lưu, tài sản hoặc vòng lặp dài hơn.
Đầu ra ví dụ
OmniHuman 1.5
Phù hợp nhất cho
Video người thuyết trình dẫn bằng bản thu giọng đã hoàn thiệnMàn trình diễn nhân vật ngắn từ một chân dung đã duyệtClip thú cưng hoặc nhân vật minh họa nói chuyệnVideo mạng xã hội và video giải thích dẫn bằng lời kể
Hỗ trợ
Hình ảnh + âm thanh thành video
Thử trực tuyến
Thử OmniHuman 1.5
Tải lên một chân dung và một đoạn âm thanh dưới 60 giây, sau đó chọn độ phân giải đầu ra, chế độ xử lý và seed tùy chọn.
Kết quả
OmniHuman 1.5
ByteDanceAI.generator.modes.image-audio-to-video
Dùng OmniHuman 1.5 khi một người, thú cưng hoặc nhân vật minh họa cần biểu diễn theo bản thu giọng đã hoàn thiện, trong khi chân dung nguồn vẫn là điểm neo hình ảnh. Tính năng nhận dạng người, phát hiện chủ thể và chọn theo mặt nạ không khả dụng trên trang này.
OmniHuman 1.5
Chưa có kết quả. Hãy gửi một prompt để bắt đầu lượt chạy.
Hình ảnh + âm thanh thành video
Độ phù hợp quyết định
Khi nào mô hình này là lựa chọn đúng
Độ phù hợp quyết định
Tín hiệu phù hợp
Đúng một ảnh chân dung và một bản âm thanh giúp quy trình tập trung
Hoạt động với người, thú cưng và chủ thể minh họa hoặc phong cách anime
Đầu ra 720p và 1080p có thể chọn
Chế độ xử lý nhanh hơn tùy chọn
Credit theo thời lượng âm thanh đã xác minh
Tác vụ phù hợp nhất
Dùng khi tác vụ trông như thế này
Video người thuyết trình dẫn bằng bản thu giọng đã hoàn thiệnMàn trình diễn nhân vật ngắn từ một chân dung đã duyệtClip thú cưng hoặc nhân vật minh họa nói chuyệnVideo mạng xã hội và video giải thích dẫn bằng lời kể
Thông tin ngắn gọn
Đầu vào, đầu ra và tín dụng cần xác nhận
Nhà cung cấp
ByteDance
Danh mục
Video
Năng lực
Hình ảnh + âm thanh thành video
Cách tính tín dụng
per_input_second · default=27 · ⌈total⌉
Đường dẫn đầu vào
1 ảnh + 1 âm thanh
Thiết lập prompt
Tối đa 300 ký tự
Câu hỏi thường gặp
Câu hỏi thường gặp về OmniHuman 1.5
OmniHuman 1.5 phù hợp nhất với mục đích nào?
OmniHuman 1.5 được thiết kế cho quy trình ảnh-và-âm-thanh tập trung: một chân dung cung cấp chủ thể và một bản thu giọng dẫn dắt phần trình diễn. Mô hình phù hợp với clip người thuyết trình, lời kể nhân vật và video chủ thể nói chuyện ngắn hơn là một tác vụ chuyển prompt thành video tổng quát.
Tôi có thể tải lên những tệp chân dung và âm thanh nào?
Tải lên đúng một ảnh JPEG, PNG hoặc WebP tối đa 10 MB và một tệp âm thanh MP3, M4A, WAV, AAC hoặc OGG tối đa 10 MB. Thời lượng âm thanh đã xác minh phải lớn hơn không và nghiêm ngặt nhỏ hơn 60 giây.
Credit của OmniHuman 1.5 được tính thế nào?
Rivya dùng mức 27 credit cho mỗi giây âm thanh đã xác minh. Thời lượng thập phân được giữ trong toàn bộ phép tính và chỉ tổng tạm giữ được làm tròn lên một credit nguyên. Khi mức sử dụng thực tế hợp lệ và không cao hơn khoản tạm giữ được báo cáo, Rivya quyết toán theo mức đó; mức sử dụng bị thiếu, không hợp lệ hoặc cao hơn khoản tạm giữ sẽ được đưa vào đối soát thay vì phát sinh một khoản trừ bổ sung ngầm.
Chế độ nhanh thay đổi điều gì?
Chế độ nhanh ưu tiên thời gian xử lý ngắn hơn và có thể đánh đổi chất lượng. Để tắt cho lượt chạy ưu tiên chất lượng, và bật khi tốc độ hoàn thành quan trọng hơn cho một lần thử sớm.
Tôi có thể thêm prompt cho chân dung và âm thanh không?
Có, nhưng prompt là tùy chọn và được giới hạn ở 300 ký tự trên Rivya. Luồng prompt hiện chấp nhận văn bản tiếng Trung, Anh, Nhật, Hàn, Tây Ban Nha hoặc Indonesia; chân dung và âm thanh vẫn là hai đầu vào bắt buộc.
Tôi có thể tạo gì trên trang OmniHuman 1.5 này?
Tạo video nhân vật dẫn bằng âm thanh từ đúng một ảnh chân dung và một đoạn âm thanh. Chủ thể có thể là người, thú cưng hoặc nhân vật minh họa, và đầu ra có thể là 720p hoặc 1080p.
Tôi nên chuẩn bị gì trước khi tạo?
Chọn một chân dung rõ đã thể hiện đúng chủ thể cần giữ, sau đó chuẩn bị bản thu giọng cuối. Âm thanh phải ngắn hơn 60 giây và cả hai tệp phải vượt qua kiểm tra tải lên trước khi tạo.
Những cài đặt nào quan trọng nhất?
Chọn 720p hoặc 1080p, quyết định có dùng tùy chọn xử lý nhanh hơn hay không, và để seed ở -1 cho kết quả ngẫu nhiên trừ khi bạn cần một phép so sánh dễ lặp lại hơn.
Tôi có cần đăng nhập không và credit hoạt động thế nào?
Thông tin chi tiết được công khai, nhưng tải tệp lên và tạo yêu cầu đăng nhập. OmniHuman 1.5 có giá 27 credit cho mỗi giây âm thanh đã xác minh, và chỉ tổng tính cuối được làm tròn lên.
Khi nào tôi nên mở Studio đầy đủ?
Ở lại đây để thử một chân dung và một bản thu giọng. Mở Studio khi bạn cần lưu take, dùng nhiều nhân vật, lặp lại nhiều phiên bản giọng hoặc xây một quy trình sản xuất dài hơn.
So sánh lựa chọn thay thế
Mô hình khác nên cân nhắc tiếp
Video
Seedance 2.0
Mô hình video Seedance 2.0 đầy đủ của ByteDance với hỗ trợ rõ ràng cho tạo prompt-only, animation dẫn dắt bằng khung hình và tạo video tham chiếu đa phương thức. Rivya giữ rõ phần tách vai trò theo tài liệu để đầu vào khung hình và tham chiếu đa phương thức tách biệt nhau, thay vì gom vào một nhóm upload mơ hồ.
Vì sao cân nhắc
Cân nhắc khi tác vụ tiếp theo của bạn cần Prompt, khung hình hoặc tham chiếu ảnh/video/âm thanh.
Đầu vàoPrompt, khung hình hoặc tham chiếu ảnh/video/âm thanh
Mô hình video Seedance 2.0 nhanh hơn của ByteDance với định tuyến cảnh đầy đủ cho tạo prompt-only, animation dẫn dắt bằng khung hình và tạo video tham chiếu đa phương thức. Rivya giữ rõ phần tách cảnh theo tài liệu để đầu vào khung đầu/cuối không lẫn với vai trò ảnh, video và âm thanh tham chiếu.
Vì sao cân nhắc
Cân nhắc khi tác vụ tiếp theo của bạn cần Prompt, khung hình hoặc tham chiếu ảnh/video/âm thanh.
Đầu vàoPrompt, khung hình hoặc tham chiếu ảnh/video/âm thanh
Phù hợp nhất choPrevis quảng cáo nhanh từ prompt hoặc khung storyboard
Video
Seedance 1.5 Pro
Mô hình video Seedance cho text-to-video và image-to-video với đồng bộ âm thanh-hình ảnh native. Mô hình hỗ trợ 480p-1080p, clip 4-12s, 6 tỷ lệ khung hình, điều khiển ống kính động hoặc cố định, tạo âm thanh tùy chọn và lip-sync.
Vì sao cân nhắc
Cân nhắc khi tác vụ tiếp theo của bạn cần Prompt + ảnh tùy chọn.