Dokumentacja Rivya AI

Przewodnik po procesach audio AI w Rivya

Wybieraj dostępne procesy audio Rivya do głosu, dialogu, muzyki i szkiców, sprawdzając wstrzymane modele efektów i czyszczenia.

Ostatni przegląd: 2026/08/29

Użyj przewodnika przed wyborem głosu, TTS, dialogu, szkicu, wersji muzycznej lub pracy nad tekstem piosenki — i zanim uznasz, że udokumentowany model efektów lub czyszczenia jest dostępny.

Najłatwiej pomylić się z audio w Rivya, gdy uznasz, że wszystkie zadania dźwiękowe tworzą jeden proces.

Nie jest.

Bieżąca kategoria audio naprawdę obejmuje kilka różnych rodzajów pracy obok siebie.

Ta strona opisuje procesy dostępne w obszarze audio. Jeśli potrzebujesz bardziej praktycznego poradnika o pierwszym zadaniu głosowym lub dźwiękowym, przeczytaj także Jak tworzyć głos, dźwięk i muzykę AI w Rivya.

Dostępne centrum audio obejmuje dziś mowę i aktywną gałąź Suno: głos, wersje wielojęzyczne, dialog, szkice utworów, szkice dźwiękowe i teksty piosenek. Katalog opisuje też efekty i czyszczenie, ale ElevenLabs Sound Effect V2 oraz ElevenLabs Audio Isolation są wstrzymane i nie uruchamiają zadań ani nie pobierają kredytów.

Zacznij od Kształtu Zadania

Zanim wybierzesz model audio, zdecyduj, który z tych problemów naprawdę rozwiązujesz:

  • głos albo narracja jednego mówcy

  • wielojęzyczny wynik mówiony

  • dialog wielu mówców

  • nowy sygnał dźwiękowy lub krótki szkic dźwiękowy

  • czyszczenie przesłanego nagrania, jeśli model do czyszczenia ponownie stanie się dostępny

  • pełny szkic piosenki albo ścieżka najpierw instrumentalna

  • ideacja tekstu piosenki przed generowaniem audio

To odrębne procesy, a nie jeden formularz z nieco innymi ustawieniami.

Co Naprawdę Obejmuje Bieżący Katalog Audio

Bieżący katalog audio opisuje dwa klastry, ale nie każdy wymieniony model jest dostępny do uruchomienia.

Głos, dialog, efekty dźwiękowe i czyszczenie

Muzyka i praca sąsiadująca z muzyką

Najważniejsze nie jest to, że kilka z nich znajduje się w tej samej kategorii. Ważne jest to, że należą do różnych kształtów formularzy i różnych wzorców kosztu.

Głos Mówiony i Narracja

Jeśli zadanie polega na tym, że jeden głos czyta jeden skrypt, ElevenLabs Turbo 2.5 nadal jest czystym wyborem domyślnym.

To najlepsze miejsce startu dla:

  • narracji

  • głosu lektorskiego

  • szybkich szkiców TTS

  • prostych ścieżek mówionych

Jeśli wykonanie mówione musi działać w wielu językach, lepiej pasuje ElevenLabs Multilingual V2.

Jeśli skrypt ma już dwóch albo więcej mówców, lepszą ścieżką jest ElevenLabs Dialogue V3, bo dialog strukturalnie różni się od odczytu jednej osoby.

Jeśli zadanie jest już dobrze określone, przeczytaj Najlepszy generator zamiany tekstu na mowę w 2026 roku dla prostego odczytu, Generator narracji AI dla objaśnień jednym głosem lub Generator dubbingu AI dla lokalizowanych albo zastępowanych ścieżek mówionych.

Projektowanie dźwięku i czyszczenie

Jeśli zadanie brzmi „wygeneruj dźwięk”, nie planuj wykonania wokół niedostępnego ElevenLabs Sound Effect V2. Suno Sounds to dostępna alternatywa do krótkich szkiców, atmosfery, pętli i tekstur, ale nie dokładny zamiennik każdego efektu.

Jeśli zadanie brzmi „napraw moje nagranie”, Audio Isolation opisuje proces od przesłania pliku, ale obecnie nie działa. Bezpośredniego zamiennika czyszczenia nie ma. Dla nowej mowy zamiast naprawy użyj ElevenLabs Multilingual V2 lub ElevenLabs Dialogue V3; żaden z nich nie naprawia nagrania.

To ważne rozróżnienie: pierwsze zadanie zaczyna się od polecenia, a drugie od przesłania pliku do naprawy.

Aktywna Gałąź Muzyczna

Muzyczna część katalogu audio jest już aktywna, ale celowo węższa niż pełny pakiet produkcji muzycznej.

Jeśli celem jest struktura piosenki, ideacja prowadzona tekstem albo wynik w stylu muzycznym, warto zacząć od muzycznej części katalogu audio zamiast od przewodników głosowych.

Suno Music jest do pierwszych szkiców utworów

Suno Music jest lepszą ścieżką, gdy potrzebujesz odtwarzalnego szkicu utworu z wokalem albo bez niego.

To czyni go najczytelniejszym startem dla:

  • pierwszych szkiców piosenek

  • konceptów ścieżek najpierw instrumentalnych

  • roboczej muzyki do wideo, demo albo podcastów

Udane wyniki mogą być kontynuowane przez Extend Music, a bieżące akcje po wyniku obejmują też konwersję WAV i separację wokalu.

Suno Sounds jest do krótkich szkiców dźwiękowych

Suno Sounds lepiej pasuje do krótkiego szkicu brzmieniowego, warstwy atmosfery, pomysłu na pętlę lub tekstury tła niż do pełnej struktury piosenki.

To bardziej użyteczne miejsce startu, gdy BPM, tonacja albo zapętlanie mają większe znaczenie niż zwrotki i refreny.

Udane wyniki mogą przejść do akcji Vocal Separation.

Suno Lyrics jest do słów przed audio

Suno Lyrics to ścieżka zaczynająca od słów.

Jest przydatna, gdy przed wydaniem punktów na generowanie utworu chcesz dopracować chwytliwą frazę, tytuł, kierunek refrenu lub zwrotkę. Ważne: wynikiem jest tekst, a nie odtwarzalny plik audio.

Szczegóły znajdziesz w Przewodniku po procesach muzyki AI w Rivya.

Dlaczego Formularze Tak Bardzo Się Zmieniają

Powierzchnia audio jest celowo kształtowana przez modele.

Formularze różnią się, bo zadania się różnią:

  • modele głosu proszą o tekst

  • modele dialogu proszą o tury i przypisanie mówców

  • dostępne modele szkiców dźwiękowych wymagają danych wejściowych w formie krótkiego sygnału

  • udokumentowane modele czyszczenia oczekują przesłanego audio, ale przed planowaniem uruchomienia trzeba sprawdzić dostępność

  • modele muzyczne mają własne wzorce poleceń i działania następcze

  • narzędzia zaczynające od tekstu piosenki mogą zwracać ustrukturyzowany tekst zamiast plików medialnych

Nie jest to niespójność. Rivya pokazuje rzeczywisty kształt każdego procesu, zamiast udawać, że wszystkie zadania mieszczą się w jednym formularzu.

Czym Gałąź Muzyczna Nie Jest

Właściwy opis bieżącej gałęzi muzycznej brzmi: "aktywna i użyteczna, ale celowo wąska".

Nie jest:

  • pełną cyfrową stacją roboczą audio

  • rozbudowanym pakietem do masteringu lub edycji wielu ścieżek

  • całą rodziną Suno odsłoniętą naraz

  • powodem, aby traktować całą pracę audio jako pracę muzyczną

Ta granica ma znaczenie, ponieważ siłą Rivya jest szerszy proces multimodalny, a nie wyspecjalizowany zestaw wyłącznie do muzyki.

Dlaczego Koszty Audio Czuć Inaczej

Praca audio w Rivya nie zawsze zachowuje się jak generowanie obrazu o stałym koszcie.

Koszt może znacznie bardziej bezpośrednio zależeć od zmiennych takich jak:

  • długość skryptu

  • czas trwania wyniku

  • czas trwania przesłanego audio

  • akcje następcze po wyniku w zadaniach muzycznych

Niektóre pozycje audio, zwłaszcza w aktywnej gałęzi muzycznej, są dokumentowane ze stałą ceną za uruchomienie. Inne zachowują się bardziej jak wzorce kosztu zależne od czasu trwania albo tekstu.

Dlatego przy modelach audio warto uważnie czytać wskazówkę o punktach. Często opisuje sposób naliczania kosztu, a nie jedną stałą liczbę.

Najczęstsze Błędy Audio

Najczęstsze złe skręty to:

  • wybór głosu, gdy prawdziwym zadaniem jest czyszczenie

  • traktowanie dialogu jak narracji jednego mówcy

  • traktowanie strony wstrzymanego modelu efektów lub czyszczenia jak działającej rekomendacji Studio

  • wybór generowania dźwięku, gdy prawdziwym zadaniem jest naprawa istniejącego nagrania

  • zaczynanie od Suno Sounds, gdy prawdziwą potrzebą jest pełny szkic piosenki

  • zaczynanie od Suno Lyrics, gdy prawdziwą potrzebą jest odtwarzalny wynik

  • ignorowanie czasu trwania albo akcji następczych jako części obrazu kosztów

Większość tych błędów znika po prawidłowym rozpoznaniu rodzaju procesu.

Szybki Sposób Wyboru

Jeśli chcesz najkrótszą wiarygodną ścieżkę decyzyjną:

  1. zdecyduj, czy wejściem jest tekst, ustrukturyzowany dialog, przesłane audio, opis muzyczny czy szkic tekstu piosenki

  2. zdecyduj, czy wynikiem ma być głos, mowa wielojęzyczna, dialog, zaprojektowany dźwięk, wyczyszczone nagranie, pełny utwór, krótki szkic dźwiękowy czy tekst piosenki

  3. wybierz pasujący model oznaczony jako dostępny; jeśli czyszczenie jest konieczne, zatrzymaj się zamiast zastępować zadanie

  4. dopiero potem dostrajaj parametry albo akcje następcze po wyniku

Ta sekwencja zapobiega większości złych dopasowań, zanim wydasz czas albo kredyty.

Publiczne Strony Audio vs Studio

Używaj publicznych stron audio, gdy chcesz pierwszy przebieg, szybkie porównanie albo stronę wejściową z wyszukiwarki, która doprowadzi Cię do właściwej gałęzi.

Używaj Studio, gdy chcesz powtarzalną iterację, zapisaną ciągłość, pełniejszy kontekst konta albo stabilniejsze miejsce do dalszego prowadzenia tego samego zadania audio.

Najbardziej przydatne dalsze materiały to Przewodnik po procesach muzyki AI w Rivya, Jak tworzyć muzykę AI z Rivya, Jak rozpocząć pierwszy proces audio AI w Rivya, Generator narracji AI, Lektor AI do wideo, Generator dubbingu AI oraz Przewodnik po Rivya Studio.

Lista kontrolna procesu audio

Zacznij tutaj, gdy wejściem albo wyjściem jest dźwięk:

  • Zdecyduj, czy zadaniem jest głos, dialog, projektowanie dźwięku, czyszczenie, muzyka czy tekst piosenki.

  • Oddziel generowanie nowego audio od naprawiania przesłanego nagrania.

  • Potwierdź dostępność wybranego modelu przed przygotowaniem briefu wykonawczego lub pliku do przesłania.

  • Sprawdź głos, język, liczbę mówców i ocenę komercyjną przed dostawą.

  • Używaj krótszych szkiców przed wydaniem kredytów na dłuższe albo bardziej ryzykowne zadania audio.

  • Trzymaj skrypty i notatki wymowy oddzielnie od ogólnego kierunku kreatywnego.

Sprawdź Ponownie, Gdy Audio Zmienia Kształt

Sprawdź ponownie, gdy narracja staje się dubbingiem, pomysł muzyczny przechodzi w pisanie tekstu albo czyszczenie zostaje zastąpione ponownym nagraniem. Zadania audio szybko tracą właściwy kierunek, jeśli ich rodzaj nie zostanie jasno nazwany.