Nagraj wypowiedź lub rozmowę (do 5 minut) albo wybierz plik nagrania lub filmu, a otrzymasz tłumaczenie na polski.
Gotowe do nagrania.
Jak nagrywać w hałasie · języki i przesyłanie dźwięku
Film na komputerze: wybierz „Karta z filmem”, kliknij „Nagraj film”, wskaż kartę w tej samej przeglądarce i zaznacz udostępnianie jej dźwięku. Dla odtwarzacza poza przeglądarką wybierz „Dźwięk komputera”, cały ekran i udostępnianie dźwięku systemowego, jeśli przeglądarka oferuje tę opcję. Nagrywanie obejmuje do 5 minut odtwarzanego fragmentu; przy włączonym wstrzymywaniu w ciszy przerwy w filmie nie liczą się do limitu. Zatrzymaj nagranie, aby otrzymać tłumaczenie. Przycisk zakończenia udostępniania w przeglądarce też kończy nagranie. Aplikacja przetwarza i wysyła do rozpoznawania tylko audio; obraz nie jest nagrywany ani wysyłany. Automat podbija cichsze fragmenty także w audio filmu. Możesz go wyłączyć i ustawić ręczne wzmocnienie 1–4×. Wzmocnienie może podbić także muzykę i szum; nie oddziela mowy od tła.
Trzymaj mikrofon blisko rozmówcy i osłoń go od wiatru. Automat wyrównuje poziom kolejnych fragmentów mowy i ogranicza wzmacnianie ciszy oraz części szumu. Nie odzyska słów zagłuszonych hałasem i nie oddziela osób mówiących jednocześnie. Przy nagrywaniu filmu z YouTube zwiększ najpierw głośność odtwarzacza. Możesz wyłączyć automat i ustawić ręczne wzmocnienie, zaczynając od 2×. Dodatkowe oczyszczanie ogranicza dudnienie. Rozpoznanie i tłumaczenie wymagają internetu.
Wykrywanie automatyczne nie jest ograniczone do języków z listy. Bez rozdzielania rozmówców pusty wynik uruchamia jedną próbę awaryjną innym modelem, co oznacza dodatkowy koszt rozpoznania. Pusty wynik nie dowodzi braku mowy. Możesz wybrać język i kliknąć „Ponów rozpoznanie nagrania”, korzystając z zachowanego dźwięku. Przy krótkim lub niewyraźnym nagraniu język może pozostać nieustalony, nawet jeśli tekst uda się rozpoznać. Napisy na żywo pojawiają się z opóźnieniem sieci i mogą się zmieniać.
Rozdzielanie rozmówców działa po zatrzymaniu nagrania. Każda kwestia otrzymuje nazwę „Kobieta” lub „Mężczyzna” według oceny głosu albo ręcznego wyboru form. Kolejne podobnie ocenione głosy to „Kobieta 2”, „Mężczyzna 2” itd.; nieustalone pozostają jako „Rozmówca”, „Rozmówca 2”. Możesz poprawić przypisanie i zapis każdej kwestii. Każdej osobie możesz nadać własną nazwę (np. Jenny, Bob) zamiast „Kobieta” czy „Mężczyzna”; nazwa zmienia tylko etykietę, nie formy tłumaczenia. Jeśli jedna osoba ma dwie etykiety, wybierz „Ta sama osoba co”. Jeśli połączono dwie osoby, użyj „Dodaj rozmówcę”, przypisz jej kilka kwestii i kliknij „Popraw podział według głosów” — nagranie zostanie podzielone ponownie według próbek głosu (dodatkowe rozpoznanie). Wybór „Liczba rozmówców” robi to automatycznie, gdy wykryto więcej osób niż wybrano. Podpowiedź przy kwestii oznacza, że wysokość głosu nie pasuje do przypisanej osoby. Obsługiwane jest do 8 rozmówców i 200 kwestii w nagraniu. Gdy model rozdzielający jest niedostępny, wyłącz opcję i ponów rozpoznanie zachowanego nagrania.
Ocena automatyczna najpierw mierzy lokalnie wysokość głosu każdej osoby; wyraźnie niski lub wysoki głos nie wymaga wysyłania próbki. Tylko głos o pośredniej lub nietypowej wysokości jest oceniany przez OpenAI na podstawie próbki do 8 sekund. W rozdzielonym dialogu wybiera ciągły fragment i pomija nakładanie innych głosów. Przy niepewnej ocenie sprawdza jeszcze jeden inny fragment tej osoby, jeśli jest odpowiednio długi; to najwyżej jedno dodatkowe płatne wywołanie dla osoby. Wynik może pozostać „nieustalony” — wybierz wtedy formy ręcznie. Jednoznaczna informacja w tekście ma pierwszeństwo przed oceną głosu. Zmiana form, zapisu albo przypisania wymaga ponowienia samego tłumaczenia. Zmienione przypisanie może wymagać nowej oceny próbki głosu; ręczny wybór form pomija tę ocenę. Bez rozdzielania rozmówców jedna ocena dotyczy całego nagrania.
Nagranie pozostaje w pamięci tej karty do następnego nagrania lub zamknięcia okna. Do końcowego rozpoznania jest wysyłane przez Cloudflare do wybranego modelu: ElevenLabs (Scribe v2) albo OpenAI; ocena niejednoznacznego głosu trafia do OpenAI; napisy na żywo przesyłają dźwięk bezpośrednio do wybranego modelu napisów (ElevenLabs albo OpenAI). Plik wybrany z urządzenia jest odczytywany lokalnie; do rozpoznania trafia tylko jego dźwięk. Porównanie oznacza dodatkowe rozpoznanie i tłumaczenie. Oceny głosów są ponownie używane, jeśli zakresy próbek poszczególnych osób się nie zmieniły.
Licznik kosztów tłumaczeń obejmuje etap tekstowy; nie obejmuje rozpoznawania nagrań, oceny głosu ani napisów na żywo. Regulacja głośności działa lokalnie i nie dodaje kosztów API.