Przejdź do treści
Yappy Pobierz
Język: pl

tego nikt inny nie pokazuje

Od pisanego do mówionego.

Czytanie na głos to nie literowanie: to interpretacja. „1492” czyta się „tysiąc czterysta dziewięćdziesiąt dwa”; „Henryk VIII” czyta się „Henryk ósmy”, ale „Louis XIV” po francusku brzmi „Louis quatorze”; „EL CID” nie jest liczbą rzymską; FBI czyta się litera po literze, a NASA nie. Zanim zsyntetyzuje choć jedną sylabę, Yappy zamienia tekst w skrypt lektorski: partyturę tego, co głos naprawdę powie.

Scenarzysta

Wypróbuj tutaj: to ten sam Rust, co w aplikacji, skompilowany do przeglądarki.

Tutaj pojawi się skrypt, a przekształcone fragmenty będą podkreślone.

Dwanaście rzemiosł za jednym zamachem.

Daty

„24/5/1533” mówi się w całości, z szykiem i rodzajem gramatycznym właściwymi dla każdego języka.

Godziny

„14:05” mówi się tak, jak powie człowiek, a nie tak, jak odczyta zegar.

Waluty

„3,50 €” mówi się „trzy euro pięćdziesiąt”, z właściwą liczbą mnogą.

Procenty

„7%” czyta się „siedem procent”, a „0,5%” nie zamienia się w „zero przecinek pięć”.

Jednostki

„230 °C” czyta się „dwieście trzydzieści stopni Celsjusza”.

Liczebniki porządkowe

„3.” czyta się „trzecia” — z rodzajem gramatycznym i odmianą, gdzie trzeba.

Rzymskie z głową

„Wiek XX” to liczebnik główny, „Henryk VIII” — porządkowy, a „EL CID” to wcale nie liczba.

Akronimy według fonotaktyki

FBI czyta się litera po literze; NASA — jak jedno słowo. Regułę dyktuje brzmienie, nie lista.

Skróty

„itd.”, „str.”, „XIX w.”: każdy język ma swoją tabelę.

Duże liczby

Gramatyki RBNF z Unicode CLDR — rodzaj i deklinacja w zestawie.

31 języków

Te same reguły, z gramatyką każdego języka. Bez ręcznie pisanych list.

Rytm

Nagłówki biorą oddech po wypowiedzeniu; listy wybijają swój takt. Pauzy należą do scenariusza, nie do przypadku.

Częste pytania

Czym są gramatyki RBNF?
RBNF to skrótowiec od Rule-Based Number Format: reguły, którymi Unicode CLDR opisuje, jak w danym języku czyta się liczbę na głos. To nie tabela na tysiąc słów, tylko gramatyka: dlatego wie, że po hiszpańsku będzie „doscientas páginas”, a nie „doscientos páginas”, że rosyjskie liczebniki się odmieniają, a francuski dolicza do dziewięćdziesięciu dwudziestkami. Yappy interpretuje je w czystym Ruście, bez ręcznie pisanych list.
Po co skrypter? Czy głos sam sobie nie poradzi?
Nie, i to celowo. Model głosu Yappy pracuje na poziomie znaków: wymawia dokładnie to, co dostaje na piśmie. To go czyni szybkim i lekkim, ale znaczy też, że gdy dostanie „1492”, spróbuje przeczytać je litera po literze. W takim modelu normalizacja jest wymową. Skrypter to element, który zamienia każdą liczbę, każdy skrót i każdy symbol w słowa, jakie wypowiedziałby człowiek.
W ilu językach to działa?
W 31 językach, które zna głos — każdy z własnymi regułami: kolejność dat, sposób łączenia walut, liczebniki porządkowe, skróty i liczby rzymskie. „Wiek XV” po hiszpańsku to „siglo quince”, po angielsku „fifteenth century”; „Louis XIV” to „Louis quatorze”, nie „Louis fourteenth”. Te same dwanaście zadań, trzydzieści jedna gramatyka.
Dlaczego karaoke zawsze trafia dokładnie w słowo?
Bo skrypt to nie tylko przerobiony tekst: przechowuje mapę między tym, co napisane, a tym, co powiedziane. Gdy głos mówi „tysiąc czterysta dziewięćdziesiąt dwa”, skrypt wie, że te cztery słowa pochodzą z czterech cyfr „1492”, więc podkreślenie kładzie się dokładnie na właściwych słowach i ani drgnie. To różnica między podświetleniem tekstu a zgadywaniem.
Jakieś słowo wymawia się źle. Czy mogę je poprawić?
Nie ma jeszcze słownika wymowy dla użytkownika. Model czyta znaki, więc najszybsza droga: wpisz w edytorze słowo tak, jak brzmi, i odsłuchaj je jeszcze raz. A jeśli zawodzi ogólny wzorzec (skrót, skrótowiec, jednostka), napisz o tym w zgłoszeniach na GitHubie: tabele generatora skryptu rosną właśnie o takie przypadki.
Czy generator skryptu na tej stronie to ten sam, co w aplikacji?
Ten sam kod, skompilowany do WebAssembly, żeby działał w przeglądarce. To, co tu napiszesz, nie opuszcza twojej karty. A ponieważ cały projekt jest otwarty, możesz przeczytać zasady jedną po drugiej w repozytorium.

Scenariusz to połowa opowieści; drugiej połowy słucha się.

Odsłuchaj próbkę