Fragen, die ankommen.
Geradeherum beantwortet, ohne Umschweife.
das Geld und die Freiheit
Gratis, ehrlich.
Ist es wirklich gratis?
Ja. Yappy ist quelloffen und steht unter der MIT-Lizenz. Hören können, was man liest, ist eine Frage der Barrierefreiheit, und Barrierefreiheit sollte keine Karte verlangen. Auf dem Rechner gibt es keine Bezahlversion und keine Werbung. Auf dem iPhone trägt der Probepapagei drei Dokumente gleichzeitig auf seiner Sitzstange, ohne Zeitlimit; willst du die bodenlose Sitzstange, die Hörbuchdruckerei und die Brücke zum Rechner, ziehst du ihn mit Yappy Parlanchín auf – im Abo oder mit einem einzigen Kauf auf Lebenszeit. Ohne Konto und ohne Werbung, so oder so.
Wo ist der Haken? Wie finanziert sich das?
Es gibt keinen Haken: Es gibt keine Server zu bezahlen. Die Sprachsynthese läuft auf deinem Gerät, also kostet Yappy nichts pro Nutzer. Das ist das persönliche Projekt seines Autors, veröffentlicht, weil es ohnehin schon da war und sicher noch jemandem nützen würde.
Gibt es eine kostenlose Testphase?
Nein, mit Absicht. Die Sitzstange für drei Dokumente ist die Probe, und die läuft nicht nach sieben Tagen ab und wird auch nicht zur Abbuchung. Wenn Yappy dir nützt, merkst du das auch, ohne dass dir jemand eine Uhr hinstellt.
Darf ich das erzeugte Audio veröffentlichen, in einem Podcast oder in einem Video?
Yappys Code ist MIT-lizenziert und macht dir keine Auflagen. Das Sprachmodell, Supertonic 3, hat eine eigene Lizenz: eine offene Lizenz vom Typ OpenRAIL-M, mit Nutzungsklauseln. Prüf sie auf der Modellseite nach, bevor du es kommerziell nutzt – dieser Teil liegt nicht bei Yappy, und wir können dafür nichts versprechen.
Deine Texte reisen nicht
Datenschutz, mit Vor- und Nachnamen.
Landen meine Texte auf irgendeinem Server?
Nein. Synthese, Transkription und Artikelextraktion laufen auf deinem Gerät. Was du mit Yappy teilst, geht nirgendwohin: Es gibt keine Konten, keine Kopien und keinen Yappy-Server, auf dem etwas landen könnte. Was tatsächlich das Netz berührt, sind vier konkrete Dinge, und alle vier stehen in der Datenschutzerklärung.
Sammelt Yappy Nutzungsstatistiken?
Ja, Yappy sammelt sie, und das will ohne Umschweife gesagt sein. Die Handy-App sendet anonyme Nutzungsstatistiken: ab Werk eingeschaltet, in der hintersten Ecke abschaltbar. Was unterwegs ist, ist der Name eines Ereignisses aus einer festen Liste (dass die App geöffnet wurde, welcher Schritt des Einführungsrundgangs gerade zu sehen ist, welcher Plan angetippt wird, ob eine Wiedergabe zu Ende ist), eine zufällige Installationskennung, die Sprache und die Version. Niemals dein Name, deine E-Mail-Adresse, der Text, den du liest, der Titel eines Dokuments oder ein Link – und keine Werbe-ID. Und sie gehen nicht an Google, nicht an Firebase und nicht an irgendein Analyseunternehmen: Sie landen in einem Worker und einer D1-Datenbank bei Cloudflare, beides gehört dem Autor selbst. Auf dem Desktop gibt es keine Statistiken, in keiner Form.
Und die Brücke zwischen Handy und Computer?
Das ist eine direkte Verbindung zwischen deinen beiden Geräten, Ende-zu-Ende-verschlüsselt mit QUIC, über das Protokoll von iroh. Gekoppelt wird, indem du die Kamera auf den QR-Code richtest, den dein Computer zeigt; den daraus entstandenen Schlüssel kannst du von dort jederzeit widerrufen. Es gibt keinen Yappy-Server dazwischen, weil es keinen Yappy-Server gibt.
Funktioniert es offline?
Ja, für immer. Nach dem ersten Download des Modells – rund 200 MB auf dem Handy, rund 398 MB auf dem Computer – kannst du Yappy im Flugmodus benutzen: Text einfügen, Dokumente öffnen, synthetisieren und exportieren. Nur das Teilen neuer Adressen braucht Netz, aus naheliegenden Gründen. Eine Cloud-Synchronisierung gibt es ebenfalls nicht: Deine Bibliothek lebt auf deinem Gerät, und die Brücke ist das, was einem Weiterreichen von einer Maschine zur anderen am nächsten kommt.
Was klingt
Die Stimme und die Sprachen.
Welches Stimmenmodell verwendet Yappy?
Supertonic 3, ein offenes Modell von Supertone mit rund 99 Millionen Parametern. Es passt in 398 MB auf dem Computer und in 200 MB auf dem Handy und synthetisiert auf jedem Laptop der letzten Jahre schneller als Echtzeit. Es arbeitet auf Zeichenebene: Deshalb gibt es den Skriptwandler, der Zahlen, Abkürzungen und Symbole in Wörter verwandelt, bevor die Stimme sie zu sehen bekommt.
Welche Sprachen spricht Yappy?
Deutsch, Arabisch, Bulgarisch, Tschechisch, Koreanisch, Kroatisch, Dänisch, Slowakisch, Slowenisch, Spanisch, Estnisch, Finnisch, Französisch, Griechisch, Hindi, Ungarisch, Indonesisch, Englisch, Italienisch, Japanisch, Lettisch, Litauisch, Niederländisch, Polnisch, Portugiesisch, Rumänisch, Russisch, Schwedisch, Türkisch, Ukrainisch und Vietnamesisch. Einunddreißig. Und die zehn Stimmen sind alle Polyglotten: Dieselbe Stimme liest alle Sprachen, ohne die Klangfarbe zu wechseln.
Was, wenn ein Dokument Sprachen mischt?
Yappy erkennt die Sprache des Dokuments und, Absatz für Absatz, die jedes Abschnitts: Ein englisches Zitat in einem spanischen Essay wird auf Englisch gelesen, mit derselben Stimme, ohne dass du etwas tun musst. Und wenn sich die Erkennung irrt, stellst du die Sprache von Hand ein.
Was ist der Unterschied zu VoiceOver oder „Bildschirm einlesen“?
Die Screenreader des Systems lesen den Bildschirm, wie er gerade dasteht, mit der Prosodie des Systems und ohne Gedächtnis. Yappy bereitet den Text auf, bevor er ihn ausspricht (putzt den Artikel, verbalisiert Zahlen und Abkürzungen, setzt die Pausen), liest ihn mit einer natürlichen Stimme, merkt sich, wo du stehengeblieben bist, exportiert Hörbücher und spielt weiter, wenn der Bildschirm gesperrt ist. Das sind verwandte Werkzeuge mit verschiedenen Berufen, und beide lassen sich gleichzeitig benutzen, ohne sich zu stören: Yappy ersetzt keinen Screenreader und hat es auch nicht vor.
Was hereinkommt
Die Dokumente.
Welche Formate akzeptiert Yappy?
Webartikel (die Seite putzt sich von selbst), Videos über das jeweils veröffentlichte Transkript, PDF, EPUB, Word, ODT, RTF, Markdown, einfacher Text, .pptx, .xlsx, .csv und Sprachnachrichten. Auf dem Handy läuft alles über das Teilen-Menü; auf dem Desktop zusätzlich per Drag & Drop oder mit Tastenkürzeln. Und wenn auf dem Computer pandoc installiert ist, wächst die Liste um LaTeX, reStructuredText, Org und ein paar weitere Formate.
Und gescannte PDFs ohne Text darin?
Auf dem Desktop durchläuft der Text vorher eine lokale OCR, und auch dabei verlässt nichts deinen Rechner. Auf dem iPhone noch nicht: Ist das PDF ein Foto vom Papier, findet das Handy keinen Text zum Vorlesen. Ein schiefer oder unscharfer Scan gibt her, was jede OCR eben hergibt; ein ordentlicher lässt sich komplett vorlesen.
Kann die App Bücher vorlesen, die ich in einem Shop gekauft habe?
Nur die, die du öffnen kannst. Ein EPUB ohne Kopierschutz lässt sich vollständig vorlesen, Kapitel inklusive. Bücher mit DRM aus einem Shop gehen nicht – weder hier noch irgendwo anders: Dieses Schloss gehört nicht Yappy, und wir tun nicht so, als hätten wir den Schlüssel.
Wie lösche ich etwas aus der Bibliothek?
Direkt in der Bibliothek: Jedes Dokument hat seine Option „Vergessen“, und mit ihr verschwindet auch das Audio. Die exportierten Dateien (.m4b, .mp3, .wav) gehören dir und liegen dort, wo du sie gespeichert hast; Löschen und Verschieben ist Sache des Finders oder der Dateien-App.
wenn etwas hakt
Störungen und Hilfe.
Warum dauert die erste Sprachausgabe ein paar Sekunden länger?
Beim ersten Mal wird das Modell in den Speicher geladen. Danach ist es warm, und die nächsten Sätze kommen sofort. Hast du die App gerade erst auf dem Rechner installiert, kommt zur ersten Wartezeit noch der Download des Sprachmodells dazu.
Ein Wort wird falsch ausgesprochen. Kann man das der App beibringen?
Ein Aussprachewörterbuch für Nutzer gibt es nicht. Der schnelle Weg: Schreib das Wort im Editor so, wie es klingt – das Modell liest Zeichen und macht, was da steht. Ist es ein allgemeines Muster (eine Abkürzung, ein Akronym, eine Einheit), schildere es in den GitHub-Issues: Die Tabellen des Normalisierers wachsen mit solchen Fällen.
Ich habe ein Video geteilt und es sagt nichts.
Yappy übernimmt die veröffentlichte Transkription des Videos und transkribiert nicht die Tonspur. Hat das Video keine Transkription, gibt es nichts vorzulesen. Ist das Video deins und liegt als Datei vor, teile die Datei: Dann transkribiert sie das lokale Ohr tatsächlich.
Ich habe einen Fehler gefunden. Wo melde ich ihn?
In den GitHub-Issues oder per Mail an [email protected]. Mit dem Text, an dem es lag – falls du ihn teilen kannst – und deinem System lässt es sich schneller beheben.