yappy

yappy · preguntas

Preguntas que llegan.

Respondidas de frente. Si la tuya no está, abre un tema en GitHub y pasará a esta lista.

el dinero y la libertad

Gratis, en serio.

¿De verdad es gratis?

Sí. Yappy es código abierto con licencia MIT. Poder escuchar lo que uno lee es una cuestión de accesibilidad, y las herramientas de accesibilidad no deberían pedir tarjeta. No hay versión de pago, ni límites que se desbloquean, ni anuncios.

¿Cuál es el truco? ¿Cómo se financia?

No hay truco: no hay servidores que pagar. La síntesis corre en tu aparato, así que Yappy no tiene coste por usuario. Es un proyecto personal de su autor, publicado porque ya existía y a alguien más le serviría.

¿Puedo publicar el audio que genero (pódcast, audiolibro, vídeo)?

El código de Yappy es MIT y no te pone condiciones. El modelo de voz (Supertonic 3, de Supertone) tiene su propia licencia abierta: revísala en su página del modelo antes de un uso comercial, porque esa parte no depende de Yappy.

la privacidad

Tus textos no viajan.

¿Mis textos van a algún servidor?

No. La síntesis, la transcripción y la extracción de artículos ocurren en tu aparato. La única red que toca Yappy es la descarga inicial del modelo y, si compartes una URL, la visita a esa URL desde tu propio teléfono u ordenador. No hay cuentas, no hay telemetría, no hay analítica.

¿Y el puente entre el móvil y el ordenador?

Es una conexión directa entre tus dos aparatos, cifrada de extremo a extremo (QUIC, con el protocolo de iroh). El emparejamiento se hace apuntando la cámara a un QR que enseña tu ordenador; la llave resultante se puede revocar desde el ordenador en cualquier momento. No hay servidor de Yappy en medio, porque no existe ningún servidor de Yappy.

¿Funciona sin conexión?

Sí, para siempre. Tras la descarga inicial del modelo (~380 MB), puedes usar Yappy en modo avión: pegar texto, abrir documentos, sintetizar, exportar. Solo compartir URL nuevas necesita red, por razones evidentes.

la voz y los idiomas

Lo que suena.

¿Qué modelo de voz usa?

Supertonic 3, un modelo abierto de Supertone de unos 66 millones de parámetros que cabe en 380 MB y sintetiza más rápido que el tiempo real en cualquier portátil de los últimos años. Trabaja a nivel de carácter: por eso existe el guionizador, que convierte números, siglas y símbolos en palabras antes de que la voz los vea.

¿Qué idiomas habla?

Alemán, árabe, búlgaro, checo, coreano, croata, danés, eslovaco, esloveno, español, estonio, finés, francés, griego, hindi, húngaro, indonesio, inglés, italiano, japonés, letón, lituano, neerlandés, polaco, portugués, rumano, ruso, sueco, turco, ucraniano y vietnamita. Las diez voces son políglotas: la misma voz lee cualquiera de las 31 lenguas.

¿Qué pasa con un documento que mezcla idiomas?

Yappy detecta el idioma del documento y, párrafo a párrafo, el de cada pieza: una cita en inglés dentro de un ensayo en español se lee en inglés, con la misma voz, sin que toques nada. Y si la detección se equivoca, puedes fijar el idioma a mano.

¿Por qué la primera síntesis tarda unos segundos más?

El modelo se carga en memoria la primera vez. Después queda caliente y las siguientes frases salen al vuelo.

los documentos

Lo que entra.

¿Qué formatos acepta?

Artículos web (la página se limpia sola), vídeos de YouTube (por su transcripción), PDF, EPUB, Word, ODT, Markdown, texto plano y notas de voz. En el móvil, todo por la hoja de compartir; en el escritorio, además, arrastrando o con los atajos.

¿Y los PDF escaneados, sin texto?

En el escritorio pasan por OCR local (PaddleOCR) antes de leerse: tampoco ahí sale nada de tu ordenador. Un escaneo torcido o borroso dará el resultado que cualquier OCR pueda dar, pero el bueno se lee entero.

¿Cómo borro algo de la biblioteca?

Desde la propia biblioteca: cada documento tiene su opción de olvidar. Los archivos exportados (.m4b, .mp3, .wav) son tuyos y viven donde los guardaste; borrarlos o moverlos es cosa del Finder o de Archivos.

¿En qué se diferencia de VoiceOver o de «Leer pantalla»?

Los lectores del sistema leen la pantalla tal cual, con la prosodia del sistema y sin memoria. Yappy prepara el texto (limpia el artículo, verbaliza números y siglas, marca las pausas), lo lee con una voz natural, recuerda por dónde ibas, exporta audiolibros y sigue sonando con la pantalla bloqueada. Son herramientas primas, con oficios distintos.

cuando algo falla

Averías y ayuda.

He encontrado un fallo. ¿Dónde lo cuento?

En los temas de GitHub. Con el texto que fallaba (si puedes compartirlo) y tu sistema, se arregla antes.

Una palabra se pronuncia mal. ¿Se puede enseñar?

Como el modelo lee caracteres, la vía rápida es escribir la palabra como suena en el editor. Si es un patrón general (una abreviatura, una sigla, una unidad), cuéntalo en GitHub: las tablas del guionizador crecen con esos casos.

¿Respondido todo?

Pues solo queda escucharlo.