Publicado el 16 de septiembre de 2026 6 min de lectura privacidad
Hay dos maneras de convertir un texto en voz. En la primera, tu texto viaja a un servidor, allí un modelo enorme genera el audio y te lo devuelve. En la segunda, el modelo está dentro de tu aparato y el texto no se mueve de ahí.
Durante años la primera era la única con calidad aceptable. Ya no. Y el cambio tiene consecuencias que van bastante más allá de la privacidad, aunque la privacidad sea la que se cuenta siempre.
Qué cabe hoy en un teléfono
La voz que usa Yappy es Supertonic 3, de la empresa coreana Supertone: unos 99 millones de parámetros. Comparado con los modelos de lenguaje de los que habla todo el mundo, eso es minúsculo: mil veces menos que los grandes. En media precisión ocupa unos 200 MB, cabe en el teléfono sin drama y sintetiza varias veces más rápido que el tiempo real.
Son cuatro redes en fila. Una predice cuánto dura cada sonido. Otra convierte el texto en una representación intermedia. La tercera —la que de verdad canta— parte de ruido y lo va limpiando paso a paso, como se revelaba una foto: ocho pasos en calidad normal, cinco si hay prisa, doce si quieres lo mejor. La cuarta convierte eso en sonido a 44.100 muestras por segundo.
El detalle que hace posible que sea tan pequeño es que trabaja a nivel de carácter: pronuncia lo que le llega escrito, letra a letra, sin un diccionario fonético gigante. Eso ahorra muchísimo peso. Y tiene una consecuencia que explico en otro artículo: si le llegan las cifras «1492», intentará decir «1492», así que alguien tiene que haberlas convertido antes en «mil cuatrocientos noventa y dos». Ese alguien es el guionizador, y es la mitad del trabajo de leer bien.
Cómo se consigue que quepa
Que un modelo entre en un teléfono no es solo cuestión de que sea pequeño de nacimiento. Hay un trabajo de ajuste que casi nunca se cuenta y que conviene conocer, aunque solo sea para saber qué se está pagando.
El modelo original ocupa 398 MB, con los números en coma flotante de treinta y dos bits. Pasarlo a media precisión, dieciséis bits, lo deja en 200 MB: la mitad. En teoría es trivial; en la práctica, si se convierte todo a ciegas, el modelo ni siquiera carga, porque hay operaciones concretas dentro que no admiten media precisión y hay que localizarlas y dejarlas como estaban. A cambio, la síntesis va un veinte por ciento más lenta —y sigue siendo varias veces más rápida que el tiempo real— y la voz no cambia de manera perceptible.
Por eso el móvil usa la versión de media precisión y el ordenador la completa: en un teléfono, ahorrar doscientos megas de descarga vale más que un veinte por ciento de velocidad que nadie nota.
Las cuatro razones, por orden de importancia real
1. El coste, que es la que menos se dice
Un servicio de voz en la nube paga servidores por cada segundo de audio que genera. Como ese coste es proporcional al uso, el precio también tiene que serlo: de ahí las suscripciones de diez a treinta euros al mes, los planes por caracteres y las «horas de audio incluidas». No es avaricia, es aritmética.
Un modelo que corre en tu aparato tiene coste marginal cero para quien lo hizo. Por eso puede haber una app que lee sin contador y sin límite de tiempo. No es generosidad mía: es que leer no me cuesta dinero. Lo que cobro —una cuerda de 3,99 € al mes o 59,99 € de por vida— es por comodidades, no por segundos.
2. La privacidad, que sí importa aunque suene a folleto
«No tengo nada que esconder» es una frase que aguanta mal el examen en cuanto miras lo que la gente le da a leer a una app así: sentencias, historiales, contratos, un manuscrito sin publicar, los exámenes de los alumnos, la carta de un amigo, un informe médico. En una app local no hay discusión que tener, porque no hay nada que se vaya.
Y hay un segundo orden, más sutil: no hay cuenta, así que no hay una base de datos con tu nombre y una lista de todo lo que has escuchado. Lo que no existe no se filtra, no se vende y no se entrega por requerimiento.
Yo digo la verdad entera, porque queda peor pero es lo que hay: la app sí toca la red en cuatro casos —bajar el modelo la primera vez, ir a buscar el texto de un enlace que tú compartes, la gestión de la suscripción y unas estadísticas de uso anónimas que en el móvil se pueden apagar—. Está todo contado en la página de privacidad. Lo que nunca sale es el contenido.
3. La latencia y el sitio donde estás
Sin conexión no hay espera de red, ni cola de servidor, ni caídas. Le das al play y suena. Y funciona en el metro, en un avión, en un pueblo con dos rayas de cobertura, en una casa rural y en un sótano de biblioteca. Quien escucha mientras camina sabe exactamente de qué hablo: la nube se corta justo en la cuesta.
4. La duración
Esta es mi razón favorita y la menos comercial. Los servicios cierran. Cambian de precio, de dueño, de API; retiran la voz que te gustaba. Un modelo descargado en tu aparato, con la app que lo ejecuta en código abierto, sigue leyendo dentro de cinco años exactamente igual que hoy, aunque yo desaparezca. Aburrido, previsible y tuyo.
Qué se pierde. Sin rodeos
Sería muy fácil terminar aquí y quedar estupendo. Pero hay cosas que la nube hace mejor, y son estas:
- Expresividad. Los modelos grandes de servidor tienen un registro actoral que un modelo pequeño no alcanza: rabia, ironía, susurro, personajes distintos. En un ensayo apenas se nota; en una novela con mucho diálogo, se nota.
- Clonación de voces y control fino. Poner la voz de alguien, dirigir la emoción frase a frase, hacer podcasts producidos: eso, hoy por hoy, es territorio de la nube.
- La descarga inicial. Doscientos megas la primera vez. En una tarifa cara o una conexión mala, es una molestia real. (En el iPhone las voces bajan con la propia instalación, así que se disimula; en el ordenador se ve.)
- Aparatos viejos. Un teléfono de hace ocho años sintetiza despacio. Un servidor no envejece nunca.
Si lo que necesitas es una voz espectacular para un vídeo, la nube es la respuesta correcta. Si lo que necesitas es escuchar tus cosas, todos los días, sin contar caracteres, la respuesta es la otra.
Cómo comprobarlo tú mismo, en un minuto
No hay que creerme. Hay dos pruebas caseras:
- Modo avión. Pon el aparato en modo avión, abre un texto largo y dale al play. Si suena, la voz está dentro. Si te sale un error de red, ya sabes dónde estaba.
- El texto raro. Dale un texto con fechas, siglas, romanos y cifras, y escucha si los dice como una persona. Eso no mide dónde está el modelo, pero mide si alguien se ha molestado en hacer la parte difícil. Puedes probarlo en el navegador, con el mismo código de la app compilado a WebAssembly, en la página del guionizador.
El resumen, en una línea
Que la voz viva en el aparato no es una postura ideológica: es lo que permite que escuchar un libro entero no cueste nada, no pida cuenta, funcione en un túnel y siga funcionando dentro de diez años. Se paga con un poco de expresividad. A mí me parece un cambio barato.
Preguntas frecuentes
¿Qué significa que un modelo de voz funcione «sin conexión»?
¿Suena peor que las voces de la nube?
¿Cuánto ocupa y cuánta batería gasta?
¿Entonces la app no se conecta nunca a internet?
¿Por qué casi todas las apps de texto a voz usan la nube?
Gratis, sin cuenta y sin nada que registrar. Se instala, se comparte un texto y ya suena.