Herramientas · IA · Tutorial Jun 2026 6 min

edge-tts: cómo genero audio de mis artículos completamente gratis en mi propio servidor

ElevenLabs cobra por carácter. Google Text-to-Speech cobra. Azure cobra. edge-tts usa la infraestructura de Microsoft Edge, es código abierto, y para un blog con decenas de artículos el costo es cero. Así funciona y cómo lo tengo configurado.

Por qué empecé a buscar text-to-speech gratis

Tenía el plan de agregar audio a los artículos de critika.com.mx. 638 posts, ~1,000 visitas diarias, y la hipótesis de que ofrecer la versión en audio aumentaría el tiempo de permanencia en la página.

El problema: a los precios de ElevenLabs, generar audio para 638 artículos de largo promedio hubiera costado entre $50 y $100 USD solo para la carga inicial, más el costo mensual recurrente para los nuevos artículos. Para un blog que todavía está construyendo su base de monetización con AdSense, ese costo no tenía sentido.

edge-tts resolvió el problema completamente.

Qué es edge-tts

edge-tts es una librería Python de código abierto que accede a la API de texto a voz del navegador Microsoft Edge. Edge tiene una función nativa de "leer en voz alta" que usa voces neurales de alta calidad — las mismas voces de Azure Cognitive Services. edge-tts accede a esa infraestructura de forma gratuita.

No es un hack ni un exploit. Es una API pública de Microsoft que edge-tts consume en su forma documentada. La calidad de las voces es genuinamente buena — especialmente en español de México con la voz es-MX-DaliaNeural.

Instalación en el servidor

En el VPS con Ubuntu 22.04, la instalación es un solo comando:

pip install edge-tts

Para generar un archivo MP3 desde la terminal:

edge-tts --voice es-MX-DaliaNeural --text "Texto del artículo aquí" --write-media articulo.mp3

Para artículos largos, lo más práctico es pasar el texto desde un archivo:

edge-tts --voice es-MX-DaliaNeural --file articulo.txt --write-media articulo.mp3

El sistema automatizado con n8n y Ghost

El uso manual sirve para probar. El uso en producción requiere automatización.

Para critika.com.mx (blog en Ghost), construí este flujo con n8n:

  1. Se publica un artículo en Ghost
  2. Ghost dispara un webhook al workflow de n8n
  3. n8n extrae el título y el contenido del artículo
  4. n8n ejecuta el script Python /usr/local/bin/ghost-audio-update.py en el servidor
  5. El script genera el MP3 con edge-tts usando el contenido del artículo
  6. El MP3 se guarda en el servidor
  7. n8n actualiza el artículo en Ghost con el reproductor de audio enlazado al MP3

El flujo completo tarda menos de 30 segundos desde la publicación del artículo hasta que el audio está disponible. Sin costo por ejecución, sin límite de artículos, sin intervención manual.

Calidad real vs ElevenLabs

Voy a ser honesto: ElevenLabs genera voces más naturales y más personalizables. La voz DaliaNeural de edge-tts suena bien, pero tiene las limitaciones de una voz neural genérica — no puedes ajustar el ritmo, el énfasis emocional ni crear una voz con tu propio timbre.

Para un blog de contenido informacional, esa diferencia no importa lo suficiente para justificar el costo. Para contenido de marca donde la voz es parte de la identidad — un podcast, un curso, un producto de audio — ElevenLabs o una alternativa premium tiene sentido. Para 638 artículos de blog, edge-tts es la decisión correcta.

Tengo la cuenta de ElevenLabs activa para proyectos específicos donde la calidad de voz forma parte del producto. Para el blog, edge-tts.

Lo que esto cambia en práctica

Antes de tener el sistema, cada nuevo artículo en el blog era texto solamente. Ahora cada artículo publicado en Ghost tiene automáticamente una versión de audio disponible en segundos, sin ningún paso manual adicional.

El lector que prefiere escuchar tiene esa opción. El SEO se beneficia del tiempo de permanencia adicional. Y el costo de ese beneficio es cero.

¿Quieres implementar algo similar para tu blog? En el Método IA enseño este tipo de automatizaciones desde la instalación hasta el workflow completo.

¿edge-tts es legal para uso comercial?

edge-tts es una librería Python open source que accede a la API de texto a voz de Microsoft Edge, que es pública. Microsoft la usa internamente en el navegador Edge para la función de lectura en voz alta. No hay términos de servicio explícitos que prohíban el uso no comercial o comercial moderado. Para uso intensivo o a escala comercial significativa, la opción correcta es la API oficial de Azure Cognitive Services, que cobra por carácter pero tiene términos claros. Para un blog con decenas o cientos de artículos, edge-tts es la solución práctica.

¿Qué voces tiene edge-tts en español?

edge-tts incluye voces en español de México, España, Argentina, Colombia y otros dialectos. Las más usadas en español de México son es-MX-DaliaNeural (voz femenina, natural) y es-MX-JorgeNeural (voz masculina). La calidad es comparable a ElevenLabs en versiones básicas — no idéntica, pero perfectamente usable para contenido de blog. La diferencia con ElevenLabs es el costo: edge-tts es gratis, ElevenLabs cobra desde $5 USD/mes y tiene límite de caracteres.

¿Se puede usar edge-tts en Windows o solo en Linux?

edge-tts es una librería Python multiplataforma — funciona en Linux, Mac y Windows. Para uso en servidor, lo más común es instalarlo en un VPS con Ubuntu. Para uso local en Mac, se instala con pip y funciona desde la terminal sin configuración adicional. El comando básico es: edge-tts --voice es-MX-DaliaNeural --text 'texto aquí' --write-media output.mp3

¿El audio generado con IA mejora el SEO?

Indirectamente. Google no indexa el contenido de audio directamente. Pero el audio en los artículos aumenta el tiempo de permanencia en la página — los visitantes que escuchan el artículo pasan más tiempo en el sitio. El tiempo de permanencia es una señal de calidad que Google considera. Además, ofrecer la opción de escuchar el artículo mejora la experiencia de usuario, especialmente en móvil donde escuchar mientras se hace otra cosa es habitual.