Módulo 2: Text to Speech — Crea tu primer audio
En este módulo comenzarás a usar Text to Speech dentro de ElevenLabs, la función principal que permite convertir texto escrito en audio generado por inteligencia artificial.
Aquí verás cómo funciona la herramienta a nivel práctico y qué elementos influyen en cómo suena una voz, antes de entrar en ajustes más detallados
Este video está disponible solo para miembros con una suscripción activa.
Suscríbete o iniciar sesión para continuar.
🔊 ¿Qué es Text to Speech en ElevenLabs?
Text to Speech es la función que convierte texto escrito en voz natural usando inteligencia artificial.
En ElevenLabs, esta es la herramienta principal y donde pasarás la mayor parte del tiempo creando audios.
🎤 Elegir una voz (lo importante)
No existe “la mejor voz”.
Existe la voz correcta para tu texto.
💡 Tip rápido:
Contenido serio → voces calmadas
Contenido dinámico → voces con más energía
Escucha varias antes de decidir. Tu oído manda.
⚙️ Ajustes clave (sin complicarte)
Hay muchos controles, pero para empezar solo importa esto:
Velocidad: controla qué tan rápido habla la voz
Estabilidad: define si la voz es pareja o más expresiva
Similitud: qué tan consistente se mantiene la voz
👉 Regla simple:
Si algo suena raro, ajusta poco y vuelve a escuchar.
👂 Escucha con intención
Después de generar tu audio, pregúntate:
¿Suena natural?
¿Tiene pausas?
¿Se siente cómodo de escuchar?
La clave no es solo la voz…
también cómo está escrito el texto.
⏭️ ¿Qué sigue en el curso?
En el siguiente módulo aprenderás a escribir texto pensado para el oído, para que la voz deje de sonar robótica sin tocar tantos ajustes.
Vamos paso a paso. Ya estás creando audio real. 🚀
Si surge alguna duda durante el proceso, puedes apoyarte en la comunidad del curso.
