Módulo 2: Text to Speech — Crea tu primer audio

En este módulo comenzarás a usar Text to Speech dentro de ElevenLabs, la función principal que permite convertir texto escrito en audio generado por inteligencia artificial.

Aquí verás cómo funciona la herramienta a nivel práctico y qué elementos influyen en cómo suena una voz, antes de entrar en ajustes más detallados

Este video está disponible solo para miembros con una suscripción activa.

Suscríbete o iniciar sesión para continuar.

🔊 ¿Qué es Text to Speech en ElevenLabs?

Text to Speech es la función que convierte texto escrito en voz natural usando inteligencia artificial.

En ElevenLabs, esta es la herramienta principal y donde pasarás la mayor parte del tiempo creando audios.

🎤 Elegir una voz (lo importante)

No existe “la mejor voz”.
Existe la voz correcta para tu texto.

💡 Tip rápido:

  • Contenido serio → voces calmadas

  • Contenido dinámico → voces con más energía

Escucha varias antes de decidir. Tu oído manda.

⚙️ Ajustes clave (sin complicarte)

Hay muchos controles, pero para empezar solo importa esto:

  • Velocidad: controla qué tan rápido habla la voz

  • Estabilidad: define si la voz es pareja o más expresiva

  • Similitud: qué tan consistente se mantiene la voz

👉 Regla simple:
Si algo suena raro, ajusta poco y vuelve a escuchar.

👂 Escucha con intención

Después de generar tu audio, pregúntate:

  • ¿Suena natural?

  • ¿Tiene pausas?

  • ¿Se siente cómodo de escuchar?

La clave no es solo la voz…
también cómo está escrito el texto.

⏭️ ¿Qué sigue en el curso?

En el siguiente módulo aprenderás a escribir texto pensado para el oído, para que la voz deje de sonar robótica sin tocar tantos ajustes.

Vamos paso a paso. Ya estás creando audio real. 🚀

Si surge alguna duda durante el proceso, puedes apoyarte en la comunidad del curso.

Módulos del curso