
¿Qué objetivo tiene el curso?
El objetivo principal de este curso es que comprendas cómo funcionan los agentes de voz con inteligencia artificial y aprendas a diseñar y construir tus propias soluciones.
A lo largo del programa entenderás qué ocurre detrás de una conversación con un agente de voz y conceptos fundamentales como la latencia, el streaming, los turnos de palabra, las interrupciones o los modelos Realtime Voice.
El programa está diseñado para que trabajes con ejemplos reales y casos 100% prácticos. Trabajaremos con plataformas como ElevenLabs, Retell y Vapi, y también crearemos agentes mediante código utilizando frameworks como LiveKit.
Aprenderás a incorporar conocimiento mediante RAG, conectar herramientas externas a través de APIs, webhooks o servidores MCP, y desplegar agentes capaces de realizar y recibir llamadas, consultar información y ejecutar acciones durante una conversación.
Al finalizar el curso, tendrás una visión completa de los agentes de voz y de las posibilidades que ofrece esta tecnología para crear nuevas soluciones basadas en inteligencia artificial.
¿Qué es un agente de voz?
Un agente de voz es un sistema basado en inteligencia artificial capaz de mantener una conversación hablada con una persona y responder en tiempo real.
Pero un agente de voz moderno va mucho más allá de simplemente convertir nuestra voz en texto y devolver una respuesta hablada.
Puede comprender lo que estamos diciendo, mantener el contexto de una conversación, consultar información externa y ejecutar acciones mientras hablamos con él.
Por ejemplo, podemos crear un agente de soporte que atienda una llamada, consulte la documentación de una empresa mediante RAG y resuelva las dudas de un cliente. Pero ese mismo agente también podría enviar información por email, consultar una incidencia en una base de datos o actualizarla directamente durante la conversación.
También podemos construir agentes proactivos que no esperen a recibir una llamada, sino que sean capaces de llamar automáticamente a clientes o potenciales clientes para realizar encuestas, confirmar citas, presentar productos o ejecutar otros procesos.
Tradicionalmente, muchos de estos sistemas funcionan mediante una arquitectura en la que la voz se convierte primero en texto, un modelo de lenguaje procesa la información y genera una respuesta, y finalmente esa respuesta vuelve a convertirse en voz.
Sin embargo, los nuevos modelos Realtime Voice permiten trabajar directamente con audio de entrada y salida, haciendo posible construir experiencias todavía más rápidas y naturales.
En esencia, los agentes de voz combinan inteligencia artificial, voz y automatización para crear sistemas capaces de comunicarse con nosotros utilizando la forma de interacción más natural que tenemos: hablar.
¿En qué va a ayudarte este curso?
Comprender qué es un agente de voz y cuáles son las posibilidades que ofrece esta nueva forma de interactuar con la inteligencia artificial.
Entender cómo funciona internamente una conversación con un agente de voz, desde que el usuario habla hasta que recibe una respuesta.
Comprender arquitecturas basadas en Speech-to-Text, LLM y Text-to-Speech, entendiendo el papel que desempeña cada componente.
Conocer los nuevos modelos Realtime Voice, capaces de procesar y generar voz directamente para conseguir interacciones más rápidas y naturales.
Entender conceptos fundamentales como latencia, streaming, turnos de palabra e interrupciones y cómo afectan a la naturalidad de una conversación.
Trabajar con plataformas especializadas como ElevenLabs, Retell y Vapi para construir agentes de voz con IA de forma visual y con un enfoque más NoCode.
Crear asistentes telefónicos con IA capaces de realizar y recibir llamadas, permitiendo desarrollar tanto asistentes reactivos como agentes proactivos que contacten automáticamente con potenciales clientes.
Proporcionar conocimiento propio a tus agentes de voz mediante RAG, utilizando documentos, páginas web y otras fuentes de información.
Comprender cómo funcionan las bases de datos vectoriales, los embeddings y la recuperación de información que existe detrás de los sistemas RAG utilizados por los agentes.
Conectar agentes telefónicos con herramientas externas para que puedan ejecutar acciones durante una conversación.
Utilizar APIs y webhooks para integrar agentes con workflows externos, ampliando sus capacidades más allá de las integraciones disponibles de forma nativa.
Conectar agentes telefónicos con servidores MCP, proporcionando al agente diferentes herramientas que podrá seleccionar y utilizar según las necesidades de la conversación.
Publicar e integrar agentes en páginas web, números de teléfono y diferentes canales para llevarlos más allá de los entornos de prueba.
Trabajar con diferentes voces y comprender cómo personalizar la experiencia de conversación, incluyendo la posibilidad de utilizar voces clonadas.
Crear agentes de voz mediante código utilizando frameworks como LiveKit, comprendiendo cómo desarrollar este tipo de soluciones más allá de las plataformas NoCode.
Construir agentes conectados a modelos Voice-to-Voice en tiempo real, capaces de procesar y generar voz directamente sin depender de módulos independientes para realizar las conversiones intermedias a texto.
Identificar oportunidades en tu entorno de trabajo para diseñar agentes de voz que permitan mejorar la atención al cliente, automatizar procesos o crear nuevas formas de interacción con usuarios.
Contenido y descripción general del curso
Este programa formativo está diseñado para personas que quieren comprender cómo funcionan los agentes de voz con inteligencia artificial y aprender a construirlos de forma práctica.
A lo largo del curso entenderás qué ocurre detrás de una conversación de voz, cómo intervienen los diferentes modelos y conceptos fundamentales como la latencia, el streaming, los turnos de palabra, las interrupciones o los modelos Realtime Voice.
Trabajaremos con plataformas especializadas como ElevenLabs, Retell y Vapi, creando agentes capaces de utilizar conocimiento propio mediante RAG, conectarse con herramientas externas y ejecutar acciones mediante APIs, webhooks o servidores MCP.
Verás casos prácticos como agentes de soporte capaces de resolver dudas y gestionar incidencias, asistentes integrados en páginas web o números de teléfono y agentes proactivos capaces de realizar llamadas comerciales de forma autónoma, entre otros.
También aprenderemos a crear asistentes telefónicos con IA mediante código utilizando LiveKit, trabajando con modelos capaces de procesar y generar voz directamente en tiempo real.
El enfoque del programa es totalmente práctico. A medida que avancemos construiremos agentes cada vez más completos, combinando voz, conocimiento, herramientas y automatización.
No necesitas conocimientos avanzados de programación. El objetivo final es que al finalizar el programa formativo obtengas una visión completa de los agentes de voz y seas capaz de identificar oportunidades y construir soluciones adaptadas a diferentes necesidades.