Voz y audio
Modo de voz, generación de audio, traducción, riesgos de clonación y agentes de voz.
8 contenidos (3 artículos · 5 vídeos)
Comienza aquí
Una selección inicial antes de explorar todo el contenido.
7 min de lecturaModo de voz de ChatGPT: hablar con la IA como con un amigo
Hablar con la IA resulta extraño durante unos noventa segundos, pero después puede convertirse en la interfaz más natural. Una guía práctica sobre sus usos, límites y funcionamiento.
Primeros pasos con IA
7 min de lecturaVoz y audio con IA: clonación, podcasts y traducción
Una guía para distinguir la clonación de voz, la narración, la transcripción y la traducción, con límites claros de consentimiento, transparencia, privacidad y verificación.
PrincipianteMás sobre este tema
6 minutosAgentes de voz de IA: cómo funcionan realmente y por qué suenan tan humanos
CX Foundation. Divide el agente de voz en su pipeline práctico: reconocimiento del habla, modelo de lenguaje, API de sistemas empresariales, conversión de texto a voz y gestión de interrupciones. Aporta una base técnica concreta al marco de despliegue del artículo antes de elegir Twilio, Retell, Vapi, LiveKit u otra plataforma.
Avanzado
9 min de lecturaAgentes de voz para flujos de atención al cliente: dónde funcionan y dónde fallan
Los agentes de voz son útiles cuando el flujo está delimitado, los datos están disponibles y la alternativa es clara. Un marco de decisión práctico para sistemas estilo Twilio/Retell, divulgación, transferencia, pruebas e implementación.
Avanzado
11 minutosCómo clonar tu voz con IA: clones de voz realistas (tutorial completo)
ElevenLabs.
Principiante
16 minutosCómo usar ElevenLabs: las mejores voces con IA para convertir texto en voz (guía completa)
Alec Wilcock.
Principiante
26 minutosPresentación de GPT-4o
OpenAI. Esta es la presentación de mayo de 2024 en la que se mostró por primera vez el modo de voz en tiempo real de ChatGPT. Mark Chen realiza la demostración del ejercicio de respiración, Barrett Zoph la del tutor de matemáticas y, después, pasan a la traducción en tiempo real entre italiano e inglés. Son veintiséis minutos de "ah, a esto se refieren con hablar con la IA como con un amigo". El modelo y las capacidades mostradas han seguido mejorando desde entonces.
Primeros pasos con IA
3 minutosDos GPT-4os interactuando y cantando
OpenAI. Dos instancias del modo de voz conversan entre sí, y una dispone de acceso a la cámara para describir la habitación. Dura tres minutos y es la forma más rápida de comprender qué diferencia al modo de voz de las antiguas interfaces de "pulsa el micrófono, espera y escucha": interrupciones, tono, música y visión en tiempo real, todo en un solo clip.
Primeros pasos con IA