Dos GPT-4os interactuando y cantando

3 minutosPrimeros pasos con IAFundamentosOpenAIChatGPT y LLM

OpenAI. Dos instancias del modo de voz conversan entre sí, y una dispone de acceso a la cámara para describir la habitación. Dura tres minutos y es la forma más rápida de comprender qué diferencia al modo de voz de las antiguas interfaces de "pulsa el micrófono, espera y escucha": interrupciones, tono, música y visión en tiempo real, todo en un solo clip.

Nota de AI Expert

Consérvalo solo como demostración breve para formarte una intuición. No demuestra que un agente de voz en producción pueda atender con seguridad a usuarios reales sin avisos transparentes, límites de registro, mecanismos de contingencia y derivación a una persona.

Qué aprenderás

Verás rápidamente cómo funciona una interacción de voz multimodal, sobre todo las interrupciones, el tono y una conversación que utiliza la cámara.

Qué ver o saber antes

Saber que el comportamiento de una demostración puede diferir según el producto, la región y el plan de cuenta disponibles.

Última revisión: 18 may 2026

Ver siguiente

Continúa por el mismo itinerario de aprendizaje con los siguientes vídeos complementarios seleccionados.