Zwei GPT-4os interagieren und singen

3 MinutenNeu bei KIGrundlagenOpenAIChatGPT & große Sprachmodelle

OpenAI. Zwei Instanzen des Sprachmodus sprechen miteinander; eine davon kann per Kamera den Raum erfassen und beschreiben. Der dreiminütige Clip zeigt besonders effizient, was den Sprachmodus von früheren Oberflächen nach dem Muster „Mikrofon drücken, warten, zuhören“ unterscheidet: Unterbrechungen, Tonfall, Musik und Bildverarbeitung in Echtzeit.

Hinweis von AI Expert

Nutzen Sie den Clip nur für ein schnelles intuitives Verständnis. Er ist kein Nachweis dafür, dass ein produktiver Sprachagent reale Nutzer ohne Offenlegung, klare Protokollierungsgrenzen, Rückfallverfahren und Eskalation an Menschen sicher bedienen kann.

Was Sie aus diesem Video mitnehmen sollten

Sie erleben multimodale Sprachinteraktion in kurzer Form, insbesondere Unterbrechungen, Tonfall und kameragestützte Gespräche.

Das sollten Sie zuerst ansehen oder wissen

Sie wissen, dass das Verhalten einer Demo von dem Produkt, der Region und dem Kontotarif abweichen kann, die Ihnen tatsächlich zur Verfügung stehen.

Zuletzt geprüft: 14. Aug. 2026

Nächste Videos ansehen

Fahren Sie mit demselben Lernpfad fort und sehen Sie die nächsten kuratierten Begleitvideos.