3:25OpenAI
Zwei Instanzen des Sprachmodus sprechen miteinander; eine davon kann per Kamera den Raum erfassen und beschreiben. Der dreiminütige Clip zeigt besonders effizient, was den Sprachmodus von früheren Oberflächen nach dem Muster „Mikrofon drücken, warten, zuhören“ unterscheidet: Unterbrechungen, Tonfall, Musik und Bildverarbeitung in Echtzeit.
Was Sie aus diesem Video mitnehmen sollten: Sie erleben multimodale Sprachinteraktion in kurzer Form, insbesondere Unterbrechungen, Tonfall und kameragestützte Gespräche.
Das sollten Sie zuerst ansehen oder wissen: Sie wissen, dass das Verhalten einer Demo von dem Produkt, der Region und dem Kontotarif abweichen kann, die Ihnen tatsächlich zur Verfügung stehen.
Hinweis von AI Expert: Nutzen Sie den Clip nur für ein schnelles intuitives Verständnis. Er ist kein Nachweis dafür, dass ein produktiver Sprachagent reale Nutzer ohne Offenlegung, klare Protokollierungsgrenzen, Rückfallverfahren und Eskalation an Menschen sicher bedienen kann.
