Två GPT-4o-modeller interagerar och sjunger

3 minuterNy inom AIGrundläggandeOpenAIChatGPT och LLM:er

OpenAI. Två instanser av röstläget pratar med varandra, varav den ena har tillgång till en kamera för att beskriva rummet. Den är tre minuter lång och det effektivaste sättet att få en intuitiv förståelse för vad som skiljer röstläget från äldre gränssnitt där man ”trycker på mikrofonen, väntar och lyssnar” – avbrott, tonfall, musik och bildtolkning i realtid, allt i ett enda klipp.

Anteckning från AI Expert

Använd bara det här som en kort tankeväckare. Betrakta det inte som belägg för att en röstagent i produktion kan hantera verkliga användare på ett säkert sätt utan tydlig information, avgränsningar för loggning, reservrutiner och eskalering till en människa.

Vad du bör få ut av detta

Få snabbt se multimodal röstinteraktion, särskilt avbrott, tonfall och samtal där kamerabilden används.

Titta på eller ha koll på först

Var medveten om att beteendet i en demonstration kan skilja sig från den produkt, region och kontonivå som är tillgänglig för dig.

Senast granskad: 18 maj 2026

Se nästa

Fortsätt längs samma lärstig med nästa kurerade kompletterande video.