Emne

Voice & Audio

Voice mode, audio generation, translation, cloning risks, and voice agents.

8 historier (3 artikler · 5 videoer)

Start her

Et par gode steder at begynde, før du går på opdagelse i hele oversigten.

Flere i dette emne

6 minutter
Video

AI-stemmeagenter: sådan fungerer de egentlig, og derfor lyder de så menneskelige

CX Foundation. Bryder voice-agenter ned til den praktiske pipeline: talegenkendelse, sprogmodel, business-system-API'er, text-to-speech og håndtering af afbrydelser. Det giver artiklens rollout-ramme et konkret teknisk fundament, før læseren vælger Twilio, Retell, Vapi, LiveKit eller en anden platform.

Avanceret
9 min læsning
Artikel

Stemmeagenter i kundeforløb: hvor de virker, og hvor de svigter

Stemmeagenter er nyttige, når forløbet er afgrænset, dataene er tilgængelige, og reserveløsningen er klar. Et praktisk beslutningsgrundlag for Twilio-/Retell-lignende systemer, oplysning, overførsel, test og udrulning.

Avanceret
11 minutter
Video

Sådan kloner du din stemme med AI — realistiske AI-stemmekloner (fuld tutorial)

ElevenLabs. Officiel gennemgang, der kontrasterer Instant Voice Cloning (et minut lyd, resultater på sekunder) med Professional Voice Cloning (30 minutter til flere timers lyd, langt højere fidelity). Vejledningen om optagekvalitet — mikrofon, rum, niveauer, forbehandling — er den del, der er sværest at finde andre steder, og betyder mest for at få en klon, du faktisk vil bruge.

Begynder
16 minutter
Video

Sådan bruger du ElevenLabs — bedste text-to-speech AI-stemmer (FULDGUIDE)

Alec Wilcock. Tour af den platform, der forankrer de fleste af artiklens eksempler — text-to-speech, speech-to-speech, voice design og stemmekloning, alt i én skærmoptaget gennemgang. Gennemgår gratis-kontra-betalt-grænser og de kontroller, der faktisk betyder noget (stability, similarity, style), uden at oversælge.

Begynder
26 minutter
Video

Introduktion af GPT-4o

OpenAI. Det er keynoten fra maj 2024, hvor ChatGPT's realtidsstemmetilstand første gang blev demonstreret. Mark Chen laver vejrtrækningsøvelsesdemoen, Barrett Zoph laver matematutor-demoen, og derefter skifter de til realtidsoversættelse mellem italiensk og engelsk. Seksogtyve minutter af "nå, det er det, de mener med at tale med AI som med en ven." Modellen og evnerne, der vises, er kun blevet bedre siden.

Ny inden for AI
3 minutter
Video

To GPT-4o'er interagerer og synger

OpenAI. To instanser af stemmetilstand taler med hinanden, hvoraf den ene har kameraadgang til at beskrive rummet. Tre minutter lang og den mest effektive måde at indarbejde, hvad der gør stemmetilstand anderledes end gamle "tryk på mikrofonen, vent, lyt"-grænseflader — afbrydelse, tone, musik, realtidsvision, alt i ét klip.

Ny inden for AI