Voice & Audio
Voice mode, audio generation, translation, cloning risks, and voice agents.
8 historier (3 artikler · 5 videoer)
Start her
Et par gode steder at begynde, før du går på opdagelse i hele oversigten.
7 min læsningChatGPT Voice Mode: tal med AI som med en ven
Det føles mærkeligt at tale med AI i cirka halvandet minut. Derefter bliver det den mest naturlige grænseflade, der findes. En praktisk guide til Voice Mode — hvad funktionen er god til, hvad den er mindre god til, og hvordan du rent faktisk bruger den.
Ny inden for AI
7 min læsningAI-stemme og lyd: fra kloning og podcasts til oversættelse
En oversigt over stemmekloning, indtaling, transskription og oversættelse med klare grænser for samtykke, oplysning, databeskyttelse og kontrol.
BegynderFlere i dette emne
6 minutterAI-stemmeagenter: sådan fungerer de egentlig, og derfor lyder de så menneskelige
CX Foundation. Bryder voice-agenter ned til den praktiske pipeline: talegenkendelse, sprogmodel, business-system-API'er, text-to-speech og håndtering af afbrydelser. Det giver artiklens rollout-ramme et konkret teknisk fundament, før læseren vælger Twilio, Retell, Vapi, LiveKit eller en anden platform.
Avanceret
9 min læsningStemmeagenter i kundeforløb: hvor de virker, og hvor de svigter
Stemmeagenter er nyttige, når forløbet er afgrænset, dataene er tilgængelige, og reserveløsningen er klar. Et praktisk beslutningsgrundlag for Twilio-/Retell-lignende systemer, oplysning, overførsel, test og udrulning.
Avanceret
11 minutterSådan kloner du din stemme med AI — realistiske AI-stemmekloner (fuld tutorial)
ElevenLabs. Officiel gennemgang, der kontrasterer Instant Voice Cloning (et minut lyd, resultater på sekunder) med Professional Voice Cloning (30 minutter til flere timers lyd, langt højere fidelity). Vejledningen om optagekvalitet — mikrofon, rum, niveauer, forbehandling — er den del, der er sværest at finde andre steder, og betyder mest for at få en klon, du faktisk vil bruge.
Begynder
16 minutterSådan bruger du ElevenLabs — bedste text-to-speech AI-stemmer (FULDGUIDE)
Alec Wilcock. Tour af den platform, der forankrer de fleste af artiklens eksempler — text-to-speech, speech-to-speech, voice design og stemmekloning, alt i én skærmoptaget gennemgang. Gennemgår gratis-kontra-betalt-grænser og de kontroller, der faktisk betyder noget (stability, similarity, style), uden at oversælge.
Begynder
26 minutterIntroduktion af GPT-4o
OpenAI. Det er keynoten fra maj 2024, hvor ChatGPT's realtidsstemmetilstand første gang blev demonstreret. Mark Chen laver vejrtrækningsøvelsesdemoen, Barrett Zoph laver matematutor-demoen, og derefter skifter de til realtidsoversættelse mellem italiensk og engelsk. Seksogtyve minutter af "nå, det er det, de mener med at tale med AI som med en ven." Modellen og evnerne, der vises, er kun blevet bedre siden.
Ny inden for AI
3 minutterTo GPT-4o'er interagerer og synger
OpenAI. To instanser af stemmetilstand taler med hinanden, hvoraf den ene har kameraadgang til at beskrive rummet. Tre minutter lang og den mest effektive måde at indarbejde, hvad der gør stemmetilstand anderledes end gamle "tryk på mikrofonen, vent, lyt"-grænseflader — afbrydelse, tone, musik, realtidsvision, alt i ét klip.
Ny inden for AI