Thema

Sprache und Audio

Sprachmodus, Audiogenerierung, Übersetzung, Risiken des Stimmenklonens und Sprachagenten.

8 Beiträge (3 Artikel · 5 Videos)

Hier beginnen

Einige gute Beiträge für den Einstieg, bevor Sie die vollständige Übersicht durchsuchen.

Weitere in diesem Thema

6 Minuten
Video

KI-Sprachagenten: Wie sie wirklich funktionieren und warum sie so menschlich klingen

CX Foundation. Das Video zerlegt Sprachagenten in eine praktische Pipeline aus Spracherkennung, Sprachmodell, APIs der Geschäftssysteme, Sprachsynthese und Unterbrechungsbehandlung. Damit erhält das Einführungsmodell des Artikels eine konkrete technische Grundlage, bevor Leser Twilio, Retell, Vapi, LiveKit oder eine andere Plattform auswählen.

Fortgeschritten
9 Min. Lesezeit
Artikel

Voice-Agenten für Kundenprozesse: Wo sie funktionieren und wo sie scheitern

Voice-Agenten sind sinnvoll, wenn der Ablauf klar begrenzt ist, die Daten verfügbar sind und die Übergabe zuverlässig funktioniert. Ein praktischer Entscheidungsrahmen für Systeme im Stil von Twilio und Retell sowie für Offenlegung, Übergabe, Tests und Rollout.

Fortgeschritten
11 Minuten
Video

Wie man mit KI seine Stimme kloniert — realistische KI-Stimmenklone (Voll-Tutorial)

ElevenLabs. Offizielle Anleitung, die Instant Voice Cloning (eine Minute Audiomaterial, Ergebnisse in Sekunden) mit Professional Voice Cloning (30 Minuten bis mehrere Stunden Audiomaterial, deutlich höhere Wiedergabetreue) vergleicht. Die Hinweise zur Aufnahmequalität — Mikrofon, Raum, Pegel und Vorverarbeitung — sind andernorts besonders schwer zu finden und für einen tatsächlich nutzbaren Stimmenklon am wichtigsten.

Einsteiger
16 Minuten
Video

Wie man ElevenLabs verwendet — beste Text-zu-Sprache-KI-Stimmen (VOLLER LEITFADEN)

Alec Wilcock. Ein Rundgang durch die Plattform, auf der die meisten Beispiele des Artikels beruhen — Text-zu-Sprache, Sprache-zu-Sprache, Stimmgestaltung und Stimmenklonung, alles in einer Bildschirmaufzeichnung. Erklärt die Unterschiede zwischen kostenlosem und kostenpflichtigem Angebot sowie die wirklich relevanten Steuerungsoptionen (Stabilität, Ähnlichkeit, Stil), ohne zu viel zu versprechen.

Einsteiger
26 Minuten
Video

Einführung in GPT-4o

OpenAI. Dies ist die Keynote vom Mai 2024, in der ChatGPTs Echtzeit-Sprachmodus erstmals demonstriert wurde. Mark Chen zeigt die Atemübung, Barrett Zoph die Mathematik-Nachhilfe; anschließend wechseln sie zur Echtzeitübersetzung zwischen Italienisch und Englisch. In 26 Minuten wird anschaulich, was mit „Mit KI wie mit einem Freund sprechen“ gemeint ist. Das gezeigte Modell und seine Fähigkeiten wurden seither nur verbessert.

Neu bei KI
3 Minuten
Video

Zwei GPT-4os interagieren und singen

OpenAI. Zwei Instanzen des Sprachmodus sprechen miteinander; eine davon kann per Kamera den Raum erfassen und beschreiben. Der dreiminütige Clip zeigt besonders effizient, was den Sprachmodus von früheren Oberflächen nach dem Muster „Mikrofon drücken, warten, zuhören“ unterscheidet: Unterbrechungen, Tonfall, Musik und Bildverarbeitung in Echtzeit.

Neu bei KI