7 / 3591

Google Gemini 3.8 Flash TTS klont Stimmen aus 30 Sekunden Audio

TL;DR

Mit den Gemini 3.8 Flash TTS-Modellen bringt Google neue Funktionen in die Sprachsynthese, darunter Voice Cloning, Stilsteuerung und Unterstützung für viele Sprachen. Für das Klonen einer Stimme reichen laut Bericht 30 Sekunden Audio. Die Modelle zielen auf ganz unterschiedliche Einsätze, von ausdrucksstarken Hörbüchern bis zu Massenaufgaben wie Dubbing und Voice Agents. Flash TTS setzt dabei vor allem auf lebendige, ausdrucksstarke Ausgaben fürs Storytelling.

Nauti's Take

Voice Cloning aus 30 Sekunden Audio senkt die Kosten für Hörbücher, Dubbing und Voice Agents deutlich, das ist ein echter Vorteil für kleine Teams. Das Risiko wächst im selben Tempo: Je leichter sich Stimmen kopieren lassen, desto einfacher werden Betrugsanrufe und gefälschte Sprachnachrichten.

Wer Gemini TTS produktiv nutzt, sollte Einwilligungen der Sprecher sauber dokumentieren und Hinweise auf synthetische Stimmen einplanen.

Video

Quellen