← Artikel
Anleitung

KI-Stimme aus Text generieren: eine praktische Anleitung

Verwandle geschriebenen Text in natürliche Sprache: Füge dein Skript ein, wähle eine Stimme, beschreibe Ton und Tempo in einfachen Worten und exportiere eine Audiodatei.

Von Pipe2.ai · Aktualisiert July 24, 2026

Um in Pipe2.ai aus Text eine KI-Stimme zu generieren, öffne Audio Generator, füge das Skript ein, das gesprochen werden soll, wähle eine Stimme (oder belasse sie auf Auto) und beschreibe die Sprechweise – Ton, Akzent, Tempo, Emotion – im Feld Voice Instructions. Das Modell liest deinen Text in diesem Stil und liefert eine MP3, die du herunterladen oder über ein Video legen kannst. Es gibt keine Aufnahmesession und keinen Sprecher zu buchen; der geschriebene Text und eine kurze Stilnotiz sind die gesamte Eingabe.

Gegen den Live-Workflow geprüft, Juli 2026: Die Eingaben, die Anzahl der Stimmen, die Sprachabdeckung, das Verhalten der Stilsteuerung und das Ausgabeformat wurden nachfolgend mit der aktuellen Audio-Generator-Pipeline abgeglichen. Dieser Leitfaden geht nicht von Steuerelementen aus, die das Formular nicht anbietet.

In fünf Schritten ein Voice-over generieren

  1. Öffne den Audio Generator. Beginne mit der Audio-Generator-Pipeline. Sie nutzt Gemini 2.5 TTS mit 30 Stimmen in 73 Sprachen.
  2. Füge deinen Text ein. Gib die genauen Worte ein, die gesprochen werden sollen. Die Interpunktion ist hier wichtig – sie steuert die Pausen (siehe unten).
  3. Wähle eine Stimme. Belasse sie auf Auto, damit das Modell eine Stimme zu deiner Stilnotiz wählt, oder lege eine benannte Stimme fest (Zephyr, Puck, Kore und weitere), wenn du dieselbe Figur über mehrere Clips hinweg behalten möchtest.
  4. Beschreibe die Sprechweise. Schreibe in Voice Instructions, wie es klingen soll: „warmer britischer Akzent, langsames Tempo mit dramatischen Pausen“ oder „fröhlich und beschwingt, flott“. Das ist Anleitung in einfacher Sprache, keine numerischen Regler.
  5. Generiere und höre zu. Die Ausgabe ist eine MP3. Prüfe das Tempo sowie schwierige Namen oder Zahlen, passe den Text oder die Anweisung an und generiere bei Bedarf erneut.

Der Audio Generator nimmt Text, optional eine Stimme und optional eine Stilanweisung entgegen und liefert eine einzelne MP3. Die Audiolänge richtet sich nach der Länge des Textes – es gibt keine separate Dauersteuerung –, sodass das Skript selbst bestimmt, wie lang der Clip läuft.

Schreibe Text, den das Modell gut liest

Weil die Worte das Skript sind, verändern kleine Änderungen am Text das Ergebnis stärker als alles andere. Ein paar Gewohnheiten helfen:

  • Schreibe in kurzen, klaren Sätzen. Sie geben ein besseres Tempo als lange, verschachtelte Sätze und bieten dem Modell natürliche Stellen zum Atmen.
  • Nutze Interpunktion, um Pausen zu formen. Ein Punkt ist ein vollständiger Stopp, ein Komma eine kurze Pause und Auslassungspunkte eine längere. Setze Kommas dort, wo die Sprechweise langsamer werden soll.
  • Schreibe schwierige Wörter so, wie sie klingen, wenn ein Name, ein Akronym oder eine Zahl falsch gelesen wird, und generiere dann erneut.
  • Behalte eine Stimme pro Figur. Lege für einen wiederkehrenden Erzähler eine benannte Stimme fest, damit der Klang über die Clips hinweg gleich bleibt; nutze Auto, wenn du nur eine gute Übereinstimmung für ein einzelnes Stück brauchst.

Beschreibe für den Stil selbst Akzent, Emotion und Geschwindigkeit gemeinsam. Zum Beispiel:

Ruhiger, beruhigender Erzähler. Ein sanftes, unaufgeregtes Tempo mit klaren Pausen zwischen den Sätzen. Neutraler Akzent, warm, aber nicht übermäßig hell.

Googles Leitfaden zur Gemini-Sprachgenerierung empfiehlt diese Art natürlichsprachlicher Anleitung, statt zu versuchen, den Ton als Parameter zu kodieren. Die Stilsteuerung ist ausdrucksstark, aber nicht exakt; behandle die Anweisung daher als Orientierung und verfeinere sie nach dem Anhören.

Stimmen, Länge und die Grenzen, die man kennen sollte

Ein paar Verhaltensweisen sind leicht zu übersehen:

  • Die Länge folgt dem Text. Es gibt keinen Dauerregler; ein längeres Skript ergibt einen längeren Clip. Kürze oder erweitere die Worte, um die Laufzeit zu ändern.
  • Sehr lange Skripte werden in Abschnitte geteilt. Die Pipeline teilt langen Text, generiert jeden Teil und fügt sie zusammen, was an einer Nahtstelle einen leichten Übergang hinterlassen kann. Einen langen Text in natürliche Absätze zu gliedern, hilft.
  • Der Stil ist richtungsweisend, nicht präzise. Anweisungen steuern Ton und Tempo, treffen aber nicht in jedem Durchlauf eine exakte Emotion oder ein exaktes Timing; generiere lieber erneut, statt ein einziges festes Ergebnis zu erwarten.
  • Sie spricht, sie singt oder vertont nicht. Verwende für Musik oder ein instrumentales Klangbett den Music Generator; der Audio Generator kann nur Sprache.

Bringe das Voice-over in ein Video

Eine generierte Stimme ist am nützlichsten, wenn sie mit Bild verbunden ist. Der übliche Weg ist Audio Generator → Video Reel: Erstelle die Erzählung und füge sie dann über den Narration-Eingang von Video Reel hinzu, während die Hintergrundmusik auf ihrem eigenen Eingang bleibt, sodass Sprache und Musik gemischt werden und die Stimme im Vordergrund bleibt. Möchtest du zusätzlich ein Klangbett unter der Erzählung, generiere eines mit Music Generator und füge beides hinzu.

Den vollständigen Produktionsablauf – Einstellungen planen, Clips generieren, Erzählung und Musik hinzufügen, dann Untertitel und Branding – erklärt der Leitfaden KI-Videos erstellen. Um einen Soundtrack gegen Sprache auszubalancieren, siehe Musik zu einem Video hinzufügen, und um die Musik selbst zu generieren, siehe Musik mit KI generieren.

Bewahre das Skript, die generierte MP3 und jedes fertige Video als separate Assets auf. So kannst du eine Zeile neu vertonen oder die Sprechweise austauschen, ohne den Rest des Projekts neu aufzubauen.

Häufig gestellte Fragen

Wie generiert man aus Text eine KI-Stimme?

Füge dein Skript ein, wähle eine Stimme und beschreibe die gewünschte Sprechweise. Öffne in Pipe2.ai den Audio Generator, gib den Text ein, wähle eine Stimme oder belasse sie auf Auto und schreibe eine Stilanweisung wie „warm, unaufgeregt, wie ein Radiomoderator spät in der Nacht“. Das Modell liest den Text in diesem Stil und liefert eine MP3, die du herunterladen oder über ein Video legen kannst.

Wie viele Stimmen und Sprachen stehen zur Verfügung?

Der Audio Generator bietet 30 unterschiedliche Stimmen und deckt über Gemini 2.5 TTS 73 Sprachen ab. Belasse die Stimme auf Auto, damit das Modell eine passende zu deiner Stilanweisung wählt, oder lege eine benannte Stimme fest, wenn du dieselbe Figur über mehrere Clips hinweg behalten möchtest.

Kann ich Ton, Akzent und Tempo der Stimme steuern?

Ja, über das Feld Voice Instructions, in einfacher Sprache statt mit numerischen Parametern. Beschreibe Akzent, Emotion und Geschwindigkeit – zum Beispiel „ruhig und beruhigend, langsam mit klaren Pausen“. Auch die Interpunktion prägt die Sprechweise: Punkte erzeugen vollständige Stopps, Kommas kurze Pausen und Auslassungspunkte eine längere Pause.

Wie lang kann die generierte Sprache sein?

Die Audiolänge richtet sich nach der Länge deines Textes und nicht nach einer Dauer-Einstellung. Lange Skripte werden automatisch in Abschnitte aufgeteilt und wieder zusammengefügt, sodass sehr langer Text an den Nahtstellen leichte Übergänge haben kann. Kurze, klare Sätze halten das Tempo gleichmäßig.

Kann die KI-Stimme singen oder Soundeffekte erzeugen?

Nein. Der Audio Generator ist für gesprochene Text-to-Speech ausgelegt, nicht für Gesang oder musikalische Darbietung und nicht für Soundeffekte. Verwende für Hintergrundmusik oder einen Instrumentaltrack stattdessen den Music Generator; für ein Voice-over samt Musik in einem Video fügst du beides in Video Reel zusammen.

In Aktion sehen

Diese Pipelines ausprobieren

Ähnliche Artikel