Sprachgenerator

Ab 0.002 Credits

Verwandeln Sie Text in natürlich klingende Sprachaufnahmen – mit 30 Stimmen in 73 Sprachen und frei formulierbaren Vorgaben für Tonfall, Akzent und Sprechtempo.

Erstelle dein erstes Voiceover

Schreib, was du sagen möchtest, oder hör dir ein Beispiel an.

Gemini 3.8 Flash TTS
Gemini 3.8 Flash-Lite TTS
Eleven v4
Zum Generieren ausfüllen

Enter the exact words to speak; Gemini reads them as written. Add sounds or pauses where they happen in angle brackets, such as <laugh>, <sigh>, or <short pause>, and capitalize a word to stress it.

Beispiele

Das ist Pyra: Voiceover

Gemini 3.8 Flash TTS. Pyras eigene Geschichte, gelesen mit warmer Erzählerstimme: ein Voiceover, das direkt in jedes Video passt.

So verwendest du Sprachgenerator

Eine kompakte Entscheidungshilfe zur Einordnung dieser Pipeline in einen Workflow.

Am besten für

  • Sprechertexte und Voice-overs in mehr als 70 Sprachen
  • Text-to-Speech mit frei formulierbaren Stilvorgaben, etwa „warm sprechen“, „flüstern“ oder „aufgeregt klingen“
  • Dialoge und andere Inhalte mit mehreren ausdrucksstarken Stimmen
  • Mehrsprachige Skripte mit automatischer Spracherkennung

Tipps

  • Kurze, klare Sätze sorgen für ein natürlicheres Sprechtempo
  • Steuere Pausen mit Satzzeichen: Punkte für deutliche Stopps, Kommas für kurze und Auslassungspunkte für längere Pausen
  • Lass die Stimme auf Auto, damit die KI eine passende Stimme auswählt; lege eine bestimmte Stimme fest, wenn eine wiederkehrende Figur immer gleich klingen soll
  • Formuliere Stilwünsche ganz normal: „langsam und dramatisch sprechen“, „fröhlich und schwungvoll“, „ruhig und beruhigend“

Sprachgenerator API

Rufen Sie diese Pipeline aus Ihrem eigenen Code auf. Eine Anfrage startet einen Lauf; das Modell ist ein Eingabefeld, kein eigener Endpunkt.

API-Token holen
Eingaben
5
erforderlich
1
Preise
0.002 to 40.0 Credits
Sprache
Sprache
bun add @pipe2-ai/sdk
Pipeline ausführen
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-3-8-flash-tts",
  },
});

pip install pipe2
Pipeline ausführen
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-3-8-flash-tts",
    },
))

go get github.com/pipe2-ai/sdk-go
Pipeline ausführen
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-3-8-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
Pipeline ausführen
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-3-8-flash-tts"}' \
  --wait

Vollständige API-Referenz CLI-Referenz

Häufig gestellte Fragen

Welche Stimmen sind verfügbar?
Zur Wahl stehen Dutzende ausdrucksstarke Stimmen – von hell und warm bis tief, bestimmt oder dramatisch. Tonfall und Vortragsweise lassen sich jeweils mit frei formulierten Anweisungen steuern.
Welche Sprachen werden unterstützt?
Mehr als 70 Sprachen werden automatisch erkannt. Dazu zählen große Sprachen wie Englisch, Chinesisch, Japanisch und Spanisch ebenso wie Regionalsprachen, etwa Cebuano, Konkani und Luxemburgisch.
Wie funktionieren die Anweisungen?
Beschreibe einfach, wie die Stimme klingen soll, zum Beispiel: „Ein 40-jähriger britischer Journalist, der langsam spricht und wichtige Punkte mit dramatischen Pausen betont.“ Die KI setzt diese Vorgabe in eine passende Sprechweise um.
In welchem Audioformat wird ausgegeben?
Du erhältst eine MP3-Datei, die du direkt herunterladen oder beispielsweise in Video Reel als Sprechertrack weiterverwenden kannst.
Welches Modell sollte ich wählen?
Gemini 3.8 Flash-Lite TTS ist am schnellsten und günstigsten und eignet sich für Entwürfe und kurze Clips. Gemini 3.8 Flash TTS liefert Sprechertexte in Studioqualität in über 130 Sprachen. Eleven v4 ist am ausdrucksstärksten und lacht, seufzt oder flüstert an den markierten Stellen. MiniMax Speech 2.8 Turbo und HD sind eine schnelle und eine hochwertigere Alternative. Alle liefern in Sekunden eine MP3-Datei.
Wie viele Credits kostet es?
Je nach Modell und Textlänge kostet die Generierung 0.002 to 40.0 Credits. Gemini-Modelle berechnen nur das tatsächlich erzeugte Audio. Das Ergebnis ist in Sekunden fertig.

KI-Sprachgenerator für Text-to-Speech

Verwandle beliebige Texte in natürlich klingende Sprache – mit Dutzenden Stimmen und mehr als 70 Sprachen. Tonfall, Akzent, Tempo und Emotion steuerst du mit einfachen Anweisungen. So entsteht in Sekunden ein sendefertiges Voice-over.

Was du erstellen kannst

  • Dokumentarische Sprechertexte: souveräne, professionelle Stimmen
  • Podcast-Intros, -Outros und Dialoge: verschiedene Stimmen für mehrere Rollen
  • Mehrsprachige Voice-overs: dasselbe Skript in mehr als 70 Sprachen vertonen
  • Hörbücher: lebendige Betonung und Regiehinweise mitten im Satz
  • Barrierefreiheit: Textinhalte als Audio verfügbar machen

So funktioniert es

  1. Text einfügen: Gib ein, was gesprochen werden soll
  2. Stimme auswählen oder Auto verwenden: Im Auto-Modus wird passend zu Text und Anweisungen eine Stimme gewählt
  3. Optional den Stil beschreiben: etwa Akzent, Tempo oder Emotion – „warmer britischer Akzent, langsames Tempo mit dramatischen Pausen“
  4. Modell auswählen: Gemini 3.8 Flash-Lite TTS für schnelle, günstige Entwürfe, Gemini 3.8 Flash TTS für Sprechertexte in Studioqualität, Eleven v4 für den ausdrucksstärksten Vortrag oder MiniMax Speech 2.8

Stiltipps

  • Kurze, klare Sätze sorgen für ein natürlicheres Sprechtempo
  • Steuere Pausen mit Satzzeichen: Punkte für deutliche Stopps, Kommas für kurze und Auslassungspunkte für längere Pausen
  • Formuliere Stilwünsche ganz normal: „langsam und dramatisch sprechen“, „fröhlich und schwungvoll“, „ruhig und beruhigend“

Weitere Pipelines entdecken

Videogenerator
from 9.5
Videogenerator
Bildgenerator
0.2-6.7
Bildgenerator
Musikgenerator
2.5-22.6
Musikgenerator
Videobearbeitung
from 9.5
Videobearbeitung