Sprachgenerator

Ab 0.002 Credits

Verwandeln Sie Text in natürlich klingende Sprachaufnahmen – mit 30 Stimmen in 73 Sprachen und frei formulierbaren Vorgaben für Tonfall, Akzent und Sprechtempo.

AI
Auto
Die KI wählt die beste Stimme anhand deiner Anweisungen und deines Textes
Oder wähle eine bestimmte Stimme...
Zephyr
F · Bright, Enthusiastic
Puck
M · Upbeat, Casual
Charon
M · Deep, Calm
Kore
F · Firm, Clear
Fenrir
M · Warm, Friendly
Leda
F · Youthful, Energetic
Orus
M · Firm, Casual
Aoede
F · Breezy, Professional
Callirrhoe
F · Easy-going, Friendly
Autonoe
F · Bright, Warm
Enceladus
M · Breathy, Confident
Iapetus
M · Clear, Professional
Umbriel
M · Easy-going, Resonant
Algieba
M · Smooth, Warm
Despina
F · Smooth, Warm
Erinome
F · Clear, Sophisticated
Algenib
M · Gravelly, Calm
Rasalgethi
M · Informative, Energetic
Laomedeia
F · Upbeat, Approachable
Achernar
F · Soft, Inviting
Alnilam
M · Firm, Optimistic
Schedar
M · Even, Casual
Gacrux
F · Mature, Engaging
Pulcherrima
M · Forward, Youthful
Achird
M · Friendly, Articulate
Zubenelgenubi
M · Casual, Deep
Vindemiatrix
F · Gentle, Smooth
Sadachbia
M · Lively, Resonant
Sadaltager
M · Knowledgeable, Calm
Sulafat
F · Warm, Enthusiastic

Noch erforderlich: Text

Beispiele

AudioGemini 2.5 Flash TTS

Das ist Pyra: Voiceover

Gemini 2.5 Flash TTS. Pyras eigene Geschichte, gelesen mit warmer Erzählerstimme: ein Voiceover, das direkt in jedes Video passt.

So verwendest du Sprachgenerator

Eine kompakte Entscheidungshilfe zur Einordnung dieser Pipeline in einen Workflow.

Am besten für

  • Sprechertexte und Voice-overs in mehr als 70 Sprachen
  • Text-to-Speech mit frei formulierbaren Stilvorgaben, etwa „warm sprechen“, „flüstern“ oder „aufgeregt klingen“
  • Dialoge und andere Inhalte mit mehreren ausdrucksstarken Stimmen
  • Mehrsprachige Skripte mit automatischer Spracherkennung

Tipps

  • Kurze, klare Sätze sorgen für ein natürlicheres Sprechtempo
  • Steuere Pausen mit Satzzeichen: Punkte für deutliche Stopps, Kommas für kurze und Auslassungspunkte für längere Pausen
  • Lass die Stimme auf Auto, damit die KI eine passende Stimme auswählt; lege eine bestimmte Stimme fest, wenn eine wiederkehrende Figur immer gleich klingen soll
  • Formuliere Stilwünsche ganz normal: „langsam und dramatisch sprechen“, „fröhlich und schwungvoll“, „ruhig und beruhigend“

Sprachgenerator API

Rufen Sie diese Pipeline aus Ihrem eigenen Code auf. Eine Anfrage startet einen Lauf; das Modell ist ein Eingabefeld, kein eigener Endpunkt.

API-Token holen
Eingaben
5
erforderlich
1
Preise
0.002 to 40.0 Credits
Sprache
Sprache
bun add @pipe2-ai/sdk
Pipeline ausführen
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-2-5-flash-tts",
  },
});

pip install pipe2
Pipeline ausführen
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-2-5-flash-tts",
    },
))

go get github.com/pipe2-ai/sdk-go
Pipeline ausführen
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-2-5-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
Pipeline ausführen
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-2-5-flash-tts"}' \
  --wait

Vollständige API-Referenz CLI-Referenz

Häufig gestellte Fragen

Welche Stimmen sind verfügbar?
Zur Wahl stehen Dutzende ausdrucksstarke Stimmen – von hell und warm bis tief, bestimmt oder dramatisch. Tonfall und Vortragsweise lassen sich jeweils mit frei formulierten Anweisungen steuern.
Welche Sprachen werden unterstützt?
Mehr als 70 Sprachen werden automatisch erkannt. Dazu zählen große Sprachen wie Englisch, Chinesisch, Japanisch und Spanisch ebenso wie Regionalsprachen, etwa Cebuano, Konkani und Luxemburgisch.
Wie funktionieren die Anweisungen?
Beschreibe einfach, wie die Stimme klingen soll, zum Beispiel: „Ein 40-jähriger britischer Journalist, der langsam spricht und wichtige Punkte mit dramatischen Pausen betont.“ Die KI setzt diese Vorgabe in eine passende Sprechweise um.
In welchem Audioformat wird ausgegeben?
Du erhältst eine MP3-Datei, die du direkt herunterladen oder beispielsweise in Video Reel als Sprechertrack weiterverwenden kannst.
Welches Modell sollte ich wählen?
Flash TTS ist günstiger und schneller und eignet sich gut für Entwürfe, kurze Clips und mehrere Varianten. Pro TTS bietet feinere Prosodie und ein natürlicheres Tempo für professionelle Sprechertexte. Beide liefern in Sekunden; Pro benötigt etwas länger.
Wie viele Credits kostet es?
Je nach Modell kostet die Generierung 0.002 to 40.0 Credits. Flash TTS ist günstiger, Pro TTS etwas teurer; beide liefern das Ergebnis in Sekunden.

KI-Sprachgenerator für Text-to-Speech

Verwandle beliebige Texte in natürlich klingende Sprache – mit Dutzenden Stimmen und mehr als 70 Sprachen. Tonfall, Akzent, Tempo und Emotion steuerst du mit einfachen Anweisungen. So entsteht in Sekunden ein sendefertiges Voice-over.

Was du erstellen kannst

  • Dokumentarische Sprechertexte: souveräne, professionelle Stimmen
  • Podcast-Intros, -Outros und Dialoge: verschiedene Stimmen für mehrere Rollen
  • Mehrsprachige Voice-overs: dasselbe Skript in mehr als 70 Sprachen vertonen
  • Hörbücher: lebendige Betonung und Regiehinweise mitten im Satz
  • Barrierefreiheit: Textinhalte als Audio verfügbar machen

So funktioniert es

  1. Text einfügen: Gib ein, was gesprochen werden soll
  2. Stimme auswählen oder Auto verwenden: Im Auto-Modus wird passend zu Text und Anweisungen eine Stimme gewählt
  3. Optional den Stil beschreiben: etwa Akzent, Tempo oder Emotion – „warmer britischer Akzent, langsames Tempo mit dramatischen Pausen“
  4. Modell auswählen: Flash TTS für schnelle Entwürfe, Pro TTS für besonders natürliche Betonung in der finalen Fassung

Stiltipps

  • Kurze, klare Sätze sorgen für ein natürlicheres Sprechtempo
  • Steuere Pausen mit Satzzeichen: Punkte für deutliche Stopps, Kommas für kurze und Auslassungspunkte für längere Pausen
  • Formuliere Stilwünsche ganz normal: „langsam und dramatisch sprechen“, „fröhlich und schwungvoll“, „ruhig und beruhigend“

Weitere Pipelines entdecken

Videogenerator
from 9.5
Videogenerator
Bildgenerator
0.2-6.4
Bildgenerator
Musikgenerator
2.5-22.6
Musikgenerator
Videobearbeitung
13.1-33.3
Videobearbeitung