Zurück zu den Pipelines

Audio-Generator

Verwandle Text in natürliche Sprache mit Dutzenden Stimmen, mehr als 70 Sprachen und individuellen Stilvorgaben für Tonfall, Akzent und Sprechtempo.

0.7
AI
Auto
Die KI wählt die beste Stimme anhand deiner Anweisungen und deines Textes
Oder wähle eine bestimmte Stimme...
Zephyr
F · Bright, Enthusiastic
Puck
M · Upbeat, Casual
Charon
M · Deep, Calm
Kore
F · Firm, Clear
Fenrir
M · Warm, Friendly
Leda
F · Youthful, Energetic
Orus
M · Firm, Casual
Aoede
F · Breezy, Professional
Callirrhoe
F · Easy-going, Friendly
Autonoe
F · Bright, Warm
Enceladus
M · Breathy, Confident
Iapetus
M · Clear, Professional
Umbriel
M · Easy-going, Resonant
Algieba
M · Smooth, Warm
Despina
F · Smooth, Warm
Erinome
F · Clear, Sophisticated
Algenib
M · Gravelly, Calm
Rasalgethi
M · Informative, Energetic
Laomedeia
F · Upbeat, Approachable
Achernar
F · Soft, Inviting
Alnilam
M · Firm, Optimistic
Schedar
M · Even, Casual
Gacrux
F · Mature, Engaging
Pulcherrima
M · Forward, Youthful
Achird
M · Friendly, Articulate
Zubenelgenubi
M · Casual, Deep
Vindemiatrix
F · Gentle, Smooth
Sadachbia
M · Lively, Resonant
Sadaltager
M · Knowledgeable, Calm
Sulafat
F · Warm, Enthusiastic

Noch erforderlich: Text

Läuft mit

API

Beispiele

AudioGemini 2.5 Flash TTS

Das ist Pyra: Voiceover

Gemini 2.5 Flash TTS. Pyras eigene Geschichte, gelesen mit warmer Erzählerstimme: ein Voiceover, das direkt in jedes Video passt.

Am besten für

  • Erzählung und Voiceover in mehr als 70 Sprachen
  • Text-to-Speech mit Stilsteuerung in natürlicher Sprache (z. B. „warm sprechen“, „flüstern“, „aufgeregter Ton“)
  • Inhalte mit mehreren Stimmen und Dutzenden ausdrucksstarken Stimmen
  • Mehrsprachige Skripte, die Sprache wird automatisch aus dem Text erkannt

Tipps

  • Schreibe Erzähltexte in kurzen, klaren Sätzen für ein besseres Sprechtempo
  • Nutze Satzzeichen, um Pausen zu steuern: Punkte für vollständige Stopps, Kommas für kurze Pausen, Auslassungspunkte für lange Pausen
  • Belasse die Stimme auf Auto, und die KI wählt eine passend zu den Stilanweisungen, oder fixiere eine bestimmte Stimme, wenn du einen wiederkehrenden Charakter möchtest
  • Nutze Stilhinweise in natürlicher Sprache: „langsam und dramatisch sprechen“, „fröhlich und schwungvoll“, „ruhig und beruhigend“

Artikel zu dieser Pipeline

Audio-Generator API

Rufen Sie diese Pipeline aus Ihrem eigenen Code auf. Eine Anfrage startet einen Lauf; das Modell ist ein Eingabefeld, kein eigener Endpunkt.

4 Eingaben
1 erforderlich
0.7 to 1.3 Credits
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "audio-generator",
  input: {
    text: "Welcome back to the show. Today we're talking about something a little strange.",
    model: "gemini-2-5-flash-tts",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="audio-generator",
    input={
        "text": "Welcome back to the show. Today we're talking about something a little strange.",
        "model": "gemini-2-5-flash-tts",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "text": "Welcome back to the show. Today we're talking about something a little strange.",
  "model": "gemini-2-5-flash-tts"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "audio-generator", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline audio-generator \
  --input-json '{"text": "Welcome back to the show. Today we're talking about something a little strange.", "model": "gemini-2-5-flash-tts"}' \
  --wait

API-Token holen →

Parameter

text erforderlich

Text, der in Sprache umgewandelt werden soll.

string
instructions

Beschreiben Sie Ton, Akzent, Tempo und Emotion. Die KI erstellt daraus einen ausdrucksstarken Stil-Prompt.

string
model

Voice engine to use. Leave unset to let Pipe2 pick the best available voice for your instructions.

gemini-2-5-flash-ttsgemini-2-5-pro-tts Standard gemini-2-5-flash-tts
Alle 4 Eingaben anzeigen
voice

Stimmenname aus Dutzenden verfügbaren, oder auto, damit die KI wählt.

autoZephyrPuckCharonKoreFenrirLedaOrusAoedeCallirrhoeAutonoeEnceladusIapetusUmbrielAlgiebaDespinaErinomeAlgenibRasalgethiLaomedeiaAchernarAlnilamSchedarGacruxPulcherrimaAchirdZubenelgenubiVindemiatrixSadachbiaSadaltagerSulafat Standard auto

Aus einem KI-Agenten heraus nutzen

Richten Sie einen beliebigen MCP-Client auf pipe2 aus, und Ihr Agent erhält diese Tools. Er findet diese Pipeline, liest dasselbe Schema von oben und führt sie aus.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Vollständige API-Referenz MCP-Einrichtung CLI-Referenz

KI-Text-to-Speech-Generator

Verwandle jeden Text in natürlich klingende Sprache mit Dutzenden Stimmen und mehr als 70 Sprachen. Steuere Tonfall, Akzent, Sprechtempo und Emotion über Anweisungen in normaler Sprache, produktionsreifer Voiceover in Sekunden.

Was du erstellen kannst

  • Dokumentarische Erzählung: autoritative, professionelle Stimmen
  • Podcast-Intros, -Outros, -Dialoge: Wiedergabe mit mehreren Charakteren
  • Mehrsprachige Voiceover: dasselbe Skript in mehr als 70 Sprachen abdecken
  • Hörbuch-Erzählung: emotionales Sprechtempo mit Regieanweisungen mitten im Satz
  • Barrierefreiheit: Textinhalte als Audio verfügbar machen

So funktioniert es

  1. Füge deinen Text ein: was gesprochen werden soll
  2. Wähle eine Stimme oder belasse es auf Auto: Auto wählt die beste Stimme anhand deines Texts und deiner Anweisungen
  3. Füge einen Stilhinweis hinzu (optional), beschreibe Akzent, Tempo, Emotion: „warmer britischer Akzent, langsames Tempo mit dramatischen Pausen“
  4. Wähle ein Modell: Flash TTS für schnelle Entwürfe, Pro TTS für studiotaugliche Prosodie bei der finalen Ausgabe

Stiltipps

  • Schreibe Erzähltexte in kurzen, klaren Sätzen für ein besseres Sprechtempo
  • Nutze Satzzeichen, um Pausen zu steuern, Punkte für vollständige Stopps, Kommas für kurze Pausen, Auslassungspunkte für lange Pausen
  • Stilhinweise nehmen normale Sprache an: „langsam und dramatisch sprechen“, „fröhlich und schwungvoll“, „ruhig und beruhigend“

Häufig gestellte Fragen

Welche Stimmen sind verfügbar?
Dutzende ausdrucksstarke Stimmen von hell über tief, warm und fest bis dramatisch. Jede reagiert auf Stilanweisungen in normaler Sprache für Tonfall und Wiedergabe.
Welche Sprachen werden unterstützt?
Mehr als 70 Sprachen mit automatischer Erkennung. Von großen Sprachen wie Englisch, Chinesisch, Japanisch und Spanisch bis zu regionalen Sprachen wie Cebuano, Konkani und Luxemburgisch.
Wie funktionieren Anweisungen?
Beschreibe in normaler Sprache, wie die Stimme klingen soll. Zum Beispiel: „Ein 40-jähriger britischer Journalist, der langsam spricht und bei wichtigen Punkten dramatische Pausen macht.“ Die KI interpretiert deine Anweisung und gestaltet die stimmliche Darbietung.
In welchem Audioformat wird ausgegeben?
MP3, bereit zum Download oder zur Verkettung in Pipelines wie Video Reel als Erzählspur.
Welches Modell sollte ich wählen?
Flash TTS ist der günstigere, schnellere Weg, ideal für Entwürfe, kurze Clips und Iteration. Pro TTS nutzt ein hochwertigeres Modell mit stärkerer Prosodie und besserem Sprechtempo, wähle es für Erzählungen in Produktionsqualität. Beide rendern in Sekunden; Pro dauert einen Moment länger.
Wie viele Credits kostet es?
0.7 to 1.3 Credits je nach Modell, Flash TTS ist die günstigere Option und Pro TTS kostet etwas mehr. Ergebnisse sind in Sekunden fertig.

Weitere Pipelines entdecken

Alle ansehen →
Video-Generator
from 9.5
Video-Generator
Bild-Generator
0.2-6.4
Bild-Generator
Musik-Generator
2.5-45.1
Musik-Generator
Video-Editor
13.1-29.8
Video-Editor