Torna alle pipeline

Trascrizione

Trascrivi in testo qualsiasi file video o audio. Timestamp, rilevamento dei parlanti e supporto per oltre 99 lingue.

ModelloElevenLabs Scribe v2
0.8

0 – 20

Sostituzioni opzionali su interi termini applicate all'SRT e al TXT generati, utili quando il riconoscitore fraintende una parola specifica (un nome, un acronimo, un termine di settore) e la scrive sempre nello stesso modo errato. Ogni chiave è la parola così come trascritta; il valore è l'ortografia corretta. Sensibile alle maiuscole; le corrispondenze devono allinearsi a parole intere. Lascia vuoto per consegnare la trascrizione esattamente come scritta dal riconoscitore.

Ancora necessario: File video o audio

Funziona con

API

Ricette che usano questo pipeline

Articoli su questo pipeline

API di Trascrizione

Richiama questa pipeline dal tuo codice. Una richiesta avvia un'esecuzione; il modello è un campo di input, non un endpoint separato.

5 input
1 obbligatorio
from 0.8 crediti
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "transcription",
  input: {
    source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="transcription",
    input={
        "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline transcription \
  --input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
  --wait

Ottieni un token API →

Parametri

source_asset_id obbligatorio

Audio or video to transcribe. Asset id returned by an upload. See /docs/api/ for the upload flow.

string
corrections

Sostituzioni opzionali su interi termini applicate all'SRT e al TXT generati, utili quando il riconoscitore fraintende una parola specifica (un nome, un acronimo, un termine di settore) e la scrive sempre nello stesso modo errato. Ogni chiave è la parola così come trascritta; il valore è l'ortografia corretta. Sensibile alle maiuscole; le corrispondenze devono allinearsi a parole intere. Lascia vuoto per consegnare la trascrizione esattamente come scritta dal riconoscitore.

object predefinito [object Object]
diarize

Label who is speaking. Turn on for interviews and multi-speaker recordings.

boolean predefinito false
Mostra tutti i 5 input
language_code

Spoken language. Leave unset to detect it from the audio.

autoenesptfrdehiarjakozh predefinito auto
num_speakers

How many speakers to expect. Leave unset to detect automatically.

integer predefinito 0

Usala da un agente IA

Punta un qualsiasi client MCP su pipe2 e il tuo agente ottiene questi strumenti. Trova questa pipeline, legge lo stesso schema qui sopra e la esegue.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Riferimento API completo Configurazione MCP Riferimento CLI

Trascrizione video con AI

Carica qualsiasi file video o audio e riottieni una trascrizione accurata con timestamp a livello di parola. Rilevamento dei parlanti facoltativo. Output come sottotitoli SRT o testo semplice, pronto per sottotitolazione, editing o riutilizzo.

Cosa puoi farci

  • Sottotitolare video: genera l'SRT, poi incorporalo o sovrapponilo per i social
  • Riutilizzare contenuti long-form: invia le trascrizioni a qualsiasi LLM per riassunti, idee di clip e copy per i social
  • Trascrivere interviste e podcast: registrazioni multi-parlante con diarizzazione
  • Accessibilità: rendi i contenuti parlati leggibili e ricercabili
  • Preparazione alla traduzione: una trascrizione pulita come sorgente per voci fuori campo tradotte

Come funziona

  1. Carica: video o audio, in qualsiasi formato comune (MP4, MOV, MP3, WAV, M4A, FLAC)
  2. Scegli una lingua: oppure lascia sul rilevamento automatico
  3. Attiva il rilevamento dei parlanti: etichetta ogni segmento con il parlante
  4. Scarica: SRT con timestamp + trascrizione in testo semplice

Formati di output

  • SRT: file di sottotitoli con timestamp accurati al millisecondo, si inserisce direttamente negli editor video
  • Testo semplice: trascrizione pulita e leggibile per editing, riassunto o traduzione

Domande frequenti

Quali formati di file sono supportati?
Qualsiasi file video o audio, MP4, MOV, AVI, MP3, WAV, M4A, FLAC e altri. La pipeline estrae automaticamente la traccia audio dai file video.
Quanto è accurata la trascrizione?
Tassi di errore per parola sotto il 5% per audio nitido nelle lingue principali. L'accuratezza dipende da qualità dell'audio, rumore di fondo e chiarezza del parlante.
Cos'è il rilevamento dei parlanti?
Quando abilitato, la trascrizione etichetta ogni segmento con il parlante che l'ha pronunciato ([speaker_0], [speaker_1], ecc.). Usa il suggerimento Numero di parlanti per migliorare l'accuratezza quando sai quante persone sono nella registrazione.
Quali lingue sono supportate?
99 lingue con rilevamento automatico. Imposta una lingua specifica per la massima accuratezza quando conosci la lingua sorgente.
Quanto tempo richiede?
In genere il 10-30% della durata dell'audio. Una registrazione di 10 minuti richiede 1-3 minuti per essere trascritta.

Esplora altri pipeline

Vedi tutto →
Generatore video
from 9.5
Generatore video
Generatore immagini
0.2-6.4
Generatore immagini
Generatore audio
0.7-1.3
Generatore audio
Generatore musica
2.5-45.1
Generatore musica