Trascrizione
Trascrivi in testo qualsiasi file video o audio. Timestamp, rilevamento dei parlanti e supporto per oltre 99 lingue.
0 – 20
Sostituzioni opzionali su interi termini applicate all'SRT e al TXT generati, utili quando il riconoscitore fraintende una parola specifica (un nome, un acronimo, un termine di settore) e la scrive sempre nello stesso modo errato. Ogni chiave è la parola così come trascritta; il valore è l'ortografia corretta. Sensibile alle maiuscole; le corrispondenze devono allinearsi a parole intere. Lascia vuoto per consegnare la trascrizione esattamente come scritta dal riconoscitore.
Ancora necessario: File video o audio
Funziona con
APIRicette che usano questo pipeline
Articoli su questo pipeline
-
Come tagliare un video in una clip pulita che non spezza mai una frase a metà
-
Creare shorts: trasformare un video lungo in clip brevi
-
Cos'è l'intelligenza artificiale generativa e come funziona
-
Come aggiungere sottotitoli a un video con un file SRT
-
Come creare video con l'IA: dal prompt al video finito
API di Trascrizione
Richiama questa pipeline dal tuo codice. Una richiesta avvia un'esecuzione; il modello è un campo di input, non un endpoint separato.
bun add @pipe2-ai/sdk import { createClient } from "@pipe2-ai/sdk";
const client = createClient(process.env.PIPE2_TOKEN!);
const { run_pipeline } = await client.RunPipeline({
pipeline_slug: "transcription",
input: {
source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
},
});pip install pipe2 import asyncio
import os
from pipe2 import Pipe2Client
client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])
run = asyncio.run(client.run_pipeline(
pipeline_slug="transcription",
input={
"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
},
))go get github.com/pipe2-ai/sdk-go client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))
input := json.RawMessage(`{
"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)
run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
log.Fatal(err)
}brew install pipe2-ai/tap/pipe2 pipe2 pipelines run \
--pipeline transcription \
--input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
--waitParametri
-
source_asset_idobbligatorio -
Audio or video to transcribe. Asset id returned by an upload. See /docs/api/ for the upload flow.
string -
corrections -
Sostituzioni opzionali su interi termini applicate all'SRT e al TXT generati, utili quando il riconoscitore fraintende una parola specifica (un nome, un acronimo, un termine di settore) e la scrive sempre nello stesso modo errato. Ogni chiave è la parola così come trascritta; il valore è l'ortografia corretta. Sensibile alle maiuscole; le corrispondenze devono allinearsi a parole intere. Lascia vuoto per consegnare la trascrizione esattamente come scritta dal riconoscitore.
objectpredefinito[object Object] -
diarize -
Label who is speaking. Turn on for interviews and multi-speaker recordings.
booleanpredefinitofalse
Mostra tutti i 5 input
-
language_code -
Spoken language. Leave unset to detect it from the audio.
autoenesptfrdehiarjakozhpredefinitoauto -
num_speakers -
How many speakers to expect. Leave unset to detect automatically.
integerpredefinito0
Usala da un agente IA
Punta un qualsiasi client MCP su pipe2 e il tuo agente ottiene questi strumenti. Trova questa pipeline, legge lo stesso schema qui sopra e la esegue.
- list_pipelines
- get_pipeline_schema
- run_pipeline
- get_pipeline_run_status
- request_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}Trascrizione video con AI
Carica qualsiasi file video o audio e riottieni una trascrizione accurata con timestamp a livello di parola. Rilevamento dei parlanti facoltativo. Output come sottotitoli SRT o testo semplice, pronto per sottotitolazione, editing o riutilizzo.
Cosa puoi farci
- Sottotitolare video: genera l'SRT, poi incorporalo o sovrapponilo per i social
- Riutilizzare contenuti long-form: invia le trascrizioni a qualsiasi LLM per riassunti, idee di clip e copy per i social
- Trascrivere interviste e podcast: registrazioni multi-parlante con diarizzazione
- Accessibilità: rendi i contenuti parlati leggibili e ricercabili
- Preparazione alla traduzione: una trascrizione pulita come sorgente per voci fuori campo tradotte
Come funziona
- Carica: video o audio, in qualsiasi formato comune (MP4, MOV, MP3, WAV, M4A, FLAC)
- Scegli una lingua: oppure lascia sul rilevamento automatico
- Attiva il rilevamento dei parlanti: etichetta ogni segmento con il parlante
- Scarica: SRT con timestamp + trascrizione in testo semplice
Formati di output
- SRT: file di sottotitoli con timestamp accurati al millisecondo, si inserisce direttamente negli editor video
- Testo semplice: trascrizione pulita e leggibile per editing, riassunto o traduzione
Domande frequenti
Quali formati di file sono supportati?
Quanto è accurata la trascrizione?
Cos'è il rilevamento dei parlanti?
Quali lingue sono supportate?
Quanto tempo richiede?
Esplora altri pipeline
Vedi tutto →Genera video con l'AI da un prompt testuale, un'immagine o una clip di riferimento. Riprese cinematografiche, reveal di prodotto, annunci lifestyle, con audio sincronizzato e movimento naturale.
Genera immagini con l'AI da testo o foto di riferimento. Scatti di prodotto, character art, poster con testo leggibile, ritratti fotorealistici, alta risoluzione in pochi secondi.
Trasforma il testo in voce naturale con decine di voci, oltre 70 lingue e indicazioni di stile personalizzate per tono, accento e ritmo.
Genera musica di sottofondo originale che si adatta a qualsiasi atmosfera, genere e durata che descrivi. Royalty-free, pronta in pochi secondi.