Trascrizione

Da 0.8 crediti

Trascrivi qualsiasi file video o audio, con timestamp, riconoscimento facoltativo dei parlanti e supporto per 99 lingue.

0 – 20

Sostituzioni opzionali su interi termini applicate all'SRT e al TXT generati, utili quando il riconoscitore fraintende una parola specifica (un nome, un acronimo, un termine di settore) e la scrive sempre nello stesso modo errato. Ogni chiave è la parola così come trascritta; il valore è l'ortografia corretta. Sensibile alle maiuscole; le corrispondenze devono allinearsi a parole intere. Lascia vuoto per consegnare la trascrizione esattamente come scritta dal riconoscitore.

Ancora necessario: File video o audio

Funziona con

1 modelli

API di Trascrizione

Richiama questa pipeline dal tuo codice. Una richiesta avvia un'esecuzione; il modello è un campo di input, non un endpoint separato.

Ottieni un token API
input
5
obbligatorio
1
Prezzi
from 0.8 crediti
Lingua
Lingua
bun add @pipe2-ai/sdk
Esegui una pipeline
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "transcription",
  input: {
    source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
  },
});

pip install pipe2
Esegui una pipeline
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="transcription",
    input={
        "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
    },
))

go get github.com/pipe2-ai/sdk-go
Esegui una pipeline
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
Esegui una pipeline
pipe2 pipelines run \
  --pipeline transcription \
  --input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
  --wait

Riferimento API completo Riferimento CLI

Domande frequenti

Quali formati di file sono supportati?
Qualsiasi file video o audio, MP4, MOV, AVI, MP3, WAV, M4A, FLAC e altri. La pipeline estrae automaticamente la traccia audio dai file video.
Quanto è accurata la trascrizione?
Tassi di errore per parola sotto il 5% per audio nitido nelle lingue principali. L'accuratezza dipende da qualità dell'audio, rumore di fondo e chiarezza del parlante.
Cos'è il rilevamento dei parlanti?
Quando abilitato, la trascrizione etichetta ogni segmento con il parlante che l'ha pronunciato ([speaker_0], [speaker_1], ecc.). Usa il suggerimento Numero di parlanti per migliorare l'accuratezza quando sai quante persone sono nella registrazione.
Quali lingue sono supportate?
99 lingue con rilevamento automatico. Imposta una lingua specifica per la massima accuratezza quando conosci la lingua sorgente.
Quanto tempo richiede?
In genere il 10-30% della durata dell'audio. Una registrazione di 10 minuti richiede 1-3 minuti per essere trascritta.

Trascrizione di video e audio con IA

Carica un file video o audio e ottieni una trascrizione accurata con timestamp e, se vuoi, l'identificazione dei parlanti. Scarica il risultato come sottotitoli SRT o testo semplice, pronto per sottotitoli, revisione e riutilizzo.

Cosa puoi farci

  • Sottotitolare video: genera l'SRT, poi incorporalo o sovrapponilo per i social
  • Riutilizzare contenuti lunghi: usa la trascrizione per riassunti, idee di clip e testi per i social
  • Trascrivere interviste e podcast: registrazioni multi-parlante con diarizzazione
  • Accessibilità: rendi i contenuti parlati leggibili e ricercabili
  • Preparazione alla traduzione: una trascrizione pulita come sorgente per voci fuori campo tradotte

Come funziona

  1. Carica: video o audio, in qualsiasi formato comune (MP4, MOV, MP3, WAV, M4A, FLAC)
  2. Scegli una lingua: oppure lascia sul rilevamento automatico
  3. Attiva il rilevamento dei parlanti: etichetta ogni segmento con il parlante
  4. Scarica: SRT con timestamp + trascrizione in testo semplice

Formati disponibili

  • SRT: file di sottotitoli con timestamp accurati al millisecondo, pronto per gli editor video
  • Testo semplice: trascrizione pulita e leggibile per editing, riassunto o traduzione

Esplora altri pipeline

Generatore video
from 9.5
Generatore video
Generatore immagini
0.2-6.4
Generatore immagini
Generatore vocale
0.002-40.0
Generatore vocale
Generatore di musica
2.5-22.6
Generatore di musica