Voltar aos pipelines

Transcrição

Transcreva qualquer arquivo de vídeo ou áudio para texto. Marcações de tempo, detecção de quem fala e suporte a mais de 99 idiomas.

ModeloElevenLabs Scribe v2
0.8

0 – 20

Substituições opcionais por palavra inteira aplicadas ao SRT e TXT gerados, úteis quando o reconhecedor entende errado uma palavra específica (um nome, uma sigla, um termo técnico) e a escreve sempre da mesma forma errada. Cada chave é a palavra como transcrita; o valor é a grafia correta. Diferencia maiúsculas de minúsculas; as correspondências devem alinhar a palavras inteiras. Deixe vazio para entregar a transcrição exatamente como o reconhecedor a escreveu.

Ainda falta: Arquivo de Vídeo ou Áudio

Funciona com

API

Receitas que usam este pipeline

Artigos sobre este pipeline

API do Transcrição

Chame este pipeline a partir do seu próprio código. Um pedido lança uma execução; o modelo é um campo de entrada, não um endpoint separado.

5 entradas
1 obrigatório
from 0.8 créditos
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "transcription",
  input: {
    source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="transcription",
    input={
        "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline transcription \
  --input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
  --wait

Obter um token de API →

Parâmetros

source_asset_id obrigatório

Audio or video to transcribe. Asset id returned by an upload. See /docs/api/ for the upload flow.

string
corrections

Substituições opcionais por palavra inteira aplicadas ao SRT e TXT gerados, úteis quando o reconhecedor entende errado uma palavra específica (um nome, uma sigla, um termo técnico) e a escreve sempre da mesma forma errada. Cada chave é a palavra como transcrita; o valor é a grafia correta. Diferencia maiúsculas de minúsculas; as correspondências devem alinhar a palavras inteiras. Deixe vazio para entregar a transcrição exatamente como o reconhecedor a escreveu.

object predefinição [object Object]
diarize

Label who is speaking. Turn on for interviews and multi-speaker recordings.

boolean predefinição false
Ver as 5 entradas
language_code

Spoken language. Leave unset to detect it from the audio.

autoenesptfrdehiarjakozh predefinição auto
num_speakers

How many speakers to expect. Leave unset to detect automatically.

integer predefinição 0

Use a partir de um agente de IA

Aponte qualquer cliente MCP para o pipe2 e o seu agente ganha estas ferramentas. Ele encontra este pipeline, lê o mesmo esquema acima e executa-o.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Referência completa da API Configuração de MCP Referência da CLI

Transcrição de Vídeo com IA

Envie qualquer arquivo de vídeo ou áudio e receba de volta uma transcrição precisa com marcações de tempo por palavra. Detecção de quem fala opcional. Saída em legendas SRT ou texto simples, pronta para legendagem, edição ou reaproveitamento.

O que você pode fazer com isso

  • Legendar vídeos: gere o SRT e depois grave-o ou sobreponha-o para as redes sociais
  • Reaproveitar conteúdo de formato longo: envie as transcrições para qualquer LLM para resumos, ideias de clipes e textos para redes sociais
  • Transcrever entrevistas + podcasts: gravações com vários locutores e diarização
  • Acessibilidade: torne o conteúdo falado legível e pesquisável
  • Preparação para tradução: transcrição limpa como fonte para narrações traduzidas

Como funciona

  1. Envie: vídeo ou áudio, em qualquer formato comum (MP4, MOV, MP3, WAV, M4A, FLAC)
  2. Escolha um idioma: ou deixe na detecção automática
  3. Ative a detecção de quem fala: identifica cada segmento com o locutor
  4. Baixe: SRT com marcações de tempo + transcrição em texto simples

Formatos de saída

  • SRT: arquivo de legendas com marcações de tempo precisas em milissegundos, que entra direto nos editores de vídeo
  • Texto simples: transcrição limpa e legível para edição, resumo ou tradução

Perguntas frequentes

Quais formatos de arquivo são suportados?
Qualquer arquivo de vídeo ou áudio, MP4, MOV, AVI, MP3, WAV, M4A, FLAC e outros. O pipeline extrai automaticamente a faixa de áudio dos arquivos de vídeo.
Quão precisa é a transcrição?
Taxas de erro de palavra abaixo de 5% para áudio nítido nos idiomas principais. A precisão depende da qualidade do áudio, do ruído de fundo e da clareza de quem fala.
O que é a detecção de quem fala?
Quando ativada, a transcrição identifica cada segmento com o locutor que o disse ([speaker_0], [speaker_1], etc.). Use a dica de Número de Locutores para melhorar a precisão quando você souber quantas pessoas há na gravação.
Quais idiomas são suportados?
99 idiomas com detecção automática. Defina um idioma específico para obter a melhor precisão quando você souber o idioma de origem.
Quanto tempo leva?
Normalmente de 10% a 30% da duração do áudio. Uma gravação de 10 minutos leva de 1 a 3 minutos para ser transcrita.

Explorar mais pipelines

Ver tudo →
Gerador de Vídeo
from 9.5
Gerador de Vídeo
Gerador de Imagens
0.2-6.4
Gerador de Imagens
Gerador de Áudio
0.7-1.3
Gerador de Áudio
Gerador de Música
2.5-45.1
Gerador de Música