Transcrição
Transcreva qualquer arquivo de vídeo ou áudio para texto. Marcações de tempo, detecção de quem fala e suporte a mais de 99 idiomas.
0 – 20
Substituições opcionais por palavra inteira aplicadas ao SRT e TXT gerados, úteis quando o reconhecedor entende errado uma palavra específica (um nome, uma sigla, um termo técnico) e a escreve sempre da mesma forma errada. Cada chave é a palavra como transcrita; o valor é a grafia correta. Diferencia maiúsculas de minúsculas; as correspondências devem alinhar a palavras inteiras. Deixe vazio para entregar a transcrição exatamente como o reconhecedor a escreveu.
Ainda falta: Arquivo de Vídeo ou Áudio
Funciona com
APIReceitas que usam este pipeline
Artigos sobre este pipeline
API do Transcrição
Chame este pipeline a partir do seu próprio código. Um pedido lança uma execução; o modelo é um campo de entrada, não um endpoint separado.
bun add @pipe2-ai/sdk import { createClient } from "@pipe2-ai/sdk";
const client = createClient(process.env.PIPE2_TOKEN!);
const { run_pipeline } = await client.RunPipeline({
pipeline_slug: "transcription",
input: {
source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
},
});pip install pipe2 import asyncio
import os
from pipe2 import Pipe2Client
client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])
run = asyncio.run(client.run_pipeline(
pipeline_slug="transcription",
input={
"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
},
))go get github.com/pipe2-ai/sdk-go client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))
input := json.RawMessage(`{
"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)
run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
log.Fatal(err)
}brew install pipe2-ai/tap/pipe2 pipe2 pipelines run \
--pipeline transcription \
--input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
--waitParâmetros
-
source_asset_idobrigatório -
Audio or video to transcribe. Asset id returned by an upload. See /docs/api/ for the upload flow.
string -
corrections -
Substituições opcionais por palavra inteira aplicadas ao SRT e TXT gerados, úteis quando o reconhecedor entende errado uma palavra específica (um nome, uma sigla, um termo técnico) e a escreve sempre da mesma forma errada. Cada chave é a palavra como transcrita; o valor é a grafia correta. Diferencia maiúsculas de minúsculas; as correspondências devem alinhar a palavras inteiras. Deixe vazio para entregar a transcrição exatamente como o reconhecedor a escreveu.
objectpredefinição[object Object] -
diarize -
Label who is speaking. Turn on for interviews and multi-speaker recordings.
booleanpredefiniçãofalse
Ver as 5 entradas
-
language_code -
Spoken language. Leave unset to detect it from the audio.
autoenesptfrdehiarjakozhpredefiniçãoauto -
num_speakers -
How many speakers to expect. Leave unset to detect automatically.
integerpredefinição0
Use a partir de um agente de IA
Aponte qualquer cliente MCP para o pipe2 e o seu agente ganha estas ferramentas. Ele encontra este pipeline, lê o mesmo esquema acima e executa-o.
- list_pipelines
- get_pipeline_schema
- run_pipeline
- get_pipeline_run_status
- request_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}Referência completa da API Configuração de MCP Referência da CLI
Transcrição de Vídeo com IA
Envie qualquer arquivo de vídeo ou áudio e receba de volta uma transcrição precisa com marcações de tempo por palavra. Detecção de quem fala opcional. Saída em legendas SRT ou texto simples, pronta para legendagem, edição ou reaproveitamento.
O que você pode fazer com isso
- Legendar vídeos: gere o SRT e depois grave-o ou sobreponha-o para as redes sociais
- Reaproveitar conteúdo de formato longo: envie as transcrições para qualquer LLM para resumos, ideias de clipes e textos para redes sociais
- Transcrever entrevistas + podcasts: gravações com vários locutores e diarização
- Acessibilidade: torne o conteúdo falado legível e pesquisável
- Preparação para tradução: transcrição limpa como fonte para narrações traduzidas
Como funciona
- Envie: vídeo ou áudio, em qualquer formato comum (MP4, MOV, MP3, WAV, M4A, FLAC)
- Escolha um idioma: ou deixe na detecção automática
- Ative a detecção de quem fala: identifica cada segmento com o locutor
- Baixe: SRT com marcações de tempo + transcrição em texto simples
Formatos de saída
- SRT: arquivo de legendas com marcações de tempo precisas em milissegundos, que entra direto nos editores de vídeo
- Texto simples: transcrição limpa e legível para edição, resumo ou tradução
Perguntas frequentes
Quais formatos de arquivo são suportados?
Quão precisa é a transcrição?
O que é a detecção de quem fala?
Quais idiomas são suportados?
Quanto tempo leva?
Explorar mais pipelines
Ver tudo →Gere vídeos com IA a partir de um prompt de texto, imagem ou clipe de referência. Tomadas cinematográficas, revelações de produto, anúncios de estilo de vida, com áudio sincronizado e movimento natural.
Gere imagens com IA a partir de texto ou fotos de referência. Fotos de produto, arte de personagens, cartazes com texto legível, retratos fotorrealistas, alta resolução em segundos.
Transforme texto em fala natural com dezenas de vozes, mais de 70 idiomas e direções de estilo personalizadas para tom, sotaque e ritmo.
Gere música de fundo original que combine com qualquer clima, gênero e duração que você descrever. Livre de royalties, pronta em segundos.