Transcrição

A partir de 0.8 créditos

Transcreva qualquer arquivo de vídeo ou áudio, com marcações de tempo, identificação opcional de falantes e suporte a 99 idiomas.

0 – 20

Substituições opcionais aplicadas aos arquivos SRT e TXT, úteis quando um nome, sigla ou termo técnico é transcrito sempre da mesma forma incorreta. Cada chave é a palavra como transcrita; o valor é a grafia correta. Diferencia maiúsculas de minúsculas; as substituições só são feitas em palavras inteiras. Deixe vazio para entregar a transcrição exatamente como o reconhecedor a escreveu.

Ainda falta: Arquivo de vídeo ou áudio

Funciona com

1 modelos

API do Transcrição

Chame este pipeline a partir do seu próprio código. Um pedido lança uma execução; o modelo é um campo de entrada, não um endpoint separado.

Obter um token de API
entradas
5
obrigatório
1
Preços
from 0.8 créditos
Idioma
Idioma
bun add @pipe2-ai/sdk
Executar um pipeline
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "transcription",
  input: {
    source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
  },
});

pip install pipe2
Executar um pipeline
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="transcription",
    input={
        "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
    },
))

go get github.com/pipe2-ai/sdk-go
Executar um pipeline
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
Executar um pipeline
pipe2 pipelines run \
  --pipeline transcription \
  --input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
  --wait

Referência completa da API Referência da CLI

Perguntas frequentes

Quais formatos de arquivo são suportados?
Qualquer arquivo de vídeo ou áudio, MP4, MOV, AVI, MP3, WAV, M4A, FLAC e outros. Nos arquivos de vídeo, a faixa de áudio é extraída automaticamente.
Quão precisa é a transcrição?
Taxa de erro por palavra abaixo de 5% para áudio nítido nos idiomas principais. A precisão depende da qualidade do áudio, do ruído de fundo e da clareza de quem fala.
O que é a detecção de quem fala?
Quando ativada, a transcrição identifica cada segmento com o locutor que o disse ([speaker_0], [speaker_1], etc.). Informe o número de falantes para melhorar a precisão quando você souber quantas pessoas há na gravação.
Quais idiomas são suportados?
99 idiomas com detecção automática. Defina um idioma específico para obter a melhor precisão quando você souber o idioma de origem.
Quanto tempo leva?
Normalmente de 10% a 30% da duração do áudio. Uma gravação de 10 minutos leva de 1 a 3 minutos para ser transcrita.

Transcrição de vídeo com IA

Envie um vídeo ou arquivo de áudio e receba uma transcrição precisa, com marcações de tempo por palavra. A identificação de falantes é opcional. Exporte em SRT ou texto simples, pronto para legendagem, edição ou reaproveitamento.

O que você pode fazer com isso

  • Legendar vídeos: gere o SRT e depois incorpore-o aos seus conteúdos para redes sociais
  • Reaproveitar conteúdo longo: use a transcrição em um assistente de IA para criar resumos, ideias de clipes e textos para redes sociais
  • Transcrever entrevistas e podcasts: diferencie automaticamente os vários participantes
  • Acessibilidade: torne o conteúdo falado legível e pesquisável
  • Preparação para tradução: transcrição limpa como fonte para narrações traduzidas

Como funciona

  1. Envie: vídeo ou áudio, em qualquer formato comum (MP4, MOV, MP3, WAV, M4A, FLAC)
  2. Escolha um idioma: ou deixe na detecção automática
  3. Ative a identificação de falantes: cada segmento é atribuído à pessoa que o pronunciou
  4. Baixe: SRT com marcações de tempo + transcrição em texto simples

Formatos de saída

  • SRT: arquivo de legendas com marcações de tempo precisas em milissegundos, que entra direto nos editores de vídeo
  • Texto simples: transcrição limpa e legível para edição, resumo ou tradução

Explorar mais pipelines

Gerador de Vídeo
from 9.5
Gerador de Vídeo
Gerador de Imagens
0.2-6.4
Gerador de Imagens
Gerador de Voz
0.002-40.0
Gerador de Voz
Gerador de Música
2.5-22.6
Gerador de Música