Transcripción

Desde 0.8 créditos

Convierte cualquier archivo de vídeo o audio en texto, con marcas de tiempo, detección de hablantes y compatibilidad con más de 99 idiomas.

0 – 20

Sustituciones opcionales de palabras completas que se aplican a los archivos SRT y TXT. Resultan útiles cuando el reconocimiento transcribe siempre de forma incorrecta un nombre, un acrónimo o un término técnico. Cada clave debe contener la palabra tal como aparece en la transcripción y su valor, la grafía correcta. Se distinguen mayúsculas y minúsculas y solo se sustituyen palabras completas. Deja el campo vacío si quieres conservar el texto tal como se reconoció.

Aún falta: Archivo de vídeo o audio

Funciona con

1 modelos

API de Transcripción

Llama a este pipeline desde tu propio código. Una petición lanza una ejecución; el modelo es un campo de entrada, no un endpoint aparte.

Obtener un token de API
entradas
5
obligatorio
1
Precios
from 0.8 créditos
Idioma
Idioma
bun add @pipe2-ai/sdk
Ejecutar un pipeline
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "transcription",
  input: {
    source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
  },
});

pip install pipe2
Ejecutar un pipeline
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="transcription",
    input={
        "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
    },
))

go get github.com/pipe2-ai/sdk-go
Ejecutar un pipeline
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
    log.Fatal(err)
}

brew install pipe2-ai/tap/pipe2
Ejecutar un pipeline
pipe2 pipelines run \
  --pipeline transcription \
  --input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
  --wait

Referencia completa de la API Referencia de la CLI

Preguntas frecuentes

¿Qué formatos de archivo son compatibles?
Se admite prácticamente cualquier archivo de vídeo o audio, incluidos MP4, MOV, AVI, MP3, WAV, M4A y FLAC. Si subes un vídeo, el sistema extrae automáticamente la pista de audio.
¿Qué precisión tiene la transcripción?
Con audio claro en los principales idiomas, la tasa de error por palabra es inferior al 5 %. La precisión depende de la calidad del sonido, el ruido de fondo y la claridad de las voces.
¿Qué es la detección de hablantes?
Al activarla, cada segmento indica quién lo pronunció mediante etiquetas como [speaker_0] o [speaker_1]. Si sabes cuántas personas intervienen, utiliza Número de hablantes para mejorar la precisión.
¿Qué idiomas son compatibles?
99 idiomas con detección automática. Si conoces el idioma original, selecciónalo para obtener la máxima precisión.
¿Cuánto tarda?
Normalmente, entre el 10 % y el 30 % de la duración del audio. Una grabación de 10 minutos tarda entre 1 y 3 minutos en transcribirse.

Transcripción de vídeo con IA

Sube cualquier archivo de vídeo o audio y recibe una transcripción precisa con marcas de tiempo por palabra y detección opcional de hablantes. Descarga el resultado como subtítulos SRT o texto plano, listo para editar, reutilizar o añadir al vídeo.

Qué puedes hacer con esto

  • Subtitular vídeos: genera el SRT y después intégralo en la imagen o súbelo como pista independiente
  • Reutilizar contenido largo: emplea la transcripción en cualquier LLM para crear resúmenes, ideas de clips y textos para redes
  • Transcribir entrevistas y pódcasts: distingue a los participantes en grabaciones con varias voces
  • Mejorar la accesibilidad: convierte el contenido hablado en texto legible y fácil de buscar
  • Preparar traducciones: utiliza una transcripción limpia como base para locuciones en otros idiomas

Cómo funciona

  1. Sube el archivo: vídeo o audio en cualquier formato habitual (MP4, MOV, MP3, WAV, M4A o FLAC)
  2. Elige el idioma: o deja que se detecte automáticamente
  3. Activa la detección de hablantes: identifica quién interviene en cada segmento
  4. Descarga el resultado: un SRT con marcas de tiempo y una transcripción en texto plano

Formatos de salida

  • SRT: archivo de subtítulos con marcas de tiempo precisas al milisegundo, listo para usar en editores de vídeo
  • Texto plano: transcripción limpia y legible para editar, resumir o traducir

Explorar más pipelines

Generador de vídeo
from 9.5
Generador de vídeo
Generador de imágenes
0.2-6.4
Generador de imágenes
Generador de audio
0.002-40.0
Generador de audio
Generador de música
2.5-22.6
Generador de música