Назад к пайплайнам

Транскрипция

Транскрибируйте любой видео- или аудиофайл в текст. Таймкоды, распознавание спикеров и поддержка 99+ языков.

МодельElevenLabs Scribe v2
0.8

0 – 20

Опциональные замены по границам слов, применяемые к готовым SRT и TXT, полезно, когда распознаватель неверно слышит конкретное слово (имя, аббревиатуру, термин) и каждый раз пишет его одинаково неправильно. Ключ, слово в том виде, как оно расшифровано; значение, правильное написание. Учитывается регистр; совпадения должны приходиться на слово целиком. Оставьте пустым, чтобы получить транскрипт ровно в том виде, как его записал распознаватель.

Осталось заполнить: Видео- или аудиофайл

Работает на

API

Рецепты с этим пайплайном

Статьи об этом пайплайне

API Транскрипция

Вызывайте этот пайплайн из своего кода. Один запрос запускает выполнение; модель — это поле ввода, а не отдельный эндпоинт.

5 полей ввода
1 обязательно
from 0.8 кредитов
bun add @pipe2-ai/sdk
import { createClient } from "@pipe2-ai/sdk";

const client = createClient(process.env.PIPE2_TOKEN!);

const { run_pipeline } = await client.RunPipeline({
  pipeline_slug: "transcription",
  input: {
    source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
  },
});
pip install pipe2
import asyncio
import os

from pipe2 import Pipe2Client

client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])

run = asyncio.run(client.run_pipeline(
    pipeline_slug="transcription",
    input={
        "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
    },
))
go get github.com/pipe2-ai/sdk-go
client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))

input := json.RawMessage(`{
  "source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)

run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
    log.Fatal(err)
}
brew install pipe2-ai/tap/pipe2
pipe2 pipelines run \
  --pipeline transcription \
  --input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
  --wait

Получить API-токен →

Параметры

source_asset_id обязательно

Audio or video to transcribe. Asset id returned by an upload. See /docs/api/ for the upload flow.

string
corrections

Опциональные замены по границам слов, применяемые к готовым SRT и TXT, полезно, когда распознаватель неверно слышит конкретное слово (имя, аббревиатуру, термин) и каждый раз пишет его одинаково неправильно. Ключ, слово в том виде, как оно расшифровано; значение, правильное написание. Учитывается регистр; совпадения должны приходиться на слово целиком. Оставьте пустым, чтобы получить транскрипт ровно в том виде, как его записал распознаватель.

object по умолчанию [object Object]
diarize

Label who is speaking. Turn on for interviews and multi-speaker recordings.

boolean по умолчанию false
Показать все поля (5)
language_code

Spoken language. Leave unset to detect it from the audio.

autoenesptfrdehiarjakozh по умолчанию auto
num_speakers

How many speakers to expect. Leave unset to detect automatically.

integer по умолчанию 0

Использование из ИИ-агента

Направьте любой MCP-клиент на pipe2, и ваш агент получит эти инструменты. Он найдёт этот пайплайн, прочитает ту же схему выше и запустит его.

  • list_pipelines
  • get_pipeline_schema
  • run_pipeline
  • get_pipeline_run_status
  • request_upload
https://mcp.pipe2.ai/mcp
{
  "mcpServers": {
    "pipe2ai": {
      "url": "https://mcp.pipe2.ai/mcp",
      "headers": { "Authorization": "Bearer YOUR_TOKEN" }
    }
  }
}

Полная справка по API Настройка MCP Справочник CLI

ИИ-транскрипция видео

Загрузите любой видео- или аудиофайл и получите точный транскрипт с таймкодами на уровне слов. Распознавание спикеров опционально. Результат в виде субтитров SRT или обычного текста, готов для субтитрирования, редактирования или переработки.

Что с этим можно делать

  • Субтитрировать видео: сгенерируйте SRT, затем вшейте или наложите его для соцсетей
  • Перерабатывать длинный контент: подавайте транскрипты в любую LLM для саммари, идей нарезок и текстов для соцсетей
  • Транскрибировать интервью и подкасты: записи с несколькими спикерами и диаризацией
  • Доступность: делайте устный контент читаемым и доступным для поиска
  • Подготовка к переводу: чистый транскрипт как источник для переведённой озвучки

Как это работает

  1. Загрузите: видео или аудио, любой распространённый формат (MP4, MOV, MP3, WAV, M4A, FLAC)
  2. Выберите язык: или оставьте автоопределение
  3. Включите распознавание спикеров: помечает каждый сегмент спикером
  4. Скачайте: SRT с таймкодами + транскрипт обычным текстом

Форматы вывода

  • SRT: файл субтитров с таймкодами с точностью до миллисекунды, сразу ложится в видеоредакторы
  • Обычный текст: чистый читаемый транскрипт для редактирования, суммирования или перевода

Часто задаваемые вопросы

Какие форматы файлов поддерживаются?
Любой видео- или аудиофайл, MP4, MOV, AVI, MP3, WAV, M4A, FLAC и другие. Пайплайн автоматически извлекает аудиодорожку из видеофайлов.
Насколько точна транскрипция?
Доля ошибок по словам менее 5% для чистого аудио на основных языках. Точность зависит от качества аудио, фонового шума и разборчивости речи.
Что такое распознавание спикеров?
Когда включено, транскрипт помечает каждый сегмент спикером, который его произнёс ([speaker_0], [speaker_1] и т. д.). Используйте подсказку «Число спикеров», чтобы повысить точность, когда знаете, сколько человек в записи.
Какие языки поддерживаются?
99 языков с автоматическим определением. Задайте конкретный язык для лучшей точности, когда знаете язык оригинала.
Сколько времени это занимает?
Обычно 10–30% от длительности аудио. Запись в 10 минут транскрибируется за 1–3 минуты.

Другие пайплайны

Смотреть все →
Генератор видео
from 9.5
Генератор видео
Генератор изображений
0.2-6.4
Генератор изображений
Генератор аудио
0.7-1.3
Генератор аудио
Генератор музыки
2.5-45.1
Генератор музыки