Транскрипция
Транскрибируйте любой видео- или аудиофайл в текст. Таймкоды, распознавание спикеров и поддержка 99+ языков.
0 – 20
Опциональные замены по границам слов, применяемые к готовым SRT и TXT, полезно, когда распознаватель неверно слышит конкретное слово (имя, аббревиатуру, термин) и каждый раз пишет его одинаково неправильно. Ключ, слово в том виде, как оно расшифровано; значение, правильное написание. Учитывается регистр; совпадения должны приходиться на слово целиком. Оставьте пустым, чтобы получить транскрипт ровно в том виде, как его записал распознаватель.
Осталось заполнить: Видео- или аудиофайл
Работает на
APIРецепты с этим пайплайном
Статьи об этом пайплайне
API Транскрипция
Вызывайте этот пайплайн из своего кода. Один запрос запускает выполнение; модель — это поле ввода, а не отдельный эндпоинт.
bun add @pipe2-ai/sdk import { createClient } from "@pipe2-ai/sdk";
const client = createClient(process.env.PIPE2_TOKEN!);
const { run_pipeline } = await client.RunPipeline({
pipeline_slug: "transcription",
input: {
source_asset_id: "a1b2c3d4-0000-4000-8000-000000000001",
},
});pip install pipe2 import asyncio
import os
from pipe2 import Pipe2Client
client = Pipe2Client(token=os.environ["PIPE2_TOKEN"])
run = asyncio.run(client.run_pipeline(
pipeline_slug="transcription",
input={
"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001",
},
))go get github.com/pipe2-ai/sdk-go client := pipe2.NewClient(os.Getenv("PIPE2_TOKEN"))
input := json.RawMessage(`{
"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"
}`)
run, err := pipe2.RunPipeline(context.Background(), client, "transcription", input)
if err != nil {
log.Fatal(err)
}brew install pipe2-ai/tap/pipe2 pipe2 pipelines run \
--pipeline transcription \
--input-json '{"source_asset_id": "a1b2c3d4-0000-4000-8000-000000000001"}' \
--waitПараметры
-
source_asset_idобязательно -
Audio or video to transcribe. Asset id returned by an upload. See /docs/api/ for the upload flow.
string -
corrections -
Опциональные замены по границам слов, применяемые к готовым SRT и TXT, полезно, когда распознаватель неверно слышит конкретное слово (имя, аббревиатуру, термин) и каждый раз пишет его одинаково неправильно. Ключ, слово в том виде, как оно расшифровано; значение, правильное написание. Учитывается регистр; совпадения должны приходиться на слово целиком. Оставьте пустым, чтобы получить транскрипт ровно в том виде, как его записал распознаватель.
objectпо умолчанию[object Object] -
diarize -
Label who is speaking. Turn on for interviews and multi-speaker recordings.
booleanпо умолчаниюfalse
Показать все поля (5)
-
language_code -
Spoken language. Leave unset to detect it from the audio.
autoenesptfrdehiarjakozhпо умолчаниюauto -
num_speakers -
How many speakers to expect. Leave unset to detect automatically.
integerпо умолчанию0
Использование из ИИ-агента
Направьте любой MCP-клиент на pipe2, и ваш агент получит эти инструменты. Он найдёт этот пайплайн, прочитает ту же схему выше и запустит его.
- list_pipelines
- get_pipeline_schema
- run_pipeline
- get_pipeline_run_status
- request_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}ИИ-транскрипция видео
Загрузите любой видео- или аудиофайл и получите точный транскрипт с таймкодами на уровне слов. Распознавание спикеров опционально. Результат в виде субтитров SRT или обычного текста, готов для субтитрирования, редактирования или переработки.
Что с этим можно делать
- Субтитрировать видео: сгенерируйте SRT, затем вшейте или наложите его для соцсетей
- Перерабатывать длинный контент: подавайте транскрипты в любую LLM для саммари, идей нарезок и текстов для соцсетей
- Транскрибировать интервью и подкасты: записи с несколькими спикерами и диаризацией
- Доступность: делайте устный контент читаемым и доступным для поиска
- Подготовка к переводу: чистый транскрипт как источник для переведённой озвучки
Как это работает
- Загрузите: видео или аудио, любой распространённый формат (MP4, MOV, MP3, WAV, M4A, FLAC)
- Выберите язык: или оставьте автоопределение
- Включите распознавание спикеров: помечает каждый сегмент спикером
- Скачайте: SRT с таймкодами + транскрипт обычным текстом
Форматы вывода
- SRT: файл субтитров с таймкодами с точностью до миллисекунды, сразу ложится в видеоредакторы
- Обычный текст: чистый читаемый транскрипт для редактирования, суммирования или перевода
Часто задаваемые вопросы
Какие форматы файлов поддерживаются?
Насколько точна транскрипция?
Что такое распознавание спикеров?
Какие языки поддерживаются?
Сколько времени это занимает?
Другие пайплайны
Смотреть все →Создавайте ИИ-видео из текстового запроса, изображения или референсного клипа. Кинематографичные кадры, презентации продуктов, лайфстайл-реклама, с синхронизированным звуком и естественным движением.
Создавайте ИИ-изображения из текста или референсных фото. Продуктовые снимки, арт персонажей, постеры с читаемым текстом, фотореалистичные портреты, высокое разрешение за секунды.
Превращайте текст в естественную речь с десятками голосов, поддержкой 70+ языков и настройкой стиля, тона, акцента и темпа.
Создавайте оригинальную фоновую музыку под любое настроение, жанр и длительность, которые вы опишете. Без роялти, готово за секунды.