文字起こし
0.8クレジットから
動画や音声を、タイムスタンプと話者ラベル付きのテキストに変換します。99言語に対応しています。
0 – 20
生成される SRT および TXT に適用される任意の単語単位の置換、認識エンジンが特定の単語(名前、頭字語、専門用語)を毎回同じように誤認識する場合に便利です。各キーは文字起こしされた単語、値は正しい綴りです。大文字と小文字を区別し、一致は単語全体に揃える必要があります。空欄にすると、認識エンジンが書き出したままの文字起こしが出力されます。
使用モデル
-
ElevenLabs
- 個の入力
- 5
- 必須
- 1
- 料金
- from 0.8 クレジット
| 入力 | 型 | 既定値 | 説明 |
|---|---|---|---|
source_asset_id | string | 既定値— | 文字起こしする音声または動画です。アップロード後に返されるアセットIDを指定します。アップロード手順は/docs/api/を参照してください。 |
corrections | object | 既定値{} | 生成される SRT および TXT に適用される任意の単語単位の置換、認識エンジンが特定の単語(名前、頭字語、専門用語)を毎回同じように誤認識する場合に便利です。各キーは文字起こしされた単語、値は正しい綴りです。大文字と小文字を区別し、一致は単語全体に揃える必要があります。空欄にすると、認識エンジンが書き出したままの文字起こしが出力されます。 |
diarize | boolean | 既定値false | 発言者を識別してラベルを付けます。インタビューや複数人の収録で有効にしてください。 |
language_code | enum | 既定値auto | 音声の言語です。未指定の場合は音声から自動判定します。auto · en · es +8autoenesptfrdehiarjakozh |
num_speakers | integer | 既定値0 | 想定する話者数です。未指定の場合は自動判定します。 |
任意の MCP クライアントを pipe2 に接続すると、エージェントがこれらのツールを使えるようになります。このパイプラインを見つけ、上と同じスキーマを読み取って実行します。
list_pipelinesget_pipeline_schemarun_pipelineget_pipeline_run_statusrequest_upload
https://mcp.pipe2.ai/mcp {
"mcpServers": {
"pipe2ai": {
"url": "https://mcp.pipe2.ai/mcp",
"headers": { "Authorization": "Bearer YOUR_TOKEN" }
}
}
}このパイプラインを使うレシピ
すべてのレシピを見るよくある質問
どのファイルフォーマットに対応していますか?
あらゆる動画・音声ファイル、MP4、MOV、AVI、MP3、WAV、M4A、FLAC など。パイプラインは動画ファイルから音声トラックを自動的に抽出します。
文字起こしの精度はどれくらいですか?
主要言語のクリアな音声では単語誤り率5%未満。精度は音質、背景ノイズ、話者の明瞭さに依存します。
話者検出とは何ですか?
有効にすると、トランスクリプトは各セグメントにそれを話した話者([speaker_0]、[speaker_1] など)のラベルを付けます。録音に何人いるか分かっている場合は「話者数」ヒントを使って精度を高めてください。
どの言語に対応していますか?
自動検出付きで99言語。ソース言語が分かっている場合は、最良の精度のために特定の言語を設定してください。
どれくらいかかりますか?
通常は音声の長さの10〜30%です。10分の録音は文字起こしに1〜3分かかります。
AI動画文字起こし
あらゆる動画や音声ファイルをアップロードすれば、単語レベルのタイムスタンプ付きの正確なトランスクリプトが返ってきます。話者検出は任意。SRT字幕またはプレーンテキストで出力、キャプション、編集、再利用にそのまま使えます。
できること
- 動画にキャプション: SRTを生成し、ソーシャル向けに焼き込むか重ねる
- 長尺コンテンツを再利用: 文字起こしを要約、クリップ案、SNS投稿の下書きに活用
- インタビュー・ポッドキャストを文字起こし: 話者分離付きのマルチスピーカー録音
- アクセシビリティ: 話されたコンテンツを読める・検索できるものに
- 翻訳の準備: 翻訳ナレーションのソースとしてのクリーンなトランスクリプト
使い方
- アップロード: 動画または音声、一般的なフォーマット何でも(MP4、MOV、MP3、WAV、M4A、FLAC)
- 言語を選ぶ: または自動検出のまま
- 話者検出を切り替え: 各セグメントに話者のラベルを付ける
- ダウンロード: タイムスタンプ付きのSRT+プレーンテキストのトランスクリプト
出力フォーマット
- SRT: ミリ秒精度のタイムスタンプ付き字幕ファイルで、動画エディターにそのまま組み込める
- プレーンテキスト: 編集、要約、翻訳用のクリーンで読みやすいトランスクリプト