音声からテキストへ
どんな動画・音声の話し言葉もプレーンテキストに文字起こし — Qwen3-ASR 搭載
音声はサーバー上で動く Qwen3-ASR によって文字起こしされ、そのままプレーンテキストに変換されます — タイムコードなし、字幕フォーマットなし、言葉だけ。SRT/VTT 字幕が必要な場合は AI 動画字幕生成をご利用ください。
⚠️ 完了するまでこのページを閉じたり更新したりしないでください。結果が失われる場合があります。
💡 アップロード速度はご自身のネットワークによるもので、サーバー側の問題ではありません——回線が遅いとバーの進みも遅くなるだけです。そのまま進みますので、再試行の必要はなく、二重に課金されることもありません。
ASRエンジン、対応言語と精度の留意点
文字起こしはQwen3-ASRをワーカー上で実行し、次の特徴を持ちます:
- 対応言語 — 中国語と英語が最も得意です。主要なヨーロッパ言語(de/es/fr/pt/ru)、日本語、韓国語、ヒンディー語も、明瞭な発話なら良好な結果が得られます。
- 自動句読点 — カンマ・疑問符・文の区切りはモデルが付与するため、後編集なしでも読みやすい文字起こしになります。
- 数字・日付 — 検出された言語の書き言葉の形に正規化されます。
- 話者分離は非対応 — 複数人の会議は連続したテキストとして出力されます。必要に応じて手動で話者ラベルを振ってください。
1ジョブあたり最大500 MBまたは2時間の音声まで対応し、所要時間は再生時間の10分の1程度が目安です。出力はページ内に表示され(コピーボタン付き)、UTF-8のTXTとしてダウンロードできます。
使い方
- 1
動画または音声ファイルをアップロード — 形式は問わず、サーバー側でデコードします。
- 2
話されている言語を選ぶか、自動検出のままにします。
- 3
文字起こし結果をコピーするか、.txt ファイルとしてダウンロードします。ファイルは30分以内に自動削除されます。
- 4
文字起こし結果はページからコピーするか、.txtファイルとしてダウンロードできます。元の音声は処理後に削除されます。
話者の区切りまで分かる、句読点付き文字起こし
録音をアップロードすれば、小文字が羅列しただけの壁のようなテキストではなく、句読点と段落付きの読みやすい文章を、11のインターフェース言語のいずれかで受け取れます。
Qwen3-ASRエンジン
AI字幕と同じ音声認識がサーバー上で動作——インタビュー、講義、会議が読みやすいプレーンテキストで返ってきます。
あらゆる形式に対応
音声・動画ファイルを問わず、ブラウザでデコードできないコンテナ形式もOK——アップロードすれば、残りはサーバーのトランスコーダが処理します。
言語ヒントまたは自動
認識器に言語のヒントを与えると精度が上がり、自動検出にも対応——書き起こしはクリーンなテキストで、コピーや検索にすぐ使えます。
よくある質問
AI 動画字幕生成ツールとの違いは?⌄
内部で使っている Qwen3-ASR の文字起こしは同じです — このツールはタイムコード、キュー番号、字幕ファイルエディターを省いて、直接プレーンテキストを出力します。SRT/VTT/ASS の字幕ファイルや焼き込み字幕が必要な場合は AI 動画字幕生成をご利用ください。
文字起こしの精度はどのくらいですか?⌄
精度は音質、訛り、背景ノイズによって変わりますが、Qwen3-ASR は一般的な話し言葉(会議、インタビュー、ポッドキャスト、講義)をうまく処理します。ノイズが非常に多い音声や話者が激しく重なる場合は、手作業での確認が必要です。
ファイルはどうなりますか?⌄
アップロードしたファイルと文字起こし結果は30分以内に自動削除されます。ジョブにはセッションの署名付きトークンでしかアクセスできません。
誰が何を言ったかを識別できますか?⌄
現時点では未対応です — 話者分離は開発ロードマップに入っています。インタビューでも多くの場合、句読点のおかげで発話の区切りは見て取れますが、セグメントに話者名は付与されません。
関連ツール
✦ 音声をテキスト化するツールとは?
音声をテキスト化するツールは、録音内の音声をきれいなプレーンテキストの書き起こしに変換します。AI字幕サービスと同じQwen3-ASR音声認識エンジンを搭載し、タイムスタンプも書式もない読みやすいテキストを返します。メモにコピーして、検索して、どこにでも貼り付けられる状態です。音声ファイルと動画ファイルの両方を受け付け、ブラウザでデコードできない形式を含めあらゆる形式に対応します。言語ヒント(自動検出も可)が認識を助け、結果はワンクリックでコピーするか、テキストファイルとしてダウンロードできます。
このツールでできること
- 📝 音声をプレーンテキスト、書式なしの文字に書き起こし
- 🎬 音声ファイルと動画ファイルの両方、任意の形式に対応
- 🌐 言語ヒントを選択——自動、中国語、英語、日本語、韓国語、スペイン語、フランス語、ドイツ語、ポルトガル語、ロシア語、ヒンディー語
- 📋 ワンクリックで書き起こしをコピー、またはテキストファイルをダウンロード
- 🔍 検索や再利用がしやすいクリーンなテキストを生成
こんなときに使えます
- インタビュー録音を文字のノートにする
- 講義をざっと目を通せる学習資料に変換する
- 会議の録音を後から検索可能にする
- 動画のナレーションをテキスト化し、字幕や記事に使う
音声は暗号化された接続でサーバーに送信され、30分以内に自動削除されます。精度は録音次第です。背景ノイズが少なく、単一話者が明瞭に話す内容はよく書き起こせますが、強いノイズ、濃いアクセント、複数話者の重なりは品質を下げます。出力はプレーンテキストのみで、話者ラベルやタイムスタンプはありません。最良の結果を得るには、静かな部屋で録音し、一人ずつ話してください。
最終更新 · 2026-09-01