tomai
ログイン
☁️ クラウド · AI · クレジット

音声からテキストへ

どんな動画・音声の話し言葉もプレーンテキストに文字起こし — Qwen3-ASR 搭載

🪙 1回の文字起こしにつき 5 クレジット

音声はサーバー上で動く Qwen3-ASR によって文字起こしされ、そのままプレーンテキストに変換されます — タイムコードなし、字幕フォーマットなし、言葉だけ。SRT/VTT 字幕が必要な場合は AI 動画字幕生成をご利用ください。

ASRエンジン、対応言語と精度の留意点

文字起こしはQwen3-ASRをワーカー上で実行し、次の特徴を持ちます:

1ジョブあたり最大500 MBまたは2時間の音声まで対応し、所要時間は再生時間の10分の1程度が目安です。出力はページ内に表示され(コピーボタン付き)、UTF-8のTXTとしてダウンロードできます。

使い方

  1. 1

    動画または音声ファイルをアップロード — 形式は問わず、サーバー側でデコードします。

  2. 2

    話されている言語を選ぶか、自動検出のままにします。

  3. 3

    文字起こし結果をコピーするか、.txt ファイルとしてダウンロードします。ファイルは30分以内に自動削除されます。

  4. 4

    文字起こし結果はページからコピーするか、.txtファイルとしてダウンロードできます。元の音声は処理後に削除されます。

話者の区切りまで分かる、句読点付き文字起こし

録音をアップロードすれば、小文字が羅列しただけの壁のようなテキストではなく、句読点と段落付きの読みやすい文章を、11のインターフェース言語のいずれかで受け取れます。

🎧

Qwen3-ASRエンジン

AI字幕と同じ音声認識がサーバー上で動作——インタビュー、講義、会議が読みやすいプレーンテキストで返ってきます。

📝

あらゆる形式に対応

音声・動画ファイルを問わず、ブラウザでデコードできないコンテナ形式もOK——アップロードすれば、残りはサーバーのトランスコーダが処理します。

⏱️

言語ヒントまたは自動

認識器に言語のヒントを与えると精度が上がり、自動検出にも対応——書き起こしはクリーンなテキストで、コピーや検索にすぐ使えます。

よくある質問

AI 動画字幕生成ツールとの違いは?

内部で使っている Qwen3-ASR の文字起こしは同じです — このツールはタイムコード、キュー番号、字幕ファイルエディターを省いて、直接プレーンテキストを出力します。SRT/VTT/ASS の字幕ファイルや焼き込み字幕が必要な場合は AI 動画字幕生成をご利用ください。

文字起こしの精度はどのくらいですか?

精度は音質、訛り、背景ノイズによって変わりますが、Qwen3-ASR は一般的な話し言葉(会議、インタビュー、ポッドキャスト、講義)をうまく処理します。ノイズが非常に多い音声や話者が激しく重なる場合は、手作業での確認が必要です。

ファイルはどうなりますか?

アップロードしたファイルと文字起こし結果は30分以内に自動削除されます。ジョブにはセッションの署名付きトークンでしかアクセスできません。

誰が何を言ったかを識別できますか?

現時点では未対応です — 話者分離は開発ロードマップに入っています。インタビューでも多くの場合、句読点のおかげで発話の区切りは見て取れますが、セグメントに話者名は付与されません。

関連ツール

✦ 音声をテキスト化するツールとは?

音声をテキスト化するツールは、録音内の音声をきれいなプレーンテキストの書き起こしに変換します。AI字幕サービスと同じQwen3-ASR音声認識エンジンを搭載し、タイムスタンプも書式もない読みやすいテキストを返します。メモにコピーして、検索して、どこにでも貼り付けられる状態です。音声ファイルと動画ファイルの両方を受け付け、ブラウザでデコードできない形式を含めあらゆる形式に対応します。言語ヒント(自動検出も可)が認識を助け、結果はワンクリックでコピーするか、テキストファイルとしてダウンロードできます。

このツールでできること

  • 📝 音声をプレーンテキスト、書式なしの文字に書き起こし
  • 🎬 音声ファイルと動画ファイルの両方、任意の形式に対応
  • 🌐 言語ヒントを選択——自動、中国語、英語、日本語、韓国語、スペイン語、フランス語、ドイツ語、ポルトガル語、ロシア語、ヒンディー語
  • 📋 ワンクリックで書き起こしをコピー、またはテキストファイルをダウンロード
  • 🔍 検索や再利用がしやすいクリーンなテキストを生成

こんなときに使えます

  • インタビュー録音を文字のノートにする
  • 講義をざっと目を通せる学習資料に変換する
  • 会議の録音を後から検索可能にする
  • 動画のナレーションをテキスト化し、字幕や記事に使う

音声は暗号化された接続でサーバーに送信され、30分以内に自動削除されます。精度は録音次第です。背景ノイズが少なく、単一話者が明瞭に話す内容はよく書き起こせますが、強いノイズ、濃いアクセント、複数話者の重なりは品質を下げます。出力はプレーンテキストのみで、話者ラベルやタイムスタンプはありません。最良の結果を得るには、静かな部屋で録音し、一人ずつ話してください。

最終更新 · 2026-09-01

関連ツール