対応形式: MP3 / M4A / WAV / AAC / OGG / FLAC などの音声、MP4 / MOV / WebM などの動画
ボタンを押してマイクに話しかけると、ひと息ついたところで文字になります
00:00
音声はお使いの端末内だけで処理され、サーバーには送信されません。初回のみ音声認識モデルをダウンロードします(2回目以降はブラウザに保存されたものを使います)。
文字起こしの結果
結果は直接書き直せます(時刻の表示を切り替えると、書き直した内容は元に戻ります)。
らくらく音声文字起こしとは
音声や動画のファイルを、AIが自動でテキストにする無料の文字起こしツールです。会議やインタビューの録音、講義、動画のナレーションなどをテキストにでき、時刻付きのテキストや動画の字幕ファイル(SRT)としてダウンロードできます。マイクに話しかけて、その場で文字にすることもできます。音声認識にはOpenAIが公開しているAI「Whisper」を使い、お使いの端末(ブラウザ)の中だけで処理するため、音声はサーバーに送信されません。アカウント登録も不要です。
使い方
- 「ファイルを選択」から音声・動画ファイルを選ぶ(ドラッグ&ドロップも可)
- 話している言語と精度を選ぶ
- 「文字起こしを開始」を押す(初回のみ音声認識モデルのダウンロードがあります)
- 結果をコピーするか、テキスト・字幕ファイルとしてダウンロードする
マイクで話した言葉を文字にするときは、「マイクで話す」タブで「話しはじめる」を押してください。ひと息ついたところで、話した内容が順に文字になります。
精度の選び方
| 精度 | 向いている使い方 |
|---|---|
| 標準 | 速さ重視。はっきり話している音声、スマートフォンでの利用、マイクでの入力 |
| 高精度 | 正確さ重視。専門用語や固有名詞が多い会議・講義、雑音のある録音(パソコン推奨) |
よくある質問
音声や動画はサーバーにアップロードされますか?
されません。文字起こしはAI(Whisper)がお使いの端末(ブラウザ)内で行います。初回のみ音声認識モデルをダウンロードしますが、音声の内容は送信されないため、会議の録音など社外秘の音声にも使えます。
どのくらいの時間がかかりますか?
端末の性能によりますが、パソコンで「標準」の精度なら音声の長さの数分の1ほどが目安です。「高精度」は精度が上がる代わりに数倍の時間がかかります。スマートフォンではパソコンより時間がかかります。
動画の字幕ファイルは作れますか?
作れます。文字起こしの結果を字幕ファイル(SRT形式)でダウンロードでき、YouTubeや動画編集ソフトに読み込めます。
話者の区別はできますか?
話者の区別(誰が話したか)には対応していません。話の区切りごとに1行ずつ出力されます。
長い音声でも使えますか?
1〜2時間程度の音声まで使えます。ただし音声全体を端末のメモリに読み込むため、とても長いファイルや大きな動画では読み込めないことがあります。その場合は音声を分割するか、音声だけのファイル(M4A・MP3など)にしてからお試しください。
機能別のページ・関連ツール
気に入ったら応援してください
このサイトは無料で運営しています。コーヒー1杯分の応援が励みになります。