対応形式と上限
対応形式: MP3 / WAV / M4A / WEBM / FLAC / MP4
1ファイル: 最大2時間・500MBまで
無料プラン: 毎月60分の文字起こし+10,000字の音声生成(クレジットカード不要)。登録前ならトップページで90秒まで試せます。
1.音声ファイルをアップロードする
ワークスペース(/transcripts)の「新規文字起こし」にファイルをドラッグ&ドロップするか、「ファイルを選択」から選びます。音声が手元になければ「サンプル音声で試す」で同じ流れを体験できます。

2.自動で文字起こしされます
アップロード後は自動で処理が始まり、一覧のステータス(キュー待ち→処理中→完了)が自動更新されます。完了すると、話者ラベルとタイムスタンプ付きのセグメント単位で結果が保存されます。

3.エディタで編集する
詳細画面を開くと、音声プレイヤーと連動したエディタで編集できます。セグメントをクリックするとその位置から再生され、話者名(話者1→実名など)の変更は文字起こし全体に反映されます。文書内検索で誤認識箇所を素早く見つけられます。

4.書き出す(TXT / SRT / VTT)
議事メモには話者名付きTXT、動画の字幕にはSRT/VTTをそのまま書き出せます。クリップボードコピーで議事録やチャットにすぐ貼り付けられます。

5.書いた文章を音声にする(音声生成)
音声生成(/speech)にテキストを貼り付けると、自然な読み上げ音声(MP3)を生成できます。文字起こしから編集したテキストをそのままナレーション化できます。上位プランでは感情表現タグやより多くの音声が使えます。

良い録音のコツ(精度を上げる5つのポイント)
- マイクは話者に近づける。スマホ1台で離れた複数人を拾うと話者分離の精度が落ちます
- 話し被り(クロストーク)を減らす。ファシリテーターが「順に発言」を促すだけでも編集時間が大きく変わります
- 録音前に30秒ほどテスト録音して、一番声の小さい人が入っているか確認する
- 標準的な形式(MP3/M4A)で録音する。一部の非圧縮形式や特殊なコーデックは変換してからアップロードしてください
- 録音の同意を取る。会議・インタビューでは録音と利用目的を参加者に伝えるのが実務の標準です
データの扱いについて
- 音声と文字起こし結果はあなたのアカウントにのみ紐付けて保存され、他のユーザーに公開されません
- AIモデルの学習データとして利用されることはありません
- 不要になったデータはワークスペースからいつでも削除できます