インタビュー・議事録の文字起こし完全ガイド――録音からSRT/VTT書き出しまでの実務ワークフロー
取材が終わってからが、本当の仕事です。インタビューの録音1時間を原稿にできる形にするには、手作業だと4〜5時間かかるとされます。会議の議事録も同じで、1時間の会議には20,000文字以上の情報が含まれ、それを要約して証跡として残す作業は、多くの職場でいまだに「誰かの夜」を消費しています。
このガイドでは、録音のコツ → AI文字起こし → 編集 → 議事録/原稿/字幕への書き出しまでの実務ワークフローを最初から最後まで通しで解説します。使うツールはPUBVOICEを例に取りますが、録音の原則やSRT/VTTの使い分けなど、大部分はどの文字起こしサービスでも共通です。
最初に押さえる: 時間とコストの現実
録音1時間あたりの処理時間を比べてみます。
| 方法 | 所要時間の目安 | 備考 |
|---|---|---|
| 手作業での書き起こし | 4〜5時間 | 「聞き直し」を含む実質時間 |
| 外注(人) | 納期数日〜 | 1時間あたり数千円〜が相場 |
| AI文字起こし+編集 | 10〜30分 | 誤認識修正と読み直しが主作業 |
AIに置き換わるのは「打ち込む時間」であって「確認する時間」ではありません。ただし打ち込みが消えるだけで、作業全体は1/10以下になる。これがワークフローを組む前提です。
ステップ0: 録音――ここで品質の8割が決まる
文字起こしの精度を最も左右するのは、AIではなく録音です。プロの取材で使われる原則を要約します。
- マイクは話者に近づける。スマホ1台で全員を拾う遠距離録音は、話者分離の精度が最も落ちるパターンです。可能なら話者ごとにレコーダーを近づけるか、会議なら各人の発話がはっきり入る配置にする
- クロストーク(同時発話)を減らす。話し被りは認識精度と話者分離の両方を壊します。ファシリテーターが「順にお願いします」と一言入れるだけで、後の編集時間が大きく変わります
- 録音フォーマットは可逆性より安定性。mp3/m4a/wavなど標準的な形式で録音してください。PUBVOICEは500MBまで、5時間を超える長尺録音にも対応します
- 録音前に一言テスト。最初の30秒を録って再生し、「一番声が小さい人」が入っているか確認する。これだけでも失敗はほぼ防げます
ステップ1: アップロードと文字起こし
PUBVOICEでの流れはシンプルです。
- ワークスペース(
/transcripts)に音声ファイルをドラッグ&ドロップ - 処理中はステータスが逐次更新され(キュー待ち → 処理中 → 完了)、完了すると自動で一覧に反映
- 完了した文字起こしには話者ラベル(話者1/話者2…)とタイムスタンプが付いたセグメント単位の本文が入る
初めてなら、登録前にトップページから90秒までの音声で試せます。話者分離の精度は録音環境で変わるので、「自分のよく録る音声」で試すのがおすすめです。
ステップ2: 編集――「誰が言ったか」を直す
AI文字起こしの誤認識は、実務では3種類に分かれます。
- 固有名詞・専門用語の誤り(社名、人名、業界用語)→ 最も多い
- 話者割り当ての誤り(AとBが入れ替わる)→ 話者が近い・声質が似ているときに発生
- 同音異義語の選び違い→ 文脈確認で直す
PUBVOICEのエディタでは、話者名の一括変更(話者1→「田中さん」)と、文書内検索で誤認識箇所を拾って直す流れが基本です。エディタ上で音声プレイヤーと連動してハイライトされるため、「怪しい箇所をクリックして聞き直す」動作がその場でできます。ここが外注と違い、確認作業が文字起こし直後の熱が冷めないうちにできる利点です。
ステップ3A: 議事録にする
トランスクリプトから議事録を作る要点は「全部書かない」ことです。
- 決定事項を先に抜き出す(議事録の本体)
- **TODO(誰が・いつまでに)**を表にする
- 経緯が必要なものだけ、該当セグメントから短く引用する
- 未決事項と次回議題を末尾に置く
セグメント単位のタイムスタンプが付いているため、「どの発言がどの時間帯か」をtraceできる状態で保存しておくと、後で「あの決定、いつだっけ?」が出たときに強いです。TXT(話者付き)で書き出せば、そのまま社内共有のベースになります。
ステップ3B: 記事原稿にする(インタビュー)
取材文字起こしから記事を書く流れ:
- 話者名を実名に直し、読みやすい段落に分割
- 使う発言(引用)に印を付ける――紙の頃と同じ作業
- 構成に沿って引用を並べ、地の文を書く
- 完成前にタイムスタンプで原音を確認(特に数値と固有名詞)
ここでも確認の高速化が効きます。数値の引用ミスは記事の命取りになりますが、エディタで該当時間をクリックして原音を1クリックで聞けるため、ファクトチェックの往復が短縮されます。
ステップ3C: 字幕にする――SRTとVTTの違い
動画やポッドキャストに字幕を付ける場合、書き出し形式の選択が必要です。この2つは中身がほぼ同じで、フォーマットの細部が違います。
| 形式 | 主な用途 | 特徴 |
|---|---|---|
| SRT | YouTube、Premiere Pro、Final Cutなど編集ソフト全般 | 最も普及している字幕形式。HH:MM:SS,mmm(カンマ区切り) |
| VTT | HTML5 <video>、Web埋め込みプレイヤー |
ヘッダー(WEBVTT)が必要。HH:MM:SS.mmm(ピリオド区切り)。スタイル付け可能 |
| TXT(話者付き) | 議事録・原稿・アーカイブ | 話者名と時刻付きの読みやすいテキスト |
迷ったらSRT。ほぼすべての動画ツールが読めます。Webプレイヤーへの直接埋め込みならVTTです。PUBVOICEはこの3形式すべてに対応しているので、文字起こし1回から全用途に書き出せます。
セキュリティと取扱いの注意
- 録音の同意: 日本では会議やインタビューの録音は原則合法ですが、取材先・参加者に録音と文字起こしの利用目的を伝えるのが実務の標準です(一部業界・地域では同意が必須)
- 機密情報: 役員会・法務・人事関連の音声は、サービスのデータ保存場所と保存期間を確認してから使いましょう。外部送信が問題になる案件は、編集段階でマスキングする運用も併用します
- 保存期間の設計: 文字起こしが証跡になる案件では、元音声とトランスクリプトの保管期限を最初に決めておく
FAQ
Q. 長時間の録音(2〜3時間の講義など)でも大丈夫ですか?
A. 大丈夫です。PUBVOICEは1ファイル500MBまで対応します。話者分離つきで処理されるため、講義の質疑応答部分も話者が分かれた状態で残ります。
Q. 方言や非標準的な話し方はどのくらい通りますか?
A. 日本語の標準話法で最も精度が出ます。方言・早口・小声は誤認識が増えるため、録音段階(ステップ0)の工夫の効果が大きい分野です。
Q. 英語など他言語の音声は?
A. 日本語以外の音声も処理できますが、現行の最適化は日本語向けです。多言語が主用途なら、比較記事の多言語対応サービス(Nottaなど)も検討してください。
Q. 文字起こし結果をチームで共有できますか?
A. 書き出したTXT/SRT/VTTはそのまま共有できます。議事録運用なら、決定事項とTODOを抽出した要約版を共有し、タイムスタンプ付き全文を証跡として残す二段構えが定番です。
関連する記事
- AI文字起こし市場の成長構造を証券アナリストの目線で分解する ―― なぜいま文字起こしは安く、速くなったのか
- 【2026年版】AI文字起こしサービス徹底比較 ―― 主要サービスの料金・無料枠・書き出し対応の比較表

笹尾 祐太朗
代表取締役 / 株式会社メディアリープ
KADOKAWA / ドワンゴでのWebメディア収益化・データ分析、SSP / アドネットワーク事業でのプログラマティック広告収益化支援を経て、2025年5月に株式会社メディアリープを創業。AI音声SaaS「PUBVOICE」、観光DXアプリ「ANIME TRAVEL」、音声AIチャットアプリ「AITOMO」を企画・開発・運営。広告・技術・分析・事業を横断する視点から、データをもとにしたメディア収益改善に取り組む。
関連記事
【2026年版】AI文字起こしサービス徹底比較――個人とチームのための選び方
Notta・toruno・Rimo Voice・スマート書記・AI GIJIROKU・YOMEL・PUBVOICEを、無料枠・料金の実効単価・話者分離・編集・書き出し形式の5軸で比較。議事録・インタビュー・講義・字幕などタスク別の選び方と、年間コストの試算例つき。
AI文字起こし市場の成長構造を証券アナリストの目線で分解する【2026年版】
音声認識市場は2025年96億ドル→2030年231億ドル(CAGR約19%)と伸びる。原価は3年で1桁下落し、競争の軸は精度から体験へ移った。市場規模・原価コーブ・日本の需要データ・競争環境・ユニットエコノミクスまで、証券リサーチ並みの粒度で分解する。