AI文字起こし市場の成長構造を証券アナリストの目線で分解する【2026年版】
「会議やインタビューの録音を、そのまま文字にできるAI」は、2026年いま、最も構造が読みやすいSaaS市場のひとつになっています。この記事では、証券会社のアナリストが産業を分析するときと同じ枠組み――市場規模、成長ドライバー、原価構造、競争環境、ユニットエコノミクス――を使って、AI文字起こし市場を分解します。
最初に結論を書きます。市場は2桁近いCAGRで拡大し、原価は急落し、参入障壁は下がった。だからこそ、勝ち負けは「モデルの精度」ではなく「体験・信頼・収益構造」で決まるフェーズに入った。この構造変化は、サービスを選ぶユーザー側にも、市場を理解したい投資家側にも同じように効いてきます。
なお筆者はAI音声SaaS「PUBVOICE」を開発・販売しています。本稿は自社を紹介する記事ではなく、公開データに基づく市場の整理が目的です。PUBVOICE の位置づけは最後にだけ簡単に触れます。
1. 市場規模: 複数の推計を読み交わせること
文字起こし関連市場の推計は調査会社によって幅があります。単一ソースを鵜呑みにせず、複数を読み交わすのが筋です。
| 調査 | 対象 | 推計 |
|---|---|---|
| MarketsandMarkets | 音声・スピーチ認識 | 2025年 96.6億ドル → 2030年 231.1億ドル(CAGR 約19%) |
| Mordor Intelligence | 音声認識 | 2026年 225.1億ドル → 2031年 617.8億ドル(CAGR 22.4%) |
| ResearchAndMarkets | Speech-to-Text API | 2026年 53.6億ドル → 2030年 104.6億ドル(CAGR 18.2%) |
| Market.us | AI文字起こしツール | 2024年 45億ドル → 2034年 192億ドル(CAGR 15.6%) |
定義の広狭で水準は変わりますが、読み方は一貫しています。この市場のCAGRは15〜22%のレンジにあり、世界経済の名目成長率を大きく上回る。SaaS市場全体の成長率が鈍化するなか、音声はいまだ「アーリー」なカテゴリです。
2. 成長ドライバー: 需要は「会議」だけではない
成長を支える需要は3層に分かれています。
第1層: リモートワークの定着。 オンライン会議は録音が前提の環境で行われます。会議の実施と調整に勤務時間の約3割を費やしているという調査(PR TIMES)もあり、「聞き逃した会議を後からテキストで追う」需要は構造的に増えています。
第2層: ナレッジワークの「記録義務化」。 議事録、保険・金融の勧誘記録、医療のカルテ、取材メモ。音声を証跡として残し、テキストとして再利用する業務は業種を問わず広がっています。会議1時間の情報量は約20,000文字以上とされ、手作業の文字起こしには平均4〜5時間かかるとされます(日刊工業新聞の整理による)。
第3層: クリエイター経済。 ポッドキャスト、YouTube、オンラインサロンの台頭で、「音声コンテンツをテキストにして再利用する」需要が新しく生まれました。字幕(SRT/VTT)、記事化、要約――文字起こしはコンテンツ制作の上流工程になりつつあります。
3. 原価コーブの崩壊: 3年で1桁下落したASR単価
ここが、この市場を理解するうえで最も重要なポイントです。音声認識API(ASR)の単価は、ここ数年で劇的に下落しました。
| API | 公表単価の目安 |
|---|---|
| AWS Transcribe(バッチ) | 約$0.024/分 |
| Azure AI Speech | 約$0.016〜0.024/分 |
| Google Chirp 3(標準) | 約$0.016/分 |
| OpenAI Whisper API | $0.006/分 |
| Deepgram Nova-3(バッチ) | 約$0.0043/分 |
| Google(動的バッチ) | 約$0.003/分 |
| AssemblyAI | 約$0.0025/分 |
標準的なバッチ認識で比較すると、1時間あたりの原価は1ドル前後から20セントを切る水準まで下がっています。オープンソースのWhisperを自前でホスティングすれば、さらに安くできます。
アナリスト的には、この事実は2つの帰結を意味します。
- 「どのモデルを使っているか」は差別化因子ではなくなった。主要APIの認識精度は実用域に達し、原価差は小さい。ユーザーが体感する差は、 UI、編集機能、話者分離の扱い、書き出し形式、価格設計といった体験層に移る。
- マージンは原価ではなく運用で決まる。API原価が1時間20円を切るいま、小売価格(日本市場で1時間200円〜1,650円程度、後述)との差額の大部分は、製品体験と信頼に対して支払われる。粗利率の観点では非常に健全な構造で、裏を返せば体験を作れないプレイヤーは価格競争に巻き込まれる。
4. 競争環境: グローバルと日本
グローバル: 「資本効率」が物語る市場の成熟
会議文字起こしの先行2社の構図は示唆的です。Fireflies.aiは2025年に評価額10億ドル(ユニコーン)に到達しましたが、調達額は総額約1,900万ドルと小さく、推定ARRは2023年580万ドル→2024年1,090万ドル(Latka)。少ない資本で粗利の高い事業を回していることを意味します。一方のOtter.aiはSequoiaらから累計数千万ドルを調達し、一般向けの認知度では先行。両社ともZoom・Teams・Meetとの連携を主戦場にしていますが、ZoomやTeams自身のネイティブAI機能が台頭し、「会議ボット連携」の地盤はプラットフォーマーに脅かされているのも事実です。
日本: 会議系とファイル持ち込み系
日本市場の主要プレイヤーは、用途で2系統に分かれます。
- 会議系(オンライン会議に自動で入って記録): スマート書記(Otolio)、AI GIJIROKU、toruno、Nottaなど。BOXILの1,690人調査ではスマート書記がシェア1位(BOXIL)。
- ファイル持ち込み系(録音済み音声をアップロードして文字起こし): Rimo Voice、Sacscribe、Notta、PUBVOICEなど。インタビュー取材、講義、研修、法廷・弁護士業務など、会議以外の音声需要を支える。
会議系は「導入して放置」できる分、企業契約(シート課金)と相性が良い一方、ファイル持ち込み系は「いま手元にある音声をどう処理するか」という個々のタスク起点のため、個人・小規模チームからの浸透が早い。ITreviewの集計では日本語特化AIで1時間198円〜というサービスも登場し、価格の実勤は1時間数百円〜1,650円程度のレンジにあります。
5. ユニットエコノミクス: 誰が儲かる構造か
簡易モデルで粗利構造を見ます。バッチ認識のAPI原価を1時間約30円(為替と従量課金の前提次第で20〜100円程度に変動)、小売価格を1時間500円と仮定すると、粗利率は90%超。クラウドの原価が支配的だった2010年代の動画エンコード事業とは逆の、極めてソフトウェア的な経済性です。
ただし注意が2点あります。第1に、リアルタイム認識(ストリーミング)は単価がバッチの数倍であり、無制額を謳うプランは原価管理がシビアになります。第2に、話者分離(diarization)や要約などの付加処理はAPIコストを押し上げるため、「何に課金し、何を無料に見せるか」の設計がそのまま利益率になる。
つまりこの市場の収益構造は、原価高騰リスクよりも「価格競争に巻き込まれるリスク」に支配されます。だからこそ各社は、編集体験、話者名の修正、用語登録、書き出し、セキュリティ(国内データ処理)といった、切り替えコストを生む体験層に投資しているわけです。
6. この市場でサービスを選ぶときの軸
分析をユーザー側の実務に戻すと、選定軸は次の5つに集約できます。
- 精度より「聞き直しの少なさ」: WER(文字誤り率)の数字より、話者分離の精度と固有名詞の強化(用語登録)が実効精度を決める
- 料金の射程: 無料枠の実質(累計か月次か)、1時間あたりの実効単価、従量か定額か
- 書き出しと再利用: TXT/SRT/VTT形式、話者名付き、クリップボードコピー
- データの居場所: 国内処理・保存期間・訓練利用の有無(法人では最初の関門)
- 導入の摩擦: 登録前に試せるか。会議系かファイル持ち込み系か
7. PUBVOICEの位置づけ(開示)
最後に自社の話を短く。PUBVOICEはファイル持ち込み型の文字起こしサービスで、①登録不要で90秒まで試せるゲスト体験、②話者分離付きの文字起こしとエディタ、③TXT/SRT/VTT書き出し、④文字起こしと音声生成(TTS)の両方を1アカウントで使える点を特徴としています。市場分析の結論――原価が下がり体验が差別化する――に沿った設計をしている、というのが正直な自己評価です。
市場はまだアーリーで、選択肢は増え続けます。本稿のフレーム(市場規模→原価→競争→ユニットエコノミクス)で各社の発表を読み解くと、広告に流されずに判断できるはずです。
関連する記事
- 【2026年版】AI文字起こしサービス徹底比較――個人とチームのための選び方 ―― 主要サービスの料金・無料枠・話者分離・書き出しを実データで比較
- インタビュー・議事録の文字起こし完全ガイド ―― 録音のコツからSRT/VTTの使い分けまで、実務ワークフローを解説

笹尾 祐太朗
代表取締役 / 株式会社メディアリープ
KADOKAWA / ドワンゴでのWebメディア収益化・データ分析、SSP / アドネットワーク事業でのプログラマティック広告収益化支援を経て、2025年5月に株式会社メディアリープを創業。AI音声SaaS「PUBVOICE」、観光DXアプリ「ANIME TRAVEL」、音声AIチャットアプリ「AITOMO」を企画・開発・運営。広告・技術・分析・事業を横断する視点から、データをもとにしたメディア収益改善に取り組む。
関連記事
【2026年版】AI文字起こしサービス徹底比較――個人とチームのための選び方
Notta・toruno・Rimo Voice・スマート書記・AI GIJIROKU・YOMEL・PUBVOICEを、無料枠・料金の実効単価・話者分離・編集・書き出し形式の5軸で比較。議事録・インタビュー・講義・字幕などタスク別の選び方と、年間コストの試算例つき。
インタビュー・議事録の文字起こし完全ガイド――録音からSRT/VTT書き出しまでの実務ワークフロー
会議1時間の文字起こしには手作業で4〜5時間かかるが、AIなら数分。録音のコツ(マイク位置・フォーマット)、話者分離付き文字起こしの流れ、議事録と記事原稿への落とし込み方、SRTとVTTの違いと使い分けまで、実務のワークフロー全体を解説する。