PUBVOICE.
    FEATURESPRICINGFAQHELP
    ログイン無料で始める
    AI文字起こし市場の成長構造を証券アナリストの目線で分解する【2026年版】

    AI文字起こし市場の成長構造を証券アナリストの目線で分解する【2026年版】

    2026年10月4日

    目次

    1. 1.1. 市場規模: 複数の推計を読み交わせること
    2. 2.2. 成長ドライバー: 需要は「会議」だけではない
    3. 3.3. 原価コーブの崩壊: 3年で1桁下落したASR単価
    4. 4.4. 競争環境: グローバルと日本
    5. ·グローバル: 「資本効率」が物語る市場の成熟
    6. ·日本: 会議系とファイル持ち込み系
    7. 7.5. ユニットエコノミクス: 誰が儲かる構造か
    8. 8.6. この市場でサービスを選ぶときの軸
    9. 9.7. PUBVOICEの位置づけ(開示)
    10. 10.関連する記事

    「会議やインタビューの録音を、そのまま文字にできるAI」は、2026年いま、最も構造が読みやすいSaaS市場のひとつになっています。この記事では、証券会社のアナリストが産業を分析するときと同じ枠組み――市場規模、成長ドライバー、原価構造、競争環境、ユニットエコノミクス――を使って、AI文字起こし市場を分解します。

    最初に結論を書きます。市場は2桁近いCAGRで拡大し、原価は急落し、参入障壁は下がった。だからこそ、勝ち負けは「モデルの精度」ではなく「体験・信頼・収益構造」で決まるフェーズに入った。この構造変化は、サービスを選ぶユーザー側にも、市場を理解したい投資家側にも同じように効いてきます。

    なお筆者はAI音声SaaS「PUBVOICE」を開発・販売しています。本稿は自社を紹介する記事ではなく、公開データに基づく市場の整理が目的です。PUBVOICE の位置づけは最後にだけ簡単に触れます。

    1. 市場規模: 複数の推計を読み交わせること

    文字起こし関連市場の推計は調査会社によって幅があります。単一ソースを鵜呑みにせず、複数を読み交わすのが筋です。

    調査 対象 推計
    MarketsandMarkets 音声・スピーチ認識 2025年 96.6億ドル → 2030年 231.1億ドル(CAGR 約19%)
    Mordor Intelligence 音声認識 2026年 225.1億ドル → 2031年 617.8億ドル(CAGR 22.4%)
    ResearchAndMarkets Speech-to-Text API 2026年 53.6億ドル → 2030年 104.6億ドル(CAGR 18.2%)
    Market.us AI文字起こしツール 2024年 45億ドル → 2034年 192億ドル(CAGR 15.6%)

    定義の広狭で水準は変わりますが、読み方は一貫しています。この市場のCAGRは15〜22%のレンジにあり、世界経済の名目成長率を大きく上回る。SaaS市場全体の成長率が鈍化するなか、音声はいまだ「アーリー」なカテゴリです。

    2. 成長ドライバー: 需要は「会議」だけではない

    成長を支える需要は3層に分かれています。

    第1層: リモートワークの定着。 オンライン会議は録音が前提の環境で行われます。会議の実施と調整に勤務時間の約3割を費やしているという調査(PR TIMES)もあり、「聞き逃した会議を後からテキストで追う」需要は構造的に増えています。

    第2層: ナレッジワークの「記録義務化」。 議事録、保険・金融の勧誘記録、医療のカルテ、取材メモ。音声を証跡として残し、テキストとして再利用する業務は業種を問わず広がっています。会議1時間の情報量は約20,000文字以上とされ、手作業の文字起こしには平均4〜5時間かかるとされます(日刊工業新聞の整理による)。

    第3層: クリエイター経済。 ポッドキャスト、YouTube、オンラインサロンの台頭で、「音声コンテンツをテキストにして再利用する」需要が新しく生まれました。字幕(SRT/VTT)、記事化、要約――文字起こしはコンテンツ制作の上流工程になりつつあります。

    3. 原価コーブの崩壊: 3年で1桁下落したASR単価

    ここが、この市場を理解するうえで最も重要なポイントです。音声認識API(ASR)の単価は、ここ数年で劇的に下落しました。

    API 公表単価の目安
    AWS Transcribe(バッチ) 約$0.024/分
    Azure AI Speech 約$0.016〜0.024/分
    Google Chirp 3(標準) 約$0.016/分
    OpenAI Whisper API $0.006/分
    Deepgram Nova-3(バッチ) 約$0.0043/分
    Google(動的バッチ) 約$0.003/分
    AssemblyAI 約$0.0025/分

    標準的なバッチ認識で比較すると、1時間あたりの原価は1ドル前後から20セントを切る水準まで下がっています。オープンソースのWhisperを自前でホスティングすれば、さらに安くできます。

    アナリスト的には、この事実は2つの帰結を意味します。

    1. 「どのモデルを使っているか」は差別化因子ではなくなった。主要APIの認識精度は実用域に達し、原価差は小さい。ユーザーが体感する差は、 UI、編集機能、話者分離の扱い、書き出し形式、価格設計といった体験層に移る。
    2. マージンは原価ではなく運用で決まる。API原価が1時間20円を切るいま、小売価格(日本市場で1時間200円〜1,650円程度、後述)との差額の大部分は、製品体験と信頼に対して支払われる。粗利率の観点では非常に健全な構造で、裏を返せば体験を作れないプレイヤーは価格競争に巻き込まれる。

    4. 競争環境: グローバルと日本

    グローバル: 「資本効率」が物語る市場の成熟

    会議文字起こしの先行2社の構図は示唆的です。Fireflies.aiは2025年に評価額10億ドル(ユニコーン)に到達しましたが、調達額は総額約1,900万ドルと小さく、推定ARRは2023年580万ドル→2024年1,090万ドル(Latka)。少ない資本で粗利の高い事業を回していることを意味します。一方のOtter.aiはSequoiaらから累計数千万ドルを調達し、一般向けの認知度では先行。両社ともZoom・Teams・Meetとの連携を主戦場にしていますが、ZoomやTeams自身のネイティブAI機能が台頭し、「会議ボット連携」の地盤はプラットフォーマーに脅かされているのも事実です。

    日本: 会議系とファイル持ち込み系

    日本市場の主要プレイヤーは、用途で2系統に分かれます。

    • 会議系(オンライン会議に自動で入って記録): スマート書記(Otolio)、AI GIJIROKU、toruno、Nottaなど。BOXILの1,690人調査ではスマート書記がシェア1位(BOXIL)。
    • ファイル持ち込み系(録音済み音声をアップロードして文字起こし): Rimo Voice、Sacscribe、Notta、PUBVOICEなど。インタビュー取材、講義、研修、法廷・弁護士業務など、会議以外の音声需要を支える。

    会議系は「導入して放置」できる分、企業契約(シート課金)と相性が良い一方、ファイル持ち込み系は「いま手元にある音声をどう処理するか」という個々のタスク起点のため、個人・小規模チームからの浸透が早い。ITreviewの集計では日本語特化AIで1時間198円〜というサービスも登場し、価格の実勤は1時間数百円〜1,650円程度のレンジにあります。

    5. ユニットエコノミクス: 誰が儲かる構造か

    簡易モデルで粗利構造を見ます。バッチ認識のAPI原価を1時間約30円(為替と従量課金の前提次第で20〜100円程度に変動)、小売価格を1時間500円と仮定すると、粗利率は90%超。クラウドの原価が支配的だった2010年代の動画エンコード事業とは逆の、極めてソフトウェア的な経済性です。

    ただし注意が2点あります。第1に、リアルタイム認識(ストリーミング)は単価がバッチの数倍であり、無制額を謳うプランは原価管理がシビアになります。第2に、話者分離(diarization)や要約などの付加処理はAPIコストを押し上げるため、「何に課金し、何を無料に見せるか」の設計がそのまま利益率になる。

    つまりこの市場の収益構造は、原価高騰リスクよりも「価格競争に巻き込まれるリスク」に支配されます。だからこそ各社は、編集体験、話者名の修正、用語登録、書き出し、セキュリティ(国内データ処理)といった、切り替えコストを生む体験層に投資しているわけです。

    6. この市場でサービスを選ぶときの軸

    分析をユーザー側の実務に戻すと、選定軸は次の5つに集約できます。

    1. 精度より「聞き直しの少なさ」: WER(文字誤り率)の数字より、話者分離の精度と固有名詞の強化(用語登録)が実効精度を決める
    2. 料金の射程: 無料枠の実質(累計か月次か)、1時間あたりの実効単価、従量か定額か
    3. 書き出しと再利用: TXT/SRT/VTT形式、話者名付き、クリップボードコピー
    4. データの居場所: 国内処理・保存期間・訓練利用の有無(法人では最初の関門)
    5. 導入の摩擦: 登録前に試せるか。会議系かファイル持ち込み系か

    7. PUBVOICEの位置づけ(開示)

    最後に自社の話を短く。PUBVOICEはファイル持ち込み型の文字起こしサービスで、①登録不要で90秒まで試せるゲスト体験、②話者分離付きの文字起こしとエディタ、③TXT/SRT/VTT書き出し、④文字起こしと音声生成(TTS)の両方を1アカウントで使える点を特徴としています。市場分析の結論――原価が下がり体验が差別化する――に沿った設計をしている、というのが正直な自己評価です。

    市場はまだアーリーで、選択肢は増え続けます。本稿のフレーム(市場規模→原価→競争→ユニットエコノミクス)で各社の発表を読み解くと、広告に流されずに判断できるはずです。

    関連する記事

    • 【2026年版】AI文字起こしサービス徹底比較――個人とチームのための選び方 ―― 主要サービスの料金・無料枠・話者分離・書き出しを実データで比較
    • インタビュー・議事録の文字起こし完全ガイド ―― 録音のコツからSRT/VTTの使い分けまで、実務ワークフローを解説
    笹尾 祐太朗

    笹尾 祐太朗

    代表取締役 / 株式会社メディアリープ

    KADOKAWA / ドワンゴでのWebメディア収益化・データ分析、SSP / アドネットワーク事業でのプログラマティック広告収益化支援を経て、2025年5月に株式会社メディアリープを創業。AI音声SaaS「PUBVOICE」、観光DXアプリ「ANIME TRAVEL」、音声AIチャットアプリ「AITOMO」を企画・開発・運営。広告・技術・分析・事業を横断する視点から、データをもとにしたメディア収益改善に取り組む。

    ← ブログ一覧に戻る

    関連記事

    【2026年版】AI文字起こしサービス徹底比較――個人とチームのための選び方

    Notta・toruno・Rimo Voice・スマート書記・AI GIJIROKU・YOMEL・PUBVOICEを、無料枠・料金の実効単価・話者分離・編集・書き出し形式の5軸で比較。議事録・インタビュー・講義・字幕などタスク別の選び方と、年間コストの試算例つき。

    インタビュー・議事録の文字起こし完全ガイド――録音からSRT/VTT書き出しまでの実務ワークフロー

    会議1時間の文字起こしには手作業で4〜5時間かかるが、AIなら数分。録音のコツ(マイク位置・フォーマット)、話者分離付き文字起こしの流れ、議事録と記事原稿への落とし込み方、SRTとVTTの違いと使い分けまで、実務のワークフロー全体を解説する。

    +
    平均3倍滞在時間
    +5%リピーター
    30+音声パターン
    ◆ 無料プランあり

    まずは無料で、
    音声配信を体験してください。

    実際の記事を使って、音声体験を無料でお試しいただけます。
    Freeプランですべての基本機能を無料でご利用いただけます。

    無料で始める機能をもっと見る

    クレジットカード不要 · いつでもキャンセル可能

    P
    PUBVOICE.

    AUDIO_CONTENT
    PLATFORM V1.0

    ◆ ALL SYSTEMS OPERATIONAL

    PRODUCT

    • PUBVOICEとは
    • ブログ

    COMPANY

    • 会社概要

    LEGAL

    • 利用規約
    • プライバシーポリシー
    • 特定商取引法に基づく表記

    SUPPORT

    • ヘルプセンター
    • よくある質問
    • お問い合わせ
    STATUS

    ALL SYSTEMS ONLINE

    Ready!

    運営サービス

    💬

    AITOMO

    推しの声でAIチャットと画像生成を楽しめるアプリ

    🌏

    海外の反応まとめアンテナ

    世界の日本への反応を、AIが翻訳してお届け

    🍜

    麺遊紀

    極上の一杯をハックする、裏社会のラーメン図鑑

    📷

    TOKYO LENS

    カメラで撮るだけで、東京がわかるAI観光ガイド

    © 2026 PUBVOICE. All rights reserved.

    Made with care in Japan