文字起こしを無料でやる方法――Googleドキュメントの音声入力・Gemini・Whisper・スマホ標準機能の実力と限界、失敗しない選び方
本記事の筆者は笹尾祐太朗です。AI音声SaaS「PUBVOICE」を開発・運用しており、有料プランを持つサービスの開発者という立場ですが、無料手段の実力と限界は公平に評価して書きます。無料でできることの範囲は思いのほか広く、音声と使い方次第では無料のまま十分実用になります。
議事録、インタビュー、講義の録音、動画の字幕。文字起こしが必要になる場面は増えていますが、手で打ち直すのは現実的ではありません。リコーのtorunoコラムによれば、文字起こしにかかる時間は一般的に音声データの4倍とされ、1時間の音声の書き起こしには4時間がかかりますリコー。
まず結論から。どの無料手段を選ぶかは、次の4行でほぼ決まります。
- 一人分の音声を今すぐ文字にしたい → Googleドキュメントの音声入力、またはスマホ標準の音声入力(どちらも完全無料)
- 録音済みの短い音声ファイルを文字にして、要約も欲しい → Gemini(無料枠)
- 長時間・大量の音声を繰り返し処理したい → OpenAI Whisperの自前実装(無料・オープンソース)
- 複数人の会話で話者分離(誰が話しているか)が必要 → 4手段の標準機能では厳しく、話者分離対応サービスの無料枠が現実解
「無料」には2種類あります。完全無料の手法(音声入力、スマホ標準機能、オープンソース)と、無料枠のあるサービス(Geminiの無料プラン、PUBVOICEのような無料プラン持ちのツール)です。本記事は前者を4つ解説し、最後に無料のまま済ませる場合と有料化する場合の判断基準を示します。
筆者はPUBVOICEの開発で音声認識・音声生成エンジンの選定を自ら行い、生成AIの活用で開発コストを従来の約1/3に圧縮してきました。VOICEVOX搭載の音声AIアプリ「AITOMO」(累計2万ダウンロード・App評価4.2)の開発・運営もしています。クラウドのモデルとOSSのエンジンの両方に触れてきた当事者として、「無料でどこまでできるか」を書きます。
方法1: Googleドキュメントの音声入力――ブラウザだけで無料のリアルタイム文字起こし
最もはじめやすいのがGoogleドキュメントの音声入力です。Chromeなどのブラウザでドキュメントを開き、「ツール」→「音声入力」を選ぶとマイクのアイコンが出るので、クリックして話すと認識結果がリアルタイムで書き込まれます。Googleアカウントがあれば費用はかかりません。公式ヘルプによれば、対応ブラウザはChrome・Edge・Safariの最新版、対応言語は100種類以上ですGoogle。「文字起こしをブラウザだけで無料で」という希望への、最も素直な答えがこの方法です。
強みは準備の最小さと長さの自由さです。インストール不要で、話し続ける分には実質的な時間の上限を気にする必要がなく、話しながら下書きを作る「口述」に最適です。
限界は3つ。1つ目は、録音済みの音声ファイルを直接読み込む機能がないこと。マイクからのリアルタイム認識のために設計されているため、手元のMP3などを起こすにはスピーカーから再生した音をマイクに拾わせる工夫が必要で、確実性は高くありません。2つ目は話者分離がないこと。複数人の会話は誰の発言か分からないままつながります。3つ目は、音声コマンドによる編集・書式設定は英語に限られることGoogle。日本語で使う場合は「書く」だけの道具と考え、誤認識はキーボードで直します。
方法2: スマホ標準の音声入力とメモの録音文字起こし――アプリを探す前に試す価値がある機能
「無料の文字起こしアプリ」を探す前に、スマホ標準の機能を確認する価値があります。
iPhoneの音声入力(ディクテーション)は、「設定」→「一般」→「キーボード」で「音声入力を有効にする」をオンにし、任意のアプリのキーボードのマイクボタンをタップして話すだけで使えますApple。対応言語の多くはiPhone本体で処理されるためインターネット接続が不要で、対応言語では句読点が自動挿入され、30秒間無音で自動停止しますApple。Androidでも純正キーボードGboardに音声入力があり、より高度な機能には対応言語や対応機種(Pixel 6以降など)の条件があるため、公式ヘルプで確認してから使ってくださいGoogle。
iPhoneでもう一つ見落とせないのが純正のメモアプリです。メモでオーディオを録音すると、対応言語では録音中にライブ文字起こしが表示され、録音と文字起こしの両方がメモに保存されますApple。対応言語は日本語を含む10言語で、iPhone 12以降が条件ですApple。スマホ1台で「録音して、その場で文字化」まで完結する、無料手段では最も手軽な部類です。
限界は共通して、リアルタイム認識であることです。録音済みの音声ファイルを後から起こす用途には向かず(メモの文字起こしもメモ内で新規に録音したものが対象)、話者分離もありません。移動中のメモや短い文章の道具と考えるのが正確です。録音ファイルを後から文字にする手順は、iPhoneボイスメモ・ICレコーダーの文字起こしガイドで解説しています。
方法3: Geminiに音声ファイルを渡す――無料枠で「起こして、整理する」
生成AIに音声ファイルを直接渡す方法です。Geminiアプリ(gemini.google.com)でプロンプト欄のファイル追加ボタンから音声ファイルをアップロードし、「この音声を文字起こしてください」と指示すると、書き起こしがテキストで返ってきます。公式ヘルプによれば、音声ファイルは無料プランで合計10分まで、有料プラン(Google AI Pro/Ultra)で合計3時間まで、1回のプロンプトで最大10ファイルまでと案内されています(2026年10月執筆時点)Gemini。
本領は、文字起こしが生成AIの機能の一部であることです。「文字起こしたうえで要点を3つに」「議事録の形式に整形して」といった後処理まで一度に依頼できます。数分の音声を無料で文字にして、ついでに要約も欲しい個人学習や軽い議事メモに合います。
注意は4つ。1つ目は長さの制限で、無料枠は音声合計10分までのため、1時間の会議は起こしきれません。2つ目は話者分離が保証されないこと。ヘルプにその記載はなく、複数人の会話では発言者が混ざります。3つ目は正確性への態度です。生成AIは聞き取れない箇所を文脈から補ってそれらしい文章を生成することがあり、証跡や引用にそのまま使うのは危険です。必ず原音と突き合わせます。4つ目は機密性です。音声を外部の生成AIサービスに預けるため、社外秘の会議ではデータの保存やAI改善への利用について公式ページの案内を確認してください。無料と有料でデータの扱いが異なる場合もあります。
方法4: OpenAI Whisperを自前で動かす――無料・オープンソースの本格派
OpenAIが公開する音声認識モデルWhisperは、コードとモデルがMITライセンスで公開されたオープンソースで、自分のPC上で無料で動かせます。多言語の音声認識・翻訳・言語識別を1つのモデルで行い、日本語にも対応しています(公式リポジトリの使用例にも日本語が登場します)GitHub。
必要なのはPythonの実行環境、PyTorch、コマンドラインの基礎です。モデルはtinyからlarge、turboまで6種類があり、必要なGPUメモリは小さいモデルで約1GB、largeでは約10GBと案内されていますGitHub。GPUのないPCでもCPU処理で動きますが、長い音声では処理時間が大きく伸びます。pipでインストールしてコマンドを1行実行すればテキストが書き出されるため、手順そのものは難しくありません。
実際の手間はその後に積まれます。話者分離はWhisper本体の機能ではなく別ライブラリとの組み合わせが必要で、長時間ファイルの処理計画、誤認識を直すための再生UI、出力の管理といった「認識の外側」を自前で揃えることになります。
開発者として補足します。筆者はPUBVOICEの開発で音声認識エンジンの選定を自分で行い、クラウドAPIとOSSの両方を評価してきました。認識精度という一点ではWhisperクラスのモデルは十分実用水準です。ただ、サービスとしての文字起こしは「認識」の周り(話者分離、音声と同期した編集画面、書き出し)で成り立っており、その部分を整える難しさは、VOICEVOX搭載アプリ「AITOMO」を個人開発してきた筆者がまさに担ってきた部分です。機密性が高く手元で処理したい音声、分量が多く繰り返し処理する音声、エンジニアリングに抵抗がない人には、Whisperは今も無料手段の本命です。
4つの無料文字起こし手段の比較表
| 手段 | 料金 | 話者分離 | 長さの目安(執筆時点) | 必要スキル | 向くケース |
|---|---|---|---|---|---|
| Googleドキュメントの音声入力 | 完全無料 | なし | その場で話す分は実質無制限 | 特になし | 一人の口述・下書き |
| スマホ標準機能(iPhoneの音声入力・メモの録音文字起こし等) | 完全無料 | なし | リアルタイム中心(メモの文字起こしはメモ内での新規録音が対象) | 特になし | 移動中のメモ、短い口述 |
| Gemini | 無料枠あり | なし(保証なし) | 音声は無料で合計10分、有料で3時間 | 特になし | 短い音声+要約・整形 |
| Whisperの自前実装 | 完全無料(OSS) | 本体になし(別ライブラリ併用) | PCの処理能力の許す限り | Python・コマンドライン | 長時間・大量・機密性の高い音声 |
Google、Apple、Gemini、OpenAIの仕様は2026年10月執筆時点の公式情報(Googleドキュメント ヘルプ、Apple ユーザガイド、Gemini アプリ ヘルプ、Whisper リポジトリ)に基づきます。無料枠の分数や対応言語は変更されるため、利用前に各公式ページで最新を確認してください。
無料手段が向くケースと、有料化したほうがよいケース
判断基準は5つに整理できます。
- 話者分離が要るか。 一人分の音声なら無料手段で十分ですが、「誰が言ったか」が必要になった時点で4手段は前提を満たせません。ここが有料化の最も明確な分岐点です。PUBVOICEなら無料プランで月60分の話者分離付き文字起こしが使えます(カード登録不要)
- 分量と頻度。 月に数本・数分なら無料の組み合わせで回せます。毎週1時間の会議では、リアルタイム入力は会議中の端末の占有が発生し、Whisperは毎回後処理の手間が乗ります。継続利用では無料枠から試して分量に合わせるのが現実的です
- 機密性。 外部クラウドに預けられない音声は手元で処理できるWhisperが最有力です。クラウドを使う場合は音声の保存先やAI学習への利用有無を確認します。PUBVOICEではアップロードされた音声がAI学習に使われることはありません
- 正確性の要求水準。 引用や議事録の証跡に使うなら、音声と同期したエディタで原音を確認できる環境が重要です。生成AIの出力をそのまま使う運用は避けてください
- 続けるかどうか。 一回こまりの用途は無料で済ませるのが正解です。チームで継続するなら共有やフォーマットの統一まで含めて考え、まず無料枠で小さく試すのが損をしません
迷ったら、「まず無料で自分の音声を処理し、限界を感じた点(話者分離・分量・確認の手間)を基準に課金する」のが失敗しない選び方です。有料サービスの比較はAI文字起こしサービス徹底比較(2026年版)にまとめてあります。
FAQ
Q. Googleドキュメントの音声入力で、録音済みのMP3ファイルは文字起こしできますか?
A. できません。音声入力はマイクからのリアルタイム認識で、ファイルの読み込み機能はありません。録音済みの音声データは、短ければGemini、長時間や機密性を重視するならWhisper、または音声ファイル対応のサービスを使います。手順はiPhoneボイスメモ・ICレコーダーの文字起こしガイドも参照してください。
Q. 無料のAI文字起こしで話者分離はできますか?
A. この記事の4手段の標準機能ではできません。話者分離が必要な会議・インタビューでは、対応サービスの無料枠から試すのが現実的です。PUBVOICEは無料プランで月60分の話者分離付き文字起こしが使えます。
Q. Geminiに会社の会議の音声をアップロードしてもよいですか?
A. 社外秘の会議では、データの保存やAI改善への利用について公式の案内を確認してください。機密性を最優先するなら、手元で処理できるWhisperが候補になります。
Q. Whisperはスマホや普通のノートPCでも動きますか?
A. GPUなしでもCPU処理で動きますが、長い音声では処理時間が大きく伸びます。快適に使うには、公式リポジトリが案内するGPUメモリの要件(モデルにより約1〜10GB)を満たすPCが前提ですGitHub。
Q. 無料で文字起こしできる量の目安は?
A. リアルタイムの音声入力はその場で話す分が無料、Geminiは無料プランで音声合計10分まで(執筆時点)、WhisperはPCの処理能力の許す限り無料です。サービスの無料枠では、PUBVOICEが月60分の文字起こしと10,000字の音声生成をカード登録不要で提供しています。
関連記事
- 議事録の作り方完全ガイド ―― コピペで使えるテンプレートとAI文字起こしを組み合わせた議事録の実務フロー
- インタビュー・議事録の文字起こし完全ガイド ―― 録音からSRT/VTT書き出しまでの文字起こしワークフロー全体
- AI文字起こしサービス徹底比較(2026年版) ―― 主要サービスの料金体系、無料枠、書き出し形式の比較表
- iPhoneボイスメモ・ICレコーダーの文字起こしガイド ―― 録音済みファイルを文字にする具体的な手順
- テキストを読み上げるAI音声生成ガイド ―― 原稿や資料を音声ファイルにする方法と読み上げツールの選び方
- 文字起こしの使い方(ヘルプ) ―― PUBVOICEでのファイルアップロードから書き出しまでの手順
無料手段は「試す」には十分で、「続ける」には選択眼が要ります。まずは自分の音声で、この記事のどれか一つを実際に動かしてみてください。話者分離や音声と同期した確認画面が必要になったとき、PUBVOICEの無料プランは月60分の文字起こしと10,000字の音声生成を、カード登録なしで試せます。操作手順は文字起こしの使い方(ヘルプ)にまとまっています。次に録る会議やインタビューを、まずはPUBVOICEにアップロードしてみてください。

笹尾 祐太朗
代表取締役 / 株式会社メディアリープ
KADOKAWA / ドワンゴでのWebメディア収益化・データ分析、SSP / アドネットワーク事業でのプログラマティック広告収益化支援を経て、2025年5月に株式会社メディアリープを創業。AI音声SaaS「PUBVOICE」、観光DXアプリ「ANIME TRAVEL」、音声AIチャットアプリ「AITOMO」を企画・開発・運営。広告・技術・分析・事業を横断する視点から、データをもとにしたメディア収益改善に取り組む。
関連記事
iPhoneのボイスメモ・ICレコーダーの録音を文字起こしする完全ガイド――m4a/mp3ファイルの取り出しからAI文字起こしまで
iPhoneのボイスメモやICレコーダーで録った音声を文字起こしする方法を、録音のコツ、m4a・mp3ファイルの取り出し方、スマホ標準機能・自前構築・AIサービスの3つの方法比較まで解説します。録って満足で終わらせないための実務フローです。
【2026年版】AI文字起こしサービス徹底比較――個人とチームのための選び方
Notta・toruno・Rimo Voice・スマート書記・AI GIJIROKU・YOMEL・PUBVOICEを、無料枠・料金の実効単価・話者分離・編集・書き出し形式の5軸で比較。議事録・インタビュー・講義・字幕などタスク別の選び方と、年間コストの試算例つき。
テキストを読み上げる方法とAI読み上げの選び方
手元のテキストを原稿や資料、学習教材から音声ファイルにしたい人のために、Windows、Mac、iPhone、Androidの標準読み上げ機能の使い方と、AI音声生成サービスとの違い、読み上げツールの選び方チェックリストまでを解説します。