iPhoneのボイスメモ・ICレコーダーの録音を文字起こしする完全ガイド――m4a/mp3ファイルの取り出しからAI文字起こしまで
本記事の筆者は、AI文字起こしツールPUBVOICEを開発・販売しています。ただし、この記事で紹介する録音のコツと文字起こしの方法は特定のツールに依存しない内容で、他社の文字起こしサービスを使っている方にもそのまま通用します。
会議、授業、取材、移動中に思いついたアイデア。録音ボタンを押すのは数秒の作業ですが、その音声を文章にする作業は何時間もかかります。リコーのtorunoコラムによれば、文字起こしにかかる時間は一般的に音声データの4倍とされており、10分のメモを書き起こすだけで40分、90分の講義なら6時間という計算ですリコー。議事録の形に整えるだけでも、大塚商会のコラムは「1時間の会議の議事録作成には一般的に1~2時間かかる」と紹介したうえで、週5時間会議に参加する社員では作成コストが年間260時間を超えるとの試算を示しています大塚商会。
この記事では、①デバイス別の録音とファイルの取り出し方、②精度を実際に決める録音時のコツ、③標準機能・自前構築・AIサービスという3つの文字起こし方法の選び方を、順に解説します。
筆者はVOICEVOXを搭載したAI音声アプリ「AITOMO」(累計2万ダウンロード、App評価4.2)を開発し、音声ファイル形式への対応を自ら実装してきました。現在はPUBVOICEの開発者として、M4AやMP3など多様な録音形式への対応を実際の利用データから判断しています。
なぜ「録ったのに書けない」のか――文字起こしのコスト構造
録音はほぼ労力ゼロで終わるのに、書き起こしには音声の4倍の時間がかかる。この非対称が「録って満足」を生みます。録音ファイルは「あとで聞く」ものとして蓄積されるだけで、検索も再利用もできなければ、メモとしての役割を果たしていません。
解決の方向は「タイピングを速くする」ではなく「タイピングそのものをやめる」ことです。録音を文字にする方法は、スマホの標準機能、自分のPCで動かすAIモデル、クラウドのAI文字起こしサービスの3つに大別され、手間・コスト・得意な場面が違います。選び方は後半で。まず、どの方法でも土台になる「録音の仕方」をデバイス別に整理します。
デバイス別の実践: 録音して、ファイルを取り出す
文字起こしの入口は、どのデバイスでも「音声ファイル」です。
iPhoneのボイスメモ: 録音の基本とm4aファイル
iPhoneには最初から「ボイスメモ」アプリ(ユーティリティフォルダ内)が入っています。Appleのサポートページによれば、録音中でもiPhoneでオーディオを再生しない限り、ほかのアプリをそのまま使えますApple。調べものをしながら録音を続けられるのは、実用上大きな利点です。iCloud設定でボイスメモをオンにすれば、録音は同じApple AccountのiPhone、iPad、Macに自動的に同期されるため、PCで作業するときもファイルを送り直す必要がありません。
文字起こしでいちばん押さえるべきはファイル形式です。ボイスメモから録音を書き出すと、デフォルトでは.m4aフォーマットで保存されますApple。m4aは圧縮音声を格納する標準的なコンテナで、十分な音質のままファイルが軽い形式です。書き出しは録音の詳細ボタンから共有または「"ファイル"に保存」で、AirDropやメールでも送れます。
よくある誤解が「m4aはmp3に変換しないと文字起こしできないのでは?」というものです。結論から言うと、変換は不要です。m4aは現代の文字起こしサービスの標準的な対応形式で、PUBVOICEもMP3、WAV、M4A、WEBM、FLAC、MP4をそのまま受け付けます。筆者がM4A対応を標準にしているのも、iPhoneからの録音ファイルの多くがボイスメモ由来で、変換を挟まずそのまま文字起こしできることが重要だからです。
Androidの録音アプリとICレコーダー
Androidは機種ごとに録音アプリの仕様が大きく異なります。文字起こしまでアプリ内で済ませられるものから、録音機能だけのものまであります。録音文字起こしアプリを選ぶときの確認点は3つです。1つ目は保存形式。設定でmp3やm4aなどが選べるなら標準的な圧縮形式を。2つ目は書き出し。共有メニューから録音をファイルとして渡せるか。3つ目は文字起こし機能の制約。アプリ内の文字起こしは手軽ですが、対応言語やテキストの書き出し先が限られる場合があります。
ICレコーダー(ボイスレコーダー)は、会議や講演のような長時間・多人数の録音に強い専用機です。方向性のあるマイクで遠い話者まで拾いやすく、バッテリーとストレージが録音用途に最適化されています。録音モードは、無圧縮に近いリニアPCM(高音質でファイルが大きい)とMP3(圧縮されて軽い)から選ぶのが一般的ですが、文字起こし用途ならMP3モードで十分なことがほとんどです。音質設定の差が精度に与える影響は、マイクの位置の影響よりはるかに小さいからです。PCへの転送は、USBで接続すると多くの機種が外部ドライブとして認識されるため、保存フォルダからコピーするだけ。ファイルさえ取り出せば、あとの扱いはスマホの録音とまったく同じです。
文字起こしの精度は、録音時点でほぼ決まる
AI文字起こしの精度は、AIとサービス選びだけで決まるわけではありません。同じサービスでも録音条件次第で仕上がりは大きく変わり、精度は録音時点でほぼ決まります。押さえるべきは次の4点です。
- マイクは話者に近づける。 部屋の中央に1台置いて全体を拾う録音が、もっとも精度を落とすパターンです。会議なら話者のそば、インタビューなら2人の間に置きます
- 一番声の小さい人に合わせる。 大声の話者に合わせた録音は小声の人の発言をほぼ失います。本番前に30秒ほどテスト録音して、全員の声が入っているか確認します
- 話し被りと雑音を減らす。 同時に話すと声が重なって認識が落ちます。エアコンの音や打鍵音も思ったより効くため、ドアを閉める、マイクの向きを変えるといった工夫が有効です
- ファイル形式より先に、ここを直す。 m4aかmp3かという差より、話者とマイクの距離の差のほうがずっと大きく効きます。形式を気にする前に、置き場所を直してください
精度が出ないとき、原因はサービス側でなく録音側であることがほとんどで、録り直けるならそれが最速の改善です。
録音を文字起こしに掛ける3つの方法
ファイルが用意できたら、次は文字起こしへの掛け方です。方法は大きく3つあり、それぞれ向き不向きがあります。
その1: スマホの標準機能・アプリ内の文字起こし。 Appleのサポートページによれば、iPhone 12以降ではボイスメモアプリ自体が文字起こしに対応しており、日本語を含む複数の言語でリアルタイムに文字起こしを表示し、テキストのコピーや、文字起こし内の語句での検索ができますApple。自分用のメモの確認なら十分でしょう。一方で、公開されている機能一覧に話者ラベル(誰が話しているかの区別)は含まれず、複数人の会話を議事録やインタビューの素材にするには力が足りません。対象もその端末で録った音声に限られ、ICレコーダーのファイルは持ち込めません。
その2: PCでAIモデル(Whisper)を自前で動かす。 OpenAIが公開している音声認識モデルのWhisperは、多言語の音声認識・翻訳・言語識別ができる汎用モデルで、コードとモデルの重みがMITライセンスで公開されていますGithub。pipでインストールして自分のPCで実行するため、録音データを外部に送らずに処理できるのが最大の強みで、ライセンス上の利用料金も発生しません。ただしPythonの環境構築が必要で、処理速度はPCのスペックに依存します。話者分離や同期編集画面も標準では付かないため、必要なら自分で組み合わせます。録音を社外に出せない場合や、エンジニアリングに抵抗がない人に向く方法です。
その3: AI文字起こしサービスにファイルをアップロードする。 m4aやmp3のファイルをアップロードするだけで、話者分離付きの文字起こしが届く方法です。たとえばPUBVOICEでは、MP3、WAV、M4A、WEBM、FLAC、MP4形式のファイルを1ファイル最大2時間・500MBまでアップロードでき、話者ラベル付きの結果を音声と同期したエディタで修正し、TXT、SRT、VTTの3形式で書き出せます。手順は文字起こしの使い方(ヘルプ)で解説しています。送信された音声がAI学習に使われることもありません。どのサービスを選ぶ場合も、確認したいのは「話者分離の有無」「書き出し形式」「音声データの扱い(AI学習への利用有無)」の3点で、比較はAI文字起こしサービス徹底比較(2026年版)にまとめてあります。
3つの方法は組み合わせて使うのが実際的で、「メモは標準機能、会議とインタビューはAIサービス、社外秘は自前のWhisper」といった使い分けが一例です。
品質チェックと活用: 固有名詞の確認から議事録・記事への展開
どの方法で文字起こししても、出てきたテキストをそのまま使うのは危険です。誤認識は日常語では少なくても3種類に集中します。固有名詞(人名・社名・製品名)は原音を聞かないと表記が確定せず、数字(金額・日付・個数)は「4」と「7」のような聞き間違いが議事録では致命傷になり、専門用語と略語は一般的な語に誤変換されがちです。確認はこの3点に集中します。同期エディタなら怪しい行をクリックすればその位置から再生され、自前構築でもタイムスタンプ付きの結果を出しておけば該当時間に戻るだけです。
そして文字起こしはゴールではなく素材です。会議の録音なら、決定事項とToDoを冒頭に置く議事録にまとめます(テンプレートは議事録の作り方完全ガイド)。インタビューなら、話者ラベル付きの文字起こしがそのまま記事の一次素材になります(インタビュー・議事録の文字起こし完全ガイド)。授業や講義は検索できるテキストで復習が速くなり、アイデアメモもテキスト化して初めてストックになります。元の音声と文字起こしは「日付+主題」の名前でセット保管しておくと、あとで必ず助かります。
FAQ
Q. ボイスメモのm4aファイルは、mp3に変換しないと文字起こしできませんか?
A. いいえ、変換は不要です。m4aのまま文字起こしできるサービスがほとんどで、PUBVOICEもM4Aに対応しています。圧縮済みの音声の再圧縮は音質を劣化させるため、変換はむしろ避けるべきです。
Q. 2時間を超える長い録音はどう扱えばよいですか?
A. 議題の区切りや休憩で録音を分けるのが確実です。PUBVOICEは1ファイル最大2時間・500MBまで対応するため、多くの会議や講義は分割なしでアップロードできます。
Q. 留守電のメッセージを文字起こしできますか?
A. 留守電の音声は一般的にそのままでは書き出せないため、まずファイル化が必要です。確実なのは、再生した音声をもう1台の端末のボイスメモで録音し直すことです。契約中のキャリアが留守電をテキスト化するオプションを提供しているかは、各自のサービスページで確認してください。
Q. 文字起こしの精度を上げる一番の方法は?
A. 録音時点でマイクを話者に近づけることです。どんなに高性能なAIでも、部屋の隅に置いたスマホが拾った遠い声を完全に復元はできません。精度はサービス選びより録音の工夫で決まる部分が大きいです。
Q. アップロードした録音データは、AIの学習に使われますか?
A. サービスによって扱いが異なるため、利用規約やヘルプで「AI学習への利用有無」を確認してください。PUBVOICEでは、送信された音声をAI学習に使うことはありません。
関連記事
- 議事録の作り方完全ガイド ―― 決定事項を冒頭に置く議事録テンプレートと録音から共有までの実務フロー
- インタビュー・議事録の文字起こし完全ガイド ―― 録音からSRT、VTT書き出しまで、文字起こしの実務ワークフロー全体を解説
- AI文字起こしサービス徹底比較(2026年版) ―― 主要サービスの料金体系、無料枠、書き出し形式の比較表
- テキストを読み上げるAI音声生成ガイド ―― 原稿や資料を音声ファイルにする方法と読み上げツールの選び方
溜まっている録音の1本で構いません。m4aのままアップロードするだけで壁は下がります。PUBVOICEの無料プランは月60分の文字起こしと10,000字の音声生成がクレジットカード登録なしで使えるので、まずはボイスメモの1本をPUBVOICEにアップロードしてみてください。

笹尾 祐太朗
代表取締役 / 株式会社メディアリープ
KADOKAWA / ドワンゴでのWebメディア収益化・データ分析、SSP / アドネットワーク事業でのプログラマティック広告収益化支援を経て、2025年5月に株式会社メディアリープを創業。AI音声SaaS「PUBVOICE」、観光DXアプリ「ANIME TRAVEL」、音声AIチャットアプリ「AITOMO」を企画・開発・運営。広告・技術・分析・事業を横断する視点から、データをもとにしたメディア収益改善に取り組む。
関連記事
【2026年版】AI文字起こしサービス徹底比較――個人とチームのための選び方
Notta・toruno・Rimo Voice・スマート書記・AI GIJIROKU・YOMEL・PUBVOICEを、無料枠・料金の実効単価・話者分離・編集・書き出し形式の5軸で比較。議事録・インタビュー・講義・字幕などタスク別の選び方と、年間コストの試算例つき。
テキストを読み上げる方法とAI読み上げの選び方
手元のテキストを原稿や資料、学習教材から音声ファイルにしたい人のために、Windows、Mac、iPhone、Androidの標準読み上げ機能の使い方と、AI音声生成サービスとの違い、読み上げツールの選び方チェックリストまでを解説します。
議事録の作り方完全ガイド――コピペで使えるテンプレートとAI文字起こしで時短する実務フロー
議事録の作り方に悩む方向けに、決定事項とToDoを冒頭に置くコピペで使えるテンプレートと、録音、AI文字起こし、編集、共有までの実務フローを解説します。手作業の負担を減らす工夫とAI文字起こしの限界も率直に紹介します。