PUBVOICE.
    FEATURESPRICINGFAQHELP
    EntrarComece grátis
    Como transcrever áudio de graça: digitação por voz do Google Docs, Gemini, Whisper e os recursos do celular: capacidades, limites e como escolher

    Como transcrever áudio de graça: digitação por voz do Google Docs, Gemini, Whisper e os recursos do celular: capacidades, limites e como escolher

    6 de outubro de 2026

    Sumário

    1. 1.Como transcrever áudio de graça: quatro métodos comparados
    2. 2.Método 1: digitação por voz no Google Docs
    3. 3.Método 2: as funções de voz do próprio celular
    4. 4.Método 3: entregar arquivos de áudio ao Gemini
    5. 5.Método 4: rodar o Whisper da OpenAI por conta própria
    6. 6.Tabela comparativa
    7. 7.Quando o gratuito basta, e quando pagar
    8. 8.Perguntas frequentes
    9. 9.Artigos relacionados

    Como transcrever áudio de graça: quatro métodos comparados

    O autor deste artigo é Yutaro Sasao. Ele desenvolve e opera o PUBVOICE, um SaaS de voz com IA com planos pagos, mas aqui avalia os métodos gratuitos com imparcialidade. O gratuito cobre mais do que se imagina; se basta depende do seu áudio e de como você o usa.

    Atas, entrevistas, gravações de aulas, legendas de vídeo: a necessidade de transcrição só cresce, mas redigitar à mão não é realista. Segundo uma coluna da Ricoh, a transcrição manual costuma levar quatro vezes a duração do áudio Ricoh.

    A conclusão primeiro, em quatro linhas:

    • Transcrever a fala de uma pessoa agora → a digitação por voz do Google Docs ou o teclado do celular (ambos totalmente grátis)
    • Transcrever um arquivo curto já gravado, com resumo → Gemini (plano gratuito)
    • Processar áudio longo ou em volume, repetidamente → rodar o Whisper da OpenAI por conta própria (grátis, código aberto)
    • Precisar de separação de falantes → além desses métodos; o plano gratuito de um serviço com separação é a resposta realista

    "Grátis" tem duas formas: métodos completamente gratuitos (digitação por voz, funções do celular, código aberto) e serviços com plano gratuito (Gemini, ferramentas como o PUBVOICE). O autor selecionou pessoalmente os motores de voz do PUBVOICE, cortou os custos de desenvolvimento para cerca de um terço com IA generativa e também desenvolve o AITOMO, um app de voz com VOICEVOX com 20 mil downloads e nota 4,2: o que segue vem da experiência direta com modelos em nuvem e motores de código aberto.

    Método 1: digitação por voz no Google Docs

    Abra um documento no Chrome, escolha "Ferramentas" → "Digitação por voz", clique no microfone e sua fala é transcrita em tempo real. Não custa nada com uma conta Google; a ajuda oficial indica as versões recentes de Chrome, Edge e Safari, e mais de 100 idiomas Google.

    Pontos fortes: preparo mínimo e liberdade de duração; nada para instalar e sem limite prático enquanto você fala. Ideal para redigir por ditado.

    Três limites: não há função para importar um arquivo de áudio existente (a digitação escuta o microfone, então transcrever um MP3 exige rotear o som do alto-falante de volta ao micro, pouco confiável); sem separação de falantes; e os comandos de voz para editar e formatar são só em inglês segundo a ajuda Google: em japonês, trate-a como ferramenta para "escrever" e corrija com o teclado.

    Método 2: as funções de voz do próprio celular

    Antes de procurar um app gratuito, veja o que o celular já traz.

    No iPhone, ative o ditado em Ajustes → Geral → Teclado → Ativar Ditado e toque no microfone em qualquer teclado Apple. Muitos idiomas são processados no aparelho, sem internet; nos compatíveis, a pontuação é inserida automaticamente; e o ditado para sozinho após 30 segundos de silêncio Apple. No Android, o Gboard traz entrada por voz; os recursos avançados têm condições de idioma e de aparelho (como Pixel 6 em diante), confira na ajuda oficial Google.

    Menção à parte no iPhone: o app Notas grava áudio e mostra a transcrição ao vivo, salvando ambas na nota Apple. O japonês está entre os dez idiomas compatíveis, exigindo iPhone 12 ou posterior Apple.

    O limite comum é o reconhecimento em tempo real: não transcrevem arquivos já gravados (o Notas só o que grava dentro dele) nem separam falantes. Para arquivos já gravados, veja o guia de transcrição de gravador de voz.

    Método 3: entregar arquivos de áudio ao Gemini

    No app do Gemini, envie o arquivo pelo botão de anexar e peça "transcreva este áudio". Segundo a ajuda oficial, o áudio fica limitado a 10 minutos no total no plano gratuito e a 3 horas nos pagos (Google AI Pro/Ultra), com até 10 arquivos por comando (em outubro de 2026) Gemini.

    A força: a transcrição é parte de uma IA generativa, então "transcreva e resuma em três pontos" ou "formate como ata" sai em uma única instrução. Bom para estudo pessoal e anotações leves.

    Quatro cautelas: duração (uma reunião de uma hora não cabe no plano gratuito); separação de falantes não garantida; postura quanto à exatidão (a IA pode preencher trechos inaudíveis com texto plausível: nunca use a saída como citação ou registro sem conferir com o áudio original); e confidencialidade (você entrega áudio a um serviço externo: verifique armazenamento e uso para treinar IA, que pode diferir entre planos).

    Método 4: rodar o Whisper da OpenAI por conta própria

    O Whisper é um modelo de reconhecimento de fala em código aberto da OpenAI, sob licença MIT, gratuito para rodar no seu PC. Um único modelo cobre reconhecimento multilíngue, tradução e identificação de idioma, japonês incluído GitHub.

    Você precisa de um ambiente Python, PyTorch e noções de linha de comando. Há seis tamanhos de modelo, com exigências de memória de GPU de cerca de 1GB a cerca de 10GB GitHub. Sem GPU roda por CPU, mas o tempo explode com áudio longo. O passo básico — instalar com pip, rodar um comando — não é difícil; o esforço real vem depois: a separação de falantes não faz parte do Whisper e você mesmo monta o entorno (processar arquivos longos, interface para revisar erros, gestão da saída).

    De primeira mão: o autor selecionou os motores do PUBVOICE e avaliou tanto APIs em nuvem quanto modelos de código aberto. Só em precisão, modelos da classe do Whisper são plenamente práticos. Mas transcrição como serviço se sustenta ao redor do reconhecimento — separação de falantes, editor sincronizado, formatos de exportação —, e esse trabalho é exatamente o que o autor carregou ao desenvolver o AITOMO. Para áudio confidencial que deve ficar local, grandes volumes e quem lida bem com tecnologia, o Whisper segue sendo a opção gratuita de referência.

    Tabela comparativa

    Método Custo Separação de falantes Duração (na redação) Habilidades Ideal para
    Digitação por voz no Google Docs Totalmente grátis Não Sem limite prático enquanto fala Nenhuma Ditado de uma pessoa, rascunhos
    Funções do celular (iPhone etc.) Totalmente grátis Não Foco em tempo real Nenhuma Anotações em movimento, ditado curto
    Gemini Plano gratuito Não (sem garantia) 10 min grátis / 3 h pago Nenhuma Áudio curto + resumo
    Whisper por conta própria Totalmente grátis (OSS) Não inclusa (bibliotecas extras) O que o PC aguentar Python, CLI Áudio longo, em volume, confidencial

    As especificações refletem informação oficial de outubro de 2026 (ajuda do Google Docs, guia da Apple, ajuda do Gemini, repositório do Whisper). Minutos gratuitos e idiomas mudam: confirme nas páginas oficiais.

    Quando o gratuito basta, e quando pagar

    • Separação de falantes. Para uma pessoa o gratuito basta; quando importa quem disse o quê, esses quatro métodos ficam curtos. O plano gratuito do PUBVOICE dá 60 minutos por mês com separação, sem cartão
    • Volume e frequência. Poucos arquivos curtos por mês cabem no gratuito; uma reunião semanal de uma hora inclina a começar num plano gratuito e escalar
    • Confidencialidade. Áudio que não pode sair da máquina fica com o Whisper; na nuvem, verifique armazenamento e uso para treinar IA. O PUBVOICE nunca usa o áudio enviado para treinar IA
    • Exatidão. Para citações e registros, verifique contra o áudio original num editor sincronizado; nunca use saídas de IA generativa sem revisar
    • Continuidade. Pontual, grátis; uso em equipe, avaliando também compartilhamento e formatos

    Na dúvida, rode um método gratuito com o seu próprio áudio e pague conforme o limite que realmente atingir. Para comparar serviços, veja a comparação de 2026.

    Perguntas frequentes

    P. A digitação por voz do Google Docs transcreve um MP3 já gravado?
    R. Não: ela escuta o microfone em tempo real e não importa arquivos. Para arquivos gravados, Gemini (se curto), Whisper ou um serviço que aceite arquivos; passos no guia de gravador de voz.

    P. Existe transcrição gratuita com separação de falantes?
    R. Não nos quatro métodos deste artigo. Comece pelo plano gratuito de um serviço que a ofereça: o do PUBVOICE inclui 60 minutos por mês.

    P. Posso enviar áudio de reuniões da empresa ao Gemini?
    R. Para reuniões confidenciais, verifique antes a orientação oficial sobre armazenamento e uso para treinar IA. Se a confidencialidade manda, o Whisper local é o candidato.

    P. O Whisper roda em celular ou notebook comum?
    R. Roda por CPU, mas o tempo explode com áudio longo. O uso confortável pressupõe um PC que atenda aos requisitos de memória GPU do repositório, entre cerca de 1 e 10GB conforme o modelo GitHub.

    P. Quanto dá para transcrever de graça?
    R. A digitação em tempo real é grátis pelo tempo que você falar; o plano gratuito do Gemini cobre 10 minutos de áudio no total (na redação); o Whisper é grátis até onde o PC aguentar. O plano gratuito do PUBVOICE oferece 60 minutos de transcrição e 10.000 caracteres de geração de voz por mês, sem cartão.

    Artigos relacionados

    • Guia completo de atas de reunião — modelo pronto para copiar e fluxo com transcrição por IA
    • Guia completo de transcrição de entrevistas e atas — o fluxo completo, da gravação à exportação SRT/VTT
    • Comparação de serviços de transcrição com IA (2026) — preços, planos gratuitos e formatos
    • Guia de transcrição de gravador de voz — passos concretos para arquivos já gravados
    • Guia de leitura de texto com voz de IA — como transformar textos e documentos em arquivos de áudio e escolher uma ferramenta de leitura
    • Guia de ajuda de transcrição — passos detalhados no PUBVOICE

    O gratuito basta para começar; escolher bem é o que o mantém funcionando. Teste um método com o seu próprio áudio. Quando precisar de separação de falantes e de um editor sincronizado, o plano gratuito do PUBVOICE dá 60 minutos de transcrição e 10.000 caracteres de geração de voz por mês, sem cartão: consulte o guia de ajuda e envie sua próxima gravação para o PUBVOICE.

    Yutaro Sasao

    Yutaro Sasao

    CEO / Media Leap Inc.

    Após liderar a monetização e a análise de dados de mídias web na KADOKAWA / DWANGO e impulsionar a monetização publicitária programática em negócios de SSP e ad networks, fundou a Media Leap Inc. em maio de 2025. Hoje desenvolve e opera o SaaS de áudio com IA "PUBVOICE", o app de turismo DX "ANIME TRAVEL" e o app de chat por voz com IA "AITOMO". Com uma visão que cruza publicidade, tecnologia, análise e negócio, trabalha na melhoria de receita de mídias com base em dados.

    ← Voltar ao blog

    Artigos relacionados

    Como transcrever notas de voz e gravadores IC: guia completo da exportação de arquivos à transcrição com IA

    Guia completo para transcrever áudio das notas de voz do iPhone e de gravadores IC: dicas de gravação, exportação de arquivos m4a e mp3, e escolha entre recursos do celular, Whisper local e serviços de transcrição com IA.

    Comparativo de serviços de transcrição com IA (2026): guia prático

    Notta, toruno, Rimo Voice, Otolio, AI GIJIROKU, YOMEL e PUBVOICE comparados por plano gratuito, preço efetivo, diarização, edição e exportação, com recomendações por tarefa e exemplos de custo anual.

    Como ler texto em voz alta e como escolher uma ferramenta de leitura com IA

    Guia prático para transformar em áudio os textos que você já tem: como usar os recursos de leitura integrados do Windows, Mac, iPhone e Android, como a geração de voz com IA é diferente e um checklist para escolher a ferramenta.

    +
    3x em médiaTempo de permanência
    +5%Leitores recorrentes
    30+Padrões de voz
    ◆ PLANO_GRATUITO_DISPONÍVEL

    Experimente grátis
    a distribuição em áudio.

    Teste gratuitamente a experiência em áudio com seus artigos reais.
    O plano Free oferece todos os recursos essenciais sem custo.

    Começar grátisVer mais recursos

    Sem cartão de crédito · Cancele quando quiser

    P
    PUBVOICE.

    AUDIO_CONTENT
    PLATFORM V1.0

    ◆ ALL SYSTEMS OPERATIONAL

    PRODUCT

    • O que é PUBVOICE?
    • Blog

    COMPANY

    • Sobre nós

    LEGAL

    • Termos de Serviço
    • Política de Privacidade
    • Aviso legal

    SUPPORT

    • Central de Ajuda
    • Perguntas frequentes
    • Contato
    STATUS

    ALL SYSTEMS ONLINE

    Ready!

    SERVIÇOS

    💬

    AITOMO

    Chat de voz com IA e geração de imagens com seus personagens favoritos

    🌏

    Kaigai Matome

    Reações do mundo sobre o Japão, traduzidas por IA

    🍜

    RAMEN TRIP

    Encontre, sele e domine cada tigela de ramen

    📷

    TOKYO LENS

    Um guia de IA que explica Tóquio pela sua câmera

    © 2026 PUBVOICE. All rights reserved.

    Made with care in Japan