Como transcrever áudio de graça: digitação por voz do Google Docs, Gemini, Whisper e os recursos do celular: capacidades, limites e como escolher
Como transcrever áudio de graça: quatro métodos comparados
O autor deste artigo é Yutaro Sasao. Ele desenvolve e opera o PUBVOICE, um SaaS de voz com IA com planos pagos, mas aqui avalia os métodos gratuitos com imparcialidade. O gratuito cobre mais do que se imagina; se basta depende do seu áudio e de como você o usa.
Atas, entrevistas, gravações de aulas, legendas de vídeo: a necessidade de transcrição só cresce, mas redigitar à mão não é realista. Segundo uma coluna da Ricoh, a transcrição manual costuma levar quatro vezes a duração do áudio Ricoh.
A conclusão primeiro, em quatro linhas:
- Transcrever a fala de uma pessoa agora → a digitação por voz do Google Docs ou o teclado do celular (ambos totalmente grátis)
- Transcrever um arquivo curto já gravado, com resumo → Gemini (plano gratuito)
- Processar áudio longo ou em volume, repetidamente → rodar o Whisper da OpenAI por conta própria (grátis, código aberto)
- Precisar de separação de falantes → além desses métodos; o plano gratuito de um serviço com separação é a resposta realista
"Grátis" tem duas formas: métodos completamente gratuitos (digitação por voz, funções do celular, código aberto) e serviços com plano gratuito (Gemini, ferramentas como o PUBVOICE). O autor selecionou pessoalmente os motores de voz do PUBVOICE, cortou os custos de desenvolvimento para cerca de um terço com IA generativa e também desenvolve o AITOMO, um app de voz com VOICEVOX com 20 mil downloads e nota 4,2: o que segue vem da experiência direta com modelos em nuvem e motores de código aberto.
Método 1: digitação por voz no Google Docs
Abra um documento no Chrome, escolha "Ferramentas" → "Digitação por voz", clique no microfone e sua fala é transcrita em tempo real. Não custa nada com uma conta Google; a ajuda oficial indica as versões recentes de Chrome, Edge e Safari, e mais de 100 idiomas Google.
Pontos fortes: preparo mínimo e liberdade de duração; nada para instalar e sem limite prático enquanto você fala. Ideal para redigir por ditado.
Três limites: não há função para importar um arquivo de áudio existente (a digitação escuta o microfone, então transcrever um MP3 exige rotear o som do alto-falante de volta ao micro, pouco confiável); sem separação de falantes; e os comandos de voz para editar e formatar são só em inglês segundo a ajuda Google: em japonês, trate-a como ferramenta para "escrever" e corrija com o teclado.
Método 2: as funções de voz do próprio celular
Antes de procurar um app gratuito, veja o que o celular já traz.
No iPhone, ative o ditado em Ajustes → Geral → Teclado → Ativar Ditado e toque no microfone em qualquer teclado Apple. Muitos idiomas são processados no aparelho, sem internet; nos compatíveis, a pontuação é inserida automaticamente; e o ditado para sozinho após 30 segundos de silêncio Apple. No Android, o Gboard traz entrada por voz; os recursos avançados têm condições de idioma e de aparelho (como Pixel 6 em diante), confira na ajuda oficial Google.
Menção à parte no iPhone: o app Notas grava áudio e mostra a transcrição ao vivo, salvando ambas na nota Apple. O japonês está entre os dez idiomas compatíveis, exigindo iPhone 12 ou posterior Apple.
O limite comum é o reconhecimento em tempo real: não transcrevem arquivos já gravados (o Notas só o que grava dentro dele) nem separam falantes. Para arquivos já gravados, veja o guia de transcrição de gravador de voz.
Método 3: entregar arquivos de áudio ao Gemini
No app do Gemini, envie o arquivo pelo botão de anexar e peça "transcreva este áudio". Segundo a ajuda oficial, o áudio fica limitado a 10 minutos no total no plano gratuito e a 3 horas nos pagos (Google AI Pro/Ultra), com até 10 arquivos por comando (em outubro de 2026) Gemini.
A força: a transcrição é parte de uma IA generativa, então "transcreva e resuma em três pontos" ou "formate como ata" sai em uma única instrução. Bom para estudo pessoal e anotações leves.
Quatro cautelas: duração (uma reunião de uma hora não cabe no plano gratuito); separação de falantes não garantida; postura quanto à exatidão (a IA pode preencher trechos inaudíveis com texto plausível: nunca use a saída como citação ou registro sem conferir com o áudio original); e confidencialidade (você entrega áudio a um serviço externo: verifique armazenamento e uso para treinar IA, que pode diferir entre planos).
Método 4: rodar o Whisper da OpenAI por conta própria
O Whisper é um modelo de reconhecimento de fala em código aberto da OpenAI, sob licença MIT, gratuito para rodar no seu PC. Um único modelo cobre reconhecimento multilíngue, tradução e identificação de idioma, japonês incluído GitHub.
Você precisa de um ambiente Python, PyTorch e noções de linha de comando. Há seis tamanhos de modelo, com exigências de memória de GPU de cerca de 1GB a cerca de 10GB GitHub. Sem GPU roda por CPU, mas o tempo explode com áudio longo. O passo básico — instalar com pip, rodar um comando — não é difícil; o esforço real vem depois: a separação de falantes não faz parte do Whisper e você mesmo monta o entorno (processar arquivos longos, interface para revisar erros, gestão da saída).
De primeira mão: o autor selecionou os motores do PUBVOICE e avaliou tanto APIs em nuvem quanto modelos de código aberto. Só em precisão, modelos da classe do Whisper são plenamente práticos. Mas transcrição como serviço se sustenta ao redor do reconhecimento — separação de falantes, editor sincronizado, formatos de exportação —, e esse trabalho é exatamente o que o autor carregou ao desenvolver o AITOMO. Para áudio confidencial que deve ficar local, grandes volumes e quem lida bem com tecnologia, o Whisper segue sendo a opção gratuita de referência.
Tabela comparativa
| Método | Custo | Separação de falantes | Duração (na redação) | Habilidades | Ideal para |
|---|---|---|---|---|---|
| Digitação por voz no Google Docs | Totalmente grátis | Não | Sem limite prático enquanto fala | Nenhuma | Ditado de uma pessoa, rascunhos |
| Funções do celular (iPhone etc.) | Totalmente grátis | Não | Foco em tempo real | Nenhuma | Anotações em movimento, ditado curto |
| Gemini | Plano gratuito | Não (sem garantia) | 10 min grátis / 3 h pago | Nenhuma | Áudio curto + resumo |
| Whisper por conta própria | Totalmente grátis (OSS) | Não inclusa (bibliotecas extras) | O que o PC aguentar | Python, CLI | Áudio longo, em volume, confidencial |
As especificações refletem informação oficial de outubro de 2026 (ajuda do Google Docs, guia da Apple, ajuda do Gemini, repositório do Whisper). Minutos gratuitos e idiomas mudam: confirme nas páginas oficiais.
Quando o gratuito basta, e quando pagar
- Separação de falantes. Para uma pessoa o gratuito basta; quando importa quem disse o quê, esses quatro métodos ficam curtos. O plano gratuito do PUBVOICE dá 60 minutos por mês com separação, sem cartão
- Volume e frequência. Poucos arquivos curtos por mês cabem no gratuito; uma reunião semanal de uma hora inclina a começar num plano gratuito e escalar
- Confidencialidade. Áudio que não pode sair da máquina fica com o Whisper; na nuvem, verifique armazenamento e uso para treinar IA. O PUBVOICE nunca usa o áudio enviado para treinar IA
- Exatidão. Para citações e registros, verifique contra o áudio original num editor sincronizado; nunca use saídas de IA generativa sem revisar
- Continuidade. Pontual, grátis; uso em equipe, avaliando também compartilhamento e formatos
Na dúvida, rode um método gratuito com o seu próprio áudio e pague conforme o limite que realmente atingir. Para comparar serviços, veja a comparação de 2026.
Perguntas frequentes
P. A digitação por voz do Google Docs transcreve um MP3 já gravado?
R. Não: ela escuta o microfone em tempo real e não importa arquivos. Para arquivos gravados, Gemini (se curto), Whisper ou um serviço que aceite arquivos; passos no guia de gravador de voz.
P. Existe transcrição gratuita com separação de falantes?
R. Não nos quatro métodos deste artigo. Comece pelo plano gratuito de um serviço que a ofereça: o do PUBVOICE inclui 60 minutos por mês.
P. Posso enviar áudio de reuniões da empresa ao Gemini?
R. Para reuniões confidenciais, verifique antes a orientação oficial sobre armazenamento e uso para treinar IA. Se a confidencialidade manda, o Whisper local é o candidato.
P. O Whisper roda em celular ou notebook comum?
R. Roda por CPU, mas o tempo explode com áudio longo. O uso confortável pressupõe um PC que atenda aos requisitos de memória GPU do repositório, entre cerca de 1 e 10GB conforme o modelo GitHub.
P. Quanto dá para transcrever de graça?
R. A digitação em tempo real é grátis pelo tempo que você falar; o plano gratuito do Gemini cobre 10 minutos de áudio no total (na redação); o Whisper é grátis até onde o PC aguentar. O plano gratuito do PUBVOICE oferece 60 minutos de transcrição e 10.000 caracteres de geração de voz por mês, sem cartão.
Artigos relacionados
- Guia completo de atas de reunião — modelo pronto para copiar e fluxo com transcrição por IA
- Guia completo de transcrição de entrevistas e atas — o fluxo completo, da gravação à exportação SRT/VTT
- Comparação de serviços de transcrição com IA (2026) — preços, planos gratuitos e formatos
- Guia de transcrição de gravador de voz — passos concretos para arquivos já gravados
- Guia de leitura de texto com voz de IA — como transformar textos e documentos em arquivos de áudio e escolher uma ferramenta de leitura
- Guia de ajuda de transcrição — passos detalhados no PUBVOICE
O gratuito basta para começar; escolher bem é o que o mantém funcionando. Teste um método com o seu próprio áudio. Quando precisar de separação de falantes e de um editor sincronizado, o plano gratuito do PUBVOICE dá 60 minutos de transcrição e 10.000 caracteres de geração de voz por mês, sem cartão: consulte o guia de ajuda e envie sua próxima gravação para o PUBVOICE.

Yutaro Sasao
CEO / Media Leap Inc.
Após liderar a monetização e a análise de dados de mídias web na KADOKAWA / DWANGO e impulsionar a monetização publicitária programática em negócios de SSP e ad networks, fundou a Media Leap Inc. em maio de 2025. Hoje desenvolve e opera o SaaS de áudio com IA "PUBVOICE", o app de turismo DX "ANIME TRAVEL" e o app de chat por voz com IA "AITOMO". Com uma visão que cruza publicidade, tecnologia, análise e negócio, trabalha na melhoria de receita de mídias com base em dados.
Artigos relacionados
Como transcrever notas de voz e gravadores IC: guia completo da exportação de arquivos à transcrição com IA
Guia completo para transcrever áudio das notas de voz do iPhone e de gravadores IC: dicas de gravação, exportação de arquivos m4a e mp3, e escolha entre recursos do celular, Whisper local e serviços de transcrição com IA.
Comparativo de serviços de transcrição com IA (2026): guia prático
Notta, toruno, Rimo Voice, Otolio, AI GIJIROKU, YOMEL e PUBVOICE comparados por plano gratuito, preço efetivo, diarização, edição e exportação, com recomendações por tarefa e exemplos de custo anual.
Como ler texto em voz alta e como escolher uma ferramenta de leitura com IA
Guia prático para transformar em áudio os textos que você já tem: como usar os recursos de leitura integrados do Windows, Mac, iPhone e Android, como a geração de voz com IA é diferente e um checklist para escolher a ferramenta.