Cómo transcribir gratis: dictado por voz de Google Docs, Gemini, Whisper y las funciones del móvil: capacidades, límites y cómo elegir bien
Cómo transcribir audio gratis: cuatro métodos comparados
El autor de este artículo es Yutaro Sasao. Desarrolla y opera PUBVOICE, un SaaS de voz con IA con planes de pago, pero aquí evalúa los métodos gratuitos con imparcialidad. Lo gratuito cubre más de lo que se cree; si basta depende de tu audio y de cómo lo uses.
Actas, entrevistas, grabaciones de clases, subtítulos: la necesidad de transcripción no deja de crecer, pero reescribirla a mano no es realista. Según una columna de Ricoh, la transcripción manual suele llevar cuatro veces la duración del audio Ricoh.
La conclusión primero, en cuatro líneas:
- Transcribir el habla de una persona ahora mismo → el dictado por voz de Google Docs o el teclado del móvil (ambos totalmente gratis)
- Transcribir un archivo corto ya grabado, con resumen incluido → Gemini (plan gratuito)
- Procesar audio largo o en volumen, repetidamente → ejecutar Whisper de OpenAI por tu cuenta (gratis, código abierto)
- Necesitar separación de hablantes → más allá de estos métodos; el plan gratuito de un servicio con separación es la respuesta realista
«Gratis» tiene dos formas: métodos completamente gratuitos (dictado, funciones del móvil, código abierto) y servicios con plan gratuito (Gemini, herramientas como PUBVOICE). El autor seleccionó personalmente los motores de voz de PUBVOICE, redujo los costes de desarrollo a aproximadamente un tercio con IA generativa y también desarrolla AITOMO, una app de voz con VOICEVOX con 20.000 descargas y valoración 4,2: lo que sigue parte de la experiencia directa con modelos en la nube y motores de código abierto.
Método 1: dictado por voz en Google Docs
Abre un documento en Chrome, elige «Herramientas» → «Dictado por voz», pulsa el micrófono y tu habla se transcribe en tiempo real. No cuesta nada con una cuenta de Google; la ayuda oficial indica las versiones recientes de Chrome, Edge y Safari, y más de 100 idiomas Google.
Fuerzas: preparación mínima y libertad de duración; nada que instalar y sin límite práctico mientras hablas. Ideal para redactar por dictado.
Tres límites: no hay función para importar un archivo de audio existente (el dictado escucha el micrófono, así que transcribir un MP3 exige redirigir el sonido del altavoz al micro, poco fiable); sin separación de hablantes; y los comandos de voz para editar y formatear son solo en inglés según la ayuda Google: en japonés, considéralo una herramienta para «escribir» y corrige con el teclado.
Método 2: las funciones de voz del propio teléfono
Antes de buscar una app gratuita, revisa lo que ya trae tu móvil.
En iPhone, activa el dictado en Ajustes → General → Teclado → Activar Dictado y pulsa el micrófono en cualquier teclado Apple. Muchos idiomas se procesan en el propio dispositivo, sin conexión; en los compatibles se insertan signos de puntuación automáticamente; y el dictado se detiene tras 30 segundos de silencio Apple. En Android, Gboard incluye entrada por voz; las funciones avanzadas tienen condiciones de idioma y de dispositivo (como Pixel 6 o posterior), consúltalas en la ayuda oficial Google.
Mención aparte en iPhone: la app Notas graba audio y muestra la transcripción en vivo, guardando ambas en la nota Apple. El japonés está entre los diez idiomas compatibles, con iPhone 12 o posterior como requisito Apple.
El límite común es el reconocimiento en tiempo real: no transcriben archivos ya grabados (Notas solo lo grabado dentro de Notas) ni separan hablantes. Para archivos ya grabados, consulta la guía de transcripción de notas de voz y grabadoras.
Método 3: entregar archivos de audio a Gemini
En la app de Gemini, sube el archivo con el botón de adjuntar y pide «transcribe este audio». Según la ayuda oficial, el audio está limitado a 10 minutos en total en el plan gratuito y a 3 horas en los de pago (Google AI Pro/Ultra), con hasta 10 archivos por consulta (a octubre de 2026) Gemini.
Su fuerza: la transcripción es parte de una IA generativa, así que «transcribe y resume en tres puntos» o «dale formato de acta» se pide en una sola instrucción. Ideal para estudio personal y notas ligeras.
Cuatro cautelas: duración (una reunión de una hora no cabe en el plan gratuito); separación de hablantes sin garantizar; actitud ante la exactitud (la IA puede rellenar lo inaudible con texto verosímil: nunca uses la salida como cita o constancia sin contrastarla con el audio original); y confidencialidad (entregas audio a un servicio externo: revisa almacenamiento y uso para mejorar la IA, que puede diferir entre planes).
Método 4: ejecutar Whisper de OpenAI por tu cuenta
Whisper es un modelo de reconocimiento de voz de código abierto de OpenAI, con licencia MIT, gratuito de ejecutar en tu propio PC. Un solo modelo cubre reconocimiento multilingüe, traducción e identificación de idioma, incluido el japonés GitHub.
Necesitas un entorno de Python, PyTorch y nociones de línea de comandos. Hay seis tamaños de modelo, con requisitos de memoria de GPU desde unos 1GB hasta unos 10GB GitHub. Sin GPU funciona por CPU, pero el tiempo se dispara con audio largo. El paso básico —instalar con pip, ejecutar un comando— no es difícil; el esfuerzo real viene después: la separación de hablantes no forma parte de Whisper y debes construir tú el entorno (procesar archivos largos, interfaz para revisar errores, gestión de la salida).
De primera mano: el autor seleccionó los motores de PUBVOICE y evaluó tanto APIs en la nube como modelos de código abierto. Solo en precisión, los modelos tipo Whisper son plenamente prácticos. Pero la transcripción como servicio se sostiene alrededor del reconocimiento —separación de hablantes, editor sincronizado, formatos de exportación—, y ese trabajo es justo el que el autor ha cargado al desarrollar AITOMO. Para audio confidencial que deba quedarse en local, grandes volúmenes y gente cómoda con la tecnología, Whisper sigue siendo la opción gratuita de referencia.
Tabla comparativa
| Método | Coste | Separación de hablantes | Duración (a la redacción) | Habilidades | Ideal para |
|---|---|---|---|---|---|
| Dictado por voz en Google Docs | Totalmente gratis | No | Sin límite práctico mientras hablas | Ninguna | Dictado de una persona, borradores |
| Funciones del teléfono (iPhone, etc.) | Totalmente gratis | No | Enfoque en tiempo real | Ninguna | Notas en movimiento, dictado corto |
| Gemini | Plan gratuito | No (sin garantía) | 10 min gratis / 3 h de pago | Ninguna | Audio corto + resumen |
| Whisper por tu cuenta | Totalmente gratis (OSS) | No incluida (bibliotecas extra) | Lo que aguante tu PC | Python, CLI | Audio largo, en volumen, confidencial |
Las especificaciones reflejan información oficial a octubre de 2026 (ayuda de Google Docs, guía de Apple, ayuda de Gemini, repositorio de Whisper). Los minutos gratuitos y los idiomas cambian: confírmalos en las páginas oficiales.
Cuándo basta con lo gratuito y cuándo pagar
- Separación de hablantes. Para una persona basta lo gratuito; cuando importa quién dijo qué, estos cuatro métodos se quedan cortos. El plan gratuito de PUBVOICE da 60 minutos al mes con separación, sin tarjeta
- Volumen y frecuencia. Unos pocos archivos cortos al mes caben en lo gratuito; una reunión semanal de una hora inclina a empezar en un plan gratuito y escalar
- Confidencialidad. El audio que no puede salir de tu máquina va con Whisper; en la nube, revisa almacenamiento y uso para entrenar IA. PUBVOICE nunca usa el audio subido para entrenar IA
- Exactitud. Para citas y constancias, verifica contra el audio original en un editor sincronizado; no uses salidas de IA generativa sin revisar
- Continuidad. Lo puntual, gratis; el uso en equipo, valorando también compartir y formatos
Si dudas, prueba un método gratuito con tu propio audio y paga según el límite que realmente alcances. Para comparar servicios, consulta la comparativa de 2026.
Preguntas frecuentes
P. ¿Puede el dictado de Google Docs transcribir un MP3 ya grabado?
R. No: escucha el micrófono en tiempo real y no importa archivos. Para archivos grabados, Gemini (si es corto), Whisper o un servicio que acepte archivos; pasos en la guía de notas de voz y grabadoras.
P. ¿Hay transcripción gratuita con separación de hablantes?
R. No en los cuatro métodos de este artículo. Empieza por el plan gratuito de un servicio que la ofrezca: el de PUBVOICE incluye 60 minutos al mes.
P. ¿Puedo subir audio de reuniones de la empresa a Gemini?
R. Para reuniones confidenciales, revisa antes la guía oficial sobre almacenamiento y uso para mejorar la IA. Si la confidencialidad manda, Whisper en local es el candidato.
P. ¿Funciona Whisper en móviles o portátiles normales?
R. Funciona por CPU, pero el tiempo se dispara con audio largo. El uso cómodo presupone un PC que cumpla los requisitos de memoria GPU del repositorio, entre unos 1 y 10GB según el modelo GitHub.
P. ¿Cuánto puedo transcribir gratis?
R. El dictado en tiempo real es gratis mientras hables; el plan gratuito de Gemini cubre 10 minutos de audio en total (a la redacción); Whisper es gratis hasta donde llegue tu PC. El plan gratuito de PUBVOICE ofrece 60 minutos de transcripción y 10.000 caracteres de generación de voz al mes, sin tarjeta.
Artículos relacionados
- Guía completa de actas de reuniones — plantilla para copiar y flujo con transcripción por IA
- Guía completa de transcripción de entrevistas y actas — flujo completo, de la grabación a la exportación SRT/VTT
- Comparativa de servicios de transcripción con IA (2026) — precios, planes gratuitos y formatos
- Guía de transcripción de notas de voz y grabadoras — pasos concretos para archivos ya grabados
- Guía de lectura de texto con voz de IA — cómo convertir textos y documentos en archivos de audio y elegir una herramienta de lectura
- Guía de ayuda de transcripción — pasos detallados en PUBVOICE
Lo gratuito basta para empezar; elegir bien es lo que lo mantiene funcionando. Prueba un método con tu propio audio. Cuando necesites separación de hablantes y un editor sincronizado, el plan gratuito de PUBVOICE te da 60 minutos de transcripción y 10.000 caracteres de generación de voz al mes, sin tarjeta: consulta la guía de ayuda y sube tu próxima grabación a PUBVOICE.
