PUBVOICE.
    FEATURESPRICINGFAQHELP
    Iniciar sesiónEmpieza gratis
    Cómo transcribir gratis: dictado por voz de Google Docs, Gemini, Whisper y las funciones del móvil: capacidades, límites y cómo elegir bien

    Cómo transcribir gratis: dictado por voz de Google Docs, Gemini, Whisper y las funciones del móvil: capacidades, límites y cómo elegir bien

    6 de octubre de 2026

    Índice

    1. 1.Cómo transcribir audio gratis: cuatro métodos comparados
    2. 2.Método 1: dictado por voz en Google Docs
    3. 3.Método 2: las funciones de voz del propio teléfono
    4. 4.Método 3: entregar archivos de audio a Gemini
    5. 5.Método 4: ejecutar Whisper de OpenAI por tu cuenta
    6. 6.Tabla comparativa
    7. 7.Cuándo basta con lo gratuito y cuándo pagar
    8. 8.Preguntas frecuentes
    9. 9.Artículos relacionados

    Cómo transcribir audio gratis: cuatro métodos comparados

    El autor de este artículo es Yutaro Sasao. Desarrolla y opera PUBVOICE, un SaaS de voz con IA con planes de pago, pero aquí evalúa los métodos gratuitos con imparcialidad. Lo gratuito cubre más de lo que se cree; si basta depende de tu audio y de cómo lo uses.

    Actas, entrevistas, grabaciones de clases, subtítulos: la necesidad de transcripción no deja de crecer, pero reescribirla a mano no es realista. Según una columna de Ricoh, la transcripción manual suele llevar cuatro veces la duración del audio Ricoh.

    La conclusión primero, en cuatro líneas:

    • Transcribir el habla de una persona ahora mismo → el dictado por voz de Google Docs o el teclado del móvil (ambos totalmente gratis)
    • Transcribir un archivo corto ya grabado, con resumen incluido → Gemini (plan gratuito)
    • Procesar audio largo o en volumen, repetidamente → ejecutar Whisper de OpenAI por tu cuenta (gratis, código abierto)
    • Necesitar separación de hablantes → más allá de estos métodos; el plan gratuito de un servicio con separación es la respuesta realista

    «Gratis» tiene dos formas: métodos completamente gratuitos (dictado, funciones del móvil, código abierto) y servicios con plan gratuito (Gemini, herramientas como PUBVOICE). El autor seleccionó personalmente los motores de voz de PUBVOICE, redujo los costes de desarrollo a aproximadamente un tercio con IA generativa y también desarrolla AITOMO, una app de voz con VOICEVOX con 20.000 descargas y valoración 4,2: lo que sigue parte de la experiencia directa con modelos en la nube y motores de código abierto.

    Método 1: dictado por voz en Google Docs

    Abre un documento en Chrome, elige «Herramientas» → «Dictado por voz», pulsa el micrófono y tu habla se transcribe en tiempo real. No cuesta nada con una cuenta de Google; la ayuda oficial indica las versiones recientes de Chrome, Edge y Safari, y más de 100 idiomas Google.

    Fuerzas: preparación mínima y libertad de duración; nada que instalar y sin límite práctico mientras hablas. Ideal para redactar por dictado.

    Tres límites: no hay función para importar un archivo de audio existente (el dictado escucha el micrófono, así que transcribir un MP3 exige redirigir el sonido del altavoz al micro, poco fiable); sin separación de hablantes; y los comandos de voz para editar y formatear son solo en inglés según la ayuda Google: en japonés, considéralo una herramienta para «escribir» y corrige con el teclado.

    Método 2: las funciones de voz del propio teléfono

    Antes de buscar una app gratuita, revisa lo que ya trae tu móvil.

    En iPhone, activa el dictado en Ajustes → General → Teclado → Activar Dictado y pulsa el micrófono en cualquier teclado Apple. Muchos idiomas se procesan en el propio dispositivo, sin conexión; en los compatibles se insertan signos de puntuación automáticamente; y el dictado se detiene tras 30 segundos de silencio Apple. En Android, Gboard incluye entrada por voz; las funciones avanzadas tienen condiciones de idioma y de dispositivo (como Pixel 6 o posterior), consúltalas en la ayuda oficial Google.

    Mención aparte en iPhone: la app Notas graba audio y muestra la transcripción en vivo, guardando ambas en la nota Apple. El japonés está entre los diez idiomas compatibles, con iPhone 12 o posterior como requisito Apple.

    El límite común es el reconocimiento en tiempo real: no transcriben archivos ya grabados (Notas solo lo grabado dentro de Notas) ni separan hablantes. Para archivos ya grabados, consulta la guía de transcripción de notas de voz y grabadoras.

    Método 3: entregar archivos de audio a Gemini

    En la app de Gemini, sube el archivo con el botón de adjuntar y pide «transcribe este audio». Según la ayuda oficial, el audio está limitado a 10 minutos en total en el plan gratuito y a 3 horas en los de pago (Google AI Pro/Ultra), con hasta 10 archivos por consulta (a octubre de 2026) Gemini.

    Su fuerza: la transcripción es parte de una IA generativa, así que «transcribe y resume en tres puntos» o «dale formato de acta» se pide en una sola instrucción. Ideal para estudio personal y notas ligeras.

    Cuatro cautelas: duración (una reunión de una hora no cabe en el plan gratuito); separación de hablantes sin garantizar; actitud ante la exactitud (la IA puede rellenar lo inaudible con texto verosímil: nunca uses la salida como cita o constancia sin contrastarla con el audio original); y confidencialidad (entregas audio a un servicio externo: revisa almacenamiento y uso para mejorar la IA, que puede diferir entre planes).

    Método 4: ejecutar Whisper de OpenAI por tu cuenta

    Whisper es un modelo de reconocimiento de voz de código abierto de OpenAI, con licencia MIT, gratuito de ejecutar en tu propio PC. Un solo modelo cubre reconocimiento multilingüe, traducción e identificación de idioma, incluido el japonés GitHub.

    Necesitas un entorno de Python, PyTorch y nociones de línea de comandos. Hay seis tamaños de modelo, con requisitos de memoria de GPU desde unos 1GB hasta unos 10GB GitHub. Sin GPU funciona por CPU, pero el tiempo se dispara con audio largo. El paso básico —instalar con pip, ejecutar un comando— no es difícil; el esfuerzo real viene después: la separación de hablantes no forma parte de Whisper y debes construir tú el entorno (procesar archivos largos, interfaz para revisar errores, gestión de la salida).

    De primera mano: el autor seleccionó los motores de PUBVOICE y evaluó tanto APIs en la nube como modelos de código abierto. Solo en precisión, los modelos tipo Whisper son plenamente prácticos. Pero la transcripción como servicio se sostiene alrededor del reconocimiento —separación de hablantes, editor sincronizado, formatos de exportación—, y ese trabajo es justo el que el autor ha cargado al desarrollar AITOMO. Para audio confidencial que deba quedarse en local, grandes volúmenes y gente cómoda con la tecnología, Whisper sigue siendo la opción gratuita de referencia.

    Tabla comparativa

    Método Coste Separación de hablantes Duración (a la redacción) Habilidades Ideal para
    Dictado por voz en Google Docs Totalmente gratis No Sin límite práctico mientras hablas Ninguna Dictado de una persona, borradores
    Funciones del teléfono (iPhone, etc.) Totalmente gratis No Enfoque en tiempo real Ninguna Notas en movimiento, dictado corto
    Gemini Plan gratuito No (sin garantía) 10 min gratis / 3 h de pago Ninguna Audio corto + resumen
    Whisper por tu cuenta Totalmente gratis (OSS) No incluida (bibliotecas extra) Lo que aguante tu PC Python, CLI Audio largo, en volumen, confidencial

    Las especificaciones reflejan información oficial a octubre de 2026 (ayuda de Google Docs, guía de Apple, ayuda de Gemini, repositorio de Whisper). Los minutos gratuitos y los idiomas cambian: confírmalos en las páginas oficiales.

    Cuándo basta con lo gratuito y cuándo pagar

    • Separación de hablantes. Para una persona basta lo gratuito; cuando importa quién dijo qué, estos cuatro métodos se quedan cortos. El plan gratuito de PUBVOICE da 60 minutos al mes con separación, sin tarjeta
    • Volumen y frecuencia. Unos pocos archivos cortos al mes caben en lo gratuito; una reunión semanal de una hora inclina a empezar en un plan gratuito y escalar
    • Confidencialidad. El audio que no puede salir de tu máquina va con Whisper; en la nube, revisa almacenamiento y uso para entrenar IA. PUBVOICE nunca usa el audio subido para entrenar IA
    • Exactitud. Para citas y constancias, verifica contra el audio original en un editor sincronizado; no uses salidas de IA generativa sin revisar
    • Continuidad. Lo puntual, gratis; el uso en equipo, valorando también compartir y formatos

    Si dudas, prueba un método gratuito con tu propio audio y paga según el límite que realmente alcances. Para comparar servicios, consulta la comparativa de 2026.

    Preguntas frecuentes

    P. ¿Puede el dictado de Google Docs transcribir un MP3 ya grabado?
    R. No: escucha el micrófono en tiempo real y no importa archivos. Para archivos grabados, Gemini (si es corto), Whisper o un servicio que acepte archivos; pasos en la guía de notas de voz y grabadoras.

    P. ¿Hay transcripción gratuita con separación de hablantes?
    R. No en los cuatro métodos de este artículo. Empieza por el plan gratuito de un servicio que la ofrezca: el de PUBVOICE incluye 60 minutos al mes.

    P. ¿Puedo subir audio de reuniones de la empresa a Gemini?
    R. Para reuniones confidenciales, revisa antes la guía oficial sobre almacenamiento y uso para mejorar la IA. Si la confidencialidad manda, Whisper en local es el candidato.

    P. ¿Funciona Whisper en móviles o portátiles normales?
    R. Funciona por CPU, pero el tiempo se dispara con audio largo. El uso cómodo presupone un PC que cumpla los requisitos de memoria GPU del repositorio, entre unos 1 y 10GB según el modelo GitHub.

    P. ¿Cuánto puedo transcribir gratis?
    R. El dictado en tiempo real es gratis mientras hables; el plan gratuito de Gemini cubre 10 minutos de audio en total (a la redacción); Whisper es gratis hasta donde llegue tu PC. El plan gratuito de PUBVOICE ofrece 60 minutos de transcripción y 10.000 caracteres de generación de voz al mes, sin tarjeta.

    Artículos relacionados

    • Guía completa de actas de reuniones — plantilla para copiar y flujo con transcripción por IA
    • Guía completa de transcripción de entrevistas y actas — flujo completo, de la grabación a la exportación SRT/VTT
    • Comparativa de servicios de transcripción con IA (2026) — precios, planes gratuitos y formatos
    • Guía de transcripción de notas de voz y grabadoras — pasos concretos para archivos ya grabados
    • Guía de lectura de texto con voz de IA — cómo convertir textos y documentos en archivos de audio y elegir una herramienta de lectura
    • Guía de ayuda de transcripción — pasos detallados en PUBVOICE

    Lo gratuito basta para empezar; elegir bien es lo que lo mantiene funcionando. Prueba un método con tu propio audio. Cuando necesites separación de hablantes y un editor sincronizado, el plan gratuito de PUBVOICE te da 60 minutos de transcripción y 10.000 caracteres de generación de voz al mes, sin tarjeta: consulta la guía de ayuda y sube tu próxima grabación a PUBVOICE.

    Artículos relacionados

    +
    3x de mediaTiempo de permanencia
    +5%Lectores recurrentes
    30+Patrones de voz
    ◆ PLAN_GRATUITO_DISPONIBLE

    Prueba gratis
    la distribución de audio.

    Puedes probar la experiencia de audio gratis con tus artículos reales.
    El plan Free incluye todas las funciones básicas sin coste.

    Empieza gratisVer más funciones

    Sin tarjeta de crédito · Cancela cuando quieras

    P
    PUBVOICE.

    AUDIO_CONTENT
    PLATFORM V1.0

    ◆ ALL SYSTEMS OPERATIONAL

    PRODUCT

    • ¿Qué es PUBVOICE?
    • Blog

    COMPANY

    • Sobre nosotros

    LEGAL

    • Términos de servicio
    • Política de privacidad
    • Aviso legal

    SUPPORT

    • Centro de ayuda
    • Preguntas frecuentes
    • Contacto
    STATUS

    ALL SYSTEMS ONLINE

    Ready!

    SERVICIOS

    💬

    AITOMO

    Chat de voz con IA y generación de imágenes con tus personajes favoritos

    🌏

    Kaigai Matome

    Reacciones del mundo sobre Japón, traducidas por IA

    🍜

    RAMEN TRIP

    Encuentra, colecciona y domina cada tazón de ramen

    📷

    TOKYO LENS

    Una guía con IA que explica Tokio a través de tu cámara

    © 2026 PUBVOICE. All rights reserved.

    Made with care in Japan

    Yutaro Sasao

    Yutaro Sasao

    CEO / Media Leap Inc.

    Tras liderar la monetización y el análisis de datos de medios web en KADOKAWA / DWANGO e impulsar la monetización publicitaria programática en negocios de SSP y ad networks, fundó Media Leap Inc. en mayo de 2025. Actualmente desarrolla y opera el SaaS de audio con IA "PUBVOICE", la app de turismo DX "ANIME TRAVEL" y la app de chat por voz con IA "AITOMO". Con una visión que abarca publicidad, tecnología, análisis y negocio, trabaja en la mejora de ingresos de medios basada en datos.

    ← Volver al blog

    Cómo transcribir notas de voz y grabadoras IC: guía completa desde la exportación de archivos hasta la transcripción con IA

    Guía completa para transcribir audio de las notas de voz del iPhone y de grabadoras IC: consejos de grabación, exportación de archivos m4a y mp3, y elección entre funciones del móvil, Whisper local y servicios de transcripción con IA.

    Comparativa de servicios de transcripción con IA (2026): guía práctica

    Notta, toruno, Rimo Voice, Otolio, AI GIJIROKU, YOMEL y PUBVOICE comparados por plan gratuito, precio efectivo, diarización, edición y exportación, con recomendaciones por tarea y ejemplos de coste anual.

    Cómo leer texto en voz alta y cómo elegir una herramienta de lectura con IA

    Guía práctica para convertir en audio los textos que ya tienes: cómo usar las funciones de lectura integradas de Windows, Mac, iPhone y Android, en qué se diferencia la generación de voz con IA y una lista de comprobación para elegir herramienta.