Mercado de transcripción con IA: análisis estilo equity research (2026)
El mercado de la transcripción con IA, leído como un analista
La IA que convierte grabaciones de reuniones y entrevistas en texto se ha convertido en uno de los mercados SaaS más legibles de 2026. En este artículo lo descompongo con el mismo marco que usaría un analista financiero: tamaño de mercado, motores de crecimiento, estructura de costes, panorama competitivo y unit economics.
La conclusión primero: el mercado crece a tasas cercanas al doble dígito, los costes se han desplomado y las barreras de entrada han caído — precisamente por eso los ganadores ya no los decide la precisión del modelo, sino la experiencia, la confianza y el diseño de monetización. Ese cambio estructural importa tanto a quien elige un servicio como a quien quiere entender la industria.
Descargo: desarrollo y vendo un SaaS de audio con IA llamado PUBVOICE. Este artículo es un análisis de mercado basado en datos públicos, no una presentación comercial; solo menciono su posicionamiento al final.
1. Tamaño de mercado: leer varias estimaciones a la vez
| Fuente | Alcance | Estimación |
|---|---|---|
| MarketsandMarkets | Reconocimiento de voz | 9.660 M USD (2025) → 23.110 M USD (2030), ~19% CAGR |
| Mordor Intelligence | Reconocimiento de voz | 22.510 M USD (2026) → 61.780 M USD (2031), 22,4% CAGR |
| ResearchAndMarkets | API de speech-to-text | 5.360 M USD (2026) → 10.460 M USD (2030), 18,2% CAGR |
| Market.us | Herramientas de transcripción IA | 4.500 M USD (2024) → 19.200 M USD (2034), 15,6% CAGR |
Las definiciones varían, pero la lectura es consistente: el CAGR se sitúa entre el 15% y el 22%, muy por encima del crecimiento nominal del PIB mundial. Mientras el SaaS en general se desacelera, la voz sigue siendo una categoría temprana.
2. Motores de crecimiento: la demanda va más allá de las reuniones
Capa 1: el trabajo remoto es estructural. Las reuniones online ocurren en entornos donde grabar es lo predeterminado. Las encuestas sugieren que se dedica un 30% de la jornada a reuniones y su coordinación (PR TIMES): «recuperar en texto las reuniones que me perdí» es una necesidad estructural.
Capa 2: el trabajo del conocimiento se está volviendo registro. Actas, registros de asesoría financiera, notas médicas, entrevistas periodísticas: el audio como evidencia crece en todos los sectores. Una hora de reunión contiene más de 20.000 caracteres y la transcripción manual lleva de media 4–5 horas por hora de audio.
Capa 3: la economía de los creadores. Pódcasts, YouTube y comunidades de pago generan demanda nueva: la transcripción como materia prima de subtítulos (SRT/VTT), artículos y resúmenes.
3. La curva de costes: los precios de ASR cayeron un orden de magnitud
| API | Precio orientativo |
|---|---|
| AWS Transcribe (lote) | ~0,024 USD/min |
| Azure AI Speech | ~0,016–0,024 USD/min |
| Google Chirp 3 (estándar) | ~0,016 USD/min |
| OpenAI Whisper API | 0,006 USD/min |
| Deepgram Nova-3 (lote) | ~0,0043 USD/min |
| Google (lote dinámico) | ~0,003 USD/min |
| AssemblyAI | ~0,0025 USD/min |
El coste por hora ha caído de alrededor de un dólar a menos de veinte centavos en reconocimiento por lotes — y menos aún si alojas Whisper en abierto por tu cuenta.
Dos conclusiones de analista: (1) «¿qué modelo usas?» ya no es un diferenciador — las diferencias que el usuario percibe se han movido a la capa de experiencia (UI, edición, diarización, formates de exportación, diseño de precios); (2) el margen lo decide la operación, no el coste — con un coste de API inferior a 20 yenes/hora y precios minoristas de 200–1.650 yenes/hora en Japón, la mayor parte del diferencial se paga por experiencia y confianza.
4. Panorama competitivo: global y Japón
Fireflies.ai alcanzó en 2025 una valoración de 1.000 M USD tras recaudar solo ~19 M USD, con un ARR estimado de 5,8 M (2023) a 10,9 M USD (2024) (Latka). Otter.ai, respaldada por Sequoia, lidera el reconocimiento general. Pero con Zoom y Teams lanzando asistentes de IA nativos, la capa de integración con bots de reunión sufre presión de plataforma.
En Japón conviven dos modelos: herramientas que entran solas a las reuniones (Otolio/スマート書記, AI GIJIROKU, toruno, Notta — Otolio fue n.º 1 en una encuesta de BOXIL con 1.690 respuestas) y herramientas de «sube tu grabación» (Rimo Voice, Sacscribe, Notta y PUBVOICE), que sirven entrevistas, clases y trabajos jurídicos. Hay servicios especializados en japonés desde 198 yenes/hora.
5. Unit economics: quién gana dinero
Con un coste de API de ~30 yenes/hora y un precio de 500 yenes/hora, el margen bruto supera el 90%. Dos cautelas: el reconocimiento en streaming cuesta varias veces más que por lotes, y la diarización y el resumen añaden coste — qué se cobra y qué se muestra gratis es, en sí mismo, el diseño del margen. El riesgo dominante no es el coste, sino la guerra de precios: por eso todos invierten en la capa que genera coste de cambio (edición, vocabulario personalizado, exportación, seguridad).
6. Cómo elegir un servicio en la práctica
- Menos reescuchas por encima de la precisión bruta (diarización y vocabulario personalizado mandan)
- Geometría de precios (sustancia del plan gratuito, coste efectivo por hora)
- Exportación y reutilización (TXT/SRT/VTT, con hablantes)
- Dónde viven los datos (tratamiento nacional, retención, uso para entrenamiento)
- Fricción de entrada (probar antes de registrarse; reunión vs. archivo)
7. Dónde encaja PUBVOICE (descargo)
PUBVOICE es un servicio de transcripción de archivos: (1) experiencia de invitado de 90 segundos sin registro, (2) transcripción con separación de hablantes y editor, (3) exportación TXT/SRT/VTT, (4) transcripción y texto-a-voz en una sola cuenta. Autoevaluación honesta: está diseñado según la conclusión de este análisis — los costes caen, la experiencia diferencia.
Artículos relacionados

Yutaro Sasao
CEO / Media Leap Inc.
Tras liderar la monetización y el análisis de datos de medios web en KADOKAWA / DWANGO e impulsar la monetización publicitaria programática en negocios de SSP y ad networks, fundó Media Leap Inc. en mayo de 2025. Actualmente desarrolla y opera el SaaS de audio con IA "PUBVOICE", la app de turismo DX "ANIME TRAVEL" y la app de chat por voz con IA "AITOMO". Con una visión que abarca publicidad, tecnología, análisis y negocio, trabaja en la mejora de ingresos de medios basada en datos.
Artículos relacionados
Comparativa de servicios de transcripción con IA (2026): guía práctica
Notta, toruno, Rimo Voice, Otolio, AI GIJIROKU, YOMEL y PUBVOICE comparados por plan gratuito, precio efectivo, diarización, edición y exportación, con recomendaciones por tarea y ejemplos de coste anual.
Guía completa de transcripción de entrevistas y actas: de la grabación a la exportación SRT/VTT
La transcripción manual lleva 4–5 horas por hora de audio; la IA, minutos. Esta guía cubre consejos de grabación, el flujo con separación de hablantes, cómo convertir la transcripción en actas o artículos y cómo elegir entre SRT y VTT.