Comparación práctica de servicios de incrustación de audio para medios web
Cada vez más equipos de medios se están topando con un techo en sus ingresos publicitarios y empiezan a preguntarse: «¿Podemos convertir nuestros artículos en audio?». El número de servicios entre los que elegir también ha crecido. ElevenLabs, ReadSpeaker, CoeFont, BeyondWords y la japonesa PUBVOICE. Vistos solo por su nombre, todos parecen lo mismo: «audio».
Un servicio de audio de artículos para medios web es un sistema integral que convierte los artículos en voz de forma automática, incrusta un reproductor en el sitio, mide los datos de reproducción y, en algunos casos, se conecta con la publicidad en audio para monetizar. Los ejes que conviene comparar para una herramienta sencilla de TTS (texto a voz) y para un CMS de audio de nivel editorial son completamente distintos.
Al tratarse de un artículo comparativo, declaro el conflicto de intereses de entrada. Actualmente desarrollo y vendo un SaaS de audio de artículos llamado PUBVOICE. Tengo experiencia de campo tanto en el lado publicitario como en el de los medios, pero el objetivo aquí es ofrecer un marco para la selección de servicios; la explicación de las cifras de rendimiento de nuestro propio producto la dejo para un artículo aparte.
La calidad de voz por sí sola no decidirá al ganador
Antes de la comparación, fijemos primero los ejes.
Los motores de TTS para japonés (AITalk, CoeFont, ElevenLabs y las voces neuronales de cada proveedor) ya han alcanzado un nivel práctico. Si no estás acostumbrado a ellos, hay margen para preferencias de gusto. Sin embargo, la fase en la que las microdiferencias de calidad de voz por sí solas determinaban «qué servicio elige un medio» probablemente ya quedó atrás.
ReadSpeaker ofrece más de 90 idiomas y más de 300 voces neuronales, y ElevenLabs destaca en soporte multilingüe y clonación de voz. La calidad técnica de la voz ha alcanzado un nivel práctico en todos los servicios principales.
Lo que de verdad importa en el terreno es la facilidad de implantación, la guionización que entiende la estructura del artículo, la medición de reproducciones y la posibilidad de conectar todo con la publicidad en audio. Si situamos a BeyondWords como referencia, los ejes de comparación se reducen a estos cuatro.

El patrón de «CMS de audio» que BeyondWords estableció
BeyondWords es un CMS de audio ampliamente utilizado por editoriales extranjeras. Tiene un historial con grandes medios como News Corp, y es habitual oír que entrega artículos de audio a varios millones de personas por semana. Según Vendr (una agregación colaborativa de datos de compras, por lo que la muestra es limitada), unos $3,000 al año es el precio medio de contrato, y los precios empresariales son más altos.
La referencia (el conjunto ideal de funciones) en este artículo son los siguientes cinco puntos:
- Generación de audio: voces de IA de alta calidad más clones de voz de reporteros y editores
- Integración en el flujo de trabajo: detección automática de artículos y generación de audio desde WordPress o RSS
- Incrustación del reproductor: colocar un reproductor de audio en el sitio web mediante una etiqueta JS, etc.
- Analítica: tasa de inicio de reproducción, tasa de finalización, comportamiento de los oyentes (integración con GA4, etc.)
- Monetización: inserción de audio de patrocinadores antes y después de los artículos de audio, integración con el ad server
La fortaleza de BeyondWords es que la monetización viene integrada de serie. «Generar un artículo de audio → hacer que los oyentes lo reproduzcan en el reproductor → ganar con anuncios de audio» todo vive dentro de un único producto. Lo que los medios japoneses probablemente quieren imitar es este patrón integral.
Ordenar los servicios en tres niveles hace visible la elección
Los servicios se dividen a grandes rasgos en tres niveles, según la amplitud con la que sus funciones sirven al objetivo de un medio (mejorar la retención o monetizar con publicidad).
Categoría A: tipo plataforma de audio de artículos
Un nivel que cubre la generación automática de audio de artículos, la incrustación del reproductor y la analítica de reproducciones dentro de un único producto. Si la monetización viene integrada varía según el producto.
BeyondWords (internacional)
Para grandes editoriales. El módulo de monetización es estándar, lo que lo convierte en el más cercano al modelo «integral» al estilo BeyondWords. Una media de unos $3,000 al año. Conviene verificar antes de la implantación si el funcionamiento y el soporte funcionan bien en un entorno en japonés.
PUBVOICE (Japón)
Se puede implantar con el registro del RSS y una sola línea de JavaScript incrustado. Entiende los titulares y las listas de viñetas del artículo, los reorganiza en un guion agradable al oído y después genera el audio. La integración con GA4 visualiza los comportamientos de inicio de reproducción y de finalización cercana. Hay un plan gratuito disponible, y los planes de pago se publican entre 1,480 JPY/month y 29,800 JPY/month. Actualmente se centra en el audio de artículos y la medición; los anuncios de audio no están integrados (ver más abajo).
BotTalk (internacional)
Una plataforma de distribución de audio para editoriales. Se promociona por su capacidad de convertir contenido web en audio sin integración de API. Uno de los servicios dirigidos a editoriales extranjeras.
Categoría B: tipo infraestructura / accesibilidad
Estos se inclinan hacia «hacer el sitio escuchable» como infraestructura. Tienen muchas implantaciones. Los flujos de trabajo de publicidad en audio y monetización para medios tienden a requerir, por diseño, una construcción aparte.
ReadSpeaker webReader (internacional / Japón)
Más de 12,000 implantaciones en todo el mundo (según la empresa; la fecha del dato está por confirmar). Una sola etiqueta convierte todos los artículos en audio. Ofrece más de 90 idiomas y más de 300 voces neuronales. La estabilidad en japonés y el cumplimiento de accesibilidad (Ley de Eliminación de la Discriminación contra las Personas con Discapacidad, JIS X 8341-3:2016, etc.) son fortalezas. Una opción sólida para medios que priorizan la lectura en voz alta del artículo completo y la accesibilidad.
Web Yomi Shokunin (Japón)
Un producto ofrecido por AI Inc. Convierte el contenido en audio mediante la incrustación de etiquetas HTML. Ampliamente adoptado por gobiernos locales y para usos de accesibilidad. Los requisitos de monetización y analítica para medios suelen tener que verificarse caso por caso dentro del alcance del plan de implantación y de las integraciones del entorno.
Categoría C: tipo componente técnico
Un nivel de servicios cuyas funciones están especializadas en un área concreta y que sirven como piezas para montar una pila completa internamente.
ElevenLabs / Audio Native (internacional)
Fuerte en calidad de voz, soporte multilingüe y clonación. Audio Native también es compatible con la incrustación en artículos. La analítica y la monetización deben construirse internamente. Una opción como motor de TTS de alta calidad.
Amazon Polly (internacional)
Basado en AWS. Es conocida la historia de que The Washington Post lo usó en una implementación propia. Estrictamente para construcciones internas completas.
CoeFont (Japón)
Más de 10,000 voces de IA y una API. Una capa tecnológica de voz en japonés. Los reproductores y la integración publicitaria deben desarrollarse internamente.
Otonaru Inc. (Japón)
Según la información pública, su campo principal es la publicidad en audio, la producción de pódcast y la integración con ad servers. Suele entrar en la lista de candidatos cuando el tema en Japón es «construir inventario y ventas de anuncios de audio». Su filosofía de diseño de producto difiere de la de un SaaS de audio incrustado en artículos. Que incluya TTS o audio automático de artículos puede variar según el producto y el plan, por lo que es necesario confirmarlo frente a tus requisitos.
Matriz comparativa
He resumido en una tabla los ejes que importan al seleccionar sobre el terreno.
| Servicio | Facilidad de implantación | Analítica de retención | Monetización publicitaria | Uso adecuado (orientativo) | Notas |
|---|---|---|---|---|---|
| BeyondWords | Alta (integración con CMS) | Función estándar | Función estándar | Editoriales extranjeras / integral | Alrededor de $3,000/año, referencia |
| PUBVOICE | Alta (RSS + 1 línea de JS) | Integración con GA4 | Actualmente centrado en la medición | Medios japoneses / audio de artículos | Plan gratuito disponible; de pago desde 1,480 JPY/month |
| BotTalk | Alta | Por confirmar | Por confirmar | Editoriales extranjeras / audio automático | Sin información pública |
| ReadSpeaker | Alta (etiqueta) | Depende del producto | El diseño a medida es habitual | Accesibilidad / lectura completa del artículo | 90 idiomas, 300 voces; amplia base de implantación |
| Web Yomi Shokunin | Alta (etiqueta) | Por confirmar | El diseño a medida es habitual | Gobierno local / accesibilidad | Ofrecido por AI Inc. |
| ElevenLabs | Media (desarrollo) | Construcción interna | Construcción interna | TTS de alta calidad / interno | Incrustable mediante Audio Native |
| CoeFont | Baja (API) | Construcción interna | Construcción interna | API de voz en japonés / interno | Sin información pública |
| Otonaru Inc. | Por confirmar | Por confirmar | Una fortaleza principal | Japón / anuncios de audio / ad server | Alcance de funciones por confirmar |

Si tu objetivo es elevar las tasas de retención
Si el objetivo es mejorar la duración de sesión y la profundidad de navegación de los usuarios principales, los tres requisitos esenciales son estos:
La medición de datos de reproducción, la generación automática de audio de artículos y una implantación casi sin código.
Con ReadSpeaker o AITalk también se puede crear un estado «escuchable». Sin embargo, para hacer girar el ciclo de mejora de la retención, encaja mejor una plataforma de audio de artículos que se conecte con tus herramientas de analítica web. Sin visibilidad sobre la tasa de inicio de reproducción y las métricas cercanas a la finalización, el lado editorial se queda en «añadimos audio», y resulta difícil formular hipótesis de mejora.
En el mercado japonés, para los medios que quieren el audio automático de artículos y la integración con GA4 como un conjunto, productos como PUBVOICE tienden a entrar en la lista de candidatos. El hecho de que entienda la estructura del artículo y la convierta en guion en consecuencia puede contribuir a mejorar las tasas de finalización. «No es una simple lectura en voz alta» es la dirección de los comentarios de los socios de implantación.
Si persigues lo mismo fuera de Japón, BeyondWords es el primer candidato. Hasta dónde cubre el japonés y el soporte local debe confirmarse caso por caso.
Si tu objetivo es recuperar los ingresos publicitarios
Si el objetivo es nuevo inventario publicitario (pre-roll, mid-roll, integración con un ad server existente), los protagonistas de la comparación se desplazan hacia el lado del CMS de audio y la infraestructura de anuncios de audio.
Fuera de Japón hay ejemplos como BeyondWords, donde el audio de artículos y los anuncios de audio viven dentro de un único producto. También en Japón existen varios servicios centrados en el diseño de entrega de anuncios de audio, la producción de pódcast y la integración con ad servers. Según la información pública, Otonaru Inc. es un nombre que a veces entra en la lista como producto que posiciona su fortaleza en esa área. El alcance de las funciones puede cambiar según el plan y el momento, por lo que contrastar los requisitos con los materiales oficiales es obligatorio.
Mientras tanto, el SaaS de audio incrustado en artículos (muchos productos, incluido PUBVOICE) está, por ahora, centrado en la retención y la medición. Si el diseño cierra el ciclo con anuncios de audio dentro del mismo panel varía según el producto.
Instalar audio de artículos por sí solo no sustituirá a la publicidad display. La monetización que incluye el diseño de inventario, las ventas y la medición es una historia que se construye con productos aparte o con desarrollo interno. Si tienes un equipo interno, también existe la configuración de generar el audio con ElevenLabs o CoeFont y cargarlo en tu infraestructura publicitaria existente. La implementación propia de The Washington Post con Polly es una historia para un grande con recursos de ingeniería; el coste de que un medio mediano tome el mismo camino es alto.
El espacio en blanco que queda en el mercado japonés
La calidad de voz por sí sola ya no genera gran diferenciación. Lo que los medios buscan realmente es cuánto del flujo de trabajo pueden externalizar.
En Japón, mi impresión es que las opciones al estilo BeyondWords —«integral, desde el audio del artículo pasando por el reproductor hasta los anuncios de audio»— siguen siendo limitadas. Son muchos los casos en que el SaaS de audio de artículos y los servicios orientados a anuncios de audio / ad servers existen como productos separados. Así que, en la selección, creo que un orden realista es aclarar primero el objetivo (retención o nuevo inventario publicitario) y luego preseleccionar productos de la categoría que encaje con él.
Sobre el autor y PUBVOICE
Escribí sobre los motivos y el contexto en Por qué construimos un SaaS de audio con IA para medios web.
El producto actual de PUBVOICE está centrado en el audio de artículos y la medición de reproducciones. No está diseñado para cerrar el ciclo de los anuncios de audio dentro del mismo producto como hace BeyondWords, ni asumimos un paquete de implantación conjunto con servicios de otras empresas.
En cuanto a la publicidad en audio, estamos en la fase de considerar la integración de entrega mediante etiquetas VAST, entre otras cosas, para que se apoye con facilidad sobre las operaciones publicitarias que el medio ya tiene. El calendario y las especificaciones están sin decidir, y para las decisiones de implantación en este momento creo que el encuadre de «retención y medición como propósito principal» es el adecuado.
Para cerrar
Elegir un servicio no es cuestión de preferencia por la calidad de voz; es una cuestión de cuánto del flujo de trabajo externalizas.
Si quieres poner en marcha un ciclo de medición y mejora de la retención, opta por una plataforma de audio de artículos conectada con GA4. Si lo primero es crear inventario publicitario, preselecciona productos orientados al CMS de audio o a la infraestructura de anuncios de audio mientras contrastas los requisitos con el alcance oficial de funciones. Si lo primero es la accesibilidad y la lectura completa del artículo, ReadSpeaker y Web Yomi Shokunin también son candidatos sólidos.
Expuse el declive estructural y continuo del CPM de display de texto en Por qué los ingresos publicitarios de los medios web se estancan: disección de 3 problemas estructurales. El audio no es un sustituto de eso. Buena parte tiene que ver con aumentar los canales a través de los cuales se puede llegar a los lectores.
Qué elegirán los medios a continuación. La respuesta correcta probablemente sea distinta para cada uno. Dejo aquí los ejes de comparación.
La información de precios y funciones se basa en información pública disponible a agosto de 2026. Consulta los materiales oficiales más recientes de cada proveedor.
Artículos relacionados
- Por qué los ingresos publicitarios de los medios web se estancan: disección de 3 problemas estructurales — Los límites estructurales de los ingresos publicitarios, con los datos más recientes sobre bloqueo de anuncios y oligopolio de plataformas
- Qué cambia cuando los artículos de medios web se convierten en audio — Cómo se movieron el tiempo de permanencia y la tasa de repetición con el audio
- Por qué construimos un SaaS de audio con IA para medios web — Por qué construí un producto de audio viniendo del lado publicitario
- Contenido imitado en la era de la IA y la entrega más allá del texto — Qué significa tener una ruta de entrega distinta de «leer» en la era de la búsqueda con IA

Yutaro Sasao
CEO / Media Leap Inc.
Tras liderar la monetización y el análisis de datos de medios web en KADOKAWA / DWANGO e impulsar la monetización publicitaria programática en negocios de SSP y ad networks, fundó Media Leap Inc. en mayo de 2025. Actualmente desarrolla y opera el SaaS de audio con IA "PUBVOICE", la app de turismo DX "ANIME TRAVEL" y la app de chat por voz con IA "AITOMO". Con una visión que abarca publicidad, tecnología, análisis y negocio, trabaja en la mejora de ingresos de medios basada en datos.
Artículos relacionados
Cómo estamos pensando en aumentar el valor de los espacios publicitarios existentes sin añadir más
Más allá de «añadir más espacios», ¿qué más puede hacerse para hacer crecer los ingresos publicitarios? ¿Cómo afecta una permanencia más prolongada a la probabilidad y la duración con que se ven los anuncios situados fuera de la primera pantalla? Con la visibilidad y las métricas de atención en mente, alguien que estuvo en el bando de «añadir más anuncios» escribe lo que está pensando, como concepto de trabajo.
El momento en que el contenido original caduca: la imitación en la era de la IA y más allá del texto
Con un 74% de las nuevas páginas web conteniendo contenido generado por IA (Ahrefs 2025, aunque solo el 2.5% es totalmente generado por IA; la mayoría es un híbrido humano-IA), ¿dónde reside la ventaja de un creador de contenidos? Las directrices de calidad de Google sitúan la confianza (Trust) en el centro del E-E-A-T, y las AI Overviews reducen un 58% el CTR de la página en el primer puesto. Escrito por alguien que ha trabajado en ambos lados de la publicidad web y los medios desde 2015.
Qué cambia cuando los medios web añaden audio a sus artículos
Tras añadir audio con IA a los artículos de un medio web, observamos de media un tiempo de permanencia 3 veces mayor, +5% en la tasa de repetición y +5% en PV (medición limitada de algunas implementaciones). Con 167 millones de oyentes mensuales de podcasts en EE. UU. y un mercado de TTS que crece a doble dígito, un profesional de la monetización de medios en activo desde 2015 analiza el potencial, los beneficios y los retos del contenido de audio.