Guía completa de transcripción de entrevistas y actas: de la grabación a la exportación SRT/VTT
Guía completa de transcripción de entrevistas y actas
El trabajo de verdad empieza al terminar la entrevista. Transcribir a mano una hora de audio lleva 4–5 horas; una reunión contiene más de 20.000 caracteres y resumirla sigue consumiendo «la noche de alguien» en la mayoría de los trabajos.
Esta guía recorre el flujo completo: consejos de grabación → transcripción con IA → edición → exportación a actas/artículos/subtítulos. Uso PUBVOICE como ejemplo, pero casi todo (principios de grabación, SRT vs. VTT) vale para cualquier servicio.
La realidad de tiempo y coste
| Método | Tiempo aproximado | Notas |
|---|---|---|
| Transcripción manual | 4–5 h por hora de audio | Incluye reescuchas |
| Externalizada | Días de plazo | ~miles de yenes por hora |
| IA + edición | 10–30 min | Corregir errores y verificar |
La IA sustituye el tecleo, no la verificación. Pero eliminar el tecleo reduce el trabajo total a menos de una décima parte: ese es el punto de partida del flujo.
Paso 0: la grabación — aquí se decide el 80% de la calidad
- Acerca los micrófonos a los hablantes. Un móvil recogiendo toda la sala es el peor caso para la diarización.
- Reduce las conversaciones cruzadas. Un moderador que pida «de uno en uno» ahorra horas de edición.
- Usa formatos estándar (mp3/m4a/wav). PUBVOICE admite hasta 500 MB y grabaciones de más de 5 horas.
- Graba una prueba de 30 segundos y comprueba que se oye a la persona más baja de voz.
Paso 1: subir y transcribir
Arrastra el archivo al espacio de trabajo (/transcripts), observa el estado (en cola → procesando → listo) y recibe una transcripción con etiquetas de hablante y marcas de tiempo por segmento. Puedes probar hasta 90 segundos en la página principal sin registrarte — hazlo con el tipo de audio que realmente grabas.
Paso 2: editar — corregir «quién dijo qué»
Los errores caen en tres categorías: nombres propios y jerga (lo más común), intercambios de hablante, y elección de homófonos. El flujo básico: renombrar hablantes en lote (Hablante 1 → «Tanaka») y usar la búsqueda del documento para cazar errores. El editor se sincroniza con el reproductor: clicar una línea sospechosa y reescuchar ocurre en el mismo sitio — verificas mientras el contexto está fresco, la verdadera ventaja frente a externalizar.
Paso 3A: convertir en actas
La clave es no transcribirlo todo: primero las decisiones, luego los TODO (quién y cuándo) en tabla, citas breves solo donde importa el rastro, y al final los asuntos abiertos. Conserva la transcripción con marcas de tiempo como archivo trazable.
Paso 3B: convertir en artículo
Renombra hablantes, divide en párrafos, marca las citas que usarás, ordénalas según tu estructura y escribe el texto de unión. Verifica cifras y nombres propios clicando la marca de tiempo: las cifras mal citadas matan artículos, y la reescucha de un clic acorta el fact-check.
Paso 3C: subtítulos — SRT vs. VTT
| Formato | Uso principal | Notas |
|---|---|---|
| SRT | YouTube, Premiere, Final Cut, casi todo | El más soportado. HH:MM:SS,mmm (coma) |
| VTT | <video> HTML5, reproductores web |
Cabecera WEBVTT. HH:MM:SS.mmm (punto). Con estilos |
| TXT (con hablantes) | Actas, borradores, archivo | Texto legible con hablantes y horas |
En duda, elige SRT; para incrustar en web, VTT. PUBVOICE exporta los tres desde una sola transcripción.
Seguridad y manejo
- Consentimiento: grabar es legal en Japón en principio, pero avisar a entrevistados y participantes del grabado y su fin es el estándar profesional (y obligatorio en algunos sectores)
- Material confidencial: revisa ubicación y retención de datos del servicio; enmascara en edición si la transmisión externa preocupa
- Retención: si la transcripción es evidencia, decide de antemano cuánto se conservan el audio y el texto
FAQ
P. ¿Aguanta grabaciones largas (2–3 horas)?
R. Sí: archivos de hasta 500 MB, con separación de hablantes que mantiene atribuidas las preguntas y respuestas.
P. ¿Y dialectos o habla no estándar?
R. El japonés estándar da la mejor precisión; dialectos, velocidad y cuchicheos aumentan los errores (el Paso 0 pesa más ahí).
P. ¿Otros idiomas?
R. Se pueden procesar, pero la optimización actual es para japonés. Si tu caso principal es multilingüe, considera servicios como Notta del artículo comparativo.
P. ¿Puedo compartir los resultados?
R. Los TXT/SRT/VTT se comparten tal cual. Patrón habitual: resumen (decisiones + TODOs) para circular y transcripción completa con marcas de tiempo como registro.
