Inicio › Cómo transcribir un audio
Guía práctica · Transcripción en local
Cómo transcribir un audio en el Mac, paso a paso
Tienes una entrevista, una reunión grabada o una nota de voz y quieres el texto. Esta guía explica cómo transcribir un audio en un Mac de principio a fin —importar el archivo, elegir modelo, dejar que detecte el idioma entre 99, separar las voces y exportar— con el reconocimiento ejecutándose en tu propio equipo: el audio no se sube a ningún servidor.
Lo que necesitas antes de empezar
Para transcribir un audio en el Mac hacen falta tres cosas y ninguna es complicada: el archivo, un Mac con Apple Silicon (M1 o posterior) y macOS 13 (Ventura) o superior, y espacio en disco para el modelo de reconocimiento, que se descarga una única vez. A partir de ahí no hace falta conexión: el modelo trabaja en tu equipo y el audio no se sube a ningún sitio.
Una advertencia útil de entrada: no existe la transcripción automática perfecta. Lo que sale es un borrador muy avanzado, no un documento terminado. Cuenta con un repaso, sobre todo si en la grabación hay nombres propios, cifras o varias personas hablándose encima.
Cómo transcribir un audio: los seis pasos
El recorrido completo, desde el fichero hasta el texto exportado, cabe en seis pasos. Solo el tercero se hace una vez: el resto se repite en cada grabación.
1. Comprueba el archivo
Sirve prácticamente cualquier grabación: M4A, MP3, WAV, AIFF, CAF, FLAC, y también archivos de vídeo como MP4 o MOV, de los que se extrae la pista de audio. No hace falta convertir nada de antemano. Si el archivo está en el móvil, pásalo antes al Mac por AirDrop o por cable; la aplicación trabaja sobre el fichero que tengas en el disco.
Antes de nada, escucha diez segundos. Si el sonido está muy bajo, muy saturado o el micrófono estaba lejos de quien hablaba, ningún programa lo arreglará del todo. Cuando la grabación aún no existe, ese es el momento de mejorarla: acercar el micro es la única optimización que multiplica el resultado.
2. Arrastra el archivo a la aplicación
Abre Lesskeys y suelta el archivo en la ventana de transcripción, o búscalo con el selector de ficheros. La aplicación reconoce que es audio o vídeo y lo prepara: si es un vídeo, separa la pista de sonido; si el audio viene en estéreo o con varios canales, lo normaliza para el reconocimiento. La grabación original no se toca en ningún momento.
3. Elige el modelo de reconocimiento
La primera vez tendrás que descargar un modelo. Hay varios tamaños y la elección es un intercambio sencillo:
| Tamaño del modelo | Velocidad | Cuándo conviene |
|---|---|---|
| Pequeño | Muy rápida | Audio limpio, una sola voz, dictado, notas propias |
| Mediano | Intermedia | Reuniones normales, entrevistas con buen micrófono |
| Grande | Más lenta | Acentos marcados, ruido de fondo, varios idiomas, terminología |
Si no tienes claro cuál, empieza por el grande: la diferencia de tiempo es asumible en un archivo de una hora y el ahorro en correcciones lo compensa. La descarga es única; después el modelo se queda en tu disco.
4. Deja que detecte el idioma (o fuérzalo)
La aplicación identifica sola el idioma hablado entre 99, así que en el caso normal no tienes que configurar nada. Cuándo conviene intervenir se explica más abajo.
5. Lanza la transcripción y espera
El proceso corre en la GPU de tu Mac. Verás avanzar el progreso y podrás seguir trabajando en otras cosas, aunque el equipo irá algo más cargado y, en archivos largos, se calentará. El tiempo depende del modelo y de la duración: no publicamos cifras de velocidad ni porcentajes de precisión porque dependen tanto del audio y de la máquina que cualquier número sería engañoso.
Al terminar tendrás el texto dividido en fragmentos, cada uno con su marca de tiempo y, si había varias voces, con el hablante identificado. Pulsando en una frase se reproduce ese punto exacto de la grabación, que es lo que convierte la revisión en algo llevadero.
6. Revisa y exporta
Cuando el texto esté como quieres, exporta: TXT plano para trabajar el contenido, o SRT y VTT si el audio acompaña a un vídeo y necesitas subtítulos con tiempos. La transcripción también se queda en una biblioteca local en la que puedes buscar por palabras, por fecha o por hablante.
Detección de idioma: cuándo dejarla y cuándo forzarla
El idioma se determina por grabación, no frase a frase. En la práctica eso significa que una conversación en español salpicada de anglicismos técnicos no da ningún problema. Lo que sí se complica es una reunión que cambia de idioma durante minutos enteros: el resultado sale mezclado.
Hay dos casos en los que merece la pena forzar el idioma a mano. El primero, cuando la grabación empieza con silencio, música o ruido: el sistema decide con los primeros segundos y puede equivocarse. El segundo, cuando trabajas siempre en los mismos dos o tres idiomas y quieres evitar que un fragmento corto o poco claro se atribuya a un idioma lejano.
Y aquí una ventaja que conviene conocer: volver a transcribir un archivo ya transcrito no consume cuota de la versión gratuita. Puedes repetir la transcripción forzando otro idioma o con un modelo mayor tantas veces como quieras sin gastar una de tus transcripciones.
Separar quién dice cada cosa
Si la grabación tiene más de una voz, el texto sale con los hablantes separados y etiquetados, y puedes renombrar las etiquetas. Es lo que diferencia una transcripción utilizable de un muro de texto en una entrevista o en una reunión de seis personas. Cuando dos personas hablan a la vez la atribución se degrada, así que las etiquetas son editables a propósito. El detalle está en identificar quién habla en una grabación.
La revisión: qué mirar siempre
- Nombres propios. Apellidos, nombres de empresa y marcas son el fallo más frecuente y el más visible.
- Cifras y fechas. Importes, porcentajes y horas conviene contrastarlos con el audio, no darlos por buenos.
- Puntuación. El modelo la deduce de la entonación, así que párrafos y comas suelen necesitar mano.
- Siglas y acrónimos. El modelo escribe lo que oye, así que las siglas salen deletreadas, en minúscula o partidas en sílabas; conviene fijar una forma y corregirlas de una pasada con buscar y reemplazar.
- Acento y variedad del español. El español estándar peninsular se reconoce con más solvencia que un acento andaluz o canario cerrado, el seseo o una variedad latinoamericana muy marcada, y el voseo rioplatense se transcribe a veces con la forma que el modelo considera más probable. Son errores previsibles, y por eso conviene repasarlos siempre en el mismo sitio.
- Los tramos con voces solapadas. Son los que más errores acumulan; búscalos por la marca de tiempo y escúchalos.
- El acta o la cita que vas a publicar. Cualquier texto que comprometa a alguien se lee entero antes de salir; una transcripción automática no se entrega con garantía de valor probatorio.
Si todavía no tienes el archivo
Cuando lo que quieres transcribir aún no está grabado, la aplicación también graba: micrófono, sonido del sistema o ambos a la vez. Eso cubre una videollamada de Teams, Zoom o Meet sin invitar ningún bot a la reunión y sin dar acceso al calendario.
Si en la grabación hay más gente, avisa antes de empezar. En España grabar una conversación en la que participas es lícito, pero captar conversaciones ajenas en las que no intervienes es delito del artículo 197.1 del Código Penal, y en el ámbito laboral el artículo 89.3 de la LOPDGDD restringe la grabación de sonido y obliga a informar a la plantilla y a la representación de los trabajadores. Difundir después una grabación lícita es otra cosa distinta y puede afectar al derecho al honor y a la intimidad. Lo sensato es anunciarlo al arrancar y dejarlo por escrito en el acta. Esto es una advertencia práctica, no asesoramiento jurídico: la valoración de un caso concreto le toca a tu asesoría o a tu delegado de protección de datos.
Requisitos, precio y versión gratuita
| Punto | Dato |
|---|---|
| Sistema | macOS 13 (Ventura) o posterior |
| Procesador | Apple Silicon (M1 o posterior), obligatorio |
| Mac con Intel | no compatibles |
| Internet | solo para la descarga inicial de la app y del modelo |
| Idiomas | 99, detectados automáticamente |
| Precio | descarga gratuita; Pro por 49,99 $ en compra única, sin cuota mensual |
| Versión gratuita | 5 minutos de dictado al día y 5 transcripciones de audio y 5 de vídeo en total; grabar y volver a transcribir, sin límite |
El importe de 49,99 $ es el precio de referencia del Mac App Store en dólares; el App Store de España te muestra la cifra final en euros antes de pagar. La compra es única y se gestiona por el Mac App Store, incluidas las devoluciones según las normas de Apple.
Descarga gratis, con límites de uso. Sin suscripción. · Pro: 49,99 $ en un solo pago (el App Store de España lo cobra en euros) · macOS 13 o posterior
Preguntas frecuentes
¿Cómo transcribo un audio en el Mac?
Abre Lesskeys, arrastra el archivo de audio o de vídeo a la ventana de transcripción, elige el modelo de reconocimiento y lanza el proceso. El idioma se detecta solo entre 99 y el resultado sale con marcas de tiempo y las voces separadas, listo para exportar a TXT, SRT o VTT.
¿Qué formatos de archivo admite?
Los formatos de audio habituales —M4A, MP3, WAV, AIFF, CAF, FLAC— y también archivos de vídeo como MP4 o MOV, de los que se extrae la pista de sonido. No hace falta convertir nada antes.
¿Hay que decirle en qué idioma está la grabación?
No en el caso normal: la aplicación identifica el idioma automáticamente entre 99. Conviene forzarlo a mano cuando la grabación empieza con silencio o ruido, o cuando trabajas siempre con los mismos dos o tres idiomas y quieres evitar una detección errónea en fragmentos cortos.
¿Se puede volver a transcribir un archivo sin gastar cuota?
Sí. Volver a transcribir algo que ya has transcrito —por ejemplo forzando otro idioma o con un modelo mayor— no consume cuota de la versión gratuita. Puedes repetirlo tantas veces como quieras.
¿Cuánto tarda y cuánto acierta?
Depende del modelo, de la duración y del Mac, así que no publicamos cifras: cualquier número sería engañoso fuera de su contexto. Lo que sí es constante es que el resultado es un borrador avanzado y necesita un repaso, sobre todo en nombres propios, cifras y tramos con voces solapadas.
¿Qué necesito y cuánto cuesta?
Un Mac con Apple Silicon (M1 o posterior) y macOS 13 (Ventura) como mínimo; los Mac con Intel no son compatibles. La descarga es gratuita, con límites: 5 minutos de dictado al día y 5 transcripciones de audio y 5 de vídeo en total. Pro es una compra única de 49,99 $, sin cuota mensual, y el App Store de España muestra el importe final en euros.