Inicio › Reconocimiento de voz local
Guía · Reconocimiento de voz 100 % local
Qué es el reconocimiento de voz local
El reconocimiento de voz local convierte la voz en texto en tu propio ordenador: el modelo se descarga una vez y se ejecuta en tu máquina, así que el archivo de audio no viaja a ningún servidor. También lo encontrarás como reconocimiento de voz sin conexión, procesamiento en el dispositivo o, en inglés, on-device.
Una definición sin rodeos
Cualquier programa de transcripción hace lo mismo: recibe audio y devuelve texto. La única pregunta que cambia algo de verdad es dónde se ejecuta ese cálculo. En la nube, tu archivo se sube a un servidor ajeno, se procesa allí y suele quedarse guardado el tiempo que fije el proveedor. En local, el modelo de reconocimiento se descarga una sola vez a tu disco y se ejecuta en la GPU de tu ordenador: el audio no sale de la máquina.
La distinción no es cosmética. Determina quién tiene una copia de tus grabaciones, si el programa sigue funcionando en un tren sin cobertura y si pagas por minuto transcrito o una sola vez.
Tres cosas que en español se confunden
Conviene separar tres tecnologías que se nombran casi igual y hacen cosas distintas:
- Reconocimiento de voz (voz → texto). Convierte lo que alguien dice en texto escrito. Es de lo que trata esta página y lo único que hace Lesskeys.
- Síntesis de voz (texto → voz). El camino contrario: el ordenador lee un texto en voz alta, como el lector de pantalla de macOS. Aquí no se hace.
- Biometría de voz (voz → identidad). Compara una voz con una identidad registrada para autenticar a alguien, como en el «mi voz es mi contraseña» de algunos bancos. Tampoco se hace.
La diferencia importa: separar las voces de una grabación no es identificar a nadie. El sistema agrupa fragmentos que suenan parecido y los etiqueta como «Hablante 1» o «Hablante 2»; los nombres los escribes tú. Guardar un perfil con el nombre de una persona para reconocerla en grabaciones futuras ya es otra cosa —tratar un dato personal— y se explica en identificar quién habla en una grabación.
Local frente a nube: las diferencias reales
| En local | En la nube | |
|---|---|---|
| Dónde se procesa | Tu ordenador | Un servidor ajeno |
| Funciona sin internet | Sí | No |
| El audio sale del equipo | No | Sí |
| Cuenta de usuario | Ninguna | Normalmente obligatoria |
| Modelo de pago | A menudo un pago único | Cuota mensual o minutos prepagados |
| Duración transcribible | La que quepa en tu disco | Cuotas del servidor |
| Quién más recibe la grabación | Nadie | El proveedor y su alojamiento |
| Exigencia de hardware | Alta: una máquina reciente | Baja: vale casi cualquier equipo |
La nube conserva una ventaja honesta: funciona desde cualquier ordenador por antiguo que sea, incluso desde el móvil. El procesamiento local cambia esa flexibilidad por una exigencia de hardware, y a cambio convierte la confidencialidad en algo estructural en vez de contractual: no depende de una política de retención que no puedes auditar.
Por qué importa en la práctica
Una entrevista de investigación, una sesión con un cliente, una reunión de comité, una conversación con una fuente: son grabaciones cuya fuga no tiene arreglo. En cuanto el archivo se sube existe una copia en un sitio que ya no controlas, y su borrado depende de un procedimiento ajeno que no puedes comprobar.
El procesamiento local no gestiona ese problema: lo elimina de raíz, porque no hay transferencia y por tanto no hay copia remota. Conviene ser preciso: es una descripción de la arquitectura del programa, no un estado legal. Si tratas datos personales, tus obligaciones siguen siendo tuyas, y la evaluación de un tratamiento concreto le corresponde a tu delegado de protección de datos o a tu asesoría jurídica, nunca a la página de producto de un fabricante.
Hay dos efectos secundarios más prosaicos que pesan tanto como la privacidad: funciona en modo avión o detrás de un cortafuegos estricto, y un archivo de tres horas no cuesta más que uno de tres minutos.
Por qué hace falta Apple Silicon
Un modelo de reconocimiento de voz moderno es una red neuronal de cientos de millones de parámetros: para transcribir a una velocidad razonable necesita cálculo matricial masivo, y eso se hace mucho mejor en la GPU que en la CPU. Los chips de Apple —M1 y posteriores— integran GPU y memoria unificada en el mismo paquete, así que el modelo se carga una vez y trabaja sin copiar datos de un lado a otro.
Por eso Lesskeys exige Apple Silicon (M1 o posterior) y macOS 13 (Ventura) como mínimo. No es una recomendación: en un Mac con procesador Intel la aplicación no funciona. Compruébalo antes en el menú Apple › «Acerca de este Mac». Es el precio de entrada del modelo local y más vale saberlo antes de pagar.
Lo que cuesta: batería, calor y tiempo
Nada sale gratis. Transcribir en local consume batería y calienta el equipo, porque el trabajo lo hace tu GPU en lugar de la de otro: en unos minutos de audio es imperceptible, en un archivo de dos horas notarás el ventilador. Con el portátil enchufado deja de ser relevante.
El tiempo depende del modelo y del Mac: uno pequeño va muy rápido y se equivoca más con acentos marcados o audio ruidoso, uno grande tarda más y acierta más. La primera vez hay que descargar el modelo —de unos cientos de megas a alrededor de 1,6 GB según cuál elijas— y ese es el único momento en el que hace falta conexión.
Lo que el reconocimiento local no resuelve
Ser local no hace infalible a un sistema, y conviene decirlo antes de que lo descubras tú:
- La puntuación es una interpretación. Puntos, comas y mayúsculas los decide el modelo por la entonación y el contexto, no por una regla; en un texto largo habrá que retocarlos.
- Los nombres propios y la jerga fallan. Apellidos, nombres de empresa, acrónimos internos y terminología muy especializada salen mal escritos con frecuencia.
- El acento y el ruido pesan mucho. Un micrófono lejano, dos personas hablando a la vez o un aire acondicionado de fondo degradan el resultado más que cualquier ajuste del programa.
- Lo que sale es un borrador. Para un acta oficial, una cita publicada o un documento que compromete a alguien, la revisión humana sigue siendo imprescindible; ninguna herramienta de este tipo, tampoco esta, se entrega con garantía de valor probatorio.
Grabar a otras personas: la norma en España
Que nada se suba a un servidor no dice nada sobre tu derecho a grabar. En España, grabar una conversación en la que participas es lícito y no vulnera el secreto de las comunicaciones del artículo 18.3 de la Constitución, según doctrina consolidada desde la STC 114/1984. Captar conversaciones ajenas en las que no intervienes es otra cosa: lo castiga el artículo 197.1 del Código Penal.
Grabar ≠ difundir: publicar una grabación, aunque la hayas hecho legalmente, puede vulnerar el derecho al honor, a la intimidad y a la propia imagen que protege la LO 1/1982. Y en el trabajo el listón sube, porque el artículo 89.3 de la LOPDGDD restringe la grabación de sonido y obliga a informar a la plantilla y a su representación legal. Lo práctico no cuesta nada: avisar al empezar y no grabar si alguien se niega. Es una advertencia práctica, no asesoramiento jurídico. Más detalle en acta de reunión automática.
Reconocimiento de voz local en un Mac
Lesskeys es una aplicación de macOS construida alrededor del procesamiento local y reúne dos usos que la mayoría de las herramientas separan:
- Dictado en todo el sistema. Un atajo (⌥Espacio) funciona en cualquier parte de macOS: hablas, el texto se reconoce en el equipo y se copia al portapapeles; lo pegas tú con ⌘V. La aplicación no escribe sola en otros programas, y es una decisión de diseño: ves el texto antes de que llegue a ningún sitio.
- Transcripción de archivos y reuniones. Importas un audio o un vídeo, o grabas el sonido del sistema de una llamada, y obtienes una transcripción con marcas de tiempo y las voces separadas.
Los 99 idiomas se detectan solos, sin configurar nada. No hay cuenta de usuario ni telemetría, y la descarga en el Mac App Store es gratuita, con límites: 5 minutos de dictado al día y 5 transcripciones de audio y 5 de vídeo en total, mientras que grabar nunca se limita y volver a transcribir algo ya transcrito no consume cuota. Pro quita esos límites con una compra única de 49,99 $ dentro de la aplicación (el App Store de España muestra el importe final en euros), sin cuota mensual.
El procedimiento paso a paso lo detalla cómo transcribir un audio; la parte de confidencialidad, transcripción sin nube.
Descarga gratis, con límites de uso. Sin suscripción. · Pro: 49,99 $ en un solo pago (el App Store de España lo cobra en euros) · macOS 13 o posterior
Preguntas frecuentes
¿Qué es el reconocimiento de voz local?
Es la conversión de voz en texto que se ejecuta en tu propio ordenador, con un modelo descargado en tu disco, sin enviar el archivo a ningún servidor. También se llama reconocimiento de voz sin conexión o procesamiento en el dispositivo.
¿En qué se diferencia del reconocimiento de voz en la nube?
En la nube tu audio se sube a un servidor ajeno, que lo procesa y a menudo conserva una copia. En local el cálculo lo hace tu máquina: el audio no sale del equipo y el programa funciona sin conexión a internet.
¿Es tan fiable como un servicio en la nube?
Para el dictado y para conversaciones grabadas en condiciones normales, los modelos que se ejecutan en la GPU de un Mac con Apple Silicon están hoy en el mismo rango que los servicios en línea. No publicamos porcentajes porque dependen del audio hasta el punto de que cualquier cifra sería engañosa. Lo que más influye no es dónde se procese, sino la calidad del micrófono, el acento y cuántas personas hablan a la vez; en los dos casos lo que sale es un borrador que hay que revisar.
¿Necesito internet para transcribir en local?
Solo la primera vez, para descargar el modelo de reconocimiento. A partir de ahí funciona entero sin conexión, incluso en modo avión.
¿Qué ordenador hace falta?
Un Mac con Apple Silicon (M1 o posterior) y macOS 13 (Ventura) como mínimo. Apple Silicon es obligatorio: en un Mac con procesador Intel la aplicación no funciona.
¿Cuánto cuesta y qué incluye la versión gratuita?
La descarga en el Mac App Store es gratuita, con límites: 5 minutos de dictado al día y 5 transcripciones de audio y 5 de vídeo en total. Grabar no se limita nunca y volver a transcribir algo ya transcrito no consume cuota. Pro es una compra única de 49,99 $ dentro de la aplicación, sin cuota mensual; el App Store de España muestra el importe final en euros.