Reconocimiento de voz en Linux: 14 programas que funcionan de verdad (2026)

Antes de nada, una aclaración que hace falta en español: esta guía trata de voz a texto — hablas y el ordenador escribe. No es texto a voz, no es un lector de pantalla y no es un sintetizador. Las búsquedas de «reconocimiento de voz» devuelven las dos cosas mezcladas, así que si buscabas lo otro, esta no es tu página.

La mayoría de comparativas de programas de dictado se escriben para Windows y Mac, y luego alguien que nunca ha usado Linux se lo añade al final. Aquí es al revés: todas las herramientas de abajo tienen una versión real para Linux, y la columna que más importa es Wayland — porque ahí es donde la mayoría falla en silencio.

Una de estas herramientas es nuestra, así que sopesa las recomendaciones en consecuencia. Hemos intentado merecer tu tiempo diciendo con claridad en qué son mejores las demás, y más abajo describimos varios perfiles de lector que no deberían elegir la nuestra.

Lo esencial

  • Que funcione sin configurar nadaVibe Typer. Un AppImage, nativo en Wayland y X11, en la nube.
  • Sin conexión y sencilloVocalinux. Instalación con un comando, funciona en X11 y Wayland, whisper.cpp.
  • Sin conexión, licencia MIT, multiplataformaHandy. Whisper y Parakeet en local. En Wayland necesita ayuda.
  • Controlar el equipo con la voz, no solo escribirTalon. Ojo: en Linux, solo X11.
  • Control total, y te gusta montarlo túnerd-dictation.
  • En Wayland y con poca paciencia → Vibe Typer, Vocalinux o VOXD. Todo lo demás da trabajo.

Por qué dictar en Linux es más difícil de lo que debería

Dictar tiene dos mitades: convertir el habla en texto, y meter ese texto en la aplicación que tienes delante. La primera está resuelta — Whisper hizo gratuita la buena transcripción. Es en la segunda donde fallan las herramientas de Linux.

En X11, cualquier proceso puede inyectar pulsaciones de teclado en cualquier ventana. Eso es lo que hace xdotool, y por eso casi todas las herramientas de dictado para Linux anteriores a 2022 daban X11 por hecho y funcionaban perfectamente.

Wayland eliminó eso a propósito. Un cliente de Wayland no puede inyectar eventos de entrada en otro cliente — ese era todo el sentido del modelo de seguridad. Así que las herramientas construidas sobre xdotool o XTestFakeKeyEvent no se degradan poco a poco: simplemente no hacen nada, y normalmente sin mensaje de error. Las alternativas son ydotool (necesita un demonio uinput y a menudo un reinicio), dotool o wtype — este último no funciona en GNOME, porque GNOME no implementa el protocolo de teclado virtual que necesita.

Por eso la columna honesta de abajo se llama «Wayland» y no «Linux». Ubuntu usa Wayland por defecto desde la 22.04 y Fedora desde la 34. Si una herramienta anuncia «compatible con Linux» y quiere decir X11, una actualización de distribución puede romperte el dictado sin avisar.

La comparativa

Herramienta Wayland X11 Sin conexión Instalación Licencia Precio
Vibe Typer Nativo Nativo No AppImage Propietario Plan gratuito, 8 $/mes
Vocalinux Script de una línea GPL-3.0 Gratis
VOXD Sí (con ydotool) .deb / .rpm / .pkg MIT Gratis
Handy Parcial AppImage MIT Gratis
nerd-dictation Parcial pip + git + modelo GPL-3.0 Gratis
Talon No Instalador / zip Propietario + Patreon Gratis
OpenWhispr Parcial Aplicación Electron Código abierto Gratis
Whispering Parcial Aplicación de escritorio Código abierto Gratis
Speech Note Independiente Independiente Flatpak Código abierto Gratis
whisper.cpp Solo CLI Solo CLI Compilar MIT Gratis
Blahst Parcial Script Código abierto Gratis
Numen Código fuente Código abierto Gratis
VoiceKey Parcial No .deb Propietario De pago
Dictado en el navegador No Ninguna Gratis

«Independiente» significa que transcribe en su propia ventana en vez de escribir en la aplicación que estás usando. «Parcial» significa que funciona, pero necesita una herramienta auxiliar (ydotool, dotool, wtype) y puede comportarse mal en algunos compositores.


Las herramientas

Vibe Typer

La nuestra. Un AppImage portable — sin repositorios, sin dependencias, sin modelos que descargar:

chmod +x VibeTyper.AppImage
./VibeTyper.AppImage

Si está en lo alto de esa tabla, es por la columna de Wayland. Implementa Wayland y X11 de forma nativa en lugar de llamar a xdotool, elige la correcta para tu sesión y traslada tus ajustes si cambias de una a otra. Eso es poco habitual, y es el motivo más frecuente por el que la gente llega aquí después de que otra cosa dejara de funcionar.

Pulsas un atajo, hablas, y el texto aparece donde está tu cursor: terminales, editores, navegadores, chat, correo. El Magic Formatter elimina por el camino las muletillas, los arranques en falso y las autocorrecciones en vez de transcribirlo todo al pie de la letra. Selecciona cualquier texto y di «hazlo más corto» para reescribirlo ahí mismo. 99 idiomas con detección automática y sin descargas por idioma.

El inconveniente, dicho claramente: funciona en la nube. La transcripción se ejecuta en Groq con Cloudflare Workers AI como respaldo, y no hay modelo local. El audio se procesa en memoria y se descarta, el backend no guarda ninguna caché de transcripciones en el servidor, y no entrenamos nada con tu voz — pero necesita conexión de red, y «procesado y luego descartado» no es la misma promesa que «nunca sale de tu máquina». Si necesitas la segunda, coge Vocalinux o Handy. En serio.

El plan gratuito son 2.000 palabras y 20 operaciones de IA al mes, sin tarjeta. Pro cuesta 8 $ al mes con facturación anual, 10 $ sin permanencia.

Ideal para: quien quiere dictar en todas sus aplicaciones desde el primer día y no quiere mantener nada.


Vocalinux

La opción sin conexión más pulida, y la única herramienta de esta lista concebida para Linux desde el principio en vez de portada a él. Un comando, y el instalador detecta tu hardware:

curl -fsSL https://raw.githubusercontent.com/jatinkrmalik/vocalinux/main/install.sh -o /tmp/vl.sh && bash /tmp/vl.sh --interactive

Probado en Ubuntu 22.04+, Debian 11+, Fedora 39+, Arch, openSUSE Tumbleweed, Manjaro y EndeavourOS. Funciona en X11 y Wayland, lo que lo mete en un grupo muy reducido. Por defecto usa whisper.cpp con Vulkan, lo que le da compatibilidad con GPU de varios fabricantes, y también admite Whisper, VOSK o una API remota que controles tú. Sin nube, sin telemetría, sin cuenta. GPL-3.0, sin versión de pago.

Ideal para: quien prioriza el trabajo sin conexión, pero no quiere que se convierta en un proyecto. Si la dependencia de la nube de Vibe Typer nos deja fuera en tu caso, empieza aquí.


VOXD

Dictado local que escribe directamente en la ventana activa y se instala con paquetes nativos de cada distribución en vez de con un script:

# Ubuntu / Debian
sudo dpkg -i voxd_*.deb
# Fedora
sudo rpm -i voxd-*.rpm
# Arch
sudo pacman -U voxd-*.pkg.tar.zst

whisper.cpp por debajo, con modelos GGML de 75 MB a 2,9 GB, más de 99 idiomas y sin GPU obligatoria. El autor dice haberlo probado en Arch/Hyprland, Omarchy 3.0, Ubuntu 24.04 y 25.04, Fedora 42, Pop!_OS 22, Mint 22 y openSUSE Leap 15.6. Posprocesado opcional con IA en local mediante llama.cpp u Ollama, o con un proveedor en la nube si lo prefieres. MIT.

Wayland funciona, pero necesita ydotool y un reinicio — el script de instalación se encarga de eso por ti.

Ideal para: usuarios de gestores de ventanas en mosaico y cualquiera que prefiera un paquete de verdad a un AppImage.


Handy

La forma más amable de empezar con Whisper en local. AppImage para Linux, además de versiones para macOS y Windows, licencia MIT, desarrollo activo.

Dos familias de modelos: Whisper (de Small a Large, acelerado por GPU cuando la hay) y Parakeet V3, optimizado para CPU, que detecta el idioma automáticamente y funciona unas 5 veces más rápido que el tiempo real en hardware de gama media. Esa segunda opción es la interesante: significa dictado sin conexión utilizable en un portátil sin GPU dedicada.

Wayland es el punto débil. Necesitarás wtype o dotool, tendrás que definir el atajo en tu entorno de escritorio y no en Handy, y la propia documentación del proyecto avisa de que algunos compositores tratan la ventana superpuesta de Handy como la ventana activa, con lo que el texto pegado puede acabar en el sitio equivocado.

Ideal para: dictado sin conexión en X11, o en Wayland si estás dispuesto a configurarlo.


nerd-dictation

La que todo el mundo nombra primero en los hilos sobre dictado en Linux, y sigue siendo la más personalizable. Basada en VOSK, completamente sin conexión, sin demonio, y programable hasta un punto que ninguna otra alcanza aquí: puedes reescribir la salida en Python antes de que se escriba.

pip3 install vosk
git clone https://github.com/ideasman42/nerd-dictation.git
cd nerd-dictation
wget https://alphacephei.com/kaldi/models/vosk-model-small-en-us-0.15.zip
unzip vosk-model-small-en-us-0.15.zip && mv vosk-model-small-en-us-0.15 model

Necesita Python 3.6+, una utilidad de audio (parec, sox o pw-cat) y un simulador de entrada. En esa última elección está toda la cuestión de Wayland: xdotool es el valor por defecto y solo funciona en X11, mientras que ydotool, dotool y wtype cubren Wayland con las salvedades habituales.

Sé sincero contigo mismo sobre la contrapartida. Los modelos pequeños de VOSK están claramente por detrás de Whisper en acentos y ruido de fondo, y no hay limpieza con IA: obtienes una transcripción fiel, muletillas incluidas. A cambio tienes control total y ninguna dependencia del servicio de nadie. GPL-3.0.

Ideal para: quien quiere ser dueño de todo su montaje y disfruta configurándolo.


Talon Voice

La única herramienta aquí que hace lo que hace Dragon. No solo dictado: control por voz completo, control por ruidos (hacer clic con un siseo o un chasquido), seguimiento ocular para la posición del cursor y una gramática de comandos programable en Python. Los conjuntos de comandos de la comunidad para editores e IDE están maduros y son realmente impresionantes.

Salvedad importante: en Linux, Talon solo funciona en X11. Si estás en Wayland, hoy por hoy no es tu herramienta, y es lo más pedido en su comunidad.

Gratis, con un Patreon opcional para acceso anticipado y soporte prioritario. Curva de aprendizaje pronunciada: estás aprendiendo un lenguaje de comandos, no instalando una aplicación.

Ideal para: manejar el ordenador sin las manos. Si una lesión por esfuerzo repetitivo, un accidente o una discapacidad motora hacen que el teclado sea el problema, esta es la respuesta seria, y las herramientas de solo dictado no son un sustituto.


OpenWhispr

Una aplicación de escritorio en Electron que trata Linux como una plataforma de primer nivel, ejecutando Whisper y NVIDIA Parakeet enteramente en tu máquina, sin Internet. Código abierto, más de 99 idiomas, atajo global.

Ideal para: quien quiere una aplicación pulida con procesado local y no tiene problema con la huella de Electron.


Whispering

Código abierto, Whisper en local, multiplataforma, con una de las interfaces más accesibles de la categoría. Una buena alternativa si Handy no te encaja.


Speech Note

flatpak install flathub net.mkiol.SpeechNote

Completamente sin conexión: voz a texto, texto a voz y traducción automática, con buena cobertura multilingüe — alemán, catalán, checo, coreano, danés, español, francés, islandés, italiano, neerlandés, persa, polaco, portugués, tamil y ucraniano, entre otros. Complementos de GPU opcionales para AMD y NVIDIA.

Una cosa tiene que quedar clara: es una aplicación de notas independiente, no una herramienta de escritura para todo el sistema. Dictas en Speech Note y de ahí copias el texto a donde lo necesites. Si el objetivo era hablar en Slack, esta no es la forma adecuada.

Ideal para: transcripción sin conexión y toma de notas multilingüe.


whisper.cpp

No es una aplicación de dictado, sino un motor de inferencia rápido en C++ para modelos Whisper, y la base de varias herramientas de arriba. Si has venido a montarte algo tú mismo, empieza por aquí — y cuenta con escribir tú el manejo del atajo, la captura de audio y la inserción de texto. MIT.


Blahst, Numen, VoiceKey

Tres proyectos más pequeños que conviene conocer. Blahst se apoya en whisper.cpp para darte entrada por voz en cualquier campo. Numen es control por voz más que dictado, diseñado para Wayland desde el principio: una respuesta más ligera al problema que Talon resuelve en X11. VoiceKey (antes VoiceHotKey) es un .deb de pago para Ubuntu, Debian y Mint.


Dictado en el navegador

Chrome y Google Docs llevan años con dictado por voz y no cuesta nada. Pero solo funciona dentro de una pestaña de Chrome: no en tu terminal, no en tu editor, no en Slack de escritorio, no en tu cliente de correo. Vale para un documento largo puntual. No es un flujo de trabajo.


Quién debería elegir qué

«Quiero teclear menos y no quiero que sea un proyecto». Vibe Typer. Plan gratuito, un solo archivo, funciona desde el primer día en ambos protocolos gráficos.

«Mi audio no puede salir nunca de esta máquina». Vocalinux si quieres que funcione sin más, Handy si quieres licencia MIT y compatibilidad multiplataforma, nerd-dictation si quieres controlar cada pieza. Vibe Typer no: funciona en la nube, y eso lo descarta en tu caso.

«Estoy en Wayland y estoy harto de que las cosas fallen en silencio». Vibe Typer, Vocalinux o VOXD. Esos tres lo resuelven sin que montes antes una instalación de ydotool.

«No puedo usar el teclado». Talon si estás en X11, Numen si estás en Wayland. Las herramientas de solo dictado no resuelven este problema, la nuestra incluida.

«Escribo en varios idiomas». Vibe Typer (99 idiomas, detección automática, sin descargas) o Speech Note sin conexión. La mayoría de herramientas basadas en VOSK necesitan un modelo distinto por idioma.

«Dicto sobre todo prompts a asistentes de código». Cualquiera de ellas escribe en una terminal, pero las sesiones remotas por SSH son donde se cae la mayoría de los montajes: compruébalo pronto, no en mitad de la jornada.


Las herramientas que no funcionan en Linux

Vale la pena dejarlo por escrito, porque la mayoría de comparativas las mencionan sin decir que no existen para Linux. Comprobado con las plataformas que publica cada fabricante:

Herramienta Plataformas que indica el fabricante Fuente
Wispr Flow macOS, Windows, iPhone, Android, Chrome wisprflow.ai
Superwhisper macOS, Windows, iOS — petición de Linux pendiente superwhisper.com
Aqua Voice macOS, Windows aquavoice.com
Dragon Professional Solo Windows; Wine y máquinas virtuales explícitamente no compatibles dragon.nuance.com
TypeWhisper macOS y Windows estables; iOS en alfa typewhisper.com
Soniox Voice Typing macOS, Windows, iOS, Android soniox.com
SpeechPulse Windows, macOS (Apple Silicon) speechpulse.com
PulseScribe macOS, Windows; Linux en la hoja de ruta pulsescribe.me
Talkativ Windows talkativ.app
DictaType Windows dictatype.com
Spokenly macOS, iOS spokenly.app
BetterDictation macOS betterdictation.com
Whispur macOS whispur.app
EdgeWhisper macOS (Apple Silicon) edgewhisper.com
VoiceInk macOS 14.4+ VoiceInk

Instalar Vibe Typer

  1. Descarga el AppImage desde la página de descargas.
  2. chmod +x VibeTyper.AppImage
  3. Ábrelo y concede acceso al micrófono.
  4. Define un atajo global.
  5. Haz clic en cualquier aplicación y habla.

Visión general completa en dictado por voz para Linux.

Preguntas frecuentes

¿Cuál es el mejor programa de dictado para Linux?

Para la mayoría, la elección está entre Vibe Typer (sin configuración, funciona en Wayland y X11 desde el primer momento, en la nube) y Vocalinux (sin conexión, instalación con un comando, también gestiona ambos protocolos gráficos). Si necesitas controlar el equipo con la voz y no solo escribir, Talon — pero solo en X11.

¿Hay programas de dictado gratuitos para Linux?

Sí, y varios son realmente buenos. Vocalinux, VOXD, Handy, nerd-dictation, Whispering y Speech Note son todos gratuitos y de código abierto. Vibe Typer tiene un plan gratuito de 2.000 palabras al mes.

¿Qué programas de dictado para Linux funcionan en Wayland?

Vibe Typer, Vocalinux y VOXD funcionan en Wayland sin montaje adicional. Handy, nerd-dictation, OpenWhispr y Whispering pueden funcionar con ydotool, dotool o wtype, con salvedades según tu compositor. Talon solo funciona en X11.

¿Puedo dictar en Linux sin conexión a Internet?

Sí. Vocalinux, VOXD, Handy, nerd-dictation, Speech Note, OpenWhispr, Whispering y Talon funcionan todos en local. Vibe Typer no: funciona en la nube.

¿Funciona el dictado en la terminal en Linux?

Con una herramienta para todo el sistema, sí: el texto va donde esté tu cursor, incluidos terminales y editores. El dictado en el navegador no puede hacerlo.

¿Qué es más preciso, Whisper o VOSK?

Whisper, claramente, sobre todo con acentos y ruido de fondo. La ventaja de VOSK es que es ligero y funciona con soltura en hardware modesto. La mayoría de herramientas actuales han pasado a Whisper o whisper.cpp; nerd-dictation es el último reducto de VOSK.

¿Cuál es el mejor programa de dictado para Ubuntu?

Vale la misma lista corta, pero Ubuntu usa Wayland por defecto desde la 22.04, así que esa columna importa más de lo habitual. Vibe Typer, Vocalinux y VOXD son los tres que funcionan en Ubuntu sin trabajo previo.

Dictando en menos de un minuto

  • 1
    Descárgalo
  • 2
    Pulsa tu atajo
  • 3
    Empieza a hablar
Sí, así de rápido.

Dilo. Ya está escrito.