Reconnaissance vocale sous Linux : 14 outils qui fonctionnent vraiment (2026)

La plupart des comparatifs de logiciels de dictée sont écrits pour Windows et Mac, puis Linux y est ajouté après coup par quelqu’un qui ne l’a jamais utilisé. Ici, c’est l’inverse : chaque outil ci-dessous existe en vrai binaire Linux, et la colonne qui compte le plus est Wayland — parce que c’est là que la majorité d’entre eux échouent en silence.

Nous développons l’un de ces outils : pondérez les recommandations en conséquence. Nous avons essayé de mériter votre attention en disant précisément où les autres font mieux, et plusieurs profils décrits plus bas ont tout intérêt à ne pas choisir le nôtre.

Une précision utile : ce guide parle de reconnaissance vocale au sens de la parole transcrite en texte. Ce n’est pas de la synthèse vocale, et ce n’est pas de la reconnaissance du locuteur.

L’essentiel

  • Vous voulez que ça marche, sans configurationVibe Typer. Un AppImage, natif sous Wayland et X11, dans le cloud.
  • Hors ligne et simpleVocalinux. Installation en une commande, gère X11 et Wayland, whisper.cpp.
  • Hors ligne, licence MIT, multiplateformeHandy. Whisper et Parakeet en local. Sous Wayland, il faut un utilitaire en plus.
  • Piloter la machine à la voix, pas seulement écrireTalon. Attention : sous Linux, X11 uniquement.
  • Contrôle maximal, pour qui aime mettre les mains dans le cambouisnerd-dictation.
  • Sous Wayland et à court de patience → Vibe Typer, Vocalinux ou VOXD. Tout le reste demande du travail.

Pourquoi la reconnaissance vocale est plus difficile sous Linux qu’elle ne devrait l’être

La dictée se divise en deux étapes : transformer la parole en texte, et faire entrer ce texte dans l’application que vous avez sous les yeux. La première est réglée — Whisper a rendu gratuite la transcription de qualité. C’est sur la seconde que les outils Linux se cassent les dents.

Sous X11, n’importe quel processus peut injecter des frappes clavier dans n’importe quelle fenêtre. C’est ce que fait xdotool, et c’est pourquoi presque tous les outils de dictée Linux antérieurs à 2022 environ supposaient X11 et fonctionnaient très bien.

Wayland a délibérément supprimé cela. Un client Wayland ne peut pas injecter d’entrées dans un autre client — c’était tout l’objet du modèle de sécurité. Les outils bâtis sur xdotool ou XTestFakeKeyEvent ne se dégradent donc pas progressivement : ils ne font strictement rien, en général sans message d’erreur. Les contournements s’appellent ydotool (nécessite un démon uinput et souvent un redémarrage), dotool ou wtype — ce dernier ne fonctionne pas sous GNOME, car GNOME n’implémente pas le protocole de clavier virtuel dont il a besoin.

Voilà pourquoi la colonne honnête ci-dessous s’appelle « Wayland » et non « Linux ». Ubuntu utilise Wayland par défaut depuis la 22.04 et Fedora depuis la 34. Si un outil annonce « compatible Linux » en voulant dire X11, une mise à niveau de distribution peut casser votre dictée sans prévenir.

Le comparatif

Outil Wayland X11 Hors ligne Installation Licence Prix
Vibe Typer Natif Natif Non AppImage Propriétaire Offre gratuite, 8 $/mois
Vocalinux Oui Oui Oui Script en une ligne GPL-3.0 Gratuit
VOXD Oui (via ydotool) Oui Oui .deb / .rpm / .pkg MIT Gratuit
Handy Partiel Oui Oui AppImage MIT Gratuit
nerd-dictation Partiel Oui Oui pip + git + modèle GPL-3.0 Gratuit
Talon Non Oui Oui Programme d’installation / zip Propriétaire + Patreon Gratuit
OpenWhispr Partiel Oui Oui Application Electron Open source Gratuit
Whispering Partiel Oui Oui Application de bureau Open source Gratuit
Speech Note Autonome Autonome Oui Flatpak Open source Gratuit
whisper.cpp CLI seulement CLI seulement Oui Compilation MIT Gratuit
Blahst Partiel Oui Oui Script Open source Gratuit
Numen Oui Oui Sources Open source Gratuit
VoiceKey Partiel Oui Non .deb Propriétaire Payant
Dictée dans le navigateur Non Aucune Gratuit

« Autonome » signifie qu’il transcrit dans sa propre fenêtre au lieu d’écrire dans l’application que vous utilisez. « Partiel » signifie qu’il fonctionne mais nécessite un utilitaire (ydotool, dotool, wtype) et peut mal se comporter avec certains compositeurs.


Les outils

Vibe Typer

Le nôtre. Un AppImage portable — pas de dépôt, pas de dépendances, aucun modèle à télécharger :

chmod +x VibeTyper.AppImage
./VibeTyper.AppImage

S’il figure en haut du tableau, c’est grâce à la colonne Wayland. Il implémente nativement Wayland et X11 au lieu d’appeler xdotool, choisit le bon pour votre session, et transfère vos réglages quand vous changez de session. C’est inhabituel, et c’est la raison la plus fréquente pour laquelle les gens arrivent ici après que quelque chose d’autre a cessé de fonctionner.

Vous appuyez sur un raccourci, vous parlez, et le texte arrive là où se trouve votre curseur : terminaux, éditeurs, navigateurs, messagerie, e-mail. Le Magic Formatter supprime au passage les hésitations, les faux départs et les autocorrections plutôt que de les transcrire fidèlement. Sélectionnez du texte et dites « raccourcissez ce texte » pour le réécrire sur place. 99 langues avec détection automatique et sans téléchargement par langue.

L’inconvénient, pour être clair : il fonctionne dans le cloud. La transcription tourne sur Groq avec Cloudflare Workers AI en secours, et il n’y a pas de modèle local. L’audio est traité en mémoire puis supprimé, le backend ne conserve aucun cache de transcription côté serveur, et aucun modèle n’est entraîné sur votre voix — mais il faut une connexion réseau, et « traité puis supprimé » n’est pas la même promesse que « ne quitte jamais votre machine ». Si c’est la seconde qu’il vous faut, prenez Vocalinux ou Handy. Vraiment.

L’offre gratuite couvre 2 000 mots et 20 opérations IA par mois, sans carte bancaire. Pro coûte 8 $ par mois avec facturation annuelle, 10 $ sans engagement.

Idéal pour : les gens qui veulent dicter dans toutes leurs applications dès le premier jour, sans rien maintenir.


Vocalinux

L’option hors ligne la plus aboutie, et le seul outil ici conçu d’abord pour Linux plutôt que porté vers lui. Une commande, et le script d’installation détecte votre matériel :

curl -fsSL https://raw.githubusercontent.com/jatinkrmalik/vocalinux/main/install.sh -o /tmp/vl.sh && bash /tmp/vl.sh --interactive

Testé sous Ubuntu 22.04+, Debian 11+, Fedora 39+, Arch, openSUSE Tumbleweed, Manjaro et EndeavourOS. Fonctionne sous X11 et Wayland, ce qui le place dans un cercle très restreint. Utilise par défaut whisper.cpp avec Vulkan pour une prise en charge GPU multi-constructeurs, et accepte aussi Whisper, VOSK ou une API distante que vous contrôlez. Pas de cloud, pas de télémétrie, pas de compte. GPL-3.0, sans palier payant.

Idéal pour : ceux qui veulent du 100 % local sans que ça devienne un projet. Si la dépendance au cloud de Vibe Typer est rédhibitoire pour vous, commencez ici.


VOXD

Dictée locale qui écrit directement dans la fenêtre active, livrée sous forme de vrais paquets de distribution plutôt que d’un script :

# Ubuntu / Debian
sudo dpkg -i voxd_*.deb
# Fedora
sudo rpm -i voxd-*.rpm
# Arch
sudo pacman -U voxd-*.pkg.tar.zst

whisper.cpp sous le capot, avec des modèles GGML de 75 Mo à 2,9 Go, plus de 99 langues, sans GPU obligatoire. L’auteur indique avoir testé sous Arch/Hyprland, Omarchy 3.0, Ubuntu 24.04 et 25.04, Fedora 42, Pop!_OS 22, Mint 22 et openSUSE Leap 15.6. Post-traitement IA optionnel en local via llama.cpp ou Ollama, ou via un fournisseur cloud si vous le souhaitez. MIT.

Wayland fonctionne mais nécessite ydotool et un redémarrage — le script d’installation s’en charge pour vous.

Idéal pour : les utilisateurs de gestionnaires de fenêtres en mosaïque, et tous ceux qui préfèrent un vrai paquet à un AppImage.


Handy

La porte d’entrée la plus accueillante vers Whisper en local. AppImage pour Linux, plus des versions macOS et Windows, licence MIT, développement actif.

Deux familles de modèles : Whisper (de Small à Large, accéléré par GPU quand c’est possible) et Parakeet V3, optimisé pour le CPU, qui détecte automatiquement la langue et tourne à environ 5× le temps réel sur du matériel de milieu de gamme. C’est cette seconde option qui est intéressante : elle rend la dictée hors ligne utilisable sur un portable sans GPU dédié.

Wayland est le point faible. Il vous faudra wtype ou dotool, vous devrez définir le raccourci dans votre environnement de bureau plutôt que dans Handy, et la documentation du projet avertit elle-même que certains compositeurs considèrent la fenêtre superposée de Handy comme la fenêtre active — le texte collé peut alors atterrir au mauvais endroit.

Idéal pour : la dictée hors ligne sous X11, ou sous Wayland si le travail de configuration ne vous rebute pas.


nerd-dictation

Celui que tout le monde cite en premier dans les discussions Linux, et toujours le plus bidouillable. Reposant sur VOSK, entièrement hors ligne, sans démon, et scriptable à un degré qu’aucun autre n’atteint ici — vous pouvez réécrire la sortie en Python avant qu’elle ne soit tapée.

pip3 install vosk
git clone https://github.com/ideasman42/nerd-dictation.git
cd nerd-dictation
wget https://alphacephei.com/kaldi/models/vosk-model-small-en-us-0.15.zip
unzip vosk-model-small-en-us-0.15.zip && mv vosk-model-small-en-us-0.15 model

Nécessite Python 3.6+, un utilitaire audio (parec, sox ou pw-cat) et un simulateur d’entrée. C’est ce dernier choix qui décide de tout sous Wayland : xdotool est l’option par défaut et ne fonctionne que sous X11, tandis que ydotool, dotool et wtype couvrent Wayland avec les réserves habituelles.

Soyez honnête avec vous-même sur le compromis. Les petits modèles de VOSK sont nettement derrière Whisper sur les accents et le bruit de fond, et il n’y a aucun nettoyage par IA — vous obtenez une transcription fidèle, hésitations comprises. En retour, vous avez un contrôle total et aucune dépendance au service de quiconque. GPL-3.0.

Idéal pour : les gens qui veulent maîtriser leur pile logicielle de bout en bout et aiment la configurer.


Talon Voice

Le seul outil ici qui fait ce que fait Dragon. Pas seulement de la dictée : contrôle vocal complet, contrôle par bruits (cliquer en sifflant ou en claquant la langue), suivi oculaire pour la position du curseur, et une grammaire de commandes scriptable en Python. Les jeux de commandes communautaires pour les éditeurs et les IDE sont aboutis et réellement impressionnants.

Réserve importante : la prise en charge Linux de Talon est X11 uniquement. Sous Wayland, ce n’est pas votre outil pour l’instant, et c’est la demande la plus fréquente de sa communauté.

Gratuit, avec un Patreon optionnel pour l’accès anticipé et l’assistance prioritaire. Courbe d’apprentissage raide — vous apprenez un langage de commandes, vous n’installez pas une application.

Idéal pour : l’usage mains libres de l’ordinateur. Si des TMS, une blessure ou un handicap moteur font du clavier lui-même le problème, c’est la réponse sérieuse — et aucun outil de dictée seule n’y supplée.


OpenWhispr

Une application de bureau Electron qui traite Linux comme une plateforme de premier plan, exécutant Whisper et NVIDIA Parakeet entièrement sur votre machine, sans Internet. Open source, plus de 99 langues, raccourci global.

Idéal pour : ceux qui veulent une application soignée avec traitement local et acceptent l’empreinte d’Electron.


Whispering

Open source, Whisper en local, multiplateforme, avec l’une des interfaces les plus accessibles de la catégorie. Un bon plan B si Handy ne vous convient pas.


Speech Note

flatpak install flathub net.mkiol.SpeechNote

Entièrement hors ligne : reconnaissance vocale, synthèse vocale et traduction automatique, avec une forte couverture multilingue — catalan, tchèque, allemand, danois, espagnol, persan, français, islandais, italien, coréen, néerlandais, polonais, portugais, tamoul et ukrainien, entre autres. Modules GPU optionnels pour AMD et NVIDIA.

Une chose doit être claire : c’est une application de notes autonome, pas un outil de saisie à l’échelle du système. Vous dictez dans Speech Note et vous copiez le texte. Si l’objectif était de parler dans Slack, ce n’est pas le bon outil.

Idéal pour : la transcription hors ligne et la prise de notes multilingue.


whisper.cpp

Ce n’est pas une application de dictée, mais un moteur d’inférence C++ rapide pour les modèles Whisper, et le socle de plusieurs outils ci-dessus. Si vous êtes ici pour assembler quelque chose vous-même, commencez par là — et attendez-vous à écrire vous-même la gestion du raccourci, la capture audio et l’injection de texte. MIT.


Blahst, Numen, VoiceKey

Trois projets plus petits qu’il vaut la peine de connaître. Blahst s’appuie sur whisper.cpp pour vous donner la saisie vocale dans n’importe quel champ. Numen est du contrôle vocal plutôt que de la dictée, conçu pour Wayland dès le départ — une réponse plus légère au problème que Talon résout sous X11. VoiceKey (anciennement VoiceHotKey) est un .deb payant pour Ubuntu, Debian et Mint.


Dictée dans le navigateur

Chrome et Google Docs proposent la saisie vocale depuis des années, et cela ne coûte rien. Mais cela ne fonctionne que dans un onglet Chrome — pas dans votre terminal, pas dans votre éditeur, pas dans Slack Desktop, pas dans votre client mail. Ça dépanne pour un long document ponctuel. Pas pour un usage quotidien.


Qui devrait choisir quoi

« Je veux moins taper et je ne veux pas en faire un projet. » Vibe Typer. Offre gratuite, un seul fichier, fonctionne dès le premier jour sous les deux protocoles d’affichage.

« Mon audio ne doit jamais quitter cette machine. » Vocalinux si vous voulez que ça marche tout seul, Handy si vous voulez du MIT et du multiplateforme, nerd-dictation si vous voulez maîtriser chaque brique. Pas Vibe Typer — il fonctionne dans le cloud, et c’est rédhibitoire pour vous.

« Je suis sous Wayland et j’en ai assez que les choses échouent en silence. » Vibe Typer, Vocalinux ou VOXD. Ces trois-là s’en sortent sans que vous ayez à mettre en place ydotool au préalable.

« Je ne peux pas utiliser de clavier. » Talon sous X11, Numen sous Wayland. Les outils de dictée seule ne résolvent pas ce problème, y compris le nôtre.

« J’écris dans plusieurs langues. » Vibe Typer (99 langues, détection automatique, aucun téléchargement) ou Speech Note hors ligne. La plupart des outils fondés sur VOSK exigent un modèle distinct par langue.

« Je dicte surtout des prompts à des assistants de code. » N’importe lequel d’entre eux écrira dans un terminal, mais c’est en SSH que la plupart des configurations lâchent — testez ce cas tout de suite, pas en pleine journée de travail.


Les outils qui ne fonctionnent pas du tout sous Linux

Cela vaut la peine d’être consigné, car la plupart des comparatifs les citent sans préciser qu’ils n’existent pas sous Linux. Vérifié d’après la prise en charge publiée par chaque éditeur :

Outil Plateformes annoncées par l’éditeur Source
Wispr Flow macOS, Windows, iPhone, Android, Chrome wisprflow.ai
Superwhisper macOS, Windows, iOS — demande Linux en attente superwhisper.com
Aqua Voice macOS, Windows aquavoice.com
Dragon Professional Windows uniquement ; Wine et VM explicitement non pris en charge dragon.nuance.com
TypeWhisper macOS et Windows stables ; iOS en alpha typewhisper.com
Soniox Voice Typing macOS, Windows, iOS, Android soniox.com
SpeechPulse Windows, macOS (Apple Silicon) speechpulse.com
PulseScribe macOS, Windows ; Linux dans la feuille de route pulsescribe.me
Talkativ Windows talkativ.app
DictaType Windows dictatype.com
Spokenly macOS, iOS spokenly.app
BetterDictation macOS betterdictation.com
Whispur macOS whispur.app
EdgeWhisper macOS (Apple Silicon) edgewhisper.com
VoiceInk macOS 14.4+ VoiceInk

Installer Vibe Typer

  1. Téléchargez l’AppImage depuis la page de téléchargement.
  2. chmod +x VibeTyper.AppImage
  3. Lancez-le et autorisez l’accès au micro.
  4. Définissez un raccourci global.
  5. Cliquez dans n’importe quelle application et parlez.

Vue d’ensemble complète sur la dictée vocale pour Linux.

Questions fréquentes

Quel est le meilleur logiciel de dictée pour Linux ?

Pour la plupart des gens, cela se joue entre Vibe Typer (aucune configuration, fonctionne immédiatement sous Wayland et X11, dans le cloud) et Vocalinux (hors ligne, installation en une commande, gère aussi les deux protocoles d’affichage). Si vous voulez piloter la machine à la voix plutôt que de vous contenter d’écrire, Talon — mais uniquement sous X11.

Existe-t-il un logiciel de dictée gratuit pour Linux ?

Oui, et plusieurs sont réellement bons. Vocalinux, VOXD, Handy, nerd-dictation, Whispering et Speech Note sont tous gratuits et open source. Vibe Typer propose une offre gratuite de 2 000 mots par mois.

Quels logiciels de dictée Linux fonctionnent sous Wayland ?

Vibe Typer, Vocalinux et VOXD fonctionnent sous Wayland sans configuration supplémentaire. Handy, nerd-dictation, OpenWhispr et Whispering peuvent fonctionner avec ydotool, dotool ou wtype, avec des réserves selon votre compositeur. Talon est X11 uniquement.

Puis-je dicter sous Linux sans connexion Internet ?

Oui. Vocalinux, VOXD, Handy, nerd-dictation, Speech Note, OpenWhispr, Whispering et Talon fonctionnent tous localement. Vibe Typer non — il fonctionne dans le cloud.

La dictée fonctionne-t-elle dans le terminal sous Linux ?

Avec un outil à l’échelle du système, oui — le texte va là où se trouve votre curseur, y compris dans les terminaux et les éditeurs. La dictée dans le navigateur ne le permet pas.

Lequel est le plus précis, Whisper ou VOSK ?

Whisper, nettement, en particulier sur les accents et le bruit de fond. L’avantage de VOSK est d’être léger et de tourner confortablement sur du matériel modeste. La plupart des outils actuels sont passés à Whisper ou whisper.cpp ; nerd-dictation est le principal irréductible de VOSK.

Quel est le meilleur logiciel de dictée pour Ubuntu ?

La même sélection s’applique, mais Ubuntu utilise Wayland par défaut depuis la 22.04, donc cette colonne compte plus que d’habitude. Vibe Typer, Vocalinux et VOXD sont les trois qui fonctionnent sous Ubuntu sans travail préalable.

Opérationnel en moins d’une minute

  • 1
    Télécharger
  • 2
    Appuyer sur le raccourci
  • 3
    Commencer à parler
Oui, c’est aussi rapide que ça.

Dites-le. C’est écrit.