Fonctionnement et architecture
BetterWispr s’installe sur macOS 14 ou version ultérieure et utilise la combinaison d’un raccourci Option + Space pour déclencher l’enregistrement vocal. Une fois le texte dicté, le logiciel libère le raccourci, lance la transcription et insère le texte nettoyé dans l’application active. Le traitement repose exclusivement sur des modèles locaux : Apple Speech, Parakeet TDT v3 (25 langues européennes), Parakeet Japanese, Whisper Large v3 Turbo et, sur demande, des modèles compatibles OpenAI via une clé API. Les modèles sont téléchargés une fois, stockés sur le disque et exécutés sur le processeur ou le GPU du Mac, la version Apple Silicon étant recommandée pour des temps d’inférence réduits.
git clone https://github.com/BetterWispr/BetterWispr.git
cd BetterWispr
make dev
Le code source, publié sous licence Apache 2.0, est disponible sur GitHub et les mises à jour sont signées avec EdDSA grâce au framework Sparkle, garantissant l’intégrité du binaire avant installation.
Analyse de la confidentialité et de la sécurité
Contrairement aux services de dictée cloud, BetterWispr ne transmet aucune donnée audio ou texte à un serveur externe. Toutes les étapes – capture audio, reconnaissance, nettoyage des interjections (« um », « uh ») et génération de styles (light, medium, none) – se déroulent sur le Mac de l’utilisateur. Les permissions requises se limitent au microphone, à l’accessibilité (pour l’insertion automatique) et à la reconnaissance vocale d’Apple, ce qui minimise la surface d’attaque. L’absence de compte ou de clé API élimine les vecteurs d’usurpation d’identité, et la signature EdDSA empêche les attaques de type supply‑chain lors des mises à jour.
Le stockage des modèles occupe plusieurs gigaoctets selon le choix (Whisper Turbo dépasse 2 Go). Cette empreinte locale peut être un point de vulnérabilité si le disque est compromis, mais aucune donnée sensible n’est conservée dans le cloud, ce qui réduit les risques de fuite massive.
Performances, limites et perspectives
Les benchmarks internes affichent une latence de transcription d’environ 0,0 s après la libération du raccourci, avec un débit de 137 wpm (mots par minute) en moyenne et une correction de 312 mots nettoyés sur 4 218 mots dictés. La vitesse dépend fortement du processeur : les Macs Apple Silicon offrent une inférence plus rapide que les Intel, d’où la recommandation officielle. La prise en charge linguistique reste confinée aux langues couvertes par les modèles intégrés ; les commandes vocales (« comma », « question mark », « new paragraph ») ne fonctionnent qu’en anglais, limitant l’utilité dans des contextes multilingues.
Le modèle de nettoyage « medium » applique des règles d’élision et de reformulation via Apple Intelligence ou Ollama, mais ces étapes sont exécutées localement et peuvent introduire des latences supplémentaires. L’absence de transcription en temps réel (le texte apparaît uniquement après la fin de l’enregistrement) peut être perçue comme un inconvénient pour les utilisateurs habitués aux flux continus.
En perspective, l’ajout de modèles supplémentaires via l’API OpenAI ou Sarvam AI ouvre la voie à une extensibilité accrue, à condition que les utilisateurs acceptent les exigences de connexion réseau et les éventuelles politiques de confidentialité associées. Tant que le projet reste open source, la communauté peut auditer le code, proposer des améliorations de performance et enrichir la prise en charge linguistique, consolidant ainsi la position de BetterWispr comme alternative locale fiable aux solutions cloud.