Présentation
Falcon‑ASR est un modèle de reconnaissance vocale de 1,6 milliard de paramètres développé par le Technology Innovation Institute (TII) d’Abu Dhabi. Il cible principalement l’arabe, en mettant l’accent sur le dialecte émirati, tout en conservant la capacité de transcrire l’anglais, le français, l’espagnol et le portugais avec les mêmes poids de modèle. Le système fournit des horodatages au niveau du mot, ce qui associe chaque terme transcrit à sa position temporelle dans le signal audio.
Performances sur l’arabe
Sur les six jeux de test arabes de l’Open Universal Arabic ASR Leaderboard, Falcon‑ASR obtient un taux d’erreur de mots (WER) moyen de 20,92 %. Le meilleur résultat publié dans le snapshot du tableau de bord du 30 septembre 2026 était de 23,17 %, soit une amélioration de 2,25 points de pourcentage. Le même protocole mesure le taux d’erreur de caractères (CER), mais les valeurs exactes ne sont pas détaillées dans le communiqué. Dans une évaluation interne centrée sur le dialecte émirati, le modèle atteint 22,73 % de WER et 10,19 % de CER, surpassant le second meilleur système, Qwen3‑Omni, de 4,07 points de pourcentage sur le WER. Ces écarts confirment la robustesse du modèle face aux variations dialectales et aux conditions d’enregistrement spécifiques à la région du Golfe.
Performances multilingues et entraînement
En anglais, Falcon‑ASR a été testé sur les sept jeux de données publics de l’Open ASR Leaderboard, affichant un WER moyen de 5,74 %. Le même jeu de poids est utilisé pour le français, l’espagnol et le portugais, sans besoin de drapeau linguistique supplémentaire, ce qui simplifie le déploiement dans des environnements multilingues. Le processus d’entraînement a intégré des perturbations acoustiques variées : bruit de fond, chevauchement de locuteurs, musique, réverbération de salle et effets de téléphonie, ainsi que des modifications de vitesse et de hauteur. Cette exposition à des conditions réalistes vise à réduire la dégradation de performance lors d’enregistrements en réunion, appels téléphoniques ou environnements bruyants.
Architecture et perspectives
Falcon‑ASR repose sur l’architecture Falcon3‑Audio, décrite dans le papier « Competitive Audio‑Language Models with Data‑Efficient Single‑Stage Training on Public Data ». Le modèle suit une approche d’entraînement monostage, où les données audio et textuelles sont jointes dès le départ, limitant le besoin de pré‑traitements séparés. Cette stratégie permet d’exploiter efficacement les corpus publics tout en conservant une taille de modèle gérable (1,6 B). Le déploiement actuel se fait via un espace de démonstration Hugging Face, avec une API prévue et des applications natives en cours de développement. Les auteurs soulignent que la disponibilité de ressources annotées pour les dialectes arabes reste limitée, ce qui pourrait freiner l’amélioration future du WER. Une extension du jeu de données, notamment pour les variantes téléphoniques, serait nécessaire pour pousser les performances au‑delà du seuil actuel.