Contexte et objectifs

Le modèle Falcon-Emirati-7B vise à combler le fossé entre l’arabe standard moderne (MSA) et le dialecte émirati, une variante du golfe riche en vocabulaire, rythme et références culturelles. Les auteurs soulignent que le dialecte est majoritairement oral, ce qui limite la disponibilité de textes écrits et rend les traductions littérales insuffisantes pour saisir les proverbes, la poésie nabati et les anecdotes locales. L’objectif est donc de fournir un LLM capable de comprendre et de générer du texte qui reflète à la fois la grammaire et le contexte socioculturel propre aux Émirats.

Architecture hybride et choix de taille

Falcon-Emirati-7B repose sur la famille Falcon‑H1‑Arabic, qui utilise une architecture hybride combinant State Space Models (Mamba) et Transformer attention au sein de chaque bloc. Les sorties de ces deux sous‑modules sont fusionnées avant la projection finale, offrant la complexité linéaire de Mamba pour les séquences longues tout en conservant la précision de l’attention sur les dépendances à longue portée – un avantage notable pour une langue morphologiquement riche comme l’arabe. La famille propose trois échelles (3 B, 7 B et 34 B paramètres) avec des fenêtres de contexte allant jusqu’à 128 K voire 256 K tokens. Le choix du variant 7 B reflète un compromis : il possède suffisamment de capacité pour absorber les nuances dialectales tout en restant viable en termes de coût d’entraînement et d’inférence, contrairement au 34 B jugé trop onéreux et au 3 B jugé insuffisant.

Méthodologie de données et entraînement

Le pipeline de données s’articule autour de trois sources complémentaires. Premièrement, du web émirati authentique a été crawlé et curaté, garantissant que le texte reflète l’usage natif du dialecte, sans traduction depuis le MSA. Deuxièmement, des documents en MSA portant sur la culture, l’histoire et les coutumes des Émirats ont été intégrés afin d’enrichir le modèle en connaissances factuelles que les locuteurs natifs considèrent comme acquises. Troisièmement, une large portion de données synthétiques a été générée en imposant des glossaires et des règles de style spécifiques à l’émirat, évitant ainsi que le texte artificiel ne devienne simplement « gulf‑ish ». Le processus d’entraînement a consisté en un mélange itératif de pré‑entraînement continu, de fine‑tuning supervisé (SFT) et d’optimisation de préférence, chaque étape étant évaluée à la fois par des locuteurs natifs et par des métriques automatiques (benchmark Alyah, LLM‑as‑Judge, comparaisons pair‑wise). Cette approche expérimentale a permis d’ajuster le ratio dialecte/MSA et le moment d’introduction des données synthétiques.

Évaluation et limites

Les résultats montrent que le modèle dépasse les performances de Falcon‑H1‑Arabic sur des tâches de génération et de compréhension spécifiques au dialecte, notamment dans les évaluations manuelles où les locuteurs natifs notent une meilleure adéquation culturelle et linguistique. Cependant, les auteurs reconnaissent plusieurs limites : la dépendance à des données web qui peuvent contenir des biais régionaux, la difficulté à couvrir l’ensemble du spectre lexical du dialecte en raison de son caractère oral, et l’absence d’un benchmark public dédié aux dialectes arabes. La section « Responsible AI » signale également que le modèle peut reproduire des stéréotypes culturels présents dans les sources d’entraînement. Ces réserves incitent à poursuivre la collecte de corpus oraux et à développer des métriques d’évaluation plus fines pour les variantes dialectales.