Présentation
Desert Ant Labs lance aujourd'hui 18 modèles d'intelligence artificielle conçus pour fonctionner entièrement sur l'appareil. Douze modèles sont en version stable et six en bêta, accessibles via un SDK unique compatible Swift, Kotlin et JavaScript. Le service est gratuit jusqu'à 100 000 appareils actifs mensuels, sans frais de token ni authentification, ce qui permet d’intégrer de l'IA dans chaque interaction produit sans contrainte de coût d’inférence. L’entreprise se positionne en Europe comme défenseur de la souveraineté des données : les entrées restent sur le dispositif, aucune transmission vers le cloud n’est requise.
Architecture et performances
Chaque modèle est optimisé pour la rapidité et la taille. Voz transcrit 10 minutes d’audio en 2 secondes sur iPhone, soit 4,7 × plus rapide que Whisper, avec horodatage mot à mot. Clear, modèle de 9 Mo, transforme un enregistrement de 5 minutes en audio de qualité studio en 1 seconde. Redact masque en temps réel noms, adresses et numéros de carte dans 27 langues, évitant toute fuite vers les serveurs. Tongue, modèle de 2 Mo, identifie 84 langues à partir de trois mots. Le modèle Clips de 284 Mo découpe une vidéo de 10 minutes en douze clips en 5 secondes, 10 × plus rapide et 470 × moins énergivore que le modèle Claude Sonnet, tout en conservant la même qualité. Les modèles s'exécutent sur le Neural Engine d'Apple ou via WebAssembly dans le navigateur, démontrant une flexibilité d’inférence entre mobile natif et web. Les tailles restent inférieures à 300 Mo, ce qui les rend compatibles avec des smartphones de plus de cinq ans.
Implications pour les développeurs
Le modèle économique « inférence gratuite » supprime le facteur coût par appel, autorisant des traitements continus comme le nettoyage audio ou la détection de données sensibles à chaque utilisation. Cette gratuité, combinée à l'absence de latence réseau, modifie la conception produit : les fonctionnalités peuvent être activées en permanence plutôt qu’à la demande. Le SDK propose des fonctions d’intégration en quelques lignes de code, réduisant le temps de mise en production. Toutefois, la spécialisation des modèles implique des limites : ils ne couvrent que des tâches ciblées (transcription, amélioration audio, détection de langue, masquage de données) et ne remplacent pas les grands modèles de type LLM pour des tâches génératives ou de compréhension complexe. De plus, les performances dépendent fortement du matériel disponible ; les appareils plus anciens ou dépourvus de Neural Engine verront des temps d’exécution supérieurs. Enfin, six modèles restent en bêta, ce qui nécessite des tests supplémentaires avant un déploiement à grande échelle.