Présentation du portail

Le Debian Inference Portal est un service auto‑service destiné aux contributeurs Debian. Il centralise la création et la gestion des clés API, ainsi que le suivi de la consommation budgétaire liée aux requêtes d’inférence. L’accès se fait exclusivement via le compte Salsa, garantissant que seules les personnes reconnues comme développeurs ou mainteneurs Debian peuvent exploiter les modèles hébergés.

Intégration du modèle Qwen3.8‑27B

Le 25 septembre 2026, le portail a ajouté le modèle scaleway/qwen3.8-27b. Ce modèle compte 27 milliards de paramètres, ce qui le place parmi les LLM de grande taille capables de générer du texte cohérent sur des contextes étendus. L’hébergement sur l’infrastructure Scaleway implique une exécution sur des GPU dédiés, ce qui impose des exigences de bande passante et de latence strictes pour maintenir des temps de réponse acceptables. L’ajout du modèle augmente la charge calculatoire du backend et nécessite une allocation dynamique des ressources afin d’éviter la saturation des nœuds de calcul.

Gestion de la sécurité et du sandboxing

La documentation mise à jour le 23 septembre 2026 introduit une section de configuration DebGPT et un exemple de sandboxing. Le sandboxing isole chaque session d’inférence dans un conteneur limité en accès réseau et en droits système, réduisant le risque d’exécution de code malveillant provenant d’instructions LLM. Cette isolation repose sur des namespaces Linux et des cgroups, ce qui impose une surcharge CPU et mémoire proportionnelle au nombre de conteneurs actifs. La configuration DebGPT précise les paramètres de temps d’exécution maximal et les quotas de mémoire, garantissant que les requêtes ne dépassent pas les limites budgétaires définies par l’utilisateur.

Contraintes d’accès et de financement

Le service reste réservé aux développeurs et mainteneurs Debian, ce qui limite son adoption à un public technique déjà familiarisé avec les outils de la distribution. Le financement provient d’un sponsoring de Scaleway, ce qui implique une dépendance vis‑à‑vis de la disponibilité des ressources cloud du partenaire. Le suivi budgétaire, intégré au portail, comptabilise chaque token généré et chaque seconde de GPU utilisée, mais la granularité des métriques n’est pas détaillée dans la documentation publique, ce qui peut compliquer l’optimisation des coûts pour les projets à forte consommation.