Contexte et objectif

Le modèle Qwen‑Image 2.1, fourni par Hugging Face, compte 9 billion de paramètres et nécessite environ 20 Go de mémoire RAM. Son temps de génération dépasse plusieurs milliers de tokens pour produire un seul paragraphe, ce qui le rend impraticable sur des machines modestes. L’auteur a constaté que le Hub ne proposait que des copies compressées de ce même modèle, sans version allégée. Il a donc demandé à ML‑Intern, l’assistant de génération de modèles de Hugging Face, de créer une version tiny capable de tourner sur un CPU.

Méthodologie et architecture

Le processus démarre par un prompt détaillé (450 à 2 000 mots) qui décrit le besoin, le jeu de données, le modèle de base et le script d’entraînement. Deux sections sont obligatoires : un baseline qui mesure la performance du modèle de référence sur la même métrique, et un smoke test qui vérifie que les poids ont réellement changé avant d’engager le coût complet. ML‑Intern propose un budget, attend l’accord de l’utilisateur, puis exécute les étapes suivantes : génération d’étiquettes (8 797 requêtes), entraînement, évaluation et publication sur le Hub. Le modèle final compte 0,8 B de paramètres, s’exécute entièrement sur CPU et délivre une sortie valide dans 99,7 % des cas tout en consommant un quart des tokens du modèle enseignant.

Résultats et coûts

Le projet complet, incluant le coût du modèle enseignant pour le labellisation, a coûté 16 USD. En parallèle, six autres modèles ont été produits :

Citrus‑Doctor VLM : jeu de données de 3 017 images annotées (21 classes). Le modèle de base Qwen3.5‑2B atteignait 14,9 % de précision sur 335 photos de test ; après deux époques sur un GPU A10G, la précision est montée à 52,8 % pour un coût de 1,90 USD.

Huggy LoRA : LoRA sur le modèle FLUX.2‑klein 4 B, entraîné avec 84 légendes. Le checkpoint à 200 étapes produit le premier rendu complet ; à partir de 500 étapes le style « Huggy » déborde sur des prompts non liés. Coût total ≈ 7,60 USD.

Camera‑Angle LoRA : génération de 1 030 objets scannés à 24 angles (24 722 images) sur CPU (coût négligeable). Après sélection de 461 objets d’entraînement et 40 de test, 1 844 paires avant/après ont été créées. L’entraînement de 2 000 étapes sur un A100 a duré ~90 minutes pour 3,75 USD. Le projet complet a consommé 16 USD.

Limites et perspectives

Les modèles produits restent limités par la taille du jeu de données (ex. 84 légendes pour le LoRA Huggy) et par la capacité de généralisation du petit modèle (0,8 B). Le contrôle budgétaire empêche les dépassements, mais peut contraindre des itérations plus longues. De plus, l’absence de version officielle du modèle 0,8 B signifie que la reproductibilité dépend entièrement du prompt et du pipeline ML‑Intern. Malgré ces contraintes, l’expérience montre qu’un flux automatisé, guidé par des prompts structurés, peut réduire le coût d’obtention d’un modèle spécialisé de dizaines de dollars à quelques unités, tout en conservant une performance exploitable.