Présentation
Le Mac Studio équipé du processeur M5 Ultra et de 256 Go de mémoire unifiée a été testé pendant quatre jours. L’auteur compare cet appareil à un M3 Ultra doté de 512 Go et à un PC de bureau équipé d’une carte graphique RTX 5090. Le point central de l’évaluation est la capacité du M5 Ultra à exécuter des modèles d’IA locaux – notamment Qwen3.8‑Flash‑Next et DeepSeek V4 Flash – avec une latence compatible avec des assistants personnels en temps réel.
Architecture et performances
Le M5 Ultra bénéficie d’une architecture à mémoire unifiée qui élimine les copies entre CPU et GPU. Cette conception réduit la latence d’accès aux données et augmente le débit effectif, surtout lorsqu’on travaille avec de grands contextes. Bien que la RTX 5090 possède une bande passante mémoire supérieure, le Mac Studio compense par une consommation thermique maîtrisée et un facteur de forme réduit, ce qui évite le bruit et la surchauffe typiques d’un PC de jeu. Le test montre que les agents IA conservent une réponse fluide même avec des fenêtres de contexte élargies, alors que le même modèle sur la RTX 5090 commence à ralentir dès que la taille du batch dépasse 8 k tokens.
Cas d’usage local AI
Dans le cadre d’un projet interne nommé Desk, l’auteur a orchestré une équipe d’agents basés sur DeepSeek V4 Flash et olmOCR. Ces agents ont fonctionné 24 h/24 pendant 99 jours, traitant 310 documents : transcription de sessions WWDC, extraction de fonctionnalités iOS 27, OCR de captures d’écran et synchronisation via l’API Notion. Le coût total de l’infrastructure cloud a été nul, contrairement à une solution basée sur les API d’Anthropic ou d’OpenAI qui aurait généré plusieurs milliers de dollars de dépenses. Le M5 Ultra a également été utilisé dans l’application Codex, où des sous‑agents orchestrés par GPT‑6 Astra ont exécuté des boucles multi‑tours sans perte de vitesse, grâce à la bande passante mémoire élevée du GPU intégré.
Analyse des limites et perspectives
Malgré ses performances, le M5 Ultra reste limité par la capacité maximale de 256 Go de RAM, ce qui contraint les modèles très volumineux (plus de 30 GB) à être découpés ou quantifiés. De plus, l’absence de support natif pour les bibliothèques CUDA empêche l’exploitation directe de certains optimisations GPU disponibles sur les cartes RTX. Le coût d’acquisition du Mac Studio, supérieur à celui d’un PC équivalent, doit être amorti sur plusieurs années d’utilisation pour que le modèle économique « local » devienne rentable. Enfin, la configuration logicielle repose sur des outils tiers (Open Minis, Hermes Agent) qui ne sont pas toujours stables, ce qui impose une expertise technique avancée.