Présentation du modèle et de l’abliteration

DeepSeek‑V4.1‑Flash Uncensored est un checkpoint FP8 de 1 M‑token de contexte qui a subi une abliteration au niveau des poids. Le processus, développé par l’équipe de recherche dealignai, retire les circuits de refus sans modifier les composantes critiques : experts routés, mémoire Engram, attention sparse CSA2, tour de vision, portes de routeur, normalisations et embeddings. Le modèle charge comme le checkpoint de base, aucune modification du code d’inférence n’est requise.

Architecture et mécanismes conservés

Le modèle conserve la mémoire Engram hébergée sur le CPU (203 GB) grâce à la variable d’environnement SGLANG_ENABLE_DSV41_ENGRAM_HOST_TABLE=1, libérant ainsi ~46 GiB par GPU. La KV‑cache occupe 890 bytes par token, ce qui impose une limite de 20 requêtes concurrentes pour un contexte de 1 M tokens sur une configuration 4 × H200. Le système de DSpark reste intégré dans le checkpoint (3 couches de draft) et nécessite un tableau de coût SPS profilé pour obtenir un gain de vitesse ; sans ce tableau, le budget de vérification se réduit à 100 % et l’accélération disparaît.

Évaluation des performances et des limites de sécurité

Sur le benchmark MMLU, le modèle conserve son score, tandis que le taux de refus passe de 42,8 % à 1,6 % lorsqu’on active le niveau d’effort maximal. La classification à quatre niveaux (HARD_REF, SOFT_RED, HEDGE, COMPLY) indique zéro refus dans les catégories HarmBench, à l’exception du cluster éthique où le delta est de –1,1 pp, inférieur à la cible de 3 pp. Des tests de cohérence sur 1 000 tokens, de dialogues multi‑tour sur des sujets dangereux, et de description d’image montrent une absence de boucles de refus tardives et une continuité logique jusqu’au quatrième tour.

Déploiement et contraintes matérielles

Le serveur SGLang expose deux recettes de lancement ; les deux exemples ci‑dessous utilisent tp-size 4 et ep-size 4 pour répartir les experts MoE (intermediate size = 2304, divisible par 4). La première configuration fixe le contexte à 1 048 576 tokens, la seconde à 262 144 tokens, avec un facteur de mémoire statique de 0,80 et 0,85 respectivement. Le paramètre --cuda-graph-max-bs-decode 20 limite le batch de décodage à 20, conforme à la capacité KV. L’absence du binaire ninja provoque une erreur de compilation du kernel JIT, d’où la recommandation d’installer le paquet ninja avant le lancement.

export SGLANG_ENABLE_DSV41_ENGRAM_HOST_TABLE=1
export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
sglang serve \
  --model-path dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 \
  --tp-size 4 --ep-size 4 \
  --host 0.0.0.0 --port 8000 \
  --context-length 1048576 \
  --mem-fraction-static 0.80 \
  --max-running-requests 20 \
  --cuda-graph-max-bs-decode 20 \
  --reasoning-parser deepseek-v41 --tool-call-parser deepseekv41 \
  --speculative-algorithm DSPARK \
  --speculative-dspark-sps-table-path /path/to/dspark_sps.json \
  --trust-remote-code
export SGLANG_ENABLE_DSV41_ENGRAM_HOST_TABLE=1
export PYTORCH_CUDA_ALLOC_CONF=expandable_segments:True
sglang serve \
  --model-path dealignai/DeepSeek-V4.1-Flash-UNCENSORED-FP8 \
  --tp-size 4 --ep-size 4 \
  --host 0.0.0.0 --port 8000 \
  --context-length 262144 \
  --mem-fraction-static 0.85 \
  --reasoning-parser deepseek-v41 --tool-call-parser deepseekv41 \
  --trust-remote-code