← L'édition
IANouveau2 min de lecture

DeepSeek v4.1-Flash : une nouvelle architecture optimisée pour le long contexte et les agents

DeepSeek a officialisé la sortie de DeepSeek v4.1-Flash, un modèle open-weight (aux poids d'entraînement accessibles publiquement) sous licence MIT. Derrière ce numéro de version discret se cache une refonte architecturale profonde pensée pour réduire l'empreinte mémoire et accélérer le travail des agents autonomes.

Fil « Présentation du modèle DeepSeek v4.1-Flash »

Illustration de l'article — latent.space
Image : latent.space

Une séparation stricte entre analyse et génération

Derrière la désignation 763B-P8B-D16B, DeepSeek introduit une architecture hybride causale de type encodeur-décodeur (qui sépare la phase d'analyse du contexte entrant et la phase de production de la réponse). Le modèle totalise 763 milliards de paramètres, mais repose sur une structure MoE (Mixture of Experts, une technique qui n'active qu'une sous-partie du réseau pour chaque jeton) particulièrement économe.

Lors de la phase de prefill (l'analyse initiale du prompt et des documents transmis), seuls 8 milliards de paramètres sont actifs. Durant la phase de decode (la génération séquentielle du texte de réponse), ce chiffre passe à 16 milliards. Cette dissymétrie limite le calcul actif à une parsemarité de 1 à 2 % de la taille totale du réseau.

Une empreinte mémoire divisée par huit pour le long contexte

Pour les développeurs qui intègrent des agents autonomes exécutant des tâches complexes sur de longues sessions, la gestion du KV cache (la mémoire vive du modèle stockant l'historique des clés et valeurs de la conversation) est un défi majeur. DeepSeek combine une attention par fenêtre glissante (Sliding-Window Attention, qui limite la portée directe de l'attention aux jetons récents) et un sous-système de recherche parsemée.

"L'empreinte mémoire du KV cache est réduite jusqu'à un huitième par rapport à V4 Flash, atteignant environ 890 octets par jeton."

Cette optimisation permet de gérer une fenêtre de contexte globale de 1 million de tokens (les jetons ou morceaux de mots traités par l'IA) sans saturation rapide des ressources de calcul lors de l'inférence (l'exécution du modèle en production).

Tarification très basse et performances sur l'automatisation

Sur le plan tarifaire, l'accès via l'API première partie est affiché à 0,30 $ par million de jetons en entrée, 1,20 $ par million de jetons en sortie et 0,006 $ par million pour les jetons conservés en cache. Côté performances d'automatisation de code et de workflows, le modèle obtient un score de 69 % sur le benchmark AutomationBench-AA (à égalité avec GPT-6 Astra) et un score global de 40 sur l'index Artificial Analysis.

{
  "model": "deepseek-v4.1-flash",
  "messages": [
    {"role": "user", "content": "Analyse le dépôt et génère le correctif."}
  ],
  "temperature": 1.0,
  "max_tokens": 384
}

Les évaluations soulignent une forte verbosité, avec une moyenne de 89 000 jetons générés par tâche complexe (soit 25 % de plus que GLM-5.3). Malgré ce volume d'émission, le faible coût unitaire maintient l'exécution moyenne autour de 0,27 $ par tâche d'évaluation. Le modèle gère également nativement les entrées visuelles (texte et image) via une décomposition des pixels en grille 3x3, et son déploiement a débuté chez des hébergeurs tiers ainsi que sur les comptes d'équipe Ollama.