DeepSeek V4.1-Flash : moins de mémoire, même prix, pas partout meilleur
DeepSeek publie V4.1-Flash, un modèle multimodal de 552 milliards de paramètres dont le cache clé-valeur en mémoire GPU rapide n'occupe plus qu'environ un quart de l'espace utilisé par le modèle précédent, V4-Flash - une réduction spectaculaire du coût mémoire des longs contextes d'agent. Mais l'article ne signale aucune baisse de prix : le nouveau modèle reste vendu aux mêmes prix que V4-Flash. Et sur au moins une épreuve de programmation, il recule nettement derrière ses concurrents.