Introduction
Le 10 janvier 2025, DeepSeek a lancé un LLM, R1, que la startup affirme équivalent au ChatGPT o1 d'OpenAI pour les tâches de raisonnement. L'application a atteint le sommet des classements de l'App Store en un temps record, captivant l'industrie technologique et bien au-delà. Une affirmation était particulièrement surprenante : le modèle aurait été entraîné pour moins de 6 millions de dollars, contre 100 millions dépensés par OpenAI pour GPT-4, de quoi créer des vagues sur le marché boursier et dans les médias.
Bien que la tempête médiatique et financière soit difficile à ignorer, ce qui nous intéresse davantage chez Adservio est de comprendre exactement ce que DeepSeek a fait et comment. Nous commencerons par les faits clés et nos premières impressions, puis explorerons l'architecture du modèle et les techniques utilisées, avant d'examiner les tentatives de reproduction de leurs résultats.
Les nouveaux modèles de DeepSeek : Quels sont les faits ?
Qui a construit DeepSeek
Fondée en mai 2023, DeepSeek est une startup d'IA chinoise basée à Hangzhou et Pékin, soutenue par le fonds spéculatif chinois High-Flyer. High-Flyer et DeepSeek ont tous deux été fondés par Liang Wenfeng.
Le 10 janvier 2025, DeepSeek a lancé son application mobile ; le 20 janvier 2025, l'entreprise a publié les poids de R1 sur Huggingface et le code d'inférence de R1 sur GitHub.
Qu'a vraiment construit DeepSeek ? DeepSeek a construit deux types de modèles et des applications pour les utiliser : V3, la dernière version d'un modèle de langage à usage général, et R1, un modèle de raisonnement basé sur V3-Base. Ils fournissent aussi des versions réduites capables de s'exécuter sur un ordinateur portable.
Il existe deux variantes de V3. L'une est construite sur Llama (modèle à poids ouvert de Meta) et l'autre sur Qwen (modèle à poids ouvert d'Alibaba).
Bien qu'ils aient publié les poids du modèle R1 et le code pour exécuter le modèle en inférence, ils n'ont pas publié le code d'entraînement ni le code pour toutes les optimisations qu'ils ont apportées au plus proche du matériel.
Nos premières impressions en utilisant DeepSeek
Certains d'entre nous chez Adservio ont utilisé DeepSeek via le site Web de l'entreprise, tandis que d'autres ont utilisé ollama pour exécuter un modèle R1 réduit sur leur ordinateur portable. Nous avons ensuite passé du temps à utiliser le modèle comme vous le feriez avec d'autres modèles, pour des tâches allant du codage aux questions de raisonnement.
Sur la base de notre expérience ces derniers jours, voici quelques-unes de nos impressions et réflexions initiales :
Les performances multilingues ont montré de bons résultats en anglais et en mandarin, mais moins fluides en français, avec l'apparition de caractères chinois ou arabes non intentionnels et un retour occasionnel à l'anglais lors de raisonnements complexes. Son style de raisonnement peut être excessivement bavard, tournant parfois en cercles. Les instances du modèle s'installent sur du matériel grand public, y compris économe en énergie. La version hébergée semble avoir des garde-fous alignés sur la vision du gouvernement chinois, et le modèle lui-même peut refléter des perspectives cohérentes avec cet alignement. Nous n'avons pas de visibilité sur les données d'entraînement, ce qui est aussi le cas pour Llama, OpenAI ou Claude, ce qui rend certains gouvernements et entreprises nerveux.
Pouvons-nous faire confiance aux résultats de performances déclarés par DeepSeek ?
Mise à jour : début 2026, Hugging Face a publié via son projet openR1 une reproduction complète de DeepSeek R1, données d'entraînement, code et pipeline de validation inclus, confirmant les résultats annoncés à un ou trois écarts-types près sur des benchmarks comme MATH-500.
Nous aimerions également comprendre si le modèle a été exposé aux données de repère lors de l'entraînement et si les méthodes d'évaluation utilisées dans l'article sont appropriées.
Cela dit, nous n'avons aucune raison particulière de croire que les résultats ne sont pas réels.
Ce qui a créé des vagues est le nombre de 2,788 millions d'heures de GPU (estimé à 5,576 millions de dollars) pour l'entraînement. L'article de V3 clarifie les hypothèses derrière ce chiffre, tout en précisant qu'il ne représente que la dernière série d'entraînement. Vu la vitesse à laquelle l'industrie s'est jetée sur la couverture de cette famille de modèles, nous soupçonnons que ce chiffre a souvent été repris hors contexte.
Les composants techniques de DeepSeek
R1 a été entraîné en utilisant une combinaison de SFT et RL sur V3-Base. Ce sont des transformers hautement optimisés pour des frameworks matériels/logiciels spécifiques, en fonction des limites imposées par l'environnement (les contrôles d'exportation américains sur les puces NVIDIA H100). DeepSeek a combiné des techniques nouvelles et anciennes de manière intéressante. Commençons par V3-Base.
V3-Base : mélange d'experts et coûts d'entraînement
V3-Base utilise une approche de mélange d'experts solide, similaire à Mixtral mais plus efficace, entraînée avec 671 milliards de paramètres totaux contre 405 milliards pour Llama. Les deux modèles utilisent la quantification FP8 et une fenêtre de contexte de 128K, avec des volumes de tokens d'entraînement comparables : 14,8 billions pour V3-Base contre 15 billions pour Llama.
La différence clé : l'article de V3 mentionne 2,788 millions d'heures de GPU, contre 39,3 millions d'heures cumulées pour Llama 3.1 405B FP8. La nuance est là, le chiffre de V3 ne concerne que la dernière série d'entraînement complète, tandis que celui de Llama est cumulé. Nous ne savons donc pas s'il y a une comparaison directe à faire : V3 a par exemple été entraîné sur des données générées par un R1 non encore publié à l'époque, les coûts de V3 devraient-ils inclure ceux de R1 ?
R1 a été construit sur V3-Base via ajustement fin supervisé (SFT) et apprentissage par renforcement (RL) pour intégrer le raisonnement, avec un motif de chaîne de pensée longue, puis distillé en petits modèles denses, avec des versions basées sur Llama et Qwen. Ils ont aussi publié R1-Zero, qui n'utilise pas SFT et souffre de limitations (lisibilité, mélange des langues) malgré des comportements de raisonnement intrigants, probablement plus intéressant pour les chercheurs que pour les utilisateurs, d'où un entraînement multi-étapes avec données de démarrage à froid avant RL pour corriger ces problèmes.
V3 a ensuite été construit en utilisant les données créées par les motifs de raisonnement, de vérification et de réflexion de R1 pour améliorer davantage V3-Base pour créer un modèle plus complet, V3.
Tous ces modèles ont été entraînés en utilisant les GPU NVIDIA H800. Il s'agit de versions des GPU H100 fabriquées pour le marché chinois et qui sont, comme mentionné plus tôt, limitées de manière à respecter les contrôles d'exportation américains. Spécifiquement, les puces H800 possèdent la moitié de la vitesse d'interconnexion puce à puce des H100 (environ 400 Go/s contre 900 Go/s sur NVLink).
Le coût de l'entraînement de R1 est rapporté à 5,58 millions de dollars, mais ce chiffre est trompeur, sans qu'on sache précisément à quel point. Il provient du rapport technique de V3, qui est le coût d'entraînement de DeepSeek V3, CNN le note correctement en précisant qu'il s'agit du modèle de base, sans toujours aider à comprendre la différence. R1 ayant été entraîné sur V3-Base, son coût cumulé est nécessairement supérieur : les nombres du tableau un du rapport V3 semblent correspondre à une seule série d'entraînement complète, probablement la dernière, alors que reproduire le processus demanderait sans doute plusieurs séries.
Il y a aussi des rapports contradictoires selon lesquels DeepSeek aurait accès à 50 000 A100, plus conforme à ce qu'OpenAI aurait utilisé pour entraîner GPT-4 (25 000 A100). Louer 50 000 GPU A100 aux États-Unis coûterait aujourd'hui environ 1,35 dollar/GPU-heure, soit environ 11,34 millions de dollars par semaine, mais DeepSeek aurait pu utiliser des GPU que son bailleur High-Flyer avait acquis antérieurement pour le trading haute fréquence.
Plonger plus profondément dans ce qui rend DeepSeek distinctif
Il existe un certain nombre de façons sophistiquées dont DeepSeek a modifié l'architecture du modèle, les techniques d'entraînement et les données pour tirer le meilleur parti du matériel limité dont il disposait. Examinons maintenant ces éléments de bas en haut.
Optimiser pour le matériel disponible
Optimiser pour le matériel disponible, Il y a deux limitations clés des H800 que DeepSeek devait utiliser par rapport aux H100. D'abord, ils ont la moitié de la bande passante d'interconnexion GPU à GPU des H100, et deuxièmement, une mémoire beaucoup plus petite : 80 Go contre 188 Go.
Fait intéressant, DeepSeek semble avoir transformé ces limitations en avantage. « [L]es coûts d'entraînement économiques de DeepSeek-V3 … [ont été] réalisés grâce à notre conception co-optimisée des algorithmes, des frameworks et du matériel », a écrit l'équipe de DeepSeek. En d'autres termes, ils ont pris des décisions qui leur permettraient d'extraire le plus de ce qu'ils avaient disponible.
Par exemple, ils ont utilisé FP8 pour réduire la mémoire requise. Avant ce travail, FP8 était considéré comme efficace mais imparfait ; DeepSeek a démontré comment l'utiliser pleinement : « nous introduisons un cadre d'entraînement en précision mixte FP8 et validons son efficacité sur un modèle extrêmement grande échelle, réalisant à la fois un entraînement accéléré et une réduction de l'utilisation mémoire du GPU. »
Ils ont poussé l'optimisation matérielle à très bas niveau : « nous développons des noyaux de communication tout-à-tout efficaces interserveurs pour utiliser pleinement les bandes passantes InfiniBand et NVLink. De plus, nous optimisons méticuleusement l'empreinte mémoire, rendant possible l'entraînement de DeepSeek-V3 sans le coûteux parallélisme tensoriel. » Un travail sérieusement profond pour tirer le meilleur parti d'un matériel limité.
L'article aborde aussi l'algorithme DualPipe : « nous concevons l'algorithme DualPipe pour un parallélisme de pipeline efficace, qui a moins de bulles de pipeline et cache la plupart de la communication par le chevauchement calcul-communication [...] tout en réalisant un surcharge de communication tout-à-tout pratiquement nulle. » Ce résultat tranche avec les façons « normales » d'adapter l'entraînement distribué, qui reviennent à « ajouter plus de matériel au tas ».
C'est un cas clair où la nécessité est la mère de l'invention.
L'impact de l'apprentissage par renforcement lors de l'entraînement supplémentaire sur la performance de repère, DeepSeek a appliqué l'apprentissage par renforcement avec GRPO (optimisation de politique relative de groupe) dans V2 et V3. Mais, apparemment, l'apprentissage par renforcement a eu un grand impact sur le modèle de raisonnement, R1,son impact sur la performance de repère est notable.
En utilisant GRPO pour appliquer la récompense, DeepSeek évite un grand modèle « critique », économisant de la mémoire. Mais GRPO, basé sur des règles, fonctionne mieux pour les problèmes à réponse objective (codage, mathématiques) et pourrait peiner sur des réponses subjectives ou variables, un compromis à suivre à mesure que l'approche se généralise.
Attention latente multi-têtes et arbitrages distillation/apprentissage par renforcement
L'attention latente multi-têtes (MLA) est une variation de l'attention multi-têtes introduite par DeepSeek dans son article V2. Les techniques précédentes étaient un compromis : réduire la qualité du modèle pour mieux scaler l'entraînement de grands modèles. DeepSeek affirme que MLA permet la mise à l'échelle tout en améliorant le modèle, un point que nous voulons creuser davantage.

Distillation vs apprentissage par renforcement, L'article R1 tire deux conclusions intéressantes : « la distillation de modèles plus puissants en modèles plus petits produit d'excellents résultats, tandis que les modèles plus petits s'appuyant sur l'apprentissage par renforcement à grande échelle nécessitent une puissance de calcul énorme et pourraient même ne pas atteindre la performance de la distillation. [...] si les stratégies de distillation sont économiques et efficaces, progresser au-delà des limites de l'intelligence pourrait nécessiter des modèles de base plus puissants et un RL à plus grande échelle. »
La première conclusion est intéressante et vraiment intuitive. La seconde est rassurante, ils n'ont pas, du moins, complètement bouleversé notre compréhension de la façon dont l'apprentissage profond fonctionne en termes d'exigences de calcul importantes.
Qu'avons-nous pu apprendre de ce qui n'a pas fonctionné ? C'est toujours intéressant à lire. Qu'est-ce que DeepSeek a essayé qui n'a pas fonctionné ?
Premièrement, un modèle de récompense par processus (PRM) pour guider le RL n'était pas viable à grande échelle, même s'il reste utile pour le re-classement des réponses top-N. Deuxièmement, la recherche en arbre Monte Carlo (MCTS), utilisée par AlphaGo et AlphaZero, ne s'adapte pas au raisonnement général : l'espace des problèmes n'y est pas aussi « contraint » que les échecs ou le Go, un espace jugé trop complexe il y a moins d'une décennie.
Autres choses intéressantes, Il y a évidemment une énorme quantité de choses intéressantes sur lesquelles nous pourrions commenter. Cependant, il y a quelques éléments qui méritent d'être signalés :
Un repère de codage très impressionnant. La formation supplémentaire + la mise à l'échelle d'inférence semble être une stratégie viable pour créer un modèle très efficace
Ce qui vient ensuite ?
Briser la circularité des repères et des modèles, Après la publication de chaque nouveau et meilleur modèle, nous nous demandons si lui a été exposé aux données de repère au moment de l'entraînement. « A-t-il simplement étudié pour l'examen ou a-t-il réellement appris le sujet ? »
Cela est dû à la circularité perverse des ensembles de données de repère : une spirale sans fin de battage trompeur. Vous créez un bon repère, le prochain modèle le gamifie pour gagner en visibilité, il faut alors créer un autre repère « juste », que le modèle suivant gamifiera à son tour. L'Examen Final de l'Humanité ne restera ce qu'il prétend être que jusqu'à la publication du prochain modèle.
En d'autres termes, quand un LLM génère avec assurance les bonnes réponses sur les repères actuels, c'est excellent si son application porte sur des données réelles de complexité similaire. Mais quand il échoue sur un nouveau repère ou domaine, c'est généralement parce qu'il est confiant dans des réponses fausses, la nouvelle donnée a une complexité qu'il ne connaissait pas au moment de l'entraînement.
Ce cycle doit s'arrêter, et nous avons besoin de meilleurs mécanismes d'évaluation plus génériques et de métriques plus informatives qui ne dépendent pas de nouveaux repères toutes les quelques semaines.

Répliquer les résultats de DeepSeek R1
Ce qui restait à faire début 2025 est désormais chose faite : début 2026, le projet openR1 de Hugging Face a publié une reproduction complète de R1, entraînement compris, validant indépendamment ses conclusions. Voici ce que cette reproduction a nécessité :
Trois ingrédients ont été nécessaires : des GPU (2 048, ce qui n'est pas un grand nombre, pour environ 5,5 millions de dollars par série d'entraînement), du code d'entraînement, que DeepSeek n'a pas open-sourcé, et des données d'entraînement, sans doute l'écart le plus important à combler.
DeepSeek ne publiera probablement pas l'intégralité de son ensemble de données d'entraînement, tout comme OpenAI ou Anthropic ne publieront pas le leur. Autant que nous ayons pu le trouver, DeepSeek n'a pas publié d'échantillons des données utilisées pour l'entraînement de la longue chaîne de pensée. La communauté open-source a donc commencé à créer ses propres ensembles de données ; OpenThoughts en est un exemple.
Pendant ce temps, les chercheurs de Berkeley affirment avoir reproduit R1-zero pour moins de 30 dollars…
Depuis, DeepSeek a fait évoluer sa famille de modèles au-delà de V3 et R1, avec une nouvelle génération qui reprend les mêmes principes de co-conception algorithmes/matériel à plus grande échelle, confirmant que les choix architecturaux décrits ici n'étaient pas un coup ponctuel mais une méthode reproductible.
...Je pense que j'ai besoin de faire une sieste.
Merci à mes collègues Shayan Mohanty, Ben O'Mahony, Chris Kramer, Sahger Lad, Prathamesh Kalamkar, Lauris Jullien, Emily Gorcenski, Karrtik Iyer, Runyan Tan, Parag Mahajani et Andy Yates qui ont tous contribué à cette article.
RÉCUPÉRER CET ARTICLE
Téléchargez l'article complet en PDF pour le lire hors ligne ou le partager.
RESTER INFORMÉ
Recevez nos prochaines analyses et retours d'expérience directement dans votre boîte mail.





Comment pouvez-vous utiliser DeepSeek ?
Vous pouvez essayer le modèle sur le site Web de DeepSeek ou l'application mobile. Alternatively, vous pouvez utiliser ollama run deepseek-r1:32b pour exécuter la version réduite du modèle localement. Pour cela, vous devrez télécharger et installer Ollama.
Les fournisseurs de services cloud se sont également lancés dans l'aventure. Vous pouvez déployer les modèles DeepSeek sur GCP Vertex AI, AWS Bedrock et Azure AI Foundry. Vous pouvez également le déployer en tant que NIM NVIDIA.
Les modèles de DeepSeek sont certainement assez intrigants pour être envisagés comme addition à la boîte à outils de votre plateforme IA aux côtés d'autres modèles à poids ouvert, car les développeurs d'applications voudront expérimenter ou utiliser différents modèles pour différents objectifs.