Modèleadopt
Architecture multi-modèles
Router chaque tâche vers le modèle qui lui convient plutôt que d'en élire un seul. Les paliers tarifaires écartent désormais les modèles d'un facteur vingt-cinq : le routage est un levier de coût autant que de qualité.
GPT-5.6 est distribué en trois paliers depuis juillet 2026, de 0,20 $ à 5 $ le million de jetons en entrée.
Modèleadopt
Modèles de frontière propriétaires
Claude Opus 5, GPT-5.6 et Gemini 3.7 tiennent le haut du panier sur le raisonnement long et le travail agentique. À réserver aux tâches qui le justifient : leur coût au jeton reste un ordre de grandeur au-dessus des modèles ouverts.
Claude Opus 5 est sorti le 24 juillet 2026 ; Gemini 3.7 Flash est en disponibilité générale depuis le 13 août 2026.
Modèleadopt
Mistral Large 3 et Small 4
Poids ouverts sous licence Apache 2.0 : téléchargeables, modifiables, hébergeables chez vous sans redevance au jeton. Le choix par défaut dès que la donnée ne doit pas sortir de votre périmètre.
Mistral Large 3 est le plus grand modèle à mélange d'experts à poids ouverts publié par un laboratoire majeur.
Frameworkadopt
MCP : Model Context Protocol
Le protocole de branchement des outils sur les modèles. Il a quitté le statut de spécification d'un éditeur pour devenir la couche d'interopérabilité du marché, ce qui règle la question du verrouillage sur l'outillage.
Passé sous gouvernance de la Linux Foundation, soutenu par Anthropic, OpenAI, Google, Microsoft et AWS ; 41 % des organisations interrogées en production en 2026.
Frameworkadopt
RAG hybride
Recherche vectorielle et lexicale combinées, avec réordonnancement. C'est le socle du service documentaire en entreprise, à condition de le traiter comme une brique et non comme l'architecture entière.
77 % des responsables IT et data considèrent que le RAG seul ne suffit pas à un déploiement fiable en production.
Plateformeadopt
LangGraph
L'orchestration à état pour les agents qui vont en production : reprise sur incident, points de contrôle, intervention humaine dans la boucle. La plus longue durée d'exploitation réelle des orchestrateurs du marché.
En disponibilité générale depuis octobre 2025, avec des déploiements publics chez Klarna, Uber, LinkedIn, BlackRock et JPMorgan.
Outiladopt
pgvector
La recherche vectorielle dans le PostgreSQL que vous exploitez déjà : transactions, sauvegardes et droits d'accès sont ceux de votre base. Un système de moins à tenir, tant que le volume le permet.
Au-delà d'une dizaine de millions de vecteurs, un moteur dédié redevient pertinent, c'est le seuil que nous observons.
Outiladopt
Conventions OpenTelemetry GenAI
Les attributs normalisés gen_ai.* pour tracer appels de modèles, jetons consommés et latences. Faites-en une exigence d'achat : c'est ce qui vous permettra de changer d'outil d'observabilité sans réinstrumenter.
Les quatre plateformes d'observabilité LLM les plus répandues exportent désormais au format OpenTelemetry.
Frameworktrial
Context engineering
Gouverner tout ce qui entre dans la fenêtre de contexte, instructions, mémoire, outils, budget de jetons, compression, au lieu de peaufiner une formulation. Le prompt devient un sous-ensemble de la discipline.
82 % des responsables IT et data jugent que le prompt engineering seul ne suffit plus ; 95 % tiennent le context engineering pour important à l'échelle.
Outiltrial
Qdrant et Weaviate
Des moteurs vectoriels dédiés qui gardent leur tenue quand le filtrage sur métadonnées se durcit, parce que le filtre est intégré à l'indexation plutôt qu'appliqué après coup. À éprouver sur votre jeu de filtres réel.
Le géré coûte de 1,5 à 3 fois l'auto-hébergé autour de dix millions de vecteurs, mais supprime le travail de montée en charge.
Plateformetrial
Langfuse, LangSmith, Arize Phoenix
Traçage, versionnage des invites et évaluation continue. Sans cette couche, une régression de qualité passe inaperçue jusqu'à la réclamation client. Langfuse s'auto-héberge sous licence MIT.
Langfuse dépasse 28 000 étoiles sur GitHub et s'héberge sans restriction de licence.
Frameworktrial
A2A : Agent-to-Agent
Le pendant de MCP entre agents : découverte de capacités, délégation, réponse. Encore jeune, mais c'est déjà l'un des deux signaux d'interopérabilité que les éditeurs mettent en avant.
MCP et A2A sont les deux protocoles cités comme signaux d'interopérabilité du marché des frameworks d'agents en 2026.
Modèletrial
Modèles ouverts auto-hébergés
Llama, Qwen et DeepSeek soutiennent désormais la comparaison sur une bonne part des tests. Sur un cas d'usage cadré et à volume stable, l'inférence chez soi change l'économie du dossier.
Les modèles à poids ouverts rivalisent avec les alternatives propriétaires sur de nombreux tests de référence en 2026.
Outiltrial
vLLM et Ollama
Servir un modèle ouvert sur votre propre matériel, du poste de développement au cluster GPU. La brique qui rend l'inférence souveraine opérable plutôt que théorique.
À éprouver d'abord sur les charges à faible variabilité, où le dimensionnement GPU se calcule.
Frameworkassess
Systèmes multi-agents
Plusieurs agents spécialisés qui se répartissent une tâche. Les démonstrations convainquent ; le coût de mise au point et la difficulté à reproduire un incident tiennent encore la production à distance.
À traiter en laboratoire avec un budget de jetons plafonné et une trace complète de chaque échange.
Outilassess
Fine-tuning et distillation ciblés
Utile quand le contexte ne peut pas porter la connaissance : style maison, terminologie métier, réduction de la latence sur un geste répété. Le préalable reste un jeu d'évaluation qui prouve le gain.
Sans jeu d'évaluation antérieur, un réglage fin ne se distingue pas d'une intuition coûteuse.
Plateformeassess
Agents de développement autonomes
Des agents qui prennent un ticket et rendent une demande de fusion. Le gain se mesure sur les tickets cadrés et bien testés ; il s'effondre dès que la spécification est floue.
À mesurer sur vos propres métriques DORA avant toute généralisation.
Modèleassess
Mémoire persistante d'agent
Conserver l'état d'un agent entre les sessions plutôt que de le reconstruire à chaque appel. Le sujet ouvre autant de questions de conformité que de gains d'efficacité : ce qui est mémorisé devient une donnée à gouverner.
La mémoire est l'un des quatre piliers du context engineering, avec les instructions, la recherche et les outils.
Modèlehold
Générations de modèles retirées
GPT-4, Claude 3, Gemini 1 : ces générations ne sont plus servies ou le seront bientôt. Si l'une d'elles est encore appelée en production, la migration est un sujet de planning, pas de veille.
Chaque génération retirée emporte ses réglages : prévoyez la campagne d'évaluation avant la bascule, pas après.
Frameworkhold
Agents entièrement autonomes sans supervision
Une boucle qui décide et exécute sans point d'arrêt humain ni journal d'audit. Le risque n'est pas la performance du modèle mais l'absence de reprise en main quand la chaîne dérive.
L'AI Act est pleinement exécutoire pour les modèles à usage général depuis le 2 août 2026, avec des amendes jusqu'à 3 % du chiffre d'affaires mondial ou 15 M€.
Frameworkhold
Mise en production sans détection d'injection
Dès qu'un modèle lit un contenu qu'il n'a pas produit, page web, courriel, fichier déposé, ce contenu peut porter des instructions. Sans couche de détection ni cloisonnement des droits, l'agent devient une surface d'attaque.
Le cloisonnement des droits de l'agent compte autant que le filtre : un agent qui ne peut pas écrire ne peut pas être détourné pour écrire.
Plateformehold
Fournisseur unique sans couche d'abstraction
Appeler un seul modèle depuis tout le code applicatif. Le jour où le tarif change, où la génération est retirée ou où le service tombe, il n'existe aucun chemin de repli.
Les modèles déjà commercialisés disposent d'une fenêtre de mise en conformité jusqu'au 2 août 2027 : l'abstraction est aussi ce qui rendra cette bascule tenable.
Outilhold
Automates à règles présentés comme de l'IA
Arbres de décision et scripts rebaptisés. Rien à leur reprocher en tant qu'outils, le problème est le budget d'IA qu'ils consomment et l'attente qu'ils créent sans jamais pouvoir la tenir.
Le test tient en une question : le comportement change-t-il quand la donnée change, sans qu'on réécrive une règle ?