Vous ouvrez un onglet pour comparer les LLM. Trente minutes plus tard, vous avez douze onglets : Claude, GPT, Gemini, DeepSeek, Qwen, Kimi, Mistral, Llama. Chaque article dit "le meilleur", chacun avec un tableau différent.

Le problème n'est pas le manque d'information. C'est l'inverse. Il sort un nouveau modèle toutes les trois semaines, chacun revendique un record sur un benchmark que personne ne sait vraiment lire, et le prix affiché sur la page d'accueil n'est presque jamais le prix que vous payez à la fin du mois.

Et la vraie question n'est même pas "quel est le meilleur LLM". C'est : le meilleur pour quoi ? Coder un produit en production, répondre à un email en trois secondes, ou faire tourner un agent qui appelle vingt outils sans supervision — ce ne sont pas la même tâche, et ce n'est pas le même modèle.

Ce que vous allez trouver ici : les scores qui comptent (et ceux qui ne veulent plus dire grand-chose), le prix réel par million de tokens pour chaque famille de modèles, un état des lieux honnête de l'open source chinois face aux géants américains, la seule alternative européenne qui tient la route, et un tableau de décision par cas d'usage — code, tâche simple, agent autonome.

5 critères pour bien choisir votre LLM en 2026

  • 1 Performance réelle — le score sur les benchmarks qui comptent aujourd'hui (GPQA Diamond, SWE-bench Verified, Arena Elo), pas la promesse marketing du communiqué de lancement.
  • 2 Coût réel — le prix par million de tokens en sortie, en comptant les tokens de raisonnement invisibles que les modèles "thinking" facturent en silence.
  • 3 Fenêtre de contexte utile — la taille annoncée (souvent 1M+) contre la taille réellement exploitable sans perte de qualité.
  • 4 Cas d'usage — coder une fonctionnalité complexe, traiter un volume massif de micro-tâches, ou piloter un agent autonome ne demandent pas le même modèle.
  • 5 Souveraineté et licence — fermé américain avec conditions d'usage strictes, open source chinois sans garantie de support, ou européen hébergé localement avec conformité RGPD native.
Carte du paysage LLM 2026 — positionnement approximatif, prix de sortie par million de tokens (échelle non linéaire)
OUVERT (poids ouverts) FERMÉ (propriétaire) Llama 4 Scout DeepSeek V4 Pro Mistral Large 3 MiniMax M3 Qwen 3.6 Plus GLM-5.2 Kimi K3 Claude Haiku 4.5 Gemini 3.1 Pro Claude Sonnet 5 Claude Opus 5 GPT-5.6 Sol ← moins cher · plus cher →
Positionnement indicatif des familles de modèles citées dans cet article, par gouvernance (ouvert/fermé) et prix de sortie par million de tokens. Données : tableau comparatif ci-dessous, sources détaillées section par section.

1. Les Géants Fermés Américains : Claude, GPT, Gemini

Trois labos, trois philosophies. Anthropic mise sur la fiabilité et le raisonnement long. OpenAI mise sur la polyvalence et l'écosystème produit. Google mise sur le contexte massif et l'intégration à sa suite. Les trois restent, en juillet 2026, les seuls à occuper systématiquement le haut des classements généralistes.

Claude (Anthropic)
Fermé · États-Unis · Opus 5 / Sonnet 5 / Haiku 4.5
9.4
/10

Claude Opus 5 est sorti le 24 juillet 2026 et tient la première place des classements d'intelligence générale, un point devant Claude Fable 5 et environ 3% devant GPT-5.6 Sol. Trois modèles, trois usages : Opus 5 pour le travail de fond exigeant, Sonnet 5 comme cheval de bataille agentique quotidien, Haiku 4.5 pour tout ce qui doit tourner vite et souvent.

Ce qui change la donne cette année : Sonnet 5 (sorti le 30 juin 2026) se positionne explicitement entre Haiku et Opus comme modèle "haut volume" pour l'agentique — c'est lui qu'on utilise pour un agent qui tourne toute la journée sans faire exploser la facture.

Voir des exemples : claude.ai (chat public) · page pricing officielle

Points forts

  • Meilleur rapport fiabilité/raisonnement long sur du travail réel, pas juste des QCM
  • Fenêtre de contexte 1M tokens sur toute la gamme, prix plat sans surcoût au-delà d'un certain seuil
  • Cache de prompt à -90% sur les tokens répétés — change vraiment la facture en usage agent

Points faibles

  • Le plus cher de la gamme fermée sur Fable 5 (10$/50$ le million de tokens)
  • Pas d'offre gratuite illimitée comparable à DeepSeek ou Qwen Chat

Sonnet 5 est le choix par défaut pour la majorité des usages pro : 3$/15$ le million de tokens (2$/10$ en tarif de lancement jusqu'au 31 août 2026). Opus 5 monte à 5$/25$ pour les tâches où l'erreur coûte cher.

Tarifs API (par million de tokens)
Haiku 4.5
1$ / 5$
Contexte 200K — micro-tâches à volume
Recommandé
Sonnet 5
3$ / 15$
Contexte 1M — agent haut volume
Opus 5
5$ / 25$
Contexte 1M — raisonnement lourd

Repère benchmark issu de LLM Stats Leaderboard et de LM Council (juillet 2026).

Classement général
#1
Opus 5 · Elo ~1580
SWE-bench Verified (Fable 5)95%
Prix vs frontière (plus cher)+40%
Raisonnement long fiable Pas le moins cher

Si vous devez choisir un seul modèle fermé pour du travail pro varié, Sonnet 5 couvre 90% des cas à un prix qui reste raisonnable. Opus 5 pour le dernier kilomètre.

Extrait du tableau comparatif
A Claude Fermé · USA · #1 général 9.4 Meilleur global
À retenirClaude reste la référence quand la qualité et la fiabilité priment sur le prix. Sonnet 5 est le point d'équilibre ; Haiku 4.5 le modèle à faire tourner en boucle sans y penser.
"GPT-5.6 Sol tient le score SWE-bench le plus élevé du marché fermé. Mais un point de score ne dit rien sur ce que ça coûte de le maintenir à ce niveau sur un vrai backlog."

GPT-5.6 existe en trois versions cette année : Sol (5$/30$, le plus capable), Terra (2,50$/15$, le compromis) et Luna (1$/6$, le rapide). Sol tient 96,2% sur SWE-bench Verified — le score de référence coding en 2026 — devant Fable 5 à 95%. OpenAI reste devant sur ce test précis, de peu.

Ce qui compte moins qu'avant : les benchmarks académiques saturés (MMLU classique, par exemple) où presque tous les modèles frontière tapent 90%+. Ce qui compte plus : SWE-bench (résoudre un vrai ticket GitHub), Terminal-Bench (utiliser un terminal comme un humain) et l'exécution agentique de bout en bout.

Gemini 3.1 Pro joue une autre carte : le contexte. 1 million de tokens en standard, jusqu'à 10 millions annoncés sur les variantes longues, et un prix qui reste compétitif face à Claude et OpenAI (autour de 2 à 2,50$ en entrée, 12 à 15$ en sortie selon la source). C'est le choix par défaut quand vous devez avaler un codebase entier ou un corpus de documents sans le découper.

L'autre atout Gemini, moins mis en avant que le contexte : l'intégration native à l'écosystème Google Workspace. Pour une équipe déjà sur Docs, Sheets et Gmail, brancher Gemini directement dans ces outils évite l'étape "copier-coller dans un chat" qui reste, pour DeepSeek comme pour Claude, un point de friction quotidien. Ce n'est pas un critère de benchmark, mais c'est souvent le vrai facteur qui décide de l'adoption réelle dans une équipe.

Gemini 3 Flash, la version allégée à 0,50$/3$ le million, mérite d'être mentionnée séparément : c'est le point d'entrée le moins cher des trois géants fermés pour un usage quotidien raisonnable, avant même de considérer les alternatives ouvertes.

Faut-il vraiment payer le prix fort pour un modèle fermé ?

Pas systématiquement. Pour du volume — support client, tri d'e-mails, résumés en masse — Haiku 4.5, GPT-5.6 Luna ou l'équivalent chinois DeepSeek V4 Flash font le travail à une fraction du coût. Le modèle frontière (Opus 5, Sol, 3.1 Pro) se justifie sur les 15 à 20% de tâches où l'échec coûte plus cher qu'un abonnement.


2. L'Open Source Chinois : DeepSeek, Qwen, Kimi, GLM, MiniMax

C'est le vrai bouleversement de 2026. DeepSeek V4 Pro tourne à quelques points de GPT-5.5 et de Claude Opus 4.7 sur le coding — pour 34 fois moins cher par token de sortie. Ce n'est plus un rattrapage. C'est une redistribution des cartes sur le rapport qualité-prix.

DeepSeek V4
Open source (MIT) · Chine · Flash & Pro
8.9
/10

DeepSeek publie ses poids sous licence MIT — vous pouvez l'auto-héberger, le fine-tuner, l'intégrer sans demander la permission à personne. Le chat web et l'application mobile sont gratuits, sans plan payant, sans plafond de fichiers. Pour l'API, deux niveaux : Flash à 0,14$/0,28$ le million de tokens, Pro à 0,435$/0,87$. À titre de comparaison, remplir une fenêtre de 1M tokens coûte 0,14$ sur Flash contre 10$ sur Claude Fable 5 — un écart de 71 fois.

Le red flag classique — "un modèle chinois gratuit, c'est louche" — mérite d'être posé sérieusement plutôt qu'écarté par réflexe. Pour des données sensibles (RH, juridique, santé), l'auto-hébergement des poids ouverts sous votre propre infrastructure règle la question de la souveraineté des données mieux qu'un abonnement fermé américain.

Voir des exemples : chat.deepseek.com (gratuit)

Points forts

  • Rapport performance/prix imbattable sur le marché entier, fermé ou ouvert
  • 5 millions de tokens API gratuits offerts à chaque nouveau compte développeur
  • Poids ouverts MIT : auto-hébergement total possible, zéro dépendance à un fournisseur

Points faibles

  • Modèle de raisonnement (style R1) génère des tokens de réflexion cachés qui gonflent la facture réelle
  • Support et documentation moins matures qu'Anthropic ou OpenAI pour un déploiement entreprise

Le vrai argument DeepSeek n'est pas "gratuit", c'est le rapport prix/capacité sur l'API — le plan Pro tient tête à des modèles 10 à 30 fois plus chers sur le coding.

Tarifs API (par million de tokens)
Chat web / app
0$
Gratuit, sans plafond de fichiers
Recommandé
V4 Pro (API)
0,435$ / 0,87$
Contexte 1M — proche frontière sur coding
V4 Flash (API)
0,14$ / 0,28$
Contexte 1M — volume, tâches simples

Repère benchmark issu de AI/ML API Blog et de LLM Stats (juillet 2026).

Coding vs frontière fermée
~2-3pts
écart sous Opus / GPT-5.5
Coût par rapport à la frontière-97%
Maturité support entreprise35%
34x moins cher, quelques points sous la frontière tokens de raisonnement cachés à surveiller

Pour un budget serré ou un volume massif de requêtes, DeepSeek V4 Pro est le calcul le plus rationnel du marché en 2026. Ce n'est pas un choix de repli — c'est un choix économique assumé.

Extrait du tableau comparatif
DS DeepSeek V4 Open source · Chine · MIT 8.9 Meilleur rapport prix
À retenirDeepSeek V4 Pro n'est pas "presque aussi bon" que la frontière fermée — sur la majorité des tâches réelles, la différence ne justifie pas 30 fois le prix.

Le reste du peloton chinois mérite qu'on s'y arrête, section par section.

Qwen (Alibaba) : le généraliste multilingue

Qwen 3.7 Max talonne les modèles fermés sur le raisonnement et couvre 201 langues — utile si votre activité dépasse le français et l'anglais. Qwen Chat est gratuit, sans abonnement, et l'API descend jusqu'à 0,05$/0,40$ le million sur la version Flash. Qwen 3.6 Plus, avec 1M tokens de contexte et un tool-calling fiable, est aujourd'hui l'un des meilleurs choix open source pour un agent codant en autonomie.

Kimi (Moonshot AI) : l'outsider qui a pris la tête du coding ouvert

Kimi K3 a fait quelque chose d'inédit en juillet 2026 : devenir le premier modèle ouvert à dominer un classement de coding généraliste (Frontend Code Arena, 1 679 Elo). Il pointe aussi au deuxième rang mondial toutes catégories sur les classements d'intelligence publique, juste derrière Claude Opus 5. Côté abonnement grand public, Kimi propose des paliers payants (19$ à 199$/mois) et un plan gratuit — mais celui-ci exige un numéro de téléphone chinois, ce qui le rend peu accessible depuis l'Europe sans contournement.

GLM (Zhipu AI) et MiniMax : les deux pépites sous le radar

GLM-5.2 tourne à 0,95$/3$ le million, licence permissive, et combine contexte long avec du function calling fiable — solide sans faire de bruit. MiniMax M3 mise sur une architecture d'attention parcimonieuse (MSA) qui divise par 20 le coût de calcul sur une fenêtre de 1M tokens, avec un score GPQA Diamond à 93% — juste derrière Kimi K3. Les deux sont largement sous-couverts par la presse tech francophone alors qu'ils tiennent la comparaison avec des modèles bien plus médiatisés.

Constat brut : en juillet 2026, six des dix meilleurs modèles ouverts au monde sont chinois (DeepSeek, Qwen, Kimi, GLM, MiniMax comptent plusieurs entrées). Ignorer ce bloc par principe, c'est se priver du meilleur rapport qualité-prix du marché actuel.

3. Llama et Grok : Les Américains Qui Jouent l'Ouverture

Meta et xAI répondent à la pression chinoise sur l'open weight, chacun à sa manière.

Llama 4 reste la référence occidentale en poids ouverts, avec deux profils distincts. Scout revendique 10 millions de tokens de contexte — le record toutes catégories, devant même Gemini 3 Pro sur ce point précis — et tourne pour 0,11$/0,34$ le million sur une infrastructure comme Groq. Maverick vise la polyvalence générale avec le meilleur score MMLU (85,5%) de la famille ouverte. Sur le pur raisonnement et le coding face à Qwen ou DeepSeek, Llama 4 reste en retrait — sa force, c'est le contexte massif et l'écosystème d'outils déjà construit autour.

Grok (xAI) se positionne dans le tiers "cheap-and-good" aux côtés de Sonnet 5 et DeepSeek V4 Flash pour un usage quotidien — pas le modèle qu'on choisit pour la tâche la plus dure de la semaine, mais un choix solide pour le volume à un prix contenu (1$/2$ le million sur Grok Build 0.1, contexte 256K).

La stratégie derrière ces deux ouvertures américaines n'est pas philanthropique. Meta et xAI répondent à une pression concurrentielle directe : si Qwen, DeepSeek et Kimi captent la communauté des développeurs qui veulent auto-héberger, les deux groupes américains perdent une distribution entière. Publier des poids ouverts, même partiellement en retrait sur les benchmarks purs, garde un pied dans cet écosystème plutôt que de l'abandonner totalement au bloc chinois.

Consensus terrain · communauté self-hosting · 2026
"Le monde du coding se découpe en trois : la frontière fermée pour les 20% de tickets impossibles, un modèle correct et pas cher pour le quotidien, et de l'open-weight pour ce que vous voulez auto-héberger ou contrôler côté coût." — paraphrase du consensus documenté par plusieurs comparatifs 2026 (dev.to, MindStudio).

4. Mistral : La Seule Alternative Européenne Crédible

Sur les dix modèles cités jusqu'ici, un seul est hébergé, financé et gouverné en Europe : Mistral. Ce n'est pas un détail marketing si vous traitez des données de clients européens ou si la question de la souveraineté remonte un jour dans un audit.

Mistral Large 3
Open source (Apache 2.0) · France · 675B MoE
8.2
/10

Mistral Large 3 est un modèle Mixture-of-Experts de 675 milliards de paramètres (41 milliards actifs par token), publié sous licence Apache 2.0 — poids ouverts, vision native, 256K tokens de contexte. C'est aujourd'hui le LLM open-weight européen le plus abouti, à un tarif largement sous la frontière fermée : 0,50$/1,50$ le million de tokens, contre 5$/25$ pour Claude Opus 5 ou 5$/30$ pour GPT-5.6 Sol.

Mistral investit aussi dans l'infrastructure physique : 830 millions de dollars de financement en dette pour installer 13 800 GPU NVIDIA GB300 près de Paris, et un accord de 1,2 milliard d'euros pour des installations en Suède. L'objectif affiché : garder les données et le calcul sur le sol européen, une réponse directe à la dépendance aux clouds américains ou chinois.

Voir des exemples : Le Chat (chat.mistral.ai) · mistral.ai

Points forts

  • Seul modèle frontière européen avec infrastructure physique sur le continent (Paris, Suède)
  • Apache 2.0 : licence la plus permissive du marché, y compris usage commercial sans restriction
  • Prix imbattable pour un modèle de cette taille face aux fermés américains

Points faibles

  • Reste derrière la frontière absolue (Opus 5, GPT-5.6 Sol, Kimi K3) sur les benchmarks de raisonnement les plus durs
  • Contexte plafonné à 256K, loin des 1M+ devenus standard ailleurs

0,50$/1,50$ le million de tokens positionne Mistral Large 3 entre DeepSeek et les modèles fermés — le compromis souveraineté/prix/qualité le plus net du marché européen.

Tarifs API (par million de tokens)
Recommandé UE
Large 3
0,50$ / 1,50$
Contexte 256K — hébergement France/Suède

Repère benchmark issu d'Artificial Analysis (juillet 2026).

Positionnement vs frontière
-40%
écart score, -90% écart prix
Souveraineté données UE100%
Contexte vs standard 2026 (1M)26%
Seul frontière hébergé en Europe Contexte limité à 256K

Pour une entreprise européenne qui doit justifier où vivent ses données, Mistral Large 3 est le seul choix qui répond à la question avant même qu'on la pose.

Extrait du tableau comparatif
M Mistral Large 3 Open source · France · Apache 2.0 8.2 Seul choix souverain UE
À retenirMistral Large 3 ne gagne pas sur les benchmarks purs. Il gagne sur la seule question qu'aucun modèle américain ou chinois ne peut résoudre : où vivent vos données.

Vue comparative synthétique

Modèle Origine Contexte Prix /M (entrée/sortie) Score repère Meilleur pour
Claude Opus 5 USA · fermé 1M 5$ / 25$ #1 général (Elo ~1580) Raisonnement long, fiabilité
Claude Sonnet 5 USA · fermé 1M 3$ / 15$ Frontière, tier volume Agent haut volume, usage pro général
Claude Haiku 4.5 USA · fermé 200K 1$ / 5$ Rapide, économique Micro-tâches à répétition
GPT-5.6 Sol USA · fermé 1,1M 5$ / 30$ 96,2% SWE-bench Coding complexe
Gemini 3.1 Pro USA · fermé 1M-10M ~2,50$ / 15$ Contexte massif Corpus/codebase entiers
DeepSeek V4 Pro Chine · MIT 1M 0,435$ / 0,87$ 2-3 pts sous frontière Rapport qualité-prix
DeepSeek V4 Flash Chine · MIT 1M 0,14$ / 0,28$ Volume économique Tâches simples à très grande échelle
Qwen 3.6 Plus Chine · Apache 2.0 1M 0,50$ / 3$ Tool-calling fiable Agent codant open source
Kimi K3 Chine · ouvert 1M 3$ / 15$ #1 open sur coding front-end Coding open source haut niveau
GLM-5.2 Chine · ouvert 1M 0,95$ / 3$ Solide, sous-couvert Function calling + contexte long
MiniMax M3 Chine · ouvert 1M ~0,30$ / 1,20$ 93% GPQA Diamond Raisonnement long, agentique
Llama 4 Scout USA · ouvert 10M 0,11$ / 0,34$ Record contexte Ingestion de documents massifs
Mistral Large 3 France · Apache 2.0 256K 0,50$ / 1,50$ Souveraineté UE Données sensibles, conformité RGPD

5. Quel Modèle Pour Quel Usage : Code, Tâche Simple, Agent

La question qui compte n'est jamais "quel LLM est le meilleur". C'est "meilleur pour faire quoi, ce mardi matin, avec ce budget". Trois cas d'usage couvrent 90% des besoins réels.

Coder une fonctionnalité complexe

Ici, la frontière fermée reste devant. GPT-5.6 Sol (96,2% SWE-bench Verified) et Claude Fable 5 (95%) sont les deux options les plus fiables sur un ticket difficile — refactoring cross-fichiers, bug de concurrence, architecture nouvelle. Côté open source, Kimi K3 et Qwen 3 Coder tiennent la comparaison sur des tâches moins extrêmes, pour une fraction du prix.

Traiter une tâche simple à haut volume

Résumer un email, classer un ticket, extraire une donnée d'un document court : ne payez jamais le tarif frontière pour ça. Claude Haiku 4.5, DeepSeek V4 Flash ou Qwen-Flash (0,05$/0,40$ le million) font le travail en une fraction de seconde pour un coût qui frôle zéro à l'échelle d'une tâche individuelle.

Piloter un agent IA autonome

C'est le cas le plus mal compris. Un agent qui enchaîne des appels d'outils (MCP, function calling, boucles multi-étapes) a besoin avant tout de fiabilité sur le tool-calling — pas nécessairement du score de raisonnement le plus haut. Kimi K2.7 est aujourd'hui cité comme le modèle ouvert le plus fiable en contexte agentique long. Côté fermé, Sonnet 5 et Haiku 4.5 sont pensés spécifiquement pour ce régime : beaucoup d'appels, coût maîtrisé, comportement stable.

"Un agent qui appelle vingt outils par tâche n'a pas besoin du modèle le plus intelligent. Il a besoin du modèle qui ne se trompe jamais sur le format d'un appel de fonction."
Router une requête selon la tâche — logique de décision simplifiée
🎯 VOTRE REQUÊTE ⚡ SIMPLE / VOLUME résumer, classer, extraire → Haiku 4.5 DeepSeek Flash 💻 CODE COMPLEXE architecture, refactoring → GPT-5.6 Sol Claude Fable 5 🤖 AGENT + OUTILS MCP, boucles multi-étapes → Sonnet 5 Kimi K2.7 🔒 DONNÉES UE conformité, souveraineté → Mistral Large 3
Logique de routage simplifiée par cas d'usage — le détail par modèle est dans le tableau ci-dessous et la section 5.
Usage Modèle fermé recommandé Modèle open source recommandé
Code complexe / architecture GPT-5.6 Sol, Claude Fable 5 Kimi K3, Qwen 3 Coder
Tâche simple à volume Claude Haiku 4.5 DeepSeek V4 Flash, Qwen-Flash
Agent autonome / MCP Sonnet 5, Haiku 4.5 Kimi K2.7, Qwen 3.6 Plus
Contexte massif (livre, codebase) Gemini 3.1 Pro Llama 4 Scout (10M)
Données sensibles / RGPD Mistral Large 3 (auto-hébergeable)

6. Lire un Benchmark Sans Se Faire Avoir

MMLU, autrefois la référence, ne veut presque plus rien dire : la plupart des modèles frontière tapent 88-92%, l'écart n'est plus discriminant. Les benchmarks 2026 qui comptent vraiment sont différents.

GPQA Diamond mesure du raisonnement scientifique de niveau doctorat — le test le plus discriminant à la frontière actuelle. Claude domine ici avec 94,6%, suivi de près par Kimi K3 en tête des modèles ouverts à 93,5%.

SWE-bench Verified mesure la résolution de vrais tickets GitHub, pas des exercices synthétiques. C'est le benchmark coding le plus cité en 2026, avec GPT-5.6 Sol en tête à 96,2%.

Arena Elo (LMArena, ex-LMSYS) agrège des votes humains en aveugle sur des paires de réponses. Un score au-dessus de 1400 Elo est considéré frontière ; Opus 5 tourne autour de 1580.

Terminal-Bench évalue la capacité d'un modèle à utiliser un terminal comme le ferait un développeur — naviguer dans des fichiers, enchaîner des commandes, corriger une erreur en cours de route. C'est le benchmark qui se rapproche le plus d'un usage agentique réel, loin des questions à choix multiples.

Le score annonce-t-il vraiment la performance sur votre tâche ?

Non, pas directement. Un modèle peut dominer GPQA et rester médiocre sur votre cas d'usage précis — extraction de données structurées, respect strict d'un format de sortie, ton rédactionnel spécifique. Les benchmarks orientent, ils ne remplacent jamais un test sur vos propres prompts et vos propres données.

La méthode la plus fiable reste artisanale : prenez dix tâches réelles de votre activité, faites-les tourner sur deux ou trois modèles candidats, comparez à l'aveugle. Trente minutes de test valent plus que n'importe quel classement public pour votre cas précis.


7. Le Piège du Coût Réel : Les Tokens de Raisonnement Cachés

Le prix affiché sur la page pricing n'est presque jamais le prix payé. Deux mécanismes expliquent l'écart.

Premier mécanisme : les modèles "thinking" (GPT-5 en mode raisonnement, DeepSeek R1, et équivalents) génèrent des tokens de réflexion internes, invisibles dans la réponse finale, mais facturés comme tokens de sortie. Ce surcoût peut multiplier la facture réelle par 3 à 10 par rapport au prix affiché en tête de page.

Prix de sortie par million de tokens — échelle logarithmique (les petits prix seraient invisibles en échelle linéaire)
DeepSeek V4 Flash 0,28$ Mistral Large 3 1,50$ Qwen 3.6 Plus 3$ Kimi K3 15$ Claude Sonnet 5 15$ GPT-5.6 Sol 30$ Claude Fable 5 50$ ■ open source ■ fermé
Prix de sortie par million de tokens, modèles cités dans cet article. Longueur de barre non linéaire (échelle logarithmique) pour rendre les petits prix lisibles. Données : LLM Stats, TLDL, Artificial Analysis (juillet 2026).

Deuxième mécanisme : la fenêtre de contexte annoncée n'est presque jamais celle réellement exploitable. Des analyses portant sur 22 modèles frontière montrent qu'un modèle qui annonce 200 000 tokens devient souvent instable ou perd en qualité autour de 130 000 tokens en pratique — 60 à 70% du chiffre affiché.

Contexte annoncé vs contexte réellement exploitable — capacité effective en pratique
GPT-5.6 Sol — 1,1M annoncé → ≈770K utile (70%) Claude Sonnet 5 — 1M annoncé → ≈650K utile (65%) Gemini 3.1 Pro — 1M annoncé → ≈620K utile (62%) Llama 4 Scout — 10M annoncé → ≈6,5M utile (65%)
Estimation de la capacité de contexte réellement exploitable sans perte de qualité, à partir d'analyses portant sur 22 modèles frontière (juin 2026). La part grisée n'est pas "fausse" — elle devient simplement moins fiable au-delà du seuil effectif.
Ce qui change vraiment le calcul : le taux de cache hit et le ratio entrée/sortie de votre charge de travail pèsent souvent plus lourd que le prix du rate card. Un modèle "cher" avec un excellent taux de cache peut coûter moins qu'un modèle "pas cher" sans cache sur le même volume.

Ce qu'il faut faire avant de choisir un modèle sur la base du prix seul : simuler votre volume réel, avec vos ratios entrée/sortie réels, sur au moins deux fournisseurs. Le prix par million de tokens en tête de page n'est qu'un point de départ.

Concrètement : notez votre nombre moyen de requêtes par jour, la taille moyenne du prompt en entrée, et la taille moyenne de la réponse. Multipliez par les deux ou trois tarifs candidats. L'écart entre "prix affiché" et "facture réelle" saute aux yeux dès qu'on pose ces trois chiffres côte à côte — et c'est souvent là, pas dans le classement de benchmark, que se joue le choix final.


8. OpenRouter ou Ollama Pour Changer de Modèle

La vraie question n'est pas "quel modèle unique adopter", c'est "comment passer de l'un à l'autre sans reconstruire votre stack à chaque nouveau lancement". Deux outils répondent à ça, pour deux besoins différents.

OpenRouter agrège plus de 300 modèles derrière une seule clé API et un seul tableau de facturation. Vous changez de modèle par un paramètre de requête, sans réécrire votre application. C'est l'outil pour l'accès API à la demande — utile pour tester un nouveau modèle le jour de sa sortie sans créer un compte chez chaque fournisseur.

Ollama fait tourner les modèles en local, sur votre propre machine. Zéro coût par token — seul le matériel compte. Depuis la version 0.14 (janvier 2026), Ollama supporte nativement le format Anthropic Messages API, ce qui facilite le branchement d'outils déjà pensés pour Claude. Le vrai point faible reste documenté et récurrent : le tool-calling en local est nettement moins fiable qu'en API — le premier point de friction pour qui bascule un agent en local.

L'approche la plus pragmatique documentée en 2026 : Ollama en local pour les tâches routinières à volume (agents internes, génération de code répétitive), OpenRouter pour l'accès aux modèles frontière quand la qualité prime sur le coût. Les deux ne sont pas concurrents — ils couvrent deux moitiés du même problème.

Sur le plan du coût, OpenRouter facture le même tarif que le fournisseur d'origine plus une marge de quelques points de pourcentage — vous ne payez pas plus cher pour la commodité d'une seule facture, mais vous ne payez pas moins non plus. Ollama, à l'inverse, n'a pas de coût par token : la seule dépense est le matériel (GPU local ou instance cloud dédiée), ce qui devient rentable au-delà d'un certain volume mensuel de requêtes.

Les pépites que personne ne surveille : MiniMax M3 et GLM-5.2. Le premier introduit une architecture d'attention parcimonieuse qui divise par 20 le coût de calcul sur 1M tokens de contexte, avec un score de raisonnement (93% GPQA Diamond) juste derrière Kimi K3. Le second combine licence permissive, contexte long et function calling fiable — sans le battage médiatique de DeepSeek ou Qwen. Les deux tiennent la comparaison avec des modèles bien plus connus, pour une fraction de leur visibilité presse.
Red flags à éviter
  • Comparer sur le prix affiché seul : les tokens de raisonnement cachés peuvent multiplier la facture réelle par 3 à 10. Simulez toujours sur votre volume réel avant de trancher.
  • Croire la fenêtre de contexte annoncée : un modèle à 200K tokens annoncés tient rarement au-delà de 130K en pratique. Testez sur vos propres documents longs avant de vous y fier pour une tâche critique.
  • Basculer un agent critique sur Ollama sans tester le tool-calling : c'est le point de défaillance le plus documenté du passage au local — vérifiez la fiabilité des appels d'outils avant de retirer l'API cloud.
  • Ignorer un modèle par nationalité plutôt que par mérite : six des dix meilleurs modèles ouverts au monde sont chinois en 2026. Écarter ce bloc par principe coûte cher sur le rapport qualité-prix, à condition d'auto-héberger les données sensibles plutôt que de dépendre d'une API distante.

Tableau de décision par profil

ProfilModèle recommandéPourquoi
Développeur, tickets complexesGPT-5.6 Sol ou Claude Fable 5Scores SWE-bench les plus hauts du marché (96%/95%)
Freelance, usage généralClaude Sonnet 5 ou DeepSeek V4 ProMeilleur compromis qualité/prix sur volume varié
Micro-tâches à haut volumeClaude Haiku 4.5 ou DeepSeek V4 FlashCoût quasi nul par tâche individuelle
Équipe voulant auto-hébergerQwen 3.6 Plus, GLM-5.2 ou DeepSeekLicence permissive, zéro dépendance à une API
Entreprise européenne, RGPD strictMistral Large 3Seul modèle frontière hébergé physiquement en UE
Agent autonome, beaucoup d'outilsKimi K2.7 ou Sonnet 5 / Haiku 4.5Fiabilité du tool-calling avant tout
Documents ou codebase énormesLlama 4 Scout ou Gemini 3.1 ProFenêtres de contexte record (10M et 1M-10M tokens)

Questions Fréquentes

Quel est le meilleur LLM en 2026 ?

Il n'y en a pas un seul. Claude Opus 5 domine les classements généraux d'intelligence. GPT-5.6 Sol reste devant sur le coding pur (SWE-bench). Kimi K3 est le meilleur modèle ouvert, DeepSeek V4 Pro le meilleur rapport qualité-prix, et Mistral Large 3 le seul choix souverain européen. Le "meilleur" dépend de la tâche et du budget, pas d'un classement unique.

Les modèles chinois (DeepSeek, Qwen, Kimi) sont-ils fiables pour des données professionnelles ?

Techniquement, oui sur la qualité des réponses — plusieurs tiennent la comparaison avec la frontière fermée. Sur la question des données, la réponse dépend de l'usage : passer par l'API cloud du fournisseur pose les mêmes questions de souveraineté qu'avec n'importe quel service distant. Auto-héberger les poids ouverts (DeepSeek, Qwen, GLM sont tous open source) sur votre propre infrastructure règle ce point pour les données sensibles.

Pourquoi ma facture API est plus élevée que prévu alors que le prix affiché était bas ?

Deux raisons documentées : les tokens de raisonnement internes des modèles "thinking" sont facturés comme sortie sans apparaître dans la réponse, et peuvent multiplier le coût réel par 3 à 10. Et le taux de cache hit sur vos prompts répétés change souvent plus le total que le tarif affiché lui-même.

Faut-il choisir OpenRouter ou Ollama pour changer de modèle ?

Les deux, pour deux usages différents. OpenRouter pour l'accès API à la demande à 300+ modèles sans multiplier les comptes fournisseurs. Ollama pour faire tourner un modèle en local, sans coût par token, au prix d'un tool-calling moins fiable pour les usages agentiques.

Existe-t-il une alternative européenne crédible à Claude, GPT ou Gemini ?

Une seule aujourd'hui à ce niveau : Mistral Large 3. Il reste derrière la frontière absolue sur les benchmarks de raisonnement les plus durs, mais c'est le seul modèle de cette envergure hébergé et gouverné sur le sol européen — un argument qui compte dès que la conformité RGPD ou la souveraineté des données entre dans la décision.


Articles Liés

Résumé : il n'existe pas un meilleur LLM en 2026, seulement le meilleur modèle pour une tâche et un budget donnés. Frontière fermée (Claude, GPT, Gemini) pour la fiabilité maximale, open source chinois (DeepSeek, Qwen, Kimi) pour le rapport qualité-prix, Mistral pour la souveraineté européenne — et OpenRouter ou Ollama pour passer de l'un à l'autre sans reconstruire votre stack.

Article publié le 2 août 2026 | Catégorie : Comparatifs | 20 min de lecture | Sources : LLM Stats, LM Council, Artificial Analysis, Anthropic, données vérifiées juillet-août 2026