Field notes / IA locale
IA locale · analyse

MiniCPM5-2B : un petit LLM local peut-il vraiment rivaliser avec un 4B ?

Le chiffre qui fait le tour des réseaux est séduisant : 53,9 de moyenne pour MiniCPM5-2B, contre 51,1 pour Qwen3.5-4B dans le tableau d'OpenBMB. Pour un usage local, la vraie question est moins spectaculaire : que peut-on réellement lui confier sur sa propre machine ?

Publié le 15 septembre 2026 · CreatorPrivacyKit Research

Établi

Le modèle compte environ 2,52 milliards de paramètres, dispose d'un contexte natif de 131 072 tokens et est publié sous licence Apache-2.0.

Mesure indépendante

Artificial Analysis l'affiche actuellement à 13 sur l'Intelligence Index v4.3. Le score de lancement était 15 avec la version v4.2.

À vérifier selon l'usage

Le français n'est pas listé parmi les langues officielles du modèle. Les performances francophones ne doivent donc pas être déduites des benchmarks anglais.

Pourquoi ce 2B mérite davantage qu'un simple « benchmark impressionnant »

Les petits modèles ont longtemps été intéressants pour une raison essentiellement économique : ils coûtaient moins cher, occupaient moins de mémoire et répondaient plus vite, mais il fallait accepter une baisse nette de qualité. MiniCPM5-2B brouille cette frontière. Il reste petit, mais ses scores montrent qu'il peut prendre en charge une partie des tâches que l'on réservait récemment à des modèles plus lourds.

Cette évolution compte particulièrement pour l'IA locale. Un modèle compact peut rester chargé sur un poste de travail, un mini-PC ou une machine personnelle et traiter des documents sans envoyer chaque requête à une API distante. Cela ne crée pas automatiquement une solution « privée » : il faut aussi vérifier l'interface, la télémétrie et les outils connectés. Mais le modèle lui-même rend ce type d'architecture beaucoup plus réaliste.

Ce que l'on sait du modèle

CaractéristiqueValeurLecture pratique
Paramètres2,516 milliardsUn format compact face aux modèles 4B, 8B ou plus.
ArchitectureLlamaForCausalLM, 42 couchesCompatibilité plus simple avec des moteurs courants.
Contexte131 072 tokensIntéressant pour des documents longs, sous réserve de la mémoire disponible pour le KV cache.
LicenceApache-2.0Une base permissive pour expérimenter et intégrer le modèle.
Langues officiellesanglais, chinoisLe français nécessite une validation séparée.
Formats locauxGGUF, MLX 4-bit, GPTQ, BF16Plusieurs chemins existent pour PC, Mac et serveurs locaux.

OpenBMB documente llama.cpp, Ollama, LM Studio, MLX, vLLM et SGLang. Pour le tool calling, le projet recommande spécifiquement SGLang. C'est un détail important : un bon modèle local qui nécessite une pile exotique perd vite son intérêt pratique.

53,9 contre 51,1 : ce que dit vraiment le tableau d'OpenBMB

Dans les 34 évaluations choisies par OpenBMB, MiniCPM5-2B obtient une moyenne de 53,9. Qwen3.5-4B atteint 51,1. Le petit modèle est notamment très performant sur LiveCodeBench v6 (69,1), AIME 2026 (86,5), BFCL v4 (66,6), τ²-Bench Telecom (97,1) et SWE-bench Verified (46,4).

La tentation est d'en conclure qu'un 2B « bat » un 4B. Ce raccourci est trompeur. Sur SWE-bench Pro, MiniCPM5-2B tombe à 14,4 alors que Qwen3.5-4B atteint 28,2. Sur Terminal-Bench v2.1, l'écart est encore plus parlant : 8,6 contre 25,8. MMLU-Pro favorise également le modèle plus grand, 78,0 contre 70,8.

Type de tâcheSignal observéConclusion raisonnable
Raisonnement codeTrès fort sur LiveCodeBenchExcellent rapport capacité/taille pour des tâches bornées.
MathématiquesAIME très élevéLe raisonnement est un vrai point fort, pas seulement un argument marketing.
Appels d'outilsBFCL et τ²-Bench solidesBon candidat pour un agent local encadré.
Ingénierie logicielle longueSWE-bench Pro en retraitNe pas lui déléguer un dépôt entier sans supervision.
Terminal autonomeTerminal-Bench faible face au 4BLes boucles longues et ambiguës restent difficiles.

Le score d'Artificial Analysis a changé : c'est plutôt une bonne leçon

Au lancement, Artificial Analysis annonçait un score de 15 avec l'Intelligence Index v4.2, alors présenté comme le meilleur résultat parmi les modèles open-weight de moins de 4B paramètres. Au 15 septembre, la page du modèle utilise la version v4.3 et affiche 13.

Ce n'est pas nécessairement une régression du modèle. Le protocole, les évaluations et les pondérations évoluent. Il faut donc conserver la version du benchmark avec le chiffre pour éviter de transformer un classement temporaire en vérité absolue.

Pour l'auto-hébergement, le point fort est la spécialisation

Le meilleur rôle de MiniCPM5-2B n'est probablement pas celui d'un chatbot universel. Il est plus intéressant comme composant discret d'une chaîne locale : extraction d'informations, résumé de notes, classement de documents, génération de petits blocs de code, préparation d'appels d'outils, ou traitement de tâches répétitives avant de transmettre les cas difficiles à un modèle plus gros.

Cette organisation correspond bien à une logique d'auto-hébergement pragmatique. Inutile de mobiliser un modèle lourd pour chaque étape si un 2,5B sait traiter correctement 70 ou 80 % des requêtes courantes. On réserve alors le modèle coûteux — local ou distant — à la partie réellement difficile.

Les retours de la communauté sont prometteurs, mais contradictoires

Dans le fil de lancement de r/LocalLLaMA, un utilisateur explique que MiniCPM5-2B est meilleur que Qwen3.5-4B pour son usage précis de résumé structuré et d'extraction de compétences dans Hermes. Un autre raconte avoir caché une phrase étrange dans un article scientifique d'environ 76K tokens : le modèle l'a retrouvée, mais a échoué sur un petit test de raisonnement dit « car wash ».

Ce genre de contradiction ressemble beaucoup plus à la réalité d'un petit modèle qu'un classement unique. Un LLM peut être excellent en rappel long contexte et décevant sur un raisonnement simple. Il peut très bien respecter un schéma JSON et se perdre après dix actions successives. Ces témoignages sont utiles pour choisir des cas de test, mais ils ne remplacent pas une évaluation reproductible.

Et pour travailler en français ? Prudence

Le model card officiel liste l'anglais et le chinois. Pour un usage en France, en Belgique, en Suisse ou au Québec, il faut vérifier au minimum la compréhension d'instructions, les accents, le registre, les formulations administratives, la qualité des résumés et la stabilité du tool calling avec des entrées françaises.

Pour une chaîne de traitement documentaire, un résultat « assez bon » peut déjà être intéressant si l'on garde les données sur la machine. Pour de la rédaction éditoriale, du support client ou des textes à forte nuance culturelle, je comparerais systématiquement avec un modèle réellement entraîné et évalué sur le français.

Confidentialité : local ne veut pas dire automatiquement privé

L'intérêt de ce type de modèle est évident pour des documents sensibles : contrats, notes internes, exports de données, brouillons ou archives personnelles peuvent être traités sans envoi vers une API, si l'ensemble de l'application reste local. Le navigateur, le runtime, les extensions, les outils appelés et la télémétrie comptent autant que les poids du modèle.

C'est aussi la philosophie que nous appliquons aux outils de CreatorPrivacyKit : réduire les transferts inutiles et effectuer localement les opérations qui peuvent l'être.

Attention au contexte 128K : un modèle qui accepte 131 072 tokens sur le papier n'implique pas que votre machine puisse utiliser cette fenêtre confortablement. Le KV cache, la quantification, le batch et le nombre de sessions simultanées peuvent devenir la vraie limite.

Verdict

MiniCPM5-2B n'est pas intéressant parce qu'il « tue les 4B ». Il est intéressant parce qu'il rend crédible une nouvelle catégorie d'usage : un petit LLM local assez compétent pour effectuer du vrai travail, sans réserver toute la machine à l'inférence.

Je le testerais volontiers pour des pipelines locaux, des agents auxiliaires, de la structuration, du résumé et des outils internes. Je ne le choisirais pas sans validation pour du français éditorial exigeant, ni pour une autonomie longue sur un shell ou un gros dépôt logiciel.

Le bon modèle mental n'est donc pas « petit modèle contre gros modèle ». C'est petit modèle pour les tâches simples, modèle plus puissant pour la longue traîne difficile.

Sources

Faire local quand le serveur n'est pas nécessaire

CreatorPrivacyKit rassemble des outils qui privilégient le traitement dans le navigateur pour les tâches qui peuvent rester sur l'appareil.

Voir les outils locaux →