MiniCPM5-2B : un petit LLM local peut-il vraiment rivaliser avec un 4B ?
Le chiffre qui fait le tour des réseaux est séduisant : 53,9 de moyenne pour MiniCPM5-2B, contre 51,1 pour Qwen3.5-4B dans le tableau d'OpenBMB. Pour un usage local, la vraie question est moins spectaculaire : que peut-on réellement lui confier sur sa propre machine ?
Le modèle compte environ 2,52 milliards de paramètres, dispose d'un contexte natif de 131 072 tokens et est publié sous licence Apache-2.0.
Artificial Analysis l'affiche actuellement à 13 sur l'Intelligence Index v4.3. Le score de lancement était 15 avec la version v4.2.
Le français n'est pas listé parmi les langues officielles du modèle. Les performances francophones ne doivent donc pas être déduites des benchmarks anglais.
Pourquoi ce 2B mérite davantage qu'un simple « benchmark impressionnant »
Les petits modèles ont longtemps été intéressants pour une raison essentiellement économique : ils coûtaient moins cher, occupaient moins de mémoire et répondaient plus vite, mais il fallait accepter une baisse nette de qualité. MiniCPM5-2B brouille cette frontière. Il reste petit, mais ses scores montrent qu'il peut prendre en charge une partie des tâches que l'on réservait récemment à des modèles plus lourds.
Cette évolution compte particulièrement pour l'IA locale. Un modèle compact peut rester chargé sur un poste de travail, un mini-PC ou une machine personnelle et traiter des documents sans envoyer chaque requête à une API distante. Cela ne crée pas automatiquement une solution « privée » : il faut aussi vérifier l'interface, la télémétrie et les outils connectés. Mais le modèle lui-même rend ce type d'architecture beaucoup plus réaliste.
Ce que l'on sait du modèle
| Caractéristique | Valeur | Lecture pratique |
|---|---|---|
| Paramètres | 2,516 milliards | Un format compact face aux modèles 4B, 8B ou plus. |
| Architecture | LlamaForCausalLM, 42 couches | Compatibilité plus simple avec des moteurs courants. |
| Contexte | 131 072 tokens | Intéressant pour des documents longs, sous réserve de la mémoire disponible pour le KV cache. |
| Licence | Apache-2.0 | Une base permissive pour expérimenter et intégrer le modèle. |
| Langues officielles | anglais, chinois | Le français nécessite une validation séparée. |
| Formats locaux | GGUF, MLX 4-bit, GPTQ, BF16 | Plusieurs chemins existent pour PC, Mac et serveurs locaux. |
OpenBMB documente llama.cpp, Ollama, LM Studio, MLX, vLLM et SGLang. Pour le tool calling, le projet recommande spécifiquement SGLang. C'est un détail important : un bon modèle local qui nécessite une pile exotique perd vite son intérêt pratique.
53,9 contre 51,1 : ce que dit vraiment le tableau d'OpenBMB
Dans les 34 évaluations choisies par OpenBMB, MiniCPM5-2B obtient une moyenne de 53,9. Qwen3.5-4B atteint 51,1. Le petit modèle est notamment très performant sur LiveCodeBench v6 (69,1), AIME 2026 (86,5), BFCL v4 (66,6), τ²-Bench Telecom (97,1) et SWE-bench Verified (46,4).
La tentation est d'en conclure qu'un 2B « bat » un 4B. Ce raccourci est trompeur. Sur SWE-bench Pro, MiniCPM5-2B tombe à 14,4 alors que Qwen3.5-4B atteint 28,2. Sur Terminal-Bench v2.1, l'écart est encore plus parlant : 8,6 contre 25,8. MMLU-Pro favorise également le modèle plus grand, 78,0 contre 70,8.
| Type de tâche | Signal observé | Conclusion raisonnable |
|---|---|---|
| Raisonnement code | Très fort sur LiveCodeBench | Excellent rapport capacité/taille pour des tâches bornées. |
| Mathématiques | AIME très élevé | Le raisonnement est un vrai point fort, pas seulement un argument marketing. |
| Appels d'outils | BFCL et τ²-Bench solides | Bon candidat pour un agent local encadré. |
| Ingénierie logicielle longue | SWE-bench Pro en retrait | Ne pas lui déléguer un dépôt entier sans supervision. |
| Terminal autonome | Terminal-Bench faible face au 4B | Les boucles longues et ambiguës restent difficiles. |
Le score d'Artificial Analysis a changé : c'est plutôt une bonne leçon
Au lancement, Artificial Analysis annonçait un score de 15 avec l'Intelligence Index v4.2, alors présenté comme le meilleur résultat parmi les modèles open-weight de moins de 4B paramètres. Au 15 septembre, la page du modèle utilise la version v4.3 et affiche 13.
Ce n'est pas nécessairement une régression du modèle. Le protocole, les évaluations et les pondérations évoluent. Il faut donc conserver la version du benchmark avec le chiffre pour éviter de transformer un classement temporaire en vérité absolue.
Pour l'auto-hébergement, le point fort est la spécialisation
Le meilleur rôle de MiniCPM5-2B n'est probablement pas celui d'un chatbot universel. Il est plus intéressant comme composant discret d'une chaîne locale : extraction d'informations, résumé de notes, classement de documents, génération de petits blocs de code, préparation d'appels d'outils, ou traitement de tâches répétitives avant de transmettre les cas difficiles à un modèle plus gros.
Cette organisation correspond bien à une logique d'auto-hébergement pragmatique. Inutile de mobiliser un modèle lourd pour chaque étape si un 2,5B sait traiter correctement 70 ou 80 % des requêtes courantes. On réserve alors le modèle coûteux — local ou distant — à la partie réellement difficile.
Les retours de la communauté sont prometteurs, mais contradictoires
Dans le fil de lancement de r/LocalLLaMA, un utilisateur explique que MiniCPM5-2B est meilleur que Qwen3.5-4B pour son usage précis de résumé structuré et d'extraction de compétences dans Hermes. Un autre raconte avoir caché une phrase étrange dans un article scientifique d'environ 76K tokens : le modèle l'a retrouvée, mais a échoué sur un petit test de raisonnement dit « car wash ».
Ce genre de contradiction ressemble beaucoup plus à la réalité d'un petit modèle qu'un classement unique. Un LLM peut être excellent en rappel long contexte et décevant sur un raisonnement simple. Il peut très bien respecter un schéma JSON et se perdre après dix actions successives. Ces témoignages sont utiles pour choisir des cas de test, mais ils ne remplacent pas une évaluation reproductible.
Et pour travailler en français ? Prudence
Le model card officiel liste l'anglais et le chinois. Pour un usage en France, en Belgique, en Suisse ou au Québec, il faut vérifier au minimum la compréhension d'instructions, les accents, le registre, les formulations administratives, la qualité des résumés et la stabilité du tool calling avec des entrées françaises.
Pour une chaîne de traitement documentaire, un résultat « assez bon » peut déjà être intéressant si l'on garde les données sur la machine. Pour de la rédaction éditoriale, du support client ou des textes à forte nuance culturelle, je comparerais systématiquement avec un modèle réellement entraîné et évalué sur le français.
Confidentialité : local ne veut pas dire automatiquement privé
L'intérêt de ce type de modèle est évident pour des documents sensibles : contrats, notes internes, exports de données, brouillons ou archives personnelles peuvent être traités sans envoi vers une API, si l'ensemble de l'application reste local. Le navigateur, le runtime, les extensions, les outils appelés et la télémétrie comptent autant que les poids du modèle.
C'est aussi la philosophie que nous appliquons aux outils de CreatorPrivacyKit : réduire les transferts inutiles et effectuer localement les opérations qui peuvent l'être.
Verdict
MiniCPM5-2B n'est pas intéressant parce qu'il « tue les 4B ». Il est intéressant parce qu'il rend crédible une nouvelle catégorie d'usage : un petit LLM local assez compétent pour effectuer du vrai travail, sans réserver toute la machine à l'inférence.
Je le testerais volontiers pour des pipelines locaux, des agents auxiliaires, de la structuration, du résumé et des outils internes. Je ne le choisirais pas sans validation pour du français éditorial exigeant, ni pour une autonomie longue sur un shell ou un gros dépôt logiciel.
Le bon modèle mental n'est donc pas « petit modèle contre gros modèle ». C'est petit modèle pour les tâches simples, modèle plus puissant pour la longue traîne difficile.
Sources
- OpenBMB — MiniCPM5-2B : spécifications, langues, formats et benchmarks officiels.
- Artificial Analysis — MiniCPM5-2B : score indépendant actuel.
- Artificial Analysis — article de lancement : score v4.2 publié le 7 septembre.
- r/LocalLLaMA — fil de lancement : retours communautaires non contrôlés.
Faire local quand le serveur n'est pas nécessaire
CreatorPrivacyKit rassemble des outils qui privilégient le traitement dans le navigateur pour les tâches qui peuvent rester sur l'appareil.
Voir les outils locaux →