MiniCPM5-2B a prueba: qué puede hacer de verdad un LLM local de 2,5B
La pregunta interesante no es si un modelo de 2,5B “gana” a uno de 4B en una tabla. Es si puede resolver trabajo útil en tu propio equipo sin convertir cada tarea en una llamada de pago a una API.
MiniCPM5-2B tiene 2.516 millones de parámetros, contexto nativo de 131.072 tokens y licencia Apache-2.0.
Artificial Analysis lo sitúa actualmente en 13 puntos con Intelligence Index v4.3; el día de lanzamiento obtuvo 15 con v4.2.
El model card oficial solo lista inglés y chino. El español necesita pruebas propias antes de usarlo para texto de cara al usuario.
Por qué un modelo tan pequeño puede ser más útil que otro “más inteligente”
En local, el mejor modelo no siempre es el que encabeza un ranking. Importan la memoria, la velocidad, la posibilidad de mantener varias tareas activas, el consumo del KV cache y lo fácil que sea integrarlo con herramientas. Un modelo pequeño que resuelve bien tareas repetitivas puede aportar más valor que uno grande que obliga a cerrar el resto de aplicaciones o a mover todo a la nube.
Ese es el atractivo de MiniCPM5-2B. OpenBMB no lo presenta como un chatbot gigante reducido, sino como un modelo para asistentes locales, agentes de programación, tool calling y razonamiento con recursos limitados. Además, ofrece rutas oficiales para GGUF, MLX 4-bit, GPTQ, vLLM y SGLang.
Ficha rápida
| Dato | MiniCPM5-2B | Qué significa en la práctica |
|---|---|---|
| Parámetros | 2,516B | Huella pequeña frente a modelos de 4B, 8B o más. |
| Arquitectura | LlamaForCausalLM, 42 capas | Mejor compatibilidad con runtimes ya conocidos. |
| Contexto | 131.072 tokens | Puede trabajar con documentos largos si el hardware soporta el KV cache. |
| Licencia | Apache-2.0 | Permite integraciones comerciales con una licencia abierta y conocida. |
| Idiomas oficiales | inglés, chino | El español no debe darse por bueno sin evaluación. |
| Formatos | BF16, GGUF, MLX 4-bit, GPTQ | Opciones tanto para escritorio como para servidor local. |
El famoso 53,9: impresionante, pero no es una sentencia
OpenBMB publica una media de 53,9 para MiniCPM5-2B en su conjunto de 34 pruebas. En la misma tabla, Qwen3.5-4B marca 51,1. Para un modelo de este tamaño, es una señal fuerte.
También hay resultados concretos difíciles de ignorar: 69,1 en LiveCodeBench v6, 86,5 en AIME 2026, 66,6 en BFCL v4, 97,1 en τ²-Bench Telecom y 46,4 en SWE-bench Verified.
Pero la misma tabla evita que nos pasemos de entusiasmo. Qwen3.5-4B llega a 28,2 en SWE-bench Pro frente a 14,4 de MiniCPM5-2B, y a 25,8 en Terminal-Bench v2.1 frente a 8,6. En MMLU-Pro también gana el 4B, 78,0 frente a 70,8.
| Uso | Lo que sugieren los datos | Nivel de confianza |
|---|---|---|
| Generar o razonar sobre código corto | Muy competitivo para su tamaño | Alto dentro del conjunto oficial |
| Matemáticas | Uno de sus puntos fuertes | Alto dentro del conjunto oficial |
| Tool calling | Buen candidato para agentes acotados | Prometedor |
| Modificar repositorios grandes durante mucho tiempo | El tamaño se nota | Precaución |
| Operar un terminal de forma autónoma | Muy por detrás del 4B comparado | Precaución alta |
La medición independiente ha cambiado de 15 a 13
Artificial Analysis publicó el 7 de septiembre un resultado de 15 con Intelligence Index v4.2, que entonces colocaba a MiniCPM5-2B en una posición excepcional entre los modelos open-weight de menos de 4B parámetros. La página actual utiliza v4.3 y muestra 13.
Esto no invalida el lanzamiento. Un benchmark tiene versión: si cambia la mezcla de pruebas o su peso, el número también cambia. Conviene conservar la versión junto al resultado: 13 en v4.3 y 15 en v4.2.
¿Qué haría yo con MiniCPM5-2B en un PC normal?
Lo usaría como modelo auxiliar. Por ejemplo: resumir documentos, extraer campos, clasificar correos o notas, transformar texto a una estructura fija, preparar llamadas a herramientas, generar pequeños fragmentos de código, revisar resultados de otro proceso o decidir qué tareas merecen escalar a un modelo mayor.
Ese enfoque permite ahorrar recursos sin apostar todo a un modelo pequeño. Si el 2,5B resuelve bien la parte rutinaria, un 8B, 27B o un servicio en la nube puede reservarse para casos ambiguos o complejos.
Los usuarios ya están encontrando esa función de “modelo auxiliar”
En el hilo de lanzamiento de r/LocalLLaMA, un usuario comenta que para su flujo de resumen estructurado y extracción de skills dentro de Hermes le funciona mejor que Qwen3.5-4B y además responde más rápido. Otro usuario cuenta una prueba distinta: introdujo una frase rara en un paper científico de unas 76K tokens y MiniCPM5-2B consiguió encontrarla, aunque luego falló un test de razonamiento mucho más pequeño conocido como “car wash”.
No hay contradicción. Un LLM puede ser muy bueno recuperando información de un contexto enorme y cometer un error absurdo en una pregunta corta. También puede acertar llamadas de herramientas en un flujo fijo y degradarse cuando la tarea exige veinte decisiones encadenadas. Para un modelo pequeño, esa irregularidad es justo lo que hay que medir.
Sin pagar API no significa “gratis”
Ejecutar el modelo en local elimina el coste por token de una API, pero el coste cambia de forma: hardware, electricidad, tiempo de configuración y memoria. Aun así, para tareas frecuentes la economía puede ser muy atractiva, sobre todo si ya tienes el equipo encendido.
También hay un beneficio que no cabe bien en una calculadora: los datos pueden quedarse en tu máquina. Para documentos personales, borradores, bases de conocimiento pequeñas o automatizaciones internas, esa posibilidad puede valer más que ahorrar unos céntimos por consulta.
¿Y en español?
Aquí conviene frenar el hype. Hugging Face lista oficialmente inglés y chino. Que MiniCPM5-2B entienda prompts en español no equivale a estar optimizado para español. Antes de usarlo para soporte, copy, educación o contenido público, probaría expresiones idiomáticas, instrucciones largas, nombres propios, concordancia, registros formales e informales y consistencia en conversaciones prolongadas.
Para tareas estructuradas —extraer datos de una factura, clasificar un texto, devolver JSON o resumir con una plantilla— puede ser suficiente incluso si su estilo de escritura no es perfecto. Para contenido editorial, la barra debe ser más alta.
Contexto de 128K: útil, pero no confundas límite lógico con memoria disponible
Los 131.072 tokens son una característica oficial del modelo. No son una promesa de que cualquier portátil vaya a manejar esa ventana a velocidad cómoda. El KV cache crece con el contexto y la concurrencia; la cuantización de los pesos no elimina ese coste.
En uso real empezaría con una ventana razonable para el hardware, mediría latencia y memoria, y solo subiría el contexto cuando la tarea lo necesite.
Conclusión: merece la pena si dejas de pedirle que sea “tu único modelo”
MiniCPM5-2B es interesante porque cambia la frontera de lo que consideramos viable en local. Ya no hablamos de un modelo diminuto que solo completa frases: puede razonar, programar, manejar herramientas y trabajar con contextos largos lo bastante bien como para formar parte de un sistema real.
Sus resultados más débiles también son claros. Si necesitas autonomía prolongada, cambios complejos en repositorios, conocimiento amplio o calidad nativa en español, un modelo mayor sigue teniendo ventaja.
Mi lectura práctica es sencilla: MiniCPM5-2B para el trabajo frecuente y acotado; un modelo más grande para los casos difíciles. Esa combinación es más interesante que cualquier titular de “2B vence a 4B”.
Fuentes
- OpenBMB — MiniCPM5-2B — especificaciones, idiomas, formatos y resultados oficiales.
- Artificial Analysis — ficha actual — Intelligence Index v4.3.
- Artificial Analysis — análisis de lanzamiento — resultado v4.2.
- r/LocalLLaMA — hilo de lanzamiento — experiencias tempranas, no controladas.
Más trabajo local, menos datos enviados sin necesidad
CreatorPrivacyKit aplica la misma idea a sus utilidades: si una tarea puede ejecutarse en el navegador, preferimos mantenerla en el dispositivo.
Explorar herramientas locales →