Conseguir que un modelo de 27.000 millones de parámetros funcione en un teléfono parecía poco realista. En precisión de 16 bits, un sistema de este tamaño puede ocupar alrededor de 54 GB y quedar fuera del alcance de la mayoría de dispositivos personales. Bonsai 27B reduce esa cifra hasta los 3,9 GB en su versión más compacta.
El resultado es relevante porque permite ejecutar razonamiento, programación y análisis de documentos sin depender continuamente de servidores externos. Sin embargo, el titular necesita contexto: Bonsai 27B no convierte un móvil en un sustituto de los modelos más avanzados de la nube y sus 3,9 GB no representan toda la memoria necesaria para utilizarlo.
¿Qué es Bonsai 27B?
Bonsai 27B es una familia de modelos de baja precisión presentada por PrismML en julio de 2026. Está basada en Qwen3.6-27B, por lo que no es un modelo fundacional entrenado desde cero, sino una adaptación que conserva su arquitectura y reduce drásticamente el espacio ocupado por sus pesos.
Sus pesos se pueden descargar bajo licencia Apache 2.0, lo que permite estudiarlo, modificarlo e incorporarlo a proyectos comerciales respetando las condiciones de la licencia.
Cuenta con unos 27.300 millones de parámetros para lenguaje y un componente adicional dedicado a la visión. Su arquitectura combina atención lineal y atención convencional, una decisión que ayuda a controlar el crecimiento de la memoria cuando aumenta la longitud del contexto.
PrismML ofrece dos variantes:
| Versión | Representación | Tamaño aproximado | Enfoque |
|---|---|---|---|
| Bonsai 27B 1-bit | Negativo o positivo | 3,9 GB | Móviles y equipos con poca memoria |
| Ternary Bonsai 27B | Negativo, cero o positivo | 7,2 GB en GGUF | Mayor calidad en portátiles y GPU |
En el caso de la versión ternaria se habla en ocasiones de 5,9 GB, pero esa cifra es el mínimo teórico de su representación. El archivo GGUF disponible actualmente ocupa cerca de 7,2 GB porque cada peso se almacena dentro de un espacio de 2 bits.
¿Cómo consigue ocupar tan poco?
Un modelo convencional suele guardar cada peso mediante números de 16 bits. Bonsai sustituye esa representación por alternativas mucho más sencillas. La edición binaria utiliza dos posibles valores, mientras que la ternaria añade el cero como tercera opción. Cada grupo de pesos comparte después un factor de escala que permite aproximarse al comportamiento del modelo original.
La diferencia respecto a muchas cuantizaciones habituales es que PrismML aplica la baja precisión prácticamente a toda la red: embeddings, atención, capas internas y salida. El componente de visión se mantiene en 4 bits.
La versión binaria necesita aproximadamente 1,125 bits efectivos por peso y resulta unas catorce veces más pequeña que el modelo en FP16. La ternaria ocupa más, pero dispone de una representación algo más expresiva y conserva mejor el comportamiento original.
Capacidades principales
Bonsai 27B mantiene buena parte de las funciones de Qwen3.6-27B:
- Razonamiento en modo thinking para problemas que requieren varios pasos.
- Generación, explicación y revisión de código.
- Comprensión de imágenes, capturas de pantalla y documentos.
- OCR para extraer e interpretar texto visible.
- Llamadas estructuradas a herramientas y producción de JSON.
- Integración en agentes y flujos de trabajo con MCP.
- Una ventana de contexto máxima de 262.000 tokens.
- Ejecución local, sin conexión y sin enviar necesariamente los datos a la nube.
Es un modelo multimodal de entrada: puede recibir texto e imágenes y responder con texto. No es un generador de imágenes.
También incorpora decodificación especulativa. Un modelo auxiliar propone varios tokens y Bonsai comprueba cuáles puede aceptar. El sistema busca acelerar la respuesta sin alterar la distribución final del modelo principal.
Rendimiento: qué mantiene y qué pierde
En las pruebas publicadas por PrismML, Qwen3.6-27B en FP16 obtiene un promedio de 85,07 puntos sobre quince evaluaciones. Ternary Bonsai 27B alcanza 80,49 y la versión de 1 bit se queda en 76,11.
La empresa resume estos resultados afirmando que la edición ternaria conserva alrededor del 95 % de la calidad del modelo original y la binaria cerca del 90 %. Es una forma útil de comparar las versiones, pero no significa que mantengan ese porcentaje en cualquier tarea.
La pérdida es relativamente pequeña en matemáticas y programación. Resulta más visible en seguimiento de instrucciones, uso prolongado de herramientas y visión. La diferencia también aumenta cuando el modelo tiene que coordinar numerosos pasos dentro de un agente o interpretar información visual compleja.
Además, el lanzamiento es muy reciente. Las cifras disponibles proceden principalmente del propio desarrollador y todavía faltan evaluaciones independientes amplias, especialmente en español, conversaciones largas y entornos empresariales reales.
¿Puede funcionar realmente en un móvil?
Sí, aunque no en cualquier teléfono ni con todas sus prestaciones al máximo. PrismML ha mostrado la versión de 1 bit funcionando en un iPhone 17 Pro Max a una velocidad aproximada de 11 tokens por segundo. En ordenadores Apple, la empresa declara alrededor de 26 tokens por segundo con un M4 Pro, 44 con un M5 Pro y 66 con un M5 Max.
Los 3,9 GB corresponden únicamente a los pesos del modelo. Al añadir el programa, las activaciones y la memoria utilizada por la conversación, el consumo real aumenta. Con un contexto de 4.000 tokens puede rondar los 5,2 GB. Utilizar los 262.000 tokens anunciados puede elevar el máximo hasta unos 9,4 GB incluso comprimiendo la caché.
Por tanto, un móvil puede ejecutar el modelo y mantener conversaciones razonables, pero no necesariamente aprovechar toda su ventana de contexto. Los límites de memoria del sistema operativo y la temperatura también afectan al rendimiento sostenido.
El modelo se distribuye en formatos como GGUF y MLX. La versión binaria puede funcionar con compilaciones recientes compatibles de llama.cpp, mientras que la ternaria todavía puede requerir las herramientas adaptadas por PrismML. La instalación no es tan inmediata como descargar una aplicación convencional.
¿Para qué puede servir en una empresa?
La principal ventaja de Bonsai 27B no es superar a los modelos de frontera, sino ofrecer mucha capacidad por cada gigabyte de memoria. Esto permite desarrollar:
- Asistentes que consulten documentación interna sin enviarla a proveedores externos.
- Sistemas RAG para analizar informes, manuales, contratos o bases de conocimiento.
- Aplicaciones que deban seguir funcionando sin conexión.
- Automatizaciones con muchas llamadas al modelo y sin coste variable por token.
- Soluciones híbridas que resuelvan localmente las tareas normales y recurran a la nube solo cuando sea necesario.
Desde el punto de vista económico, la ejecución local cambia el reparto de costes. Reduce el gasto recurrente en API, pero exige hardware, integración, mantenimiento y controles propios. La opción más barata por respuesta no siempre es la que ofrece un coste menor por tarea completada correctamente.
En ámbitos fiscales, financieros o jurídicos tampoco debería utilizarse sin fuentes, supervisión y mecanismos de verificación. Ejecutar un modelo de forma privada no elimina las alucinaciones ni convierte sus respuestas en asesoramiento profesional.
¿Merece la pena Bonsai 27B?
Bonsai 27B representa un avance importante en eficiencia. Demuestra que un modelo de 27.000 millones de parámetros puede funcionar de manera interactiva en dispositivos que hasta ahora solo admitían modelos mucho más pequeños.
La versión ternaria es la opción más equilibrada para un portátil o una GPU cuando importa la calidad. La edición de 1 bit tiene sentido cuando la memoria es la restricción principal, especialmente en móviles, sistemas integrados o aplicaciones completamente locales.
No es un reemplazo directo de los mejores servicios en la nube. Su valor está en la privacidad, el funcionamiento sin conexión, el control de costes y la posibilidad de incorporar inteligencia artificial a productos donde antes no cabía. Habrá que esperar a pruebas independientes para conocer con precisión hasta dónde llega en tareas reales.
¿Qué puede aportar un economista?
Soy José García, economista y consultor SEO. Esta combinación me permite valorar tecnologías como Bonsai 27B no solo por sus especificaciones, sino también por su impacto en costes, productividad, procesos, marketing y rentabilidad. Como economista puedo comprender las distintas áreas de una empresa y analizar si una herramienta encaja realmente en su modelo de negocio.
También puedo ayudarte a mejorar la visibilidad de tu proyecto. Los buscadores y los sistemas de inteligencia artificial comparten una necesidad básica: sus rastreadores deben descubrir, interpretar y organizar el contenido publicado en internet. Por eso, el SEO ya no sirve únicamente para aparecer en Google; también aumenta las posibilidades de que una empresa sea encontrada, comprendida y citada por asistentes de inteligencia artificial.
Si quieres saber más o tienes dudas, puedes reservar una discovery call gratuita de 15 minutos. Si de verdad estás comprometido con tu negocio y quieres mejorar su presencia digital, rellena el formulario.
Si has llegado hasta aquí abajo, Sígueme:
Leave a Reply