Close-up of a computer chip with glowing elements
IA

PrismML lanza Bonsai 2 27B, reduce Qwen3.8 a 5.9 GB

PrismML afirma que la liberación de pesos ternarios retiene el 98% de las puntuaciones de referencia agregadas de Qwen con una reducción de memoria de 9x a 10x.

Por Elliot Marsh5 min de lectura

PrismML lanzó Bonsai 2 27B el 17 de septiembre, diciendo que comprime el Qwen3.8 27B de código abierto de Alibaba a un tamaño de 5.9 GB. La compañía afirma una paridad de referencia agregada del 98% en comparación con el modelo original, con el objetivo de hacer que la inferencia de LLM de "razonamiento" sea práctica en dispositivos locales en lugar de en la nube.

PrismML lanzó Bonsai 2 27B el jueves, posicionándolo como una versión comprimida del Qwen3.8 27B de código abierto de Alibaba que puede funcionar con mucha menos memoria. PrismML establece el tamaño del modelo en 5.9 GB, lo que describe como lo suficientemente pequeño para una PC y "posiblemente" un smartphone de gama alta.

El mecanismo es sencillo: reducir los parámetros almacenados del modelo lo suficiente para que la inferencia deje de estar limitada por las GPU en la nube y comience a estar limitada por lo que cabe en la memoria local.

PrismML dice que Bonsai 2 ofrece una "reducción de 9x a 10x en memoria en comparación con el original", que es el tipo de cambio significativo que importa más que mejoras marginales de velocidad cuando el objetivo es el despliegue local.

Para los observadores de infraestructura adyacente a las criptomonedas, la relevancia inmediata es la distribución y el costo. Si un modelo de "razonamiento" de 27B parámetros puede empaquetarse en un tamaño de gigabyte de un solo dígito sin colapsar la calidad, el cuello de botella se desplaza de la capacidad de inferencia centralizada a la entrega en el borde, la compatibilidad del dispositivo y la pila de software que envuelve el modelo.

De 95% a 98% de Paridad: Señales de Adopción y la Propuesta de Pesos Ternarios

PrismML enmarca Bonsai 2 como una iteración de retención de calidad, no solo como un archivo más pequeño. La compañía dice que Bonsai 2 coincide con el 98% de las puntuaciones de referencia agregadas de Qwen, un aumento del 95% en comparación con el primer lanzamiento de Bonsai hace un par de meses.

También hay evidencia de interés por parte de desarrolladores que quieren modelos abiertos más pequeños. PrismML dice que el primer modelo Bonsai ha sido descargado más de 11 millones de veces, y sus modelos aún más pequeños han sido descargados otras 2.6 millones de veces.

La afirmación de compresión se basa en cómo se representan los pesos. Los pesos son los parámetros numéricos almacenados que un modelo aprende durante el entrenamiento, y PrismML dice que un peso típico utiliza 16 bits. Su enfoque utiliza pesos "ternarios" que solo toman tres valores, "+1, -1 o 0", reduciendo los requisitos de almacenamiento lo suficiente como para disminuir el tamaño del modelo.

El problema es que la paridad de referencia no es lo mismo que la paridad de tarea, y el propio marco de PrismML deja espacio paradeslizamientos. El CEO Babak Hassibi dijo que la compresión probablemente siempre tendrá algún impacto, incluso si la brecha restante es pequeña.

La empresa también señala una segunda variable que a menudo se ignora en las comparaciones de modelos: el software circundante, o “el arnés en el que se ejecuta un modelo”, que dice puede afectar materialmente la precisión.

PrismML está tratando de ganar credibilidad con las personas y el capital tanto como con las puntuaciones. La empresa dice que recaudó una ronda de financiación inicial de 22.25 millones de dólares y cuenta con el respaldo de Khosla Ventures, Cerberus Capital y Caltech. PrismML está liderada por Hassibi, un profesor de Caltech descrito como un experto en tecnologías de compresión, y lista a Ion Stoica como asesor.

La propuesta de Stoica es que la inferencia local cambia la economía a nivel de usuario y el modelo de privacidad. “Vas a tener inteligencia al alcance de tu mano, y va a ser gratuita porque se ejecutará en el dispositivo que ya compraste. También va a ser privada, porque no la enviarás a la nube”, dijo.

Hoja de ruta hacia cientos de miles de millones de parámetros—y las preguntas abiertas

El próximo hito de PrismML es la escala. Hassibi dijo que la empresa espera lanzar modelos comprimidos “en el rango de varios cientos de miles de millones de parámetros” en los próximos meses, añadiendo: “Los próximos modelos que lanzaremos, con suerte en los próximos meses, estarán en el rango de varios cientos de miles de millones de parámetros, y espero que sea más fácil retener la inteligencia allí.”

También argumentó que los modelos más grandes pueden ser más fáciles de comprimir sin perder calidad: “Hay más espacio para poder comprimirlos sin perder la inteligencia. Así que diría, como una tendencia general, que para modelos más grandes, es más fácil llegar al 100%.” PrismML aún enmarca la paridad de referencia del 100% como incierta, y los propios comentarios de la empresa sugieren que alguna degradación puede ser estructural.

Las preguntas abiertas a corto plazo son prácticas, no filosóficas. PrismML no ha publicado una lista de hardware soportado ni benchmarks a nivel de dispositivo en el material aquí, y el ángulo del smartphone sigue siendo “posiblemente” en lugar de demostrado.

La replicación independiente también importa porque la huella real y el rendimiento pueden depender de elecciones de tiempo de ejecución, detalles de cuantización y el arnés utilizado para evaluar tareas.

También hay rumores de acuerdos no confirmados. Se rumorea que PrismML está en conversaciones con Apple, pero Hassibi se negó a comentar, dejando cualquier asociación o cronograma de integración sin resolver.

Mi opinión: El progreso en compresión es real, pero los benchmarks y la prueba de hardware decidirán el intercambio.

El umbral que importa es si la afirmación de 5.9 GB se traduce en un rendimiento repetible a nivel de dispositivo en cargas de trabajo reales, no solo en paridad de benchmark agregada. Un movimiento del 95% al 98% sugiere que PrismML está iterando rápidamente en la parte que usualmente rompe los esfuerzos de compresión, que es la retención de calidad bajo recortes de tamaño agresivos.

Si PrismML puede publicar una validación de hardware creíble y mantener la paridad cerca de sus afirmaciones a medida que avanza hacia modelos de varios cientos de miles de millones de parámetros, la configuración comienza a parecer estructural en lugar de impulsada por narrativas: la distribución en el borde y la inferencia prioritaria en la privacidad se convierten en la ruta de implementación predeterminada para una parte de las cargas de trabajo de "razonamiento" que actualmente asumen GPUs en la nube.

Fuentes