Close-up of a computer chip with glowing elements
Trí tuệ nhân tạo

PrismML ra mắt Bonsai 2 27B, nén Qwen3.8 xuống 5.9 GB

PrismML cho biết việc phát hành trọng số ba giữ lại 98% điểm chuẩn tổng hợp của Qwen với việc cắt giảm bộ nhớ 9x–10x.

Bởi Elliot Marsh5 phút đọc

PrismML đã phát hành Bonsai 2 27B vào ngày 17 tháng 9, cho biết nó nén Qwen3.8 27B mã nguồn mở của Alibaba xuống còn 5.9 GB. Công ty tuyên bố đạt 98% độ tương đương chuẩn tổng hợp so với mô hình gốc, nhằm mục đích làm cho suy luận LLM trở nên thực tế trên các thiết bị cục bộ thay vì trên đám mây.

PrismML đã phát hành Bonsai 2 27B vào thứ Năm, định vị nó như một phiên bản nén của Qwen3.8 27B mã nguồn mở của Alibaba có thể chạy với bộ nhớ ít hơn nhiều. PrismML cho biết kích thước mô hình là 5.9 GB, mà họ mô tả là đủ nhỏ cho một PC và "có thể" cho một smartphone cao cấp.

Cơ chế rất đơn giản: thu nhỏ các tham số lưu trữ của mô hình đủ để suy luận không còn bị giới hạn bởi GPU đám mây mà bắt đầu bị giới hạn bởi những gì vừa đủ trong bộ nhớ cục bộ. PrismML cho biết Bonsai 2 mang lại "giảm 9x đến 10x về bộ nhớ so với mô hình gốc," đây là loại thay đổi đáng kể hơn là những cải tiến tốc độ không đáng kể khi mục tiêu là triển khai cục bộ.

Đối với những người theo dõi cơ sở hạ tầng liên quan đến tiền điện tử, sự liên quan ngay lập tức là phân phối và chi phí. Nếu một mô hình "suy luận" 27B tham số có thể được đóng gói vào một kích thước gigabyte số đơn mà không làm giảm chất lượng, thì nút thắt chuyển từ khả năng suy luận tập trung sang phân phối biên, khả năng tương thích thiết bị và ngăn xếp phần mềm bao quanh mô hình.

Từ 95% đến 98% Độ Tương Đương: Tín hiệu Chấp Nhận và Đề Xuất Trọng Số Ba

PrismML định hình Bonsai 2 như một phiên bản giữ lại chất lượng, không chỉ là một tệp nhỏ hơn. Công ty cho biết Bonsai 2 đạt 98% điểm chuẩn tổng hợp của Qwen, tăng từ 95% cho phiên bản Bonsai đầu tiên cách đây vài tháng.

Cũng có bằng chứng về sự thu hút từ các nhà phát triển muốn các mô hình mở nhỏ hơn. PrismML cho biết mô hình Bonsai đầu tiên đã được tải xuống hơn 11 triệu lần, và các mô hình nhỏ hơn của nó đã được tải xuống thêm 2.6 triệu lần.

Yêu cầu nén dựa trên cách mà các trọng số được đại diện. Trọng số là các tham số số được lưu trữ mà một mô hình học được trong quá trình đào tạo, và PrismML cho biết một trọng số điển hình sử dụng 16 bit. Cách tiếp cận của họ sử dụng các trọng số "ba giá trị" chỉ nhận ba giá trị, "+1, -1, hoặc 0," cắt giảm yêu cầu lưu trữ đủ để thu nhỏ kích thước mô hình.

Điểm cần lưu ý là độ tương đương chuẩn không giống như độ tương đương nhiệm vụ, và cách định hình của PrismML để lại chỗ chosự trượtGiám đốc điều hành Babak Hassibi cho biết việc nén sẽ luôn có một số tác động, ngay cả khi khoảng cách còn lại là nhỏ.

Công ty cũng chỉ ra một biến số thứ hai thường bị bỏ qua trong các so sánh mô hình: phần mềm xung quanh, hay "cái khung mà một mô hình hoạt động bên trong," mà nó cho rằng có thể ảnh hưởng đáng kể đến độ chính xác.

PrismML đang cố gắng mua uy tín với mọi người và vốn đầu tư cũng như với các điểm số. Công ty cho biết đã huy động được 22,25 triệu đô la trong vòng gọi vốn hạt giống và được hỗ trợ bởi Khosla Ventures, Cerberus Capital và Caltech. PrismML được dẫn dắt bởi Hassibi, một giáo sư tại Caltech được mô tả là chuyên gia trong công nghệ nén, và nó liệt kê Ion Stoica là một cố vấn.

Lập luận của Stoica là suy diễn cục bộ thay đổi kinh tế cấp người dùng và mô hình quyền riêng tư. "Bạn sẽ có trí tuệ trong tầm tay, và nó sẽ miễn phí vì nó sẽ chạy trên thiết bị bạn đã mua. Nó cũng sẽ riêng tư, vì bạn sẽ không gửi nó lên đám mây," ông nói.

Lộ trình đến hàng trăm tỷ tham số—và những câu hỏi mở

Cột mốc tiếp theo của PrismML là quy mô. Hassibi cho biết công ty dự kiến sẽ phát hành các mô hình nén "trong khoảng vài trăm tỷ tham số" trong vài tháng tới, và thêm vào: "Các mô hình tiếp theo mà chúng tôi sẽ phát hành, hy vọng trong vài tháng tới, sẽ nằm trong khoảng vài trăm tỷ tham số, và tôi mong rằng sẽ dễ dàng hơn để giữ lại trí tuệ ở đó."

Ông cũng lập luận rằng các mô hình lớn hơn có thể dễ nén hơn mà không làm mất chất lượng: "Có nhiều không gian hơn để có thể nén chúng mà không mất đi trí tuệ. Vì vậy, tôi chỉ muốn nói, như một xu hướng chung, đối với các mô hình lớn hơn, dễ dàng hơn để đạt được 100%." PrismML vẫn coi 100% sự tương đương chuẩn mực là không chắc chắn, và các bình luận của chính công ty gợi ý rằng một số suy giảm có thể là cấu trúc.

Các câu hỏi mở trong ngắn hạn là thực tiễn, không phải triết lý. PrismML chưa công bố danh sách phần cứng hỗ trợ hoặc các tiêu chuẩn cấp thiết bị trong tài liệu này, và khía cạnh smartphone vẫn là "có thể" chứ không phải đã được chứng minh. Việc tái tạo độc lập cũng quan trọng vì dấu chân và hiệu suất thực tế có thể phụ thuộc vào các lựa chọn thời gian chạy, chi tiết định lượng, và cái khung được sử dụng để đánh giá các nhiệm vụ.

Cũng có những tin đồn về thỏa thuận chưa được xác nhận. PrismML được cho là đang đàm phán với Apple, nhưng Hassibi từ chối bình luận, để lại bất kỳ thời gian biểu hợp tác hoặc tích hợp nào chưa được giải quyết.

Quan điểm của tôi: Tiến bộ nén là có thật, nhưng các tiêu chuẩn và bằng chứng phần cứng sẽ quyết định giao dịch

Ngưỡng quan trọng là liệu tuyên bố 5,9 GB có chuyển thành hiệu suất cấp thiết bị có thể lặp lại trên các khối lượng công việc thực tế, không chỉ là sự tương đương tổng hợp của các tiêu chuẩn. Một bước chuyển từ 95% lên 98% cho thấy PrismML đang lặp lại nhanh chóng về phần thường phá vỡ nỗ lực nén, đó là việc giữ chất lượng dưới áp lực cắt giảm kích thước mạnh mẽ.

Nếu PrismML có thể công bố xác thực phần cứng đáng tin cậy và giữ được sự tương đương gần với các tuyên bố của nó khi chuyển sang các mô hình hàng trăm tỷ tham số, thì cấu trúc bắt đầu trông có vẻ mang tính cấu trúc hơn là dựa vào câu chuyện: phân phối biên và suy diễn ưu tiên quyền riêng tư trở thành con đường triển khai mặc định cho một phần của các khối lượng công việc "lập luận" hiện đang giả định GPU đám mây.

Nguồn