
Thinking Machines ra mắt Inkling, mô hình MoE 975B mở
Công ty cho biết chỉ có khoảng 41 tỷ tham số hoạt động cho mỗi token và công bố kích thước bộ nhớ từ 2TB đến 600GB cho việc triển khai.
Thinking Machines đã phát hành Inkling, một mô hình Mixture-of-Experts được xây dựng từ đầu mà họ cho biết có tổng cộng 975 tỷ tham số trong khi kích hoạt khoảng 41 tỷ tham số cho mỗi token. Các trọng số được mô tả là có sẵn trên Hugging Face theo giấy phép Apache 2.0, cùng với các yêu cầu bộ nhớ GPU bất thường rõ ràng mà liên kết "sự mở" của mô hình với các ràng buộc triển khai thực tế.
Điểm chính
- Thinking Machines đã phát hành Inkling vào ngày 15 tháng 7 năm 2026, định vị nó là mô hình đầu tiên của công ty được đào tạo từ đầu.
- Inkling được mô tả là một mô hình Mixture-of-Experts 975B tham số với khoảng 41B tham số hoạt động cho mỗi token, sử dụng định tuyến thưa thay vì tính toán dày đặc.
- Kiến trúc được chỉ định là 66 lớp với 256 chuyên gia mỗi lớp, định tuyến sáu chuyên gia cho mỗi token cộng với hai chuyên gia chung hoạt động trên mỗi token.
- Các dấu chân triển khai được nêu rõ: khoảng 2TB bộ nhớ GPU kết hợp cho độ chính xác đầy đủ và khoảng 600GB cho một checkpoint đã định lượng.
Inkling được phát hành dưới dạng MoE từ đầu, theo giấy phép Apache 2.0
Thinking Machines đã phát hành một mô hình có tên Inkling vào ngày 15 tháng 7 năm 2026. Công ty được mô tả là đã làm cho các trọng số có sẵn trên Hugging Face theo giấy phép Apache 2.0, thường cho phép tái sử dụng và sửa đổi rộng rãi theo các điều khoản của giấy phép.
Inkling được định hình như một hệ thống Mixture-of-Experts (MoE), có nghĩa là mô hình lưu trữ nhiều "chuyên gia" tham số nhưng chỉ chạy một tập hợp con cho mỗi token được tạo ra. Kích thước tiêu đề trong phân tích kỹ thuật là khoảng cách giữa tổng số tham số 975 tỷ và khoảng 41 tỷ tham số liên quan đến việc xử lý bất kỳ token đơn lẻ nào, hoặc khoảng 4% hoạt động tại một thời điểm.
Chi tiết của gói đến từ một phân tích kỹ thuật thứ cấp mà cảnh báo rõ ràng rằng nó được biên soạn từ "các chi tiết được chia sẻ công khai từ nhiều nguồn khác nhau" và yêu cầu độc giả báo cáo các thông tin không chính xác. Các tài liệu tham khảo cơ bản và các tài liệu phát hành chính không được bao gồm ở đây, vì vậy cơ chế là rõ ràng nhưng việc xác minh trực tiếp bị giới hạn ở những gì có trong đoạn trích.
Các con số mà các nhà giao dịch sẽ dựa vào: 2TB độ chính xác đầy đủ, ~600GB đã định lượng
Bản phát hành của Inkling giống như một câu chuyện cơ sở hạ tầng vì nó gắn liền với các dấu chân bộ nhớ cụ thể đến các điểm kiểm tra mô hình, không chỉ là số lượng tham số. Phân tích cho biết điểm kiểm tra độ chính xác đầy đủ cần ít nhất 2 TB bộ nhớ GPU kết hợp, được cung cấp dưới dạng tám thẻ NVIDIA B300 hoặc mười sáu thẻ H200. Nó cũng mô tả một điểm kiểm tra đã định lượng khoảng 600 GB phù hợp với bốn thẻ B300.
Những con số đó quan trọng vì chúng biến "trọng số mở" thành một vấn đề lập kế hoạch năng lực. Nếu một mô hình có thể được tải xuống và chạy, các nhà giao dịch có thể ánh xạ tuyên bố đó thành một hóa đơn vật liệu phần cứng sơ bộ, sau đó là kinh tế học suy diễn được lưu trữ, rồi đến nhu cầu về năng lực GPU và các ngăn xếp phục vụ nó.
Một con số tiêu đề 975B có thể là nhiên liệu cho câu chuyện tự nó, nhưng yêu cầu 2TB là một ràng buộc xuất hiện trong việc mua sắm, lập kế hoạch colo và định giá.
MoE là cầu nối giữa hai thực tế đó. Thiết kế của Inkling được mô tả là tách biệt chi phí lưu trữ khỏi chi phí suy diễn theo từng token: bạn vẫn phải tải toàn bộ điểm kiểm tra vào bộ nhớ để chạy nó, nhưng mỗi token chỉ kích hoạt một phần nhỏ của các tham số. Đó là lý do tại sao một mô hình có thể "rất lớn" trên giấy trong khi lại rẻ hơn để chạy theo từng token so với tổng số tham số của nó.
Cách Inkling đạt được 1 triệu token: 55 lớp cửa sổ trượt và 11 lớp chú ý đầy đủ
Inkling được mô tả là hỗ trợ một cửa sổ ngữ cảnh một triệu token, đây là số lượng văn bản tối đa mà nó có thể xem xét cùng một lúc. Cơ chế được cung cấp để làm cho điều đó khả thi là độ thưa thớt của sự chú ý: hầu hết các lớp sử dụng sự chú ý cửa sổ trượt, nơi mỗi token chỉ chú ý đến một phạm vi gần đây hạn chế, và một số lớp nhỏ hơn sử dụng sự chú ý đầy đủ, nơi các token có thể chú ý đến toàn bộ chuỗi trước đó.
Phân tích mô tả một sự thay đổi 5:1 giữa các lớp cửa sổ trượt và các lớp chú ý đầy đủ. Nó cũng trích dẫn các ghi chú tích hợp vLLM đưa ra các con số về sự phân chia: 55 lớp cửa sổ trượt và 11 lớp chú ý đầy đủ trong tổng số 66 lớp.
Đây là một sự đánh đổi kiến trúc cụ thể, không phải là một tuyên bố tiếp thị đơn lẻ. Các lớp cửa sổ trượt giữ cho tính toán không bùng nổ với độ dài chuỗi, nhưng chúng cũng có nguy cơ mất khả năng hồi tưởng xa vì các sự kiện xa không trực tiếp hiển thị trong hầu hết các lớp.
Các lớp chú ý đầy đủ định kỳ là lối thoát, cung cấp các "điểm làm mới" toàn cầu nơi thông tin từ rất sớm trong chuỗi có thể được kéo lên và sau đó được mang lại một cách cục bộ.
Những gì cần xác minh trước khi thị trường định giá: nguồn gốc, cắt bớt, và các tiêu chuẩn bị thiếu
Vấn đề chính trong việc coi Inkling như một chất xúc tác là xác minh các hiện vật chính. Gói không bao gồm một thẻ mô hình Thinking Machines, một Hugging Face trực tiếp.liên kết, hoặc các tài liệu được tham chiếu phía sau các trích dẫn trong ngoặc của đoạn trích, vì vậy điểm xác nhận đầu tiên là trang mô hình thực tế và các điều khoản cấp phép và sử dụng Apache 2.0 chính xác đính kèm với trọng số.
Mảnh ghép thứ hai còn thiếu là bằng chứng về hiệu suất. Không có điểm chuẩn, số liệu độ trễ, tuyên bố thông lượng, hoặc đánh giá ngữ cảnh dài nào được cung cấp trong gói, và đoạn trích bị cắt ngắn giữa cuộc thảo luận về mã hóa vị trí.
Các đánh giá từ bên thứ ba, đặc biệt là các bài kiểm tra điều tra hành vi ngữ cảnh dài gần cửa sổ một triệu token, sẽ là cách nhanh nhất để phân tách "hỗ trợ 1M token" khỏi "chấp nhận 1M token nhưng quên những gì quan trọng."
Xác nhận thứ ba là khả năng triển khai ở các footprint đã nêu. Phân tích cung cấp các mục tiêu bộ nhớ cụ thể cho độ chính xác đầy đủ và các điểm kiểm tra đã định lượng, và nó tham chiếu đến các ghi chú tích hợp vLLM cho sự phân chia chú ý 55/11.
Các báo cáo về các lần chạy thành công trên những cấu hình đó, cộng với bằng chứng rằng các ngăn xếp suy diễn thông thường xử lý mẫu chú ý như đã mô tả, sẽ thắt chặt niềm tin rằng đây là một mô hình mà mọi người thực sự có thể lưu trữ chứ không chỉ tải xuống.
Đọc của tôi: trọng số mở + footprint rõ ràng thắt chặt vòng phản hồi giữa các lần ra mắt mô hình và giao dịch tính toán.
Phần quyết định liệu Inkling có quan trọng với thị trường hay không không phải là tiêu đề 975B, mà là sự kết hợp giữa kích hoạt thưa thớt và footprint triển khai rõ ràng. Một mô hình MoE chỉ kích hoạt ~41B tham số cho mỗi token có thể thay đổi hợp lý đường cong chi phí theo từng token mà không từ bỏ hào quang tiếp thị của "gần một triệu tham số," và đó chính xác là loại mơ hồ mà các nhà giao dịch thường phải đoán.
Ngưỡng quan trọng là liệu danh sách Apache 2.0 của Hugging Face và các tuyên bố bộ nhớ 2TB đến 600GB có đứng vững trong các triển khai thực tế hay không, sau đó được phản ánh bởi các tinh chỉnh, biến thể định lượng và các dịch vụ suy diễn được lưu trữ. Nếu những xác nhận đó đến, "mở ngữ cảnh dài" không còn là một câu chuyện mà bắt đầu trở thành một đầu vào khả năng GPU có thể đo lường và có thể lan truyền qua ngăn xếp.