A graphics card in the foreground with a laptop
Trí tuệ nhân tạo

Nvidia công bố Nemotron 3.5 Lightning, AI miễn phí với GPU…

Mô hình có thể tải xuống, sử dụng và chỉnh sửa miễn phí, và đi kèm với NeMo Switchyard để định tuyến nhằm mục đích suy diễn theo kiểu đại lý.

Bởi Elliot Marsh6 phút đọc

Nvidia đã phát hành Nemotron 3.5 Lightning vào ngày 11 tháng 8 như một mô hình AI mã nguồn mở mà họ mô tả là “nhẹ” và có thể chạy trên một GPU duy nhất trên laptop hoặc máy tính để bàn. Công ty đang định vị việc phát hành này như là “AI miễn phí” mở rộng việc sử dụng suy diễn trong khi vẫn đáp ứng nhu cầu về GPU.

Điểm chính

  • Nemotron 3.5 Lightning là mô hình mã nguồn mở mới được Nvidia phát hành, được mô tả là “nhẹ” và được thiết kế để chạy trên một GPU duy nhất trong cấu hình laptop hoặc máy tính để bàn.
  • Nvidia cho phép các công ty tải xuống, sử dụng và chỉnh sửa mô hình mà không cần sự cho phép hoặc thanh toán, định vị nó như một cầu nối không ma sát đến suy diễn cục bộ.
  • Công ty cho biết họ đã sử dụng quá trình chưng cất để cung cấp cho mô hình Lightning nhỏ hơn những khả năng tương tự như các mô hình Nemotron lớn hơn.
  • Phân phối sẽ được thực hiện qua HuggingFace và trang web của Nvidia, kết hợp với phần mềm NeMo Switchyard chọn mô hình “rẻ nhất và phù hợp nhất” cho một nhiệm vụ nhất định.

Nemotron 3.5 Lightning: Mô hình Mở, Miễn Phí Chỉnh Sửa, Chạy Trên Một GPU của Nvidia

Nvidia đã phát hành Nemotron 3.5 Lightning vào ngày 11 tháng 8, mô tả nó như một mô hình AI mã nguồn mở “nhẹ” có thể chạy trên một GPU duy nhất trên laptop hoặc máy tính để bàn. Việc định vị là rõ ràng: suy diễn cục bộ, trên một máy duy nhất thay vì chỉ trên đám mây, theo kiểu trả tiền theo từng lần gọi.APItư thế.

Các điều khoản thương mại là nửa còn lại của cơ chế. Nvidia cho biết mô hình này miễn phí cho các công ty tải xuống, sử dụng và sửa đổi “mà không cần xin phép hoặc trả tiền cho Nvidia,” điều này loại bỏ hai rào cản thông thường làm chậm quá trình áp dụng: đàm phán cấp phép và định giá theo từng token.

Nvidia cũng liên kết việc phát hành với một kỹ thuật xây dựng cụ thể. Đại diện công ty cho biết quá trình chưng cất đã được sử dụng để mang lại cho Nemotron 3.5 Lightning "các khả năng tương tự" như các mô hình Nemotron lớn hơn, một tuyên bố quan trọng vì mô hình này được bán dựa trên hiệu suất chứ không phải quy mô thô.

‘AI miễn phí’ như một chiến lược nhu cầu GPU—và tại sao điều này quan trọng đối với các câu chuyện tính toán Crypto

Luận điểm của Nvidia là phân phối mở không làm giảm nhu cầu phần cứng, mà còn mở rộng nó. Lập luận của công ty rất đơn giản: ngay cả các mô hình "miễn phí" cũng cần phải chạy ở đâu đó, và việc giảm chi phí biên của quá trình suy diễn có thể tăng tổng mức sử dụng so với các lựa chọn độc quyền.

Giám đốc điều hành Jensen Huang đã rất thẳng thắn về cách tiếp cận này. Trong một cuộc phỏng vấn vào tháng 7, ông nói: “AI miễn phí nên tốt cho phần cứng. AI miễn phí nên tốt cho chip.” Đó là cược đứng sau một mô hình GPU đơn có thể hoạt động trên một trạm làm việc của nhà phát triển, một máy chủ doanh nghiệp nhỏ, hoặc một hộp chuyên dụng chạy các tác vụ nền.

Đối với các nhà giao dịch tiền điện tử, sự liên quan không chỉ nằm ở điểm số chuẩn của một mô hình mà còn ở hình dạng nhu cầu mà nó ngụ ý. Nếu suy diễn cục bộ trở nên đủ rẻ để luôn hoạt động, nhu cầu tính toán sẽ chuyển từ các cuộc gọi API tập trung, bùng nổ sang các khối lượng công việc liên tục trông giống như chi tiêu cơ sở hạ tầng hơn.

Câu chuyện đó có tác động hạ nguồn đến cách các thị trường định giá sự khan hiếm GPU, mạng tính toán DePIN, và “Đại lý AI"Các câu chuyện token phụ thuộc vào suy diễn liên tục hơn là các gợi ý thỉnh thoảng."

Điều đáng lưu ý là các chi tiết trong thông cáo báo chí được trích dẫn không định lượng bất kỳ điều gì trong số này. Không có số liệu tham số được công bố, không có các tiêu chuẩn đã công bố, và không có số liệu về mức độ áp dụng, vì vậy câu chuyện “AI miễn phí thúc đẩy nhiều GPU hơn” vẫn chỉ là một tuyên bố chiến lược chứ không phải là một kết quả được đo lường.

Phân phối, Đại lý và NeMo Switchyard: Giảm ma sát cho suy diễn luôn sẵn sàng

Nvidia đang thúc đẩy Nemotron 3.5 Lightning thông qua các kênh giúp các mô hình hoạt động, không chỉ được công bố. Công ty cho biết mô hình sẽ có sẵn trên HuggingFace và trang web của Nvidia, đây là con đường thực tiễn cho các nhà phát triển muốn kéo trọng số, tinh chỉnh và triển khai mà không phải chờ đợi dịch vụ quản lý.

Khung sản phẩm cũng nghiêng về các tác nhân. Nvidia cho biết mô hình được phát triển đặc biệt cho các tác nhân AI, có nghĩa là các chương trình có thể chạy tự động trong nền. Điều này quan trọng vì các tác nhân nặng về suy diễn theo thiết kế: chúng làm việc liên tục, gọi các công cụ và tạo ra nhiều đầu ra nhỏ nơi chi phí trên mỗi nhiệm vụ chiếm ưu thế.

Cùng với mô hình, Nvidia đã phát hành phần mềm NeMo Switchyard mà họ cho biết có thể xác định mô hình AI "rẻ nhất và phù hợp nhất" cho một nhiệm vụ nhất định. Về mặt cơ học, đó là một lớp định tuyến: thay vì mặc định mọi yêu cầu đến mô hình lớn nhất có sẵn, các khối lượng công việc có thể được điều hướng đến các mô hình nhỏ hơn hoặc rẻ hơn khi nhiệm vụ cho phép.

Câu chuyện định tuyến này có hai mặt đối với Nvidia. Nếu Switchyard tối ưu hóa trên một menu vẫn chạy tốt nhất trên GPU của Nvidia, nó có thể tăng tổng khối lượng suy diễn và giữ cho các khối lượng công việc gắn bó với hệ sinh thái của Nvidia. Nếu nó trở thành một môi giới trung lập mà định tuyến ra khỏi phần cứng của Nvidia khi các lựa chọn thay thế rẻ hơn, nó trở thành một đòn bẩy mà các đối thủ có thể sử dụng. Đoạn trích không xác định cách Switchyard đưa ra quyết định hoặc bộ mô hình nào mà nó có thể định tuyến.

Các tín hiệu cần theo dõi cho việc Nvidia mã nguồn mở mô hình Nemotron 3.5 Lightning

Điểm xác thực đầu tiên là công bố kỹ thuật. Việc Nvidia công bố các chỉ số, số lượng tham số hoặc đánh giá của bên thứ ba sẽ quyết định mức độ nghiêm túc mà các nhà giao dịch có thể coi các tuyên bố "GPU đơn" và "khả năng tương tự", đặc biệt là đối với các khối lượng công việc kiểu tác nhân nơi độ trễ và độ tin cậy khi sử dụng công cụ quan trọng.

Điểm thứ hai là sự chấp nhận trông giống như triển khai hơn là chỉ là thử nghiệm. Nvidia cho biết CrowdStrike, CodeRabbit và Harvey đã thử nghiệm và tùy chỉnh mô hình, đây là một tín hiệu doanh nghiệp sớm, nhưng thị trường sẽ muốn thấy các mẫu lặp lại: sự thu hút của HuggingFace, nhiều trường hợp sử dụng sản xuất được đặt tên hơn và bằng chứng rằng các công ty thực sự đang vận chuyển Lightning bên trong các sản phẩm.

Chính sách là yếu tố có thể định giá lại toàn bộ giao dịch mô hình mở một cách nhanh chóng. Việc phát hành diễn ra trong một cuộc tranh luận ở Washington đã gia tăng sau khi AI Moonshot của Trung Quốc công bố Kimi K3, và các chính trị gia đã bày tỏ lo ngại về việc chưng cất như một vector tiềm năng cho việc đánh cắp tài sản trí tuệ.

Bất kỳ tuyên bố mới nào của Mỹ hoặc các hạn chế đề xuất xung quanh việc phát hành trọng số mở hoặc chưng cất sẽ quan trọng hơn một chu kỳ tiếp thị, vì chúng có thể thay đổi ý nghĩa của "miễn phí để sửa đổi" trong thực tế.

Cuối cùng, hãy theo dõi cách NeMo Switchyard phát triển. Các bản cập nhật làm rõ cách xác định định tuyến "rẻ nhất/ phù hợp nhất", và liệu các mặc định có đẩy khối lượng công việc về phía GPU của Nvidia hay không, sẽ cho các nhà giao dịch biết liệu đây có phải là một tính năng tiện lợi cho nhà phát triển hay một kế hoạch kiểm soát có chủ đích cho chi tiêu suy diễn.

Quan điểm của tôi: Các mô hình mở đang trở thành một mặt trận cạnh tranh, không phải là một động thái từ thiện.

Phần quyết định câu chuyện này không phải là liệu Nemotron 3.5 Lightning có phải là "mã nguồn mở" theo nghĩa cấp phép nghiêm ngặt hay không, mà là liệu Nvidia có thể biến trọng số mở thành nhiều phút suy diễn hơn mỗi ngày. Một mô hình đơn GPU mà có thể sửa đổi là một chiến lược khối lượng, và câu nói của Huang rằng "AI miễn phí nên tốt cho chip" là tuyên bố rõ ràng nhất về ý định mà Nvidia đã đưa ra.

Bài kiểm tra thực sự là liệu lớp định tuyến có trở thành thói quen hay không. Nếu NeMo Switchyard cuối cùng ngồi trước các khối lượng công việc của tác nhân và liên tục chọn các mô hình hoạt động hiệu quả trên các GPU của Nvidia, thì việc phát hành mở bắt đầu trông giống như một chiến lược phân phối mở rộng nhu cầu hơn là một cử chỉ PR nhất thời.

Nguồn