Close-up of a microchip with wires connected
Trí tuệ nhân tạo

Z.ai tiếp quản Ox Alpha, đổi tên thành GLM-5.3-Flash

Mô hình cung cấp quyền truy cập được lưu trữ với giá 18 đô la/tháng hoặc trọng số 300GB+ trên Hugging Face, sau một tuần đứng đầu bảng xếp hạng OpenRouter.

Bởi Elliot Marsh6 phút đọc

Z.ai của Trung Quốc đã nhận trách nhiệm cho mô hình “Ox Alpha” trước đây không rõ danh tính đã bùng nổ trên OpenRouter và đổi tên thành GLM-5.3-Flash. Việc công bố này biến một danh sách “lén lút” thành một phát hành của nhà cung cấp có thể theo dõi với cả quyền truy cập đăng ký bắt đầu từ 18 đô la/tháng và trọng số có thể tải xuống vượt quá 300GB.

Điểm chính

  • Mô hình “Ox Alpha” không rõ danh tính đã tăng vọt trên OpenRouter đã được Z.ai của Trung Quốc xác nhận và hiện được gọi chính thức là GLM-5.3-Flash.
  • Ox Alpha đứng đầu danh sách mô hình phổ biến nhất của OpenRouter trong tuần, với OpenRouter cho biết tất cả lưu lượng truy cập cho mô hình này đều được phục vụ thông qua các chip AI sản xuất tại Trung Quốc.
  • Z.ai đang cung cấp quyền truy cập lưu trữ thông qua các kế hoạch mã hóa GLM bắt đầu từ 18 đô la/tháng và cho biết GLM-5.3-Flash sẽ cung cấp “3 lần hạn mức sử dụng của GLM-5.3.”
  • Trọng số của GLM-5.3-Flash được đăng trên Hugging Face và được mô tả là “hơn 300GB,” trong khi OpenRouter cũng cho biết nhà cung cấp “sẽ không đào tạo trên các yêu cầu của bạn.”

Ox Alpha Bị Lật Tẩy: Z.ai Đổi Thương Hiệu Phát Hành OpenRouter Thành GLM-5.3-Flash

Thay đổi cốt lõi của Ox Alpha trong tuần này không phải là một khả năng mới, mà là một sự công bố danh tính. Mô hình trước đây không rõ danh tính đã xuất hiện trên OpenRouter tuần trước đã được công ty AI Trung Quốc Z.ai xác nhận và đổi thương hiệu thành GLM-5.3-Flash.

Z.ai cho biết mô hình có sẵn trên “tất cả các nền tảng chính thức,” với con đường “dễ dàng và trực tiếp nhất” là các kế hoạch mã hóa GLM của nó, bắt đầu từ 18 đô la mỗi tháng. Công ty cũng đã định vị mô hình này là “mạnh mẽ và rẻ,” khẳng định nó như một thách thức về chi phí và khả năng đối với các sản phẩm có trọng số kín từ các nhà phát triển Mỹ.

Việc công bố này cũng đã tạm thời vượt vào câu chuyện cổ phiếu. Sau khi Z.ai được xác nhận là công ty đứng sau mô hình, giá cổ phiếu của Z.ai đã “tăng vọt,” theo Bloomberg như được tham khảo trong tài liệu nguồn, mặc dù không có tỷ lệ phần trăm nào được cung cấp.

Sự gia tăng độ phổ biến của OpenRouter và chi tiết tính toán liên kết với Trung Quốc

OpenRouter là một nền tảng thống nhất cho phép người dùng định tuyến các yêu cầu đến các mô hình AI khác nhau thông qua một giao diện, điều này khiến nó trở thành một tín hiệu sớm hữu ích cho những gì các nhà phát triển thực sự đang thử nghiệm trong các quy trình làm việc giống như sản xuất. Trên bề mặt đó, việc áp dụng Ox Alpha diễn ra nhanh chóng một cách bất thường: nó trở thành mô hình phổ biến nhất của OpenRouter trong tuần.

Chi tiết khiến cho sự tăng vọt trở nên rõ ràng hơn là cơ sở hạ tầng. OpenRouter cho biết tất cả lưu lượng truy cập cho Ox Alpha được phục vụ thông qua các chip AI sản xuất tại Trung Quốc. Nhà cung cấp chip cụ thể và mẫu chip không được tiết lộ, nhưng tuyên bố này liên kết câu chuyện "rẻ" của mẫu chip với một dấu ấn tính toán liên quan đến Trung Quốc, không chỉ với chiến lược định giá.

Điều đó quan trọng vì các mô hình ra mắt “ẩn danh” thường dựa vào sự mơ hồ. Khi nhà cung cấp không rõ ràng, người dùng có thể dự đoán hiệu suất, chi phí và giả định về xử lý dữ liệu lên danh sách. Khi nhà cung cấp được công bố, câu chuyện trở thành về hệ thống phân phối và tính toán của nhà cung cấp, bao gồm nơi mà việc suy diễn đang diễn ra và điều đó có nghĩa gì đối với khả năng sẵn có, tư thế tuân thủ và các hạn chế về cung ứng.

OpenRouter cũng đã cố gắng giảm bớt một trong những trở ngại lớn nhất cho các đội sử dụng mô hình bên thứ ba: bảo mật prompt.

Nền tảng này mô tả Ox Alpha là một “mô hình tiên phong được xây dựng cho việc lập trình hiệu quả, công việc tác động bền vững và sử dụng trong sản xuất thực tế,” và sau đó đã thêm rằng nhà cung cấp “sẽ không đào tạo trên các prompt của bạn.” Điều này là một yếu tố giữ chân cho các quy trình lập trình và tác động, nơi mà các prompt có thể chứa mã độc quyền, logic giao dịch hoặc sổ tay vận hành.

$18/Tháng so với Tự lưu trữ: Những đánh đổi thực tiễn của một phiên bản Open-Weight trên 300GB

Z.ai đang hiệu quả vận hành hai kênh tiếp cận cùng một lúc. Kênh đầu tiên là truy cập lưu trữ chính thống: trả một khoản phí hàng tháng, nhận một hạn mức, và đối xử với mô hình như bất kỳ mô hình nào khác.API-trợ lý lập trình được hỗ trợ.

Điểm vào của Z.ai được công bố là “các kế hoạch lập trình GLM, bắt đầu từ 18 đô la một tháng,” cùng với tuyên bố rằng GLM-5.3-Flash sẽ cung cấp “3 lần hạn mức sử dụng của GLM-5.3,” mà không công bố hạn mức cơ bản hoặc các giới hạn chính xác đằng sau “có thể sử dụng.”

Funnel thứ hai là tự lưu trữ cho nhà phát triển thông qua một phiên bản mở trọng số. “Mở trọng số” có nghĩa là các trọng số đã được huấn luyện được công bố để người khác có thể tải xuống và chạy mô hình, nhưng nó không giống như “mã nguồn mở,” sẽ bao gồm mã nguồn, trọng số và dữ liệu huấn luyện. Đối với GLM-5.3-Flash, các trọng số có sẵn trên Hugging Face và được mô tả là “hơn 300GB.”

Số đó là rào cản thực tế. Một tải xuống hơn 300GB không chỉ là một mục lưu trữ. Nó là băng thông, thời gian triển khai và kế hoạch bộ nhớ GPU, và nó nâng cao tiêu chuẩn cho các đội muốn có lợi ích về tính bảo mật và kiểm soát của suy diễn cục bộ. Truy cập lưu trữ có thể rẻ trên giấy tờ, nhưng tự lưu trữ chỉ “miễn phí” nếu một đội đã có máy tính dự phòng và sự trưởng thành trong vận hành để chạy các mô hình lớn một cách đáng tin cậy.

Tài liệu nguồn cũng định hình GLM-5.3-Flash là có khả năng “tác động” được cải thiện, bao gồm việc sử dụng trình duyệt và máy tính để điều hướng các trang web và tương tác với các ứng dụng trên máy tính để bàn. Đối với những người xây dựng, điều đó đẩy mô hình từ việc tạo mã một lần sang việc sử dụng công cụ nhiều bước, nơi mà chi phí, độ trễ và độ tin cậy bắt đầu quan trọng hơn so với quyền tự hào về điểm chuẩn thô.

Điều gì sẽ xác nhận câu chuyện ‘Mạnh mẽ và Rẻ’

Câu chuyện hiện tại nặng về định vị và nhẹ về đo lường. Không có bảng điểm chuẩn hoặc đánh giá bên thứ ba nào được bao gồm trong gói, vì vậy sự xác nhận sạch nhất sẽ là các đánh giá được công bố định lượng hiệu suất của GLM-5.3-Flash so với các mô hình trọng số đóng hàng đầu dưới một bộ khung được đặt tên.

Giá cả là yếu tố thứ hai bị thiếu. Kế hoạch khởi điểm 18 đô la/tháng là điểm neo cho tiếp thị, nhưng nó không thay thế cho một bảng giá chi tiết nêu rõ giá token, giới hạn API và hành vi điều tiết. Nếu không có điều đó, “rẻ” có thể có nghĩa là bất cứ điều gì từ hạn ngạch hào phóng đến các giới hạn nghiêm ngặt chỉ trông tốt ở khối lượng thấp.

Khía cạnh hạ tầng cũng cần sự cụ thể. Tuyên bố của OpenRouter rằng tất cả lưu lượng đều được phục vụ thông qua các chip AI sản xuất tại Trung Quốc là loại chi tiết có thể thúc đẩy sự lan tỏa của câu chuyện, nhưng nó không đầy đủ nếu không có nhà cung cấp chip và mô hình. Nếu điều đó được tiết lộ, nó sẽ làm rõ liệu đây có phải là một lựa chọn năng lực tạm thời hay một phần bền vững của cấu trúc chi phí.

Cuối cùng, tuyên bố “3x hạn ngạch sử dụng của GLM-5.3” của Z.ai cần có giới hạn cụ thể. Nếu công ty công bố hạn ngạch cơ bản và hạn ngạch mới trong cùng một đơn vị, sẽ trở nên khả thi để mô hình hóa chi phí thực tế cho mỗi nhiệm vụ thay vì dựa vào một yếu tố nhân.

Quan điểm của tôi: Tại sao loại hình ra mắt ‘Từ lén lút đến chính thức’ này quan trọng đối với các câu chuyện AI mà các nhà giao dịch theo dõi

Phần quyết định xem điều này có quan trọng hay không không phải là sự thay đổi tên, mà là liệu sự tiết lộ có trở thành phân phối lặp lại hay không. Một danh sách lén lút có thể đứng đầu bảng xếp hạng hàng tuần về sự mới lạ và truyền miệng, nhưng câu chuyện của nhà cung cấp chỉ tồn tại nếu giá cả, hạn ngạch và độ tin cậy giữ vững khi các đội đưa khối lượng công việc thực vào.

Bài kiểm tra thực sự là liệu Z.ai có thể hỗ trợ lời chào “mạnh mẽ và rẻ” với các yếu tố mà thị trường có thểkiểm toán: đánh giá từ bên thứ ba, một bảng giá thực tế vượt qua mức khởi điểm 18 đô la/tháng, và sự rõ ràng về “chip AI sản xuất tại Trung Quốc” đã phục vụ lưu lượng OpenRouter.

Nếu những chi tiết đó được trình bày rõ ràng, cấu trúc bắt đầu trông giống như có tính cấu trúc hơn là dựa trên câu chuyện, vì các đội có thể thực sự so sánh chi phí trên đầu ra và quyết định nơi thực hiện suy diễn.

Nguồn