
OpenAI và Anthropic ra mắt GPT-6 và Claude Opus 5.5 giá rẻ
OpenAI đã trích dẫn việc giảm giá API 50% so với giá khuyến mãi GPT-5.6, trong khi Anthropic đề xuất chi phí vận hành thấp hơn khoảng 40% thông qua hiệu quả token.
OpenAI và Anthropic đều giới thiệu các tùy chọn mô hình chi phí thấp hơn vào ngày 22 tháng 9, định hình các bản phát hành xung quanh việc cắt giảm chi phí suy diễn của khách hàng khi các đối thủ có trọng số mở giá rẻ hơn gây áp lực lên giá API được lưu trữ.
Các bản phát hành này cũng diễn ra như là các mô hình mới đầu tiên từ cả hai phòng thí nghiệm kể từ khi có những lời kêu gọi gần đây về việc chậm lại toàn ngành liên quan đến cuộc tranh luận về an toàn AI.
Chi phí cắt giảm được đặt lên hàng đầu với GPT-6 Sol/Luna của OpenAI và Opus 5.5 của Anthropic.
OpenAI đã thêm hai cấp độ mới vào gia đình GPT-6 vào ngày 22 tháng 9: GPT-6Solvà GPT-6 Luna. Công ty cho biết các cấp độ mới đã cắt giảmAPIgiá cả giảm 50% so với giá khuyến mãi của GPT-5.6, định vị động thái này như một sự giảm trực tiếp trong khoản chi phí mà các nhà phát triển phải trả để gọi mô hình một cách lập trình.
Phân khúc là rõ ràng. OpenAI đã định vị Sol ở một cấp độ thấp hơn Astra và nhắm đến các khối lượng công việc phức tạp hơn như lập trình. Luna được định hình cho "các tác vụ khối lượng lớn" như trích xuất thông tin hoặc tóm tắt tài liệu, loại công việc nặng về thông lượng mà hóa đơn API dựa trên token có thể chiếm ưu thế trong kinh tế đơn vị.
Việc phát hành của Anthropic đã tiếp cận cùng một vấn đề từ một góc độ khác. Công ty đã công bố Claude Opus 5.5 là mẫu mới nhất trong gia đình Claude 5.5 và mô tả nó là hiệu quả hơn về token, ước tính sẽ tốn khoảng 40% chi phí vận hành ít hơn so với Opus 5. Token là các đoạn văn bản mà các mô hình xử lý, và hiệu quả token là quan trọng vì hầu hết giá API được tính theo số lượng token vào và ra.
Lãnh đạo sản phẩm của Anthropic, Dianne Penn, mô tả cơ chế này là giảm số lượng token mà mô hình cần để thực hiện cùng một công việc ở một "cài đặt nỗ lực" nhất định. "Một trong những điều mà chúng tôi đang tiếp tục đổi mới là cách làm cho suy nghĩ đó, cách làm cho việc trả lời trở nên hiệu quả hơn, để nó sử dụng ít token hơn tùy thuộc vào cài đặt nỗ lực của bạn," Penn nói.
Cả hai lần ra mắt đều diễn ra trong bối cảnh cạnh tranh giống nhau: áp lực từ các mô hình giá rẻ, trọng lượng mở, nghĩa là các mô hình có trọng lượng có sẵn để người khác chạy hoặc tinh chỉnh thay vì bị khóa sau một API được lưu trữ. Các đối thủ được nhắc đến trong bối cảnh đó là Alibaba, Moonshot AI và DeepSeek.
Thời điểm cũng quan trọng. Đây được mô tả là những phát hành đầu tiên từ cả hai phòng thí nghiệm kể từ khi cuộc tranh luận về an toàn gần đây trở nên gay gắt và các yêu cầu về việc chậm lại trên toàn ngành trong việc phát triển AI tiên tiến gia tăng. Giám đốc điều hành của Anthropic, Dario Amodei, đã kêu gọi một sự chậm lại trong những tuần gần đây, và Giám đốc điều hành của OpenAI, Sam Altman và Elon Musk cũng đã tham gia vào lời kêu gọi đó.
Cuộc tranh luận về an toàn đã được kích thích một phần bởi một bài đăng trên X vào ngày 8 tháng 9 từ cựu nhà nghiên cứu của Anthropic, Jacob Coxon, người đã nói rằng anh ta đã từ chức và cảnh báo rằng cả hai phòng thí nghiệm đều đang “cược với mạng sống của chúng ta.”
Những gì các nhà giao dịch có thể theo dõi tiếp theo: Bảng giá, Tiêu chuẩn và Sự lan tỏa trọng lượng mở
Hạn chế ngay lập tức là các thông báo chỉ mang tính định hướng, không được định giá hoàn toàn. OpenAI và Anthropic đã đưa ra các tỷ lệ phần trăm giảm giá, nhưng văn bản được cung cấp không bao gồm bảng giá API tuyệt đối, chẳng hạn như $/1M token cho đầu vào và đầu ra, hoặc bất kỳ chi tiết nào về việc các khoản cắt giảm có áp dụng đồng đều cho các cửa sổ ngữ cảnh, việc sử dụng công cụ, hoặc các chế độ lý luận tốn nhiều công sức hơn hay không.
Các tiêu chuẩn là phần nguyên thủy tiếp theo còn thiếu. Nếu không có các so sánh bên thứ ba giữa GPT-6 Sol/Luna và Claude Opus 5.5 với các phiên bản trước và với các đối thủ có trọng lượng mở được đề cập, thị trường sẽ chỉ còn lại một tín hiệu đường cong chi phí nhưng không có một delta hiệu suất theo đô la được định lượng.
Việc áp dụng là chân còn lại. Nếu Luna thực sự được tinh chỉnh cho “các nhiệm vụ khối lượng lớn,” thì sự xác thực sẽ thể hiện qua sự tăng trưởng thông lượng có thể đo lường, sự di chuyển của các nhà phát triển, hoặc sự tập trung sử dụng trong các khối lượng công việc trích xuất và tóm tắt nơi mà các triển khai trọng lượng mở có thể làm giảm giá API được lưu trữ.
Đoạn trích không cung cấp bất kỳ chỉ số sử dụng nào, vì vậy bất kỳ sự đọc tiếp theo nào về nhu cầu tính toán vẫn còn mang tính suy đoán.
Cuối cùng, các phát hành thiết lập một bài kiểm tra độ tin cậy trong ngắn hạn cho ngôn từ chậm lại. Các tuyên bố tiếp theo từ lãnh đạo về việc liệu các yêu cầu gần đây có thay đổi nhịp độ phát hành hoặc áp đặt các hạn chế triển khai sẽ quan trọng hơn mức giảm giá tiêu đề, vì nhịp độ và việc phân phối quyết định tốc độ mà suy diễn giá rẻ thực sự lan tỏa vào các khối lượng công việc sản xuất.
Đọc của tôi: Các API biên giới giá rẻ nâng cao tiêu chuẩn cho các câu chuyện ‘Token AI’ mà không cần các điểm chứng minh mới
Cơ chế ở đây rất đơn giản: cả hai phòng thí nghiệm đang cố gắng bảo vệ khối lượng suy diễn bằng cách giảm chi phí chạy hiệu quả, thông qua việc cắt giảm giá API rõ ràng (giá khuyến mãi 50% của OpenAI so với GPT-5.6) hoặc bằng cách tiếp thị hiệu quả token như “cùng một công việc, ít token hơn” (khẳng định của Anthropic rằng chạy rẻ hơn khoảng 40%).
Điều đó đọc không giống như một chương trình khuyến mãi một lần mà giống như phân khúc cho các trường hợp sử dụng nhạy cảm với chi phí, đặc biệt là trong lĩnh vực trích xuất và tóm tắt có thông lượng cao nơi mà các mô hình trọng lượng mở có thể được chạy rẻ nếu bạn có thể vận hành ngăn xếp.
Ngưỡng quan trọng là liệu các bảng giá tuyệt đối và các tiêu chuẩn độc lập có đến nhanh đủ để biến điều này từ câu chuyện thành một sự thiết lập lại hiệu suất theo đô la có thể đo lường.
Nếu các con số và dữ liệu áp dụng xác nhận rằng các mức giá rẻ hơn thực sự kéo công việc trở lại từ các triển khai trọng lượng mở, tác động thực tiễn là một mức giá sàn thấp hơn cho suy diễn mà buộc mọi câu chuyện token liên quan đến AI phải tự biện minh bằng việc sử dụng, không phải bằng khẩu hiệu.