A glowing computer screen displaying a lightning
Trí tuệ nhân tạo

DeepSeek ra mắt V4 Flash, giá đầu ra chỉ $0.28

Động thái định giá gần biên giới diễn ra chỉ vài ngày sau khi OpenAI giảm giá đầu ra của GPT-5.6 Luna xuống 80% ba tuần sau khi ra mắt.

Bởi Elliot Marsh5 phút đọc

DeepSeek đã phát hành V4 Flash, một mô hình tập trung vào lập trình mà họ định vị gần với Claude Opus 4.8 của Anthropic về các nhiệm vụ lập trình phức tạp và phần mềm tự động, trong khi giá đầu ra khoảng $0.28 so với $25 cho đầu ra tương đương của Opus 4.8. Việc phát hành này làm tăng cường cuộc chiến giá API AI vào cuối tháng 7, đang nén biên lợi nhuận của các nhà cung cấp mô hình và chuyển giá trị về các lớp định tuyến và phân phối.

DeepSeek V4 Flash ra mắt với cú sốc giá 99%

Mô hình mới V4 Flash của DeepSeek được công bố là “DeepSeek-V4-Flash-0731” và được tiếp thị là hoạt động gần với Claude Opus 4.8 của Anthropic về các nhiệm vụ lập trình phức tạp và phần mềm tự động. Cơ chế rất đơn giản và tàn nhẫn: DeepSeek đang cố gắng thiết lập lại giá thanh toán cho việc tạo mã cao cấp bằng cách làm cho mục đầu ra gần như biến mất.

So sánh của chính DeepSeek đã chỉ ra khoảng cách bằng những đồng đô la rõ ràng. Họ cho biết họ tính phí khoảng $0.28 cho cùng một lượng đầu ra mà Claude Opus 4.8 tính phí $25, coi đây là một khoản giảm giá 99%.

Tín hiệu hiệu suất ban đầu được chỉ ra là bảng xếp hạng lập trình front-end crowdsourced của Arena.ai, nơi V4 Flash được trích dẫn là ra mắt trước Opus 4.8 trong khi cung cấp hiệu suất tốt nhất cho giá của nó trong phân khúc. Điều này có ích cho các nhà giao dịch vì nó phản ánh sở thích của người dùng trực tiếp, nhưng không phải là một tiêu chuẩn kiểm soát.

Tài liệu trích dẫn không bao gồm chi tiết phương pháp hoặc điểm số số học, và ngôn ngữ giá “khoảng” có thể ẩn giấu các giả định về kế toán token và cấp độ.

Một bức tranh giá riêng biệt trong cùng một gói, có ngày 31 tháng 7 năm 2026, đã đưa ra giá đầu ra cho mỗi 1 triệu token là $0.28 cho DeepSeek V4 Flash ở mức thấp và $30 cho GPT-5.6 ở mức cao.Soltrên mức cao. Token là các đoạn văn bản mà các mô hình đọc và tạo ra, và hầu hết cácAPItính phí theo 1 triệu token đầu vào hoặc đầu ra.

Cắt giảm cuối tháng Bảy biến đầu ra mô hình thành hàng hóa

Sự ra mắt này đang diễn ra trong một thị trường đang định giá lại nhanh hơn so với chu kỳ mô hình có thể biện minh. OpenAI đã cắt giảm giá đầu ra của GPT-5.6 Luna xuống 80% vào một ngày thứ Năm được đề cập trong cùng một thời gian, chỉ ba tuần sau khi Luna ra mắt. Trong bức ảnh chụp ngày 31 tháng 7, Luna đã giảm từ 6 đô la xuống 1,20 đô la sau khi cắt.

Phần còn lại của băng ghi cuối tháng Bảy đọc như một sự chuyển hướng phối hợp về hiệu quả. Google đã phát hành ba mô hình Gemini “flash” mới tập trung vào hiệu quả. SpaceXAI đã phát hành Grok 4.5 với cùng mức giá mà OpenAI đã tính cho Luna trước khi cắt giảm trong tuần.

Meta cũng đã “lặng lẽ đảo ngược hướng đi” về trọng số mở, chuyển sang không phát hành các tham số mô hình mà người khác có thể chạy hoặc tinh chỉnh, với Muse Spark 1.1 được mô tả là một mô hình mã nguồn đóng có giá cả cạnh tranh cho các nhà phát triển.

Hệ quả kinh tế là sức mạnh của người mua. Khi các khoảng cách về hiệu suất bị thu hẹp và khối lượng công việc lập trình có thể được thử nghiệm A/B nhanh chóng, chi phí chuyển đổi giảm và việc mua sắm bắt đầu trông giống như một bài toán tối ưu hóa $/token hơn là một quyết định “chọn phòng thí nghiệm của bạn”.

Zack Kass, cựu giám đốc tiếp thị của OpenAI, đã mô tả động lực này là “lợi nhuận mô hình giảm dần”, thêm vào đó: “Vào một thời điểm nào đó, mô hình tiếp theo không còn quan trọng với bạn,” điều này về cơ bản là lời giải thích từ phía cầu về lý do tại sao các đợt cắt giảm giá hiện đang thực hiện công việc mà các bản phát hành trước đây đã làm.

Anthropic là trường hợp rõ ràng nhất trong khung này, giữ các mô hình Claude hàng đầu ở mức giá cao và đặt cược rằng các nhà phát triển sẽ trả thêm cho sự an toàn và độ chính xác. Quan điểm đó có thể trở thành một phân khúc cao cấp bền vững, hoặc nó trở thành bản in giá cao cuối cùng trước khi phải định giá lại nếu các nhà phát triển tiếp tục di chuyển đến các đồng nghiệp gần gũi.

Các tín hiệu mà nhà giao dịch có thể theo dõi: Các nhà giữ giá cao, cược khối lượng và lớp định tuyến

Kiểm tra gần hạn đầu tiên là liệu các tuyên bố lập trình “gần-Opus 4.8” của V4 Flash có được xác nhận ngoài bảng xếp hạng Arena.ai đã được trích dẫn trong 1-2 tuần tới hay không. Nếu các đánh giá của bên thứ ba hội tụ, động thái định giá sẽ không còn là một trò biểu diễn mà bắt đầu trông giống như một điểm tham chiếu mới cho đầu ra lập trình cao cấp.

Thứ hai là liệu Anthropic có phản hồi về cấu trúc giá cả thay vì tiếp thị hay không. Thị trường hiện đang nhìn vào so sánh $0.28 của DeepSeek với $25, và quyết định thực tế là nhị phân: duy trì giá cao cấp, hoặc giới thiệu một cấp độ giá thấp hơn mà nhượng bộ cho lối đi hàng hóa.

Thứ ba là liệu OpenAI có tiếp tục nén băng sau đợt cắt giảm 80% Luna hay không. Bức ảnh chụp ngày 31 tháng 7 đã trải dài từ $0.28 đến $30 cho 1 triệu token đầu ra, và một đợt cắt giảm khác sẽ báo hiệu rằng việc bảo vệ thị phần đã trở nên quan trọng hơn việc bảo vệ biên lợi nhuận trên mỗi token.

Thứ tư là việc áp dụng “các bộ định tuyến thông minh,” phần mềm định tuyến mỗi yêu cầu đến mô hình tốt nhất cho công việc dựa trên khả năng, tốc độ và giá cả. Phó chủ tịch Qualcomm Vinesh Sukumar đã lập luận rằng điều này có thể trở thành một lớp sinh lợi, và ý nghĩa thị trường thì rõ ràng: nếu định tuyến trở thành mặc định, sức mạnh định giá của phòng thí nghiệm đơn lẻ sẽ bị xói mòn vì người mua không còn phải cam kết với một nhà cung cấp.

Quan điểm của tôi: Cuộc chiến đang chuyển từ 'Mô hình tốt nhất' sang 'Phân phối tốt nhất'

Phần quan trọng ở đây không phải là V4 Flash có thực sự 'tốt hơn' Opus 4.8 trên một thang đo tuyệt đối hay không. Mà là liệu nó có đủ gần để các nhà phát triển có thể coi đầu ra mã là có thể thay thế và định tuyến theo giá, vì việc định giá $0.28 của DeepSeek so với $25 là một nỗ lực nhằm cố định hành vi đó.

Bài kiểm tra thực sự là liệu khối lượng có thể vượt qua sự nén biên lợi nhuận hay không. Sam Altman đã ghi nhận luận điểm khối lượng trên biên lợi nhuận, nói rằng: 'Chúng tôi sẽ có quá nhiều người sử dụng các mô hình của mình đến mức chúng tôi không cần phải là một doanh nghiệp có biên lợi nhuận cực cao để có thể chi trả cho việc đào tạo mô hình,' và điều đó chỉ hoạt động nếu phân phối và định tuyến giữ cho nhu cầu ổn định khi giá giảm.

Nếu các bộ định tuyến và thị trường trở thành giao diện mua sắm mặc định, những người chiến thắng trông sẽ ít giống như các phòng thí nghiệm 'mô hình tốt nhất' và nhiều hơn như bất kỳ ai kiểm soát luồng yêu cầu.

Nguồn