
OpenAI ra mắt GPT-6 Astra sau 12 mô hình trong 6 tuần
Chi phí suy diễn đang bị nén lại nhờ việc cắt giảm đọc bộ nhớ đệm và giá Flash phẳng, trong khi các cấp độ có khả năng mạng đang chuyển sang các chương trình có kiểm soát.
OpenAI đã ra mắt GPT-6 Astra vào ngày 3 tháng 9 năm 2026, với đồng sáng lập Greg Brockman gọi đây là sự khởi đầu của "kỷ nguyên AGI." Sự ra mắt này đánh dấu việc phát hành 12 mô hình tiên phong trong khoảng sáu tuần, một đợt bùng nổ hiện đang định hình lại cả giá cả suy diễn và ai sẽ có quyền truy cập vào những khả năng liên quan đến an ninh nhất.
Điểm chính
- OpenAI đã phát hành GPT-6 Astra vào ngày 3 tháng 9 năm 2026, và Greg Brockman đã định hình nó như là sự khởi đầu của "kỷ nguyên AGI."
- Astra là mô hình đầu tiên của OpenAI đạt đến cấp độ "quan trọng" trong Khung Chuẩn Bị, và việc triển khai của nó được giới hạn với quyền truy cập doanh nghiệp Daybreak trước tiên và không có thời gian biểu công bố cho việc cung cấp đầy đủ.APIhoặc khả năng AWS Bedrock.
- Anthropic đã giảm giá đọc bộ nhớ Claude Fable 5.1 xuống 75% còn $0.25 cho mỗi triệu token trong khi giữ giá tiêu đề ở mức $10/$50, thay đổi kinh tế cho các khối lượng công việc sản xuất ngữ cảnh lặp lại.
- Google đã giữ giá giới thiệu của Gemini Flash ở mức $0.75/$3.75 cho mỗi triệu token đến hết ngày 31 tháng 12 năm 2026, trong khi hạn chế Gemini 3.8 Flash Cyber cho các chính phủ và các nhà điều hành cơ sở hạ tầng quan trọng thông qua Fairwind.
GPT-6 Astra Hạ cánh như là lần ra mắt thứ 12 trong sáu tuần
GPT-6 Astra đã được phát hành vào ngày 3 tháng 9 năm 2026, và đồng sáng lập OpenAI Greg Brockman đã gọi đây là sự khởi đầu của "kỷ nguyên AGI." OpenAI cũng mô tả Astra như một "bước nhảy thế hệ," ngôn ngữ mà thường sẽ là toàn bộ câu chuyện.
Khung cảnh liên quan đến nhà giao dịch hơn là nhịp độ. Astra đã ra mắt như là mô hình biên giới thứ 12 trong khoảng sáu tuần, sau các lần ra mắt liên tiếp từ Anthropic, Google, SpaceXAI và nhiều phòng thí nghiệm Trung Quốc. Khi lịch trình phát hành trông như thế này, các câu chuyện về mô hình đơn lẻ bắt đầu trở nên kém quan trọng hơn so với những gì cuộc chạy nước rút này làm với kinh tế đơn vị và phân phối.
Cuộc chạy nước rút đó bao gồm các phát hành trọng số mở như Kimi K3 của Moonshot AI (16 tháng 7) và V4-Pro GA của DeepSeek (13 tháng 8), cùng với các sản phẩm nhanh chóng theo kiểu “Flash” từ Google và Z.ai. Mô hình biên giới, trong bối cảnh này, có nghĩa là cấp độ cao nhất mà các phòng thí nghiệm khả năng sử dụng để định nghĩa công nghệ tiên tiến, và khoảng thời gian này có đủ để biến giá cả và quyền truy cập thành chiến trường thực sự.
Các tiêu chuẩn gần trần, nhưng quyền truy cập mới là rào cản thực sự
OpenAI đã công bố điểm chuẩn mà thực tế chạm trần trên một số bài kiểm tra công khai: 98% trên FrontierMath Tier 4, 99.9% trên ARC-AGI-3, và 100% trên ExploitBench. Vấn đề là những con số này được tự báo cáo trong tài liệu nguồn và không được xác minh độc lập vào thời điểm viết, điều này khiến chúng vừa là tiêu đề vừa là cờ rủi ro cùng một lúc.
Khả năng nổi bật của Astra là “sử dụng máy tính,” được mô tả là điều hướng máy tính như một người: điền bảng tính, duyệt web và xây dựng ứng dụng từ các lệnh thoại. Brockman cho biết Astra có thể làm “bất cứ điều gì mà con người có thể làm với máy tính” và gọi tốc độ của nó là “siêu nhân” trong một số nhiệm vụ nhất định.
Về mặt cơ học, tính năng đó quan trọng vì nó biến mô hình thành một người vận hành, không chỉ là một trình tạo văn bản, điều này chính xác là lớp khả năng thường va chạm với các rào cản an ninh và chính sách.
Việc tự kiểm soát của OpenAI làm điều đó trở nên rõ ràng. Công ty cho biết Astra là mô hình đầu tiên kích hoạt cấp độ “quan trọng” trong Khung Chuẩn Bị của nó, khung rủi ro nội bộ của nó để đánh giá và hạn chế các khả năng có thể nguy hiểm, đặc biệt là trong an ninh mạng.
Phân phối theo tư thế rủi ro đó: Khách hàng doanh nghiệp trong chương trình Daybreak của OpenAI được truy cập trước, sau đó là người dùng ChatGPT Plus, Pro, Business và Enterprise “trong những ngày tới,” trong khi quyền truy cập API đầy đủ và AWS Bedrock được lên kế hoạch mà không có thời gian biểu công bố.
Đối với các nhà giao dịch, thứ tự đó là điểm mấu chốt. Các tiêu đề khả năng có thể được công bố trước khi có sẵn rộng rãi, và diện tích có thể kiếm tiền là API và các kênh đám mây, không phải là một đợt phát hành theo giai đoạn bắt đầu với một nhóm doanh nghiệp hẹp.
Cuộc chiến giá im lặng: Cắt giảm đọc bộ nhớ đệm và định giá Flash phẳng
Sự thay đổi cụ thể nhất trong cuộc chạy nước rút này không phải là sự khác biệt trong điểm chuẩn. Đó là cách mà việc suy diễn đang được định giá lại, đặc biệt là cho các khối lượng công việc lặp lại, nơi mà bộ nhớ đệm chiếm ưu thế trong hóa đơn.
Việc phát hành Claude Fable 5.1 của Anthropic vào ngày 1 tháng 9 giữ giá tiêu đề ở mức 10$/50$ cho mỗi triệu token, nhưng đã cắt giảm giá đọc bộ nhớ đệm 75% từ 1,00$ xuống 0,25$ cho mỗi triệu token. Giá đọc bộ nhớ đệm là phí giảm giá cho việc tái sử dụng ngữ cảnh đã được xử lý trước đó, vì vậy các truy vấn lặp lại không phải trả toàn bộ chi phí đầu vào một lần nữa.
Điều này quan trọng nhất đối với các hệ thống sản xuất mà giữ nguyên ngữ cảnh giống nhau, như chatbot, trợ lý mã và các pipeline RAG, nơi mà việc tạo ra tài liệu tăng cường lấy tài liệu và đưa chúng trở lại mô hình ở mỗi lượt.
Động thái của Google thì yên lặng hơn nhưng cũng có định hướng tương tự. Qua ba lần phát hành Gemini Flash trong sáu tuần, Google giữ giá khởi điểm ở mức 0,75 USD/3,75 USD cho mỗi triệu token cho đến ngày 31 tháng 12 năm 2026: Gemini 3.6 Flash (21 tháng 7), Gemini 3.7 Flash (13 tháng 8), và Gemini 3.8 Flash (2 tháng 9).
Việc giữ giá ổn định qua các vòng lặp nhanh là một tuyên bố về nơi mà phòng thí nghiệm nghĩ rằng giá thị trường sẽ đi tới, và nó gây áp lực lên các đối thủ cạnh tranh phải cạnh tranh về cơ chế thanh toán và phân khúc sản phẩm thay vì chỉ đơn giản là tăng giá niêm yết.
Đây là nơi câu chuyện về "kinh tế suy diễn" trở nên thực sự. Nếu việc đọc bộ nhớ cache trở nên rẻ hơn và các mô hình nhanh vẫn giữ giá rẻ, chi phí biên để chạy các vòng lặp tác nhân giảm xuống, và nút thắt chuyển sang hướng truy cập, tuân thủ, và ai được phép triển khai các biến thể mạnh nhất.
Các Biến Thể Có Khả Năng An Ninh Mạng Di Chuyển Vào Các Chương Trình Bị Hạn Chế
Một mẫu mà trước năm 2026 không tồn tại giờ đã trở nên nhất quán ở các phòng thí nghiệm lớn: các khả năng liên quan đến an ninh mạng nhất đang được tách ra thành các cấp độ bị hạn chế thay vì được bán như quyền truy cập API tiêu chuẩn.
Phiên bản của OpenAI là Gating Chuẩn Bị. Astra là "quan trọng", và quyền truy cập bắt đầu với Enterprise Daybreak trước khi mở rộng sang các cấp độ ChatGPT rộng hơn, với API và AWS Bedrock được lên kế hoạch nhưng chưa có lịch trình. Đó là một sự triển khai có quyền cho phép theo thiết kế, không phải là sự trì hoãn tiếp thị.
Phiên bản của Anthropic là phân nhánh sản phẩm. Claude Fable 5.1 là mô hình hướng ra công chúng, trong khi Mythos 5.1 được mô tả là cùng một mô hình với các biện pháp bảo vệ lỏng lẻo hơn và bị hạn chế cho các tổ chức được kiểm duyệt ở Mỹ thông qua Dự án Glasswing. Cơ chế này rất đơn giản: khả năng không chỉ được định giá, mà còn được cấp phép, và việc cấp phép này gắn liền với danh tính và quyền tài phán.
Phiên bản của Google là hạn chế theo chương trình. Gemini 3.8 Flash Cyber là một biến thể phòng thủ an ninh mạng chỉ có sẵn thông qua Chương trình Fairwind của Google dành cho các chính phủ và các nhà điều hành cơ sở hạ tầng quan trọng. Dòng Flash cơ bản vẫn được tiếp cận rộng rãi với giá khởi điểm thấp, trong khi cấp độ có khả năng an ninh mạng nằm sau một cánh cổng trông giống như mua sắm hơn là API tự phục vụ.
Điều nổi bật là sự hội tụ. Các phòng thí nghiệm khác nhau đang sử dụng các lớp bọc khác nhau, nhưng cùng một động thái cơ bản đang diễn ra: "an ninh mạng" đang trở thành một kênh phân phối có kiểm soát, không chỉ là một tính năng đánh dấu trên SKU chủ lực.
Áp Lực Cân Nặng Mở Của Trung Quốc và Các Yêu Cầu Token Đầu Ra Dưới 0,50 USD
Câu chuyện áp lực giá của cuộc chạy đua đang được thiết lập bởi các phòng thí nghiệm Trung Quốc vận chuyển các mô hình quy mô biên giới với trọng số mở hoặc gần như mở. Trọng số mở có nghĩa là các tham số đã được đào tạo có sẵn để tải xuống, vì vậy các nhà phát triển có thể tự chạy và tinh chỉnh mô hình thay vì chỉ tiêu thụ nó thông qua một API được lưu trữ. Điều đó thay đổi lựa chọn bên ngoài cho người mua, điều này buộc phải khám phá giá.
Kimi K3 của Moonshot AI (16 tháng 7) được mô tả là một mô hình mở với 2.8T tham số và cửa sổ ngữ cảnh 1M dưới giấy phép MIT đã được sửa đổi. V4-Pro GA của DeepSeek (13 tháng 8) được mô tả là một mô hình hỗn hợp chuyên gia với 1.6T tham số, kích hoạt 49B tham số cho mỗi truy vấn, cũng với cửa sổ ngữ cảnh 1M và giấy phép MIT.
Hỗn hợp chuyên gia quan trọng ở đây vì nó giảm thiểu tính toán cho mỗi yêu cầu bằng cách chỉ kích hoạt một phần của mạng, điều này là một lý do khiến các mô hình này có thể được cung cấp với giá rẻ.
Tài liệu nguồn cũng cho rằng các mô hình biên mở của Trung Quốc đã đẩy giá API xuống dưới 0.50 đô la cho mỗi triệu token đầu ra, tạo ra áp lực giảm giá liên tục lên giá cả của các phòng thí nghiệm phương Tây. Các ví dụ là nhất quán theo hướng nhưng không hoàn toàn chính xác về con số.
GLM-5.3-Flash của Z.ai (26 tháng 8) được liệt kê với giá cả mâu thuẫn trong cùng một nguồn: một bảng cho thấy 0.15/0.50 đô la cho mỗi triệu token, trong khi văn bản sau đó gọi giá khởi điểm là 0.075/0.25 đô la. Tầng Flash của DeepSeek được trích dẫn với giá 0.14 đô la cho mỗi triệu token đầu vào, nhưng giá token đầu ra không được chỉ định trong đoạn trích.
Qwen 3.8-Max của Alibaba thêm vào một yếu tố khác: hiệu suất cạnh tranh ở mức giá thấp hơn. Qwen 3.8-Max ra mắt vào ngày 3 tháng 8 với giá được trích dẫn là 2/6 đô la cho mỗi triệu token, và một bản cập nhật của Qwen 3.8-Max-0902 vào ngày 2 tháng 9 được cho là đã vượt qua Code Arena WebDev với 1,691 điểm, cao hơn ba điểm so với Claude Opus 5 Max trong đánh giá đó.
Ngay cả với những bất nhất nội bộ, cơ chế vẫn nhất quán. Trọng số mở cộng với các tầng lưu trữ rẻ thiết lập một mức giá tham chiếu, và các phòng thí nghiệm phương Tây phản ứng bằng cách cắt giảm các phần của hóa đơn mà chiếm ưu thế trong khối lượng công việc thực tế, như đọc bộ nhớ cache, trong khi phân đoạn các khả năng nhạy cảm nhất phía sau các chương trình xác minh.
Các tín hiệu cần theo dõi cho cuộc đua mô hình AI biên nén giá cả
Tín hiệu đầu tiên là liệu OpenAI có công bố một thời gian biểu chắc chắn cho việc truy cập đầy đủ API GPT-6 Astra và khả năng AWS Bedrock hay không. Nếu không có ngày tháng, việc phân phối 'đã lên kế hoạch' không phải là điều mà thị trường có thể mô hình hóa, và điều này giữ cho khoảng cách giữa các tiêu đề khả năng và truy cập có thể kiếm tiền rộng.
Tín hiệu thứ hai là liệu các phòng thí nghiệm khác có theo chân Anthropic bằng cách cắt giảm giá đọc bộ nhớ cache thay vì chỉ cắt giảm giá token đầu vào và đầu ra hay không. Đọc bộ nhớ cache là nơi mà các hệ thống ngữ cảnh lặp lại phải trả tiền, và một động thái rộng rãi ở đó sẽ xác nhận rằng biên cạnh tranh đang chuyển từ giá danh sách sang các nguyên tắc lập hóa đơn.
Tín hiệu thứ ba là sự mở rộng phạm vi trong các chương trình mạng hạn chế. Nếu điều kiện đủ điều kiện Daybreak mở rộng, nếu Dự án Glasswing mở rộng ra ngoài các tổ chức Mỹ đã được kiểm tra, hoặc nếu tiêu chí Fairwind của Google mở rộng ra ngoài các chính phủ và các nhà điều hành cơ sở hạ tầng quan trọng, điều đó sẽ làm phẳng đường cong cấp phép.
Nếu các cổng đó thắt chặt, điều đó sẽ chính thức hóa một thị trường hai tầng nơi các khả năng liên quan đến an ninh nhất là khan hiếm về cấu trúc.
Tín hiệu cuối cùng là làm rõ về việc công bố giá của các phòng thí nghiệm Trung Quốc, đặc biệt là khi gói chứa các bất nhất nội bộ như GLM-5.3-Flash. Nếu tuyên bố dưới 0.50 đô la cho mỗi triệu token đầu ra sẽ là điểm neo cho câu chuyện, thị trường sẽ cần các điều khoản giá cả sạch, có thể so sánh.
Đọc của tôi: Các nhà giao dịch nên theo dõi đường cong chi phí và đường cong cấp phép một cách riêng biệt
Tôi đọc sprint sáu tuần này như hai đường cong di chuyển theo hướng ngược nhau. Đường cong chi phí đang nén lại nhanh chóng, và bằng chứng rõ ràng nhất là cơ học: Anthropic giảm giá đọc bộ nhớ từ 1,00 USD xuống 0,25 USD cho mỗi triệu token trong khi giữ giá tiêu đề ở mức 10 USD/50 USD, và Google giữ giá Flash ở mức 0,75 USD/3,75 USD qua ba lần phát hành cho đến ngày 31 tháng 12 năm 2026. Đó không phải là những tuyên bố tiếp thị. Đó là các điều khoản thanh toán, và các điều khoản thanh toán là nơi việc áp dụng sản xuất xảy ra hoặc bị đình trệ.
Đường cong quyền truy cập đang thắt chặt cùng một lúc. OpenAI gán nhãn Astra là “quan trọng” theo Khung Chuẩn bị của mình và kiểm soát việc triển khai thông qua Daybreak, Anthropic hạn chế Mythos 5.1 thông qua Dự án Glasswing, và Google đưa Flash Cyber vào phía sau Fairwind đều chỉ ra cùng một kết quả: các khả năng liên quan đến bảo mật nhất đang được coi như cơ sở hạ tầng được kiểm soát, không phải là một API hàng hóa.
Điều đó hoạt động cho đến khi một đối thủ có thể cung cấp khả năng tương tự mà không cần cùng một cổng, đây là nơi áp lực trọng lượng mở từ Trung Quốc trở thành yếu tố thúc đẩy.
Ngưỡng quan trọng là liệu Astra có trở nên rộng rãi thông qua phân phối API đầy đủ và các kênh đám mây theo một thời gian cụ thể, hay liệu “quan trọng” trở thành một cái cớ bền vững cho sự khan hiếm. Nếu OpenAI công bố ngày và Astra có mặt trên AWS Bedrock đúng thời hạn, khung “thế hệ AGI” bắt đầu chuyển thành một sự kiện phân phối thực sự.
Nếu các thời gian vẫn mơ hồ trong khi các cấp độ có khả năng mạng máy tính qua các phòng thí nghiệm vẫn bị khóa sau các chương trình thẩm định, thì tác động thực sự của sprint đến thị trường không phải là khả năng, mà là một chuỗi cung ứng phân nhánh nơi suy diễn rẻ tiền dồi dào nhưng quyền truy cập hàng đầu là khan hiếm.tài sản..
Điều này quan trọng về mặt thực tiễn nếu quý tiếp theo mang lại cả việc phân phối Astra rộng rãi hơn và cắt giảm đọc bộ nhớ trên toàn ngành, vì điều đó sẽ xác nhận luận điểm cốt lõi: biên giới đang trở nên rẻ hơn để vận hành trong khi trở nên khó tiếp cận hơn.