
Kimi K3 của Moonshot thu hẹp khoảng cách giá token Mỹ
OpenRouter và Hugging Face cho thấy các mô hình của Trung Quốc đang chiếm lĩnh thị phần trên các kênh đó khi cuộc thảo luận về lệnh cấm của Mỹ và các câu chuyện IPO va chạm với nhau.
Kimi K3 của Moonshot đang được định vị như một đối thủ gần ngang hàng với mô hình tiên tiến nhất của Anthropic trong khi chi phí vận hành chỉ là một phần nhỏ, đưa chi phí trở lại trung tâm của cuộc cạnh tranh mô hình tiên tiến.
Điểm chính
- Kimi K3 của Moonshot đang được định hình là gần như tương đương với mô hình tiên tiến nhất của Anthropic trong khi tính phí thấp hơn nhiều cho mỗi đơn vị đầu ra.
- Các mô hình Trung Quốc chiếm 41,4% lượt tải mô hình sinh tạo trên Hugging Face trong số các nhà phát triển, cao hơn khoảng 5 điểm phần trăm so với các mô hình của Mỹ.
- Chỉ số chia sẻ token hàng tháng của OpenRouter cho thấy việc sử dụng mô hình Trung Quốc đã vượt qua các nền tảng của Mỹ vào tháng 6 và đã đạt hơn 60% thị phần trong tháng trước, mặc dù bộ dữ liệu này không bao gồm lưu lượng truy cập trực tiếp đến nhà cung cấp.
- Một bài kiểm tra xây dựng tác nhân tiêu chuẩn hóa “Brewberg” đã tạo ra các trang web chức năng tương đương trên hầu hết các mô hình, với Claude Fable 5 có giá khoảng 50 đô la so với 12 đô la cho Kimi K3.
Cú sốc về chi phí - hiệu suất của Kimi K3 diễn ra khi mô hình “bom tấn” mới nhất của Trung Quốc ra mắt.
Kimi K3 là sản phẩm mới nhất của Trung Quốc được coi là một bước ngoặt vì nó kết hợp vị trí chuẩn mực gần với biên giới với mức giá trông giống như một đầu vào hàng hóa hơn là một dịch vụ phần mềm cao cấp.
Mô hình này được mô tả là gần như tương đương với khả năng của mô hình tiên tiến nhất của Anthropic với chi phí chỉ một phần nhỏ, một cách định hình quan trọng vì nó chuyển trục cạnh tranh từ “ai là tốt nhất” sang “ai đủ gần với chi phí biên thấp nhất.”
Động lực này đã được hình thành kể từ khi các sản phẩm Trung Quốc trước đó cải thiện nhanh chóng về mã hóa và lý luận ngay cả khi Washington thắt chặt kiểm soát việc bán chip của Mỹ vào Trung Quốc. Vấn đề không phải là bất kỳ phòng thí nghiệm nào cũng dẫn đầu. Mà là nhịp độ phát hành đủ nhanh để khoảng cách có thể thu hẹp trong một chu kỳ sản phẩm duy nhất, và chi phí trở thành yếu tố phân biệt bền vững.
Cơ chế này rất đơn giản. Nếu một người mua có thể hoàn thành nhiệm vụ tương đương trong mã hóa và quy trình tác nhân trong khi trả ít hơn nhiều cho mỗi token đầu ra, thì chi phí chuyển đổi trở thành hoạt động thay vì kỹ thuật. Đó là cách mà “gần như tốt” trở thành “đủ tốt,” đặc biệt là cho các nhiệm vụ nền tảng nơi độ trễ, độ bóng và sự tin tưởng vào thương hiệu là thứ yếu.
Chỉ số nhận con nuôi thay đổi: Chia sẻ OpenRouter và tải xuống Hugging Face trộn lẫn
Hai kênh phân phối riêng biệt giờ đây chỉ về cùng một hướng: Các mô hình Trung Quốc đang chiếm lĩnh thị phần trên các nền tảng mà các nhà phát triển sử dụng để thử nghiệm, định tuyến và tải xuống mô hình.
Trên OpenRouter, một nền tảng trung gian truy cập vào hàng trăm mô hình và công bố một chỉ số sử dụng được theo dõi rộng rãi, việc sử dụng mô hình Trung Quốc đã vượt qua các nền tảng của Mỹ trên toàn cầu lần đầu tiên vào tháng Sáu. Dữ liệu OpenRouter cho thấy các mô hình Trung Quốc chiếm hơn 60% thị phần trong tháng trước, được đo bằng tỷ lệ token hàng tháng trên OpenRouter.
Điều cần lưu ý là vấn đề cấu trúc, không phải thẩm mỹ. OpenRouter rõ ràng không ghi lại lưu lượng truy cập gửi trực tiếp đến các nhà cung cấp, và nó chỉ đại diện cho một phần của việc sử dụng AI toàn cầu. Vì vậy, “thị phần” ở đây là tỷ lệ token được theo dõi bởi OpenRouter, không phải tổng mức tiêu thụ toàn cầu.
Tuy nhiên, đây vẫn là một tín hiệu thực sự về hành vi định tuyến của các nhà phát triển trong một môi trường mà chi phí và độ trễ thường là những bộ lọc đầu tiên.
Hugging Face, lớp lưu trữ và phân phối mặc định cho các mô hình mở, kể một câu chuyện tương tự từ một góc độ khác. Các mô hình AI Trung Quốc chiếm 41,4% số lượt tải xuống mô hình sinh ra trong số các nhà phát triển, cao hơn khoảng 5 điểm phần trăm so với các mô hình của Mỹ, và các bản phát hành của Trung Quốc được mô tả là chiếm tỷ lệ lớn nhất trong số các lượt tải xuống mô hình sinh ra trên nền tảng.
Hai chỉ số đó đo lường những điều khác nhau. OpenRouter phản ánh việc sử dụng được định tuyến qua một nhà tổng hợp cụ thể. Hugging Face phản ánh số lượt tải xuống, điều này nghiêng về phân phối trọng số mở và triển khai địa phương. Sự chồng chéo là điểm quan trọng: Các phòng thí nghiệm Trung Quốc đang thắng cả kênh “thử ngay” và kênh “mang về nhà”.
Các tiêu chuẩn và xây dựng Brewberg: nơi sự tương đồng xuất hiện và nơi hóa đơn phân kỳ
Các tiêu chuẩn có thể ồn ào, nhưng các bức ảnh gần đây đặt Kimi K3 đủ gần với nhóm hàng đầu để giá trở thành tiêu đề. Trên bảng xếp hạng Terminal-Bench 2.1 của Artificial Analysis (dữ liệu tính đến ngày 12 tháng 8 năm 2026), Kimi K3 (max) xếp hạng #6 với điểm số 85,0%. Các mục hàng đầu là GPT-5.6 của OpenAISol (xhigh) với 89,5% và Claude Opus 5 (max) của Anthropic với 89,1%.
Terminal-Bench 2.1 quan trọng vì nó không phải là một bài kiểm tra kiến thức thông thường. Nó đánh giá các nhiệm vụ kỹ thuật phần mềm thực tế như sửa lỗi, thiết lập máy chủ và quản lý tệp. Nếu một mô hình nằm trong vài điểm trên loại thang đó, người mua bắt đầu đặt câu hỏi về những gì họ đang trả tiền khi hóa đơn là ràng buộc chính.
Một bức tranh tổng quan rộng hơn (dữ liệu tính đến ngày 14 tháng 8 năm 2026) từ chỉ số Trí tuệ của Artificial Analysis v4.1.1, chỉ số Năng lực của Epoch AI và chỉ số Vals cũng đã xếp Kimi K3 vào danh sách những người dẫn đầu và đang tiến gần đến các mô hình tiên tiến của Mỹ. Điểm chung giữa các chỉ số này không phải là họ vinh danh một người chiến thắng duy nhất. Mà là họ làm cho quy tắc mua sắm mặc định "chỉ dành cho Mỹ" trở nên khó bảo vệ hơn.
So sánh chi phí rõ ràng nhất trong gói không phải là bảng xếp hạng. Đó là một bản dựng tiêu chuẩn. Trong một bài kiểm tra “vibe-coding” tùy chỉnh, bảy mô hình tiên tiến đã được yêu cầu tạo ra một trang thương mại điện tử cà phê giả tưởng có tên Brewberg sử dụng cùng một hướng dẫn. Hầu hết các mô hình đạt được độ chính xác chức năng 100% mặc dù thỉnh thoảng có sai sót về thiết kế, nhưng chi phí token lại khác biệt rõ rệt.
Claude Fable 5 đã xây dựng trang web trong chưa đầy một giờ với 100% chức năng và chi phí khoảng 50 đô la. Kimi K3 đã tạo ra một trang web trông tương tự, chức năng tương đương với giá 12 đô la, tiết kiệm hơn 75%.
Các nguyên tắc định giá giải thích tại sao khoảng cách vẫn tồn tại ngay cả khi đầu ra hội tụ. Moonshot tính phí 15 đô la cho mỗi triệu token đầu ra cho Kimi K3. V4-Pro của DeepSeek có giá 3,96 đô la cho 1 triệu token vào giờ cao điểm và một nửa số đó vào giờ không cao điểm. Dịch vụ Fable 5 của Anthropic có giá 50 đô la.
Phân tích Brewberg cũng cho thấy cách mà các quy trình làm việc có tính tác động làm tăng sự khác biệt về chi phí. Hóa đơn của Claude Fable 5 được quy cho giá token cao hơn cộng với nhiều lần gỡ lỗi và tinh chỉnh, bao gồm xác minh dựa trên ảnh chụp màn hình đã làm tăng việc sử dụng token vượt quá đầu vào văn bản. Giai đoạn đánh giá thiết lập ban đầu tốn khoảng 0,34 USD, nhưng việc duyệt và gỡ lỗi chiếm ưu thế trong chi tiêu.
Phân phối trọng số mở gặp rủi ro chính sách của Mỹ: tại sao việc cấm là khó thực thi
Rủi ro chính sách đang được thảo luận không phải về một điều duy nhấtAPIđiểm cuối. Đây là vấn đề liệu chính phủ Mỹ có hành động để hạn chế khả năng tiếp cận các mô hình AI của Trung Quốc tại Mỹ, trong cùng một loại hình rộng như các biện pháp kiểm soát trước đó đối với việc nhập khẩu xe điện và tấm pin mặt trời của Trung Quốc.
Vấn đề thực thi là nhiều mô hình hàng đầu của Trung Quốc có trọng số mở. Một mô hình có trọng số mở là mô hình mà trọng số của nó được công bố để người khác có thể tải xuống, sao chép và chạy nó cục bộ hoặc trên máy chủ của riêng họ, thay vì chỉ truy cập thông qua API của nhà cung cấp.
Điều này trái ngược với các mô hình có trọng số đóng, không thể tải xuống và thường chỉ có thể sử dụng thông qua API trả phí hoặc đăng ký do nhà cung cấp kiểm soát.
Nếu một mô hình có thể được tải xuống và chạy cục bộ, thì lệnh cấm nhằm vào việc truy cập API hướng tới người tiêu dùng không loại bỏ khả năng đó. Nó chỉ thay đổi con đường phân phối. Đó là lý do tại sao bất kỳ hạn chế nào cũng có thể cần nhắm vào các triển khai doanh nghiệp, kênh phân phối hoặc quy tắc mua sắm, và ngay cả khi đó, nó vẫn có thể bị rò rỉ.
Sự phản đối trong nước đã được tổ chức. Gần 200 công ty Mỹ đã lên tiếng phản đối lệnh cấm đối với các mô hình AI của Trung Quốc, lập luận rằng điều này sẽ làm tăng chi phí và ảnh hưởng đến khả năng cạnh tranh quốc tế của họ. Lập luận đó không phải là ý thức hệ. Nó là một mục chi phí.
Danh sách áp dụng cũng làm suy yếu ý tưởng rằng đây là một hiện tượng hoàn toàn ở nước ngoài. Các công ty Mỹ bao gồm Airbnb, DoorDash và Coinbase đã được trích dẫn là đã áp dụng các mô hình Trung Quốc được lưu trữ trên các máy chủ địa phương, một mô hình triển khai rõ ràng giảm bớt lo ngại về an ninh dữ liệu trong khi vẫn nắm bắt được lợi thế về chi phí.
Các câu chuyện định giá vào mùa IPO: những gì mà các đối thủ gần gũi hơn với giá thấp hơn có nghĩa là đối với các phòng thí nghiệm và người mua ở Mỹ
Thời điểm này thật khó xử cho các phòng thí nghiệm tiên tiến của Mỹ vì câu chuyện 'ưu thế bền vững' là một phần trong việc hỗ trợ các định giá tư nhân rất lớn khi tiến vào các cửa sổ thị trường công. Anthropic đang xem xét một IPO sớm nhất vào tháng Mười, trong khi OpenAI đang xem xét việc ra công chúng vào năm tới.
Anthropic đã huy động vốn với định giá 965 tỷ USD vào tháng Năm, và vòng gọi vốn gần đây nhất của OpenAI vào tháng Ba đã định giá nó ở mức 852 tỷ USD.
Định giá của Moonshot được trích dẫn là 35 tỷ USD, và khoảng cách giữa con số đó và các nhà lãnh đạo của Mỹ là điểm mấu chốt. Nếu một đối thủ có giá trị thấp hơn có thể cung cấp khả năng gần giống với giá token thấp hơn đáng kể, thị trường phải quyết định xem các công ty hiện tại đang bán một sản phẩm khác biệt hay đang bán sự khan hiếm.
Đây là nơi mà chi phí trở thành một biến số định giá, không chỉ là một phàn nàn của khách hàng. Các token đầu ra là đơn vị thanh toán, và các quy trình tác động nhân lên việc tiêu thụ token vì hệ thống lập kế hoạch, duyệt, gỡ lỗi và lặp lại với sự can thiệp tối thiểu của con người. Khi quy trình là nhiều bước, mô hình 'đủ tốt' rẻ nhất có thể thắng ngay cả khi mô hình tốt nhất vẫn là tốt nhất.
Các phòng thí nghiệm Trung Quốc đã nghiêng về phân phối trọng số mở có thể được lưu trữ trên các dịch vụ đám mây nước ngoài, giảm bớt lo ngại về an ninh dữ liệu ở nước ngoài ngay cả khi phải hy sinh lợi nhuận trực tiếp.
Kevin Xu của Interconnected Capital mô tả tư thế này như sau: 'Bởi vì AI còn mới, tôi nghĩ tất cả những mô hình và công ty mở này vẫn đang ở chế độ thu hút khách hàng hoặc chiếm đất', lập luận rằng các phòng thí nghiệm Trung Quốc thoải mái hơn trong việc chấp nhận lợi nhuận thấp hơn để giành thị phần.
Sự đánh đổi này có hai chiều. Robert Lea của Bloomberg Intelligence cho biết không có phòng thí nghiệm AI nào của Trung Quốc hiện có con đường rõ ràng để có lợi nhuận, và ông dự đoán rằng sự phụ thuộc của ngành vào nguồn cung token siêu rẻ sẽ giữ cho nó không có lãi trong ba năm tới. Nếu quan điểm đó là đúng, áp lực giá là có thật đối với người mua ngày nay, nhưng đường cung có thể thay đổi nếu giai đoạn trợ cấp kết thúc.
Các tín hiệu cần chú ý về các mô hình AI của Trung Quốc làm giảm giá trị của Mỹ trên
Rủi ro từ các hạn chế của Mỹ chỉ thực sự ảnh hưởng đến thị trường khi nó trở nên cụ thể. Tín hiệu đầu tiên là bất kỳ đề xuất chính sách cụ thể nào hoặc hành động của cơ quan nhằm hạn chế khả năng tiếp cận các mô hình AI của Trung Quốc tại Mỹ, và liệu nó có nhắm vào quyền truy cập API, kênh phân phối, hay triển khai doanh nghiệp.
Mỗi mục tiêu ngụ ý một bề mặt thực thi khác nhau, và việc phân phối trọng số mở khiến "khả năng tiếp cận" trở thành một khái niệm khó nắm bắt.
Tín hiệu thứ hai là liệu chỉ số chia sẻ token hàng tháng của OpenRouter có duy trì các mô hình Trung Quốc trên 60% hay không, hoặc có đảo ngược. Tập dữ liệu không bao gồm lưu lượng truy cập trực tiếp đến nhà cung cấp, vì vậy đây không phải là một thống kê thị phần đầy đủ, nhưng nó cung cấp một cái nhìn rõ ràng về hành vi định tuyến bên trong một nền tảng mà các nhà phát triển thực sự sử dụng.
Thứ ba là liệu tỷ lệ tải xuống mô hình sinh của Hugging Face có giữ ở mức 41,4% thị phần Trung Quốc như đã trích dẫn hay mở rộng so với các mô hình của Mỹ khi các phiên bản mới được phát hành. Tải xuống không phải là doanh thu, nhưng chúng là một lợi thế phân phối, và phân phối là điều làm cho cuộc chiến giá cả trở nên bền vững.
Tín hiệu cuối cùng là sự rõ ràng về thời gian IPO và bất kỳ thông tin cập nhật nào về định giá hoặc doanh thu.địa chỉáp lực giá. Khung thời gian “sớm nhất vào tháng Mười” của Anthropic và kế hoạch “năm sau” của OpenAI gần nhau đến mức các nhà đầu tư sẽ buộc phải bảo lãnh các giả định về biên lợi nhuận trong một thế giới mà các đối thủ gần gũi đang đào tạo người dùng để mong đợi các token rẻ hơn.
Cảm nhận của tôi: giao dịch không phải là “Trung Quốc thắng,” mà là “biên lợi nhuận AI bị cạnh tranh nhanh hơn so với giá thị trường.”
Phần quyết định điều này không phải là liệu Kimi K3 có đánh bại mô hình hàng đầu của Mỹ trên bảng xếp hạng hay không. Mà là liệu “đủ gần” cộng với việc giảm hóa đơn 75% trở lên có trở thành logic mua sắm mặc định cho phần ngày càng tăng của việc sử dụng AI mà có tính chất tác động, nền tảng và nhạy cảm về chi phí hay không.
Bài kiểm tra Brewberg là một vi mô hữu ích vì nó giữ cho câu lệnh không đổi và để cho kinh tế học lên tiếng: hầu hết các mô hình đạt 100% độ chính xác chức năng, và hóa đơn vẫn tách biệt Claude Fable 5 khoảng 50 đô la so với Kimi K3 ở mức 12 đô la.
Nếu mô hình đó được tổng quát hóa, áp lực sẽ rơi vào hai nơi. Người mua có một lựa chọn bên ngoài đáng tin cậy, điều này làm giảm sức mạnh định giá cho các công ty hiện tại có trọng số đóng, những công ty kiếm tiền thông qua API trả phí và đăng ký.
Rủi ro chính sách của Mỹ sau đó trở thành một yếu tố thứ cấp, không phải là động lực chính: các hạn chế có thể làm chậm quá trình áp dụng ở mức biên, nhưng phân phối trọng số mở khiến việc cấm hoàn toàn trở nên khó thực thi, và gần 200 công ty Mỹ đã lập luận rằng việc chặn các mô hình rẻ hơn sẽ làm tăng chi phí của họ.
Có một trường hợp vô hiệu hóa. Nếu tỷ lệ cổ phần của OpenRouter quay trở lại dưới 60% và tỷ lệ tải xuống của Hugging Face không còn ưu ái cho các bản phát hành của Trung Quốc, thì việc đọc "động lực chấp nhận" sẽ nhanh chóng yếu đi vì đó là hai thước đo cụ thể trong gói.
Cũng có một câu hỏi về tính bền vững ở phía cung: nếu Robert Lea đúng rằng nguồn cung token siêu rẻ khiến các phòng thí nghiệm của Trung Quốc thua lỗ trong ba năm tới, thị trường phải quyết định xem giá cả hôm nay có phải là một điểm cân bằng ổn định hay một khoản trợ cấp chiếm đất.
Ngưỡng quan trọng là liệu chi phí có vẫn là yếu tố phân biệt quyết định ngay cả khi khả năng vẫn nằm trong vài điểm trên các tiêu chuẩn thực tế như Terminal-Bench, vì điều đó sẽ xác nhận rằng biên lợi nhuận AI đang bị cạnh tranh nhanh hơn so với những gì mà các định giá thời kỳ IPO đã giả định.