
Anthropic ngăn chặn việc lạm dụng Claude liên quan đến vũ…
Báo cáo về mối đe dọa kéo dài từ tháng 12 năm 2025 đến tháng 8 năm 2026 và diễn ra trong bối cảnh chia rẽ chính trị ở Mỹ về việc làm chậm AI so với việc “chiến thắng” nó.
Anthropic cho biết một báo cáo tình báo về mối đe dọa mới đã xác định và ngăn chặn các nỗ lực sử dụng các mô hình Claude của họ cho "hoạt động ác ý" có thể hỗ trợ phát triển vũ khí sinh học, bao gồm năm nghiên cứu trường hợp liên quan đến vũ khí sinh học. Sự tiết lộ này đến khi các nhà lãnh đạo Mỹ công khai khác biệt giữa việc kêu gọi tạm dừng hoặc cấm "siêu trí tuệ" và một nỗ lực cạnh tranh để tăng tốc phát triển AI nhằm lợi thế chiến lược.
Điểm chính
- Anthropic cho biết họ đã xác định và ngăn chặn các nỗ lực sử dụng Claude cho "hoạt động ác ý" có thể hỗ trợ phát triển vũ khí sinh học, ghi lại năm nghiên cứu trường hợp liên quan đến vũ khí sinh học.
- Công ty đã đặt khoảng thời gian ngăn chặn việc sử dụng ác ý của Claude Haiku, Sonnet và Opus từ tháng 12 năm 2025 đến tháng 8 năm 2026.
- Báo cáo tương tự đã mô tả sáu trường hợp Claude được sử dụng để xây dựng phần mềm cho vũ khí thông thường, bao gồm đạn dược và hệ thống nhắm mục tiêu và điều khiển của chúng.
- Anthropic cũng liên kết việc sử dụng sai trái với gián điệp mạng và các hoạt động ảnh hưởng, bao gồm hoạt động liên quan đến một chiến dịch có trụ sở tại Nga và một tổ chức tuyên truyền của Iran.
Anthropic cho biết họ đã ngăn chặn việc sử dụng sai trái liên quan đến vũ khí sinh học của Claude qua năm nghiên cứu trường hợp.
Anthropic cho biết báo cáo tình báo về mối đe dọa mới nhất của họ đã xác định và ngăn chặn các nỗ lực sử dụng các mô hình AI Claude của họ cho "hoạt động ác ý" có thể hỗ trợ phát triển vũ khí sinh học. Công ty cho biết báo cáo đã nêu bật "năm nghiên cứu trường hợp của các tác nhân sử dụng các mô hình của chúng tôi theo cách có thể hỗ trợ phát triển vũ khí sinh học."
Về mặt cơ học, một báo cáo tình báo về mối đe dọa là một sự tiết lộ định kỳ về cách một công ty phát hiện, điều tra và chặn các hoạt động lạm dụng liên quan đến sản phẩm của mình.
Trong trường hợp này, Anthropic đã định hình việc sử dụng sinh học sai trái như "một trong những rủi ro nghiêm trọng nhất của mô hình AI tiên tiến," sử dụng "tiên tiến" để chỉ một hệ thống có khả năng cao gần đạt đến trình độ nghệ thuật có thể tạo ra các rủi ro lạm dụng mới.
Anthropic cho biết họ đã ngăn chặn "việc sử dụng ác ý" của Claude Haiku, Sonnet và Opus trong khoảng thời gian từ tháng 12 năm 2025 đến tháng 8 năm 2026.
Họ cũng cho biết không có trường hợp sử dụng sai trái nào liên quan đến Claude Fable hoặc các mô hình mạnh mẽ thuộc lớp Mythos, ngoại trừ một trường hợp chưng cất, một kỹ thuật mà trong đó một mô hình nhỏ hơn được huấn luyện để bắt chước đầu ra của một mô hình lớn hơn và có thể chuyển giao khả năng với chi phí thấp hơn.
Căng thẳng cốt lõi của báo cáo là việc sử dụng kép. Anthropic cho biết, “Thông tin giống nhau có thể được sử dụng để phát triển vũ khí sinh học cũng có thể được sử dụng để phát triển, ví dụ, một loại vắc xin hoặc một phương pháp chữa trị cho một căn bệnh,” và cảnh báo rằng nếu không có các biện pháp bảo vệ, những khả năng như vậy “có thể có hậu quả thảm khốc.”
Những gì khác mà báo cáo cáo buộc: gián điệp mạng, tuyên truyền, lừa đảo, giám sát và phần mềm vũ khí.
Báo cáo của Anthropic đã mở rộng khung lạm dụng ra ngoài an ninh sinh học vào một tập hợp hỗn hợp các danh mục an ninh quốc gia và tội phạm. Nó cho biết Claude đã được sử dụng bởi các tác nhân liên quan đến một chiến dịch gián điệp mạng có trụ sở tại Nga và bởi một tổ chức tuyên truyền của Iran, đặt các hoạt động ảnh hưởng bên cạnh hoạt động xâm nhập.
Các hoạt động ảnh hưởng là những nỗ lực phối hợp để định hình ý kiến công chúng hoặc kết quả chính trị, thường thông qua tuyên truyền và thông điệp nhắm mục tiêu.
Anthropic cho biết các trường hợp mà họ phát hiện trong tám tháng qua đã dao động từ các ứng dụng hẹn hò giả mạo và lừa đảo WiFi khách sạn đến việc giám sát được xây dựng để xác định những người bất đồng chính kiến, và họ đã mô tả sự lạm dụng nghi ngờ bởi “các nhóm được nhà nước tài trợ, tội phạm, nhà cung cấp phần mềm gián điệp, các tổ chức tuyên truyền của nhà nước và các cá nhân có động cơ chính trị.”
Về mặt mạng, Anthropic cho biết một nhóm hacker có công việc nhất quán với Midnight Blizzard có trụ sở tại Nga đã sử dụng AI để xây dựng một hệ thống tự động phát hiện khi phần mềm độc hại bị đánh dấu bởi các biện pháp bảo vệ an ninh và viết lại mã cho đến khi nó tránh được phát hiện.
Midnight Blizzard là tên cụm liên quan đến Nga được các nhà nghiên cứu an ninh sử dụng để mô tả một tập hợp cụ thể các hoạt động gián điệp mạng, và cách diễn đạt trong báo cáo cho thấy sự quy kết mang tính gợi ý hơn là xác định.
Báo cáo cũng đã nêu tên nhóm hacker ShinyHunters và đề cập đến các phòng thí nghiệm có trụ sở tại Trung Quốc trong số những người tham gia vào hoạt động lạm dụng được mô tả trong báo cáo. Anthropic cũng cáo buộc các công ty AI của Trung Quốc đang cố gắng sao chép khả năng của Claude, mặc dù các chi tiết được trích dẫn không chỉ rõ phòng thí nghiệm nào hoặc phương pháp sao chép nào đã được sử dụng ngoài việc đề cập đến chưng cất.
Anthropic cũng cho biết báo cáo đã lưu ý sáu trường hợp mà Claude đã được sử dụng “để phát triển phần mềm cho vũ khí thông thường, bao gồm súng, tên lửa, máy bay không người lái có vũ trang, bom và các loại đạn khác, cũng như các hệ thống nhắm mục tiêu và điều khiển chúng.” Điều này quan trọng vì nó chuyển cuộc trò chuyện chính sách từ “an toàn AI” trừu tượng sang việc cho phép các quy trình vũ khí cụ thể, điều này thường thu hút sự chú ý của chính phủ ngay cả khi các quy kết cơ bản mang tính xác suất.
Màn hình chia đôi của Washington: Sự thúc đẩy tạm dừng và cấm của Sanders so với khung “thắng AI” của Trump.
Báo cáo đã đến trong một môi trường chính sách của Mỹ hiện đang rõ ràng là hai mặt. Thượng nghị sĩ Bernie Sanders đã yêu cầu tạm dừng phát triển AI tiên tiến và giới thiệu luật để cấm siêu trí tuệ AI, nói trên chương trình Newsnight của BBC: “Khi các nhà khoa học nói với bạn rằng có một cơ hội, một cơ hội rằng nó có thể có tác động thảm khốc đến nhân loại, bạn phải là một kẻ ngốc nếu không nói, hãy làm chậm lại.”
Tổng thống Donald Trump đã bác bỏ khung đó và lập luận rằng rủi ro chiến lược lại đi theo hướng ngược lại. “Nếu chúng ta không thắng AI, chúng ta sẽ bị đặt vào một vị trí rất tồi tệ,” ông nói vào thứ Năm.
Sự chia tách quan trọng đối với thị trường vì nó giữ cho thông tin tiêu đề luôn ồn ào mà không tạo ra một trường hợp rõ ràng duy nhất cho các quy tắc. Các nhà giao dịch nhìn vào tâm lý rủi ro liên quan đến AI thường bị lạc hướng bởi những câu chuyện xen kẽ, một câu chuyện coi khả năng mô hình tiên tiến là một trách nhiệm an ninh quốc gia cần phải bị hạn chế, và một câu chuyện khác coi việc hạn chế là một sự tự hại cạnh tranh.
Cuộc tranh luận cũng đang được củng cố bởi các lãnh đạo an toàn trong các phòng thí nghiệm. Nhà khoa học trưởng của OpenAI, Jakub Pachocki, đã viết vào ngày 06-09-2026 rằng ngành công nghiệp nên thực hiện "các biện pháp giảm tốc tự nguyện" cho đến khi các biện pháp bảo vệ được thiết lập, và thêm vào đó: "Tôi lo ngại rằng không ai chuẩn bị cho những hậu quả của việc gia tăng nhanh chóng trí thông minh máy móc."
Các tín hiệu cần theo dõi: các biện pháp bảo vệ, thắt chặt quyền truy cập, và liệu cuộc nói chuyện về "giảm tốc" có biến thành quy tắc hay không.
Tín hiệu đầu tiên là liệu việc công bố của Anthropic có dẫn đến việc thắt chặt các biện pháp kiểm soát quyền truy cập hay không, thay vì chỉ cải thiện khả năng phát hiện. Công ty cho biết họ đã đưa các phát hiện của mình vào quy trình "để tốt hơn trong việc ngăn chặn, phát hiện và làm gián đoạn các hoạt động này trong tương lai," và cho biết họ đã chia sẻ thông tin tình báo với các cơ quan và đối tác trong ngành khi phù hợp.
Điều đó chỉ ra các hoạt động lặp đi lặp lại, theo dõi, chặn và chia sẻ thông tin, chứ không phải là một giải pháp một lần.
Thứ hai là liệu dự luật do Sanders đề xuất để cấm siêu trí tuệ AI có tiến xa hơn việc giới thiệu vào hành động của ủy ban, đồng tài trợ, hoặc các phiên điều trần hay không. Trong một môi trường chia màn hình, các cột mốc quy trình quan trọng hơn lời nói vì chúng là điều duy nhất buộc phải có thời gian biểu.
Thứ ba là liệu các phòng thí nghiệm lớn khác có mở rộng các công bố liên quan đến vũ khí sinh học của riêng họ hoặc thắt chặt các biện pháp bảo vệ theo cách mà người dùng có thể thấy được hay không.
Google đã nói vào thứ Ba rằng ai đó đã cố gắng sử dụng Gemini để có được "hướng dẫn kỹ thuật hoàn chỉnh, từng bước để tổng hợp các tác nhân sinh học vũ khí hóa," và các công bố song song có thể tạo ra một nhịp điệu chính sách ngay cả khi mỗi trường hợp riêng lẻ được định hình là "cố gắng" lạm dụng.
Một tín hiệu thứ tư, kỹ thuật hơn là liệu việc chuyển giao khả năng thông qua chưng cất có trở thành một trọng tâm lớn hơn hay không. Anthropic cho biết không có trường hợp lạm dụng nào liên quan đến các mô hình Claude Fable hoặc Mythos-class ngoại trừ một trường hợp chưng cất, điều này nhắc nhở rằng việc hạn chế mô hình hàng đầu không nhất thiết hạn chế khả năng hạ nguồn nếu các mô hình nhỏ hơn có thể được đào tạo để bắt chước nó.
Đánh giá của tôi: giao dịch ngắn hạn là sự biến động của câu chuyện, không phải là một công tắc quy định duy nhất.
Phần quyết định câu chuyện này không phải là liệu một báo cáo có làm cho Washington sốc đến mức cấm hay không. Mà là liệu các công bố lạm dụng cụ thể, hoạt động lặp đi lặp lại có đẩy các phòng thí nghiệm hướng tới việc thắt chặt quyền truy cập và giám sát theo mặc định hay không, vì đó là con đường ít kháng cự nhất khi các nhà lập pháp chia rẽ giữa "giảm tốc" và "thắng AI."
Ngưỡng quan trọng là quy trình, không phải là lời nói: nếu "các biện pháp giảm tốc tự nguyện" và các đề xuất tạm dừng và cấm bắt đầu biến thành các phiên điều trần, quy tắc truy cập, và các kỳ vọng báo cáo có thể thi hành, thì thông tin chính sách AI không còn là một chất xúc tác tâm lý mà bắt đầu trở thành một ràng buộc về cách các mô hình tiên tiến được giao hàng và ai được phép sử dụng chúng. Đó là khi rủi ro chuyển từ tiêu đề sang diện tích sản phẩm và, theo đó, khẩu vị rủi ro rộng hơn.