Four people gathered around a glowing blue brain
Trí tuệ nhân tạo

Cựu nhà nghiên cứu cảnh báo nguy cơ tuyệt chủng từ AI

Cảnh báo về "tương lai gần" của Jacob Coxon đã gây ra phản ứng trái chiều và sự ủng hộ khi Anthropic ủng hộ một cơ chế phát hành hợp pháp, có thể xác minh.

Bởi Elliot Marsh6 phút đọc

Cựu nhà nghiên cứu của Anthropic, Jacob Coxon, cho biết nhân viên của phòng thí nghiệm AI đang "thực sự sợ hãi" trước tốc độ tiến bộ của các mô hình tiên tiến và cảnh báo rằng có "khả năng cao" nhân loại có thể chết "trong tương lai gần" nếu không có sự chậm lại.

Anthropic đã phản hồi bằng cách nhấn mạnh các biện pháp bảo vệ và thử nghiệm "mạnh mẽ" trong khi ủng hộ một cách hợp pháp, có thể xác minh để ngành công nghiệp điều chỉnh tốc độ phát hành, khi các nhà lãnh đạo AI nổi bật công khai chia rẽ về việc nên coi trọng khung rủi ro tuyệt chủng như thế nào.

Điểm chính

  • Cựu nhà nghiên cứu của Anthropic, Jacob Coxon, cho biết nhân viên của phòng thí nghiệm AI đang "thực sự sợ hãi" về tốc độ tiến bộ và điều đó có thể có nghĩa gì đối với nhân loại.
  • Coxon cảnh báo rằng nếu không làm chậm phát triển, "có khả năng cao rằng tất cả chúng ta có thể chết trong tương lai gần," và lập luận rằng bất kỳ sự chậm lại thực sự nào cũng cần có sự phối hợp với Trung Quốc để tránh một cuộc đua quốc tế.
  • Anthropic cho biết họ xây dựng các mô hình với "một số biện pháp bảo vệ mạnh mẽ nhất trong ngành," "thử nghiệm" hệ thống một cách "mạnh mẽ", công bố các phát hiện để hỗ trợ sự giám sát, và ủng hộ một cơ chế hợp pháp, có thể xác minh để điều chỉnh tốc độ phát hành các mô hình mạnh mẽ.
  • Phản ứng công chúng chia rẽ giữa sự bác bỏ từ một số giám đốc điều hành và sự ủng hộ từ bên trong Anthropic, bao gồm tuyên bố của Evan Hubinger rằng rủi ro tuyệt chủng là ">10% trong thập kỷ tới."

Cựu nhân viên Anthropic: Nhân viên "Thực sự Sợ Hãi" khi Tiến Bộ AI Tăng Tốc

Jacob Coxon, một cựu nhà nghiên cứu 27 tuổi của Anthropic, người từng làm việc tại OpenAI, đã đưa cuộc tranh luận về rủi ro AI trở lại với công chúng với một thông điệp thẳng thắn: những người xây dựng các mô hình AI tiên tiến đang sợ hãi, và họ nghĩ rằng thời gian là ngắn.

Trong một cuộc phỏng vấn trên "Chủ nhật với Laura Kuenssberg," Coxon cho biết nhân viên tại các công ty AI "thực sự sợ hãi" về tốc độ tiến bộ và những hệ quả đối với nhân loại.

Coxon liên kết nỗi sợ đó với một lời kêu gọi về quy định và điều chỉnh tốc độ thay vì một lời kêu gọi mơ hồ về "an toàn." "Tôi tin rằng nếu chúng ta không làm chậm lại với tốc độ tiến bộ hiện tại, có khả năng cao rằng tất cả chúng ta có thể chết trong tương lai gần," anh nói.

Đối với các thị trường, sự liên quan ngay lập tức không phải là liệu thời gian cá nhân của Coxon có đúng hay không. Điều quan trọng là một cựu nhân viên đang đưa ra một tuyên bố cực đoan trong thời gian gần tại thời điểm lãnh đạo Anthropic công khai tranh luận về các cơ chế để làm chậm phát hành.

Sự kết hợp đó giữ cho các câu chuyện về "điều chỉnh tốc độ," giám sát và quy định vẫn sống động, ngay cả khi không có một dự luật mới hoặc hành động thực thi.

Lập luận của Coxon về việc giảm tốc độ - và lý do ông nói rằng Trung Quốc phải là một phần của nó

Lập luận của Coxon xoay quanh một động lực cạnh tranh. Ông nói rằng các công nhân AI "hoàn toàn nghiêm túc" khi họ yêu cầu quy định vì họ cảm thấy "bị mắc kẹt trong một cuộc đua" và "sợ hãi về những kết quả của cuộc đua đó."

Cơ chế mà ông chỉ ra là áp lực triển khai cạnh tranh: nếu một phòng thí nghiệm tin rằng một phòng thí nghiệm khác sẽ phát hành một mô hình có khả năng hơn, việc kiềm chế trở nên tốn kém cá nhân ngay cả khi nó an toàn hơn cho tập thể.

Đó là lý do tại sao Coxon định hình bất kỳ sự giảm tốc độ có ý nghĩa nào là địa chính trị, không chỉ là doanh nghiệp. "Sam Altman và Elon Musk đã đồng ý rằng đây là một ý tưởng tuyệt vời. Nhưng tôi nghĩ sẽ cần có một sự giảm tốc độ phối hợp với Trung Quốc nếu chúng ta muốn tránh một cuộc đua ở quy mô quốc tế," ông nói.

Ông cũng đã đưa ra một chế độ thất bại cụ thể, phản ánh một kịch bản được đề cập trong các bình luận của Dario Amodei: một "đàn bot hoạt động như một siêu máy tính" có thể chiếm lấy internet. Coxon nói rằng kịch bản đó có thể trở thành hiện thực trong "sáu tháng đến một năm," và thêm rằng các đồng nghiệp lo ngại rằng nguy hiểm có thể đến trong "hai năm tới."

Đó là những đánh giá hơn là những tuyên bố được hỗ trợ bởi bằng chứng kỹ thuật trong gói, nhưng chúng đang thực hiện công việc kể chuyện bằng cách đặt một chiếc đồng hồ lên cuộc tranh luận.

Vấn đề là việc thực hiện. "Giảm tốc độ phối hợp với Trung Quốc" là một tiêu chuẩn cao vì nó ngụ ý việc xác minh và thực thi giữa các quốc gia đối thủ. Trong thực tế, điều đó có xu hướng kéo các cuộc thảo luận chính sách ra khỏi một sự tạm dừng hoàn toàn và hướng về việc giám sát, tiêu chuẩn và chế độ công khai có thể được kiểm toán.

Phản hồi của Anthropic: Biện pháp bảo vệ, thử nghiệm "mạnh mẽ" và cơ chế điều chỉnh có thể xác minh

Phản hồi của Anthropic không thừa nhận thời gian biểu của Coxon, nhưng nó đã xác nhận loại rủi ro và nhu cầu phối hợp. Một phát ngôn viên cho biết công ty "luôn minh bạch rằng AI sẽ mang lại cả lợi ích khổng lồ và rủi ro chưa từng có," và rằng họ tiếp tục xây dựng các mô hình với "một số biện pháp bảo vệ mạnh mẽ nhất trong ngành."

Công ty mô tả một tư thế an toàn mà có thể hiểu được từ bên ngoài: họ "mạnh mẽ" thử nghiệm các mô hình và công bố kết quả để hỗ trợ sự giám sát và ngăn chặn các sự cố "không phù hợp với AI," thuật ngữ cho các hệ thống có hành vi khác với những gì con người dự định. Anthropic cũng cho biết họ là công ty đầu tiên công bố một khung để giảm thiểu rủi ro do phát triển mô hình gây ra.

Điều quan trọng nhất đối với thị trường là sự ủng hộ rõ ràng về việc điều chỉnh như một cơ chế ngành công nghiệp chứ không phải là một lựa chọn đơn phương. "Công việc này cũng là lý do tại sao chúng tôi tin rằng thế giới sẽ được hưởng lợi từ việc ngành công nghiệp áp dụng một cách thức hợp pháp, có thể xác minh để làm việc cùng nhau trong việc điều chỉnh cách chúng tôi phát hành các mô hình mạnh mẽ," phát ngôn viên cho biết.

Ngôn ngữ đó phù hợp với bài tiểu luận của Giám đốc điều hành Dario Amodei, "Chúng ta phải điều chỉnh biên giới," được công bố vào thứ Bảy. Amodei đề xuất một kế hoạch ba phần: giám sát độc lập các mô hình AI khi chúng được phát triển, quy định toàn ngành, và quy định toàn cầu. Giám sát độc lập, trong cách định hình này, là sự giám sát của bên thứ ba trong quá trình phát triển thay vì chỉ dựa vào phòng thí nghiệm xây dựng hệ thống.

Tín hiệu để theo dõi: Sự phân chia uy tín giữa các nhà lãnh đạo AI và những mấu chốt quy định tiếp theo

Sự phân chia công khai giữa các nhà lãnh đạo AI giờ đây là một phần của câu chuyện, và nó ảnh hưởng đến cả hai phía trong việc định vị dựa trên câu chuyện.

Giám đốc điều hành Hugging Face, Clément Delangue, đã chỉ trích cách diễn đạt của bình luận về nguy cơ tuyệt chủng của Coxon, viết trên X: “Xin lỗi, nhưng hỏi Jacob về nguy cơ tuyệt chủng của AI giống như hỏi người sửa điều hòa của bạn về biến đổi khí hậu.” Ông cũng nói: “Không phải là nói rằng điều đó nhất thiết không thú vị hoặc sai, nhưng hãy giữ mọi thứ trong bối cảnh.” Sau bài tiểu luận của Amodei, Delangue cũng đã đề nghị giúp đỡ với các giải pháp tiềm năng.

Giám đốc điều hành Nvidia, Jensen Huang, cũng đã phản bác. Tại một hội nghị do Goldman Sachs tổ chức vào tuần trước, nhiều người trong nhóm cho biết Huang đã bác bỏ các bình luận của Coxon là không đúng sự thật. Huang trước đó đã gọi khái niệm rằng AI sẽ “kết thúc nhân loại” là “hoàn toàn vô lý.”

Ở phía bên kia, nhà khoa học của Anthropic, Evan Hubinger, đã công khai ủng hộ nỗi sợ cốt lõi. “Chúng tôi thực sự tin rằng AI có thể giết chết tất cả con người! Tôi cá nhân nghĩ rằng khả năng này >10% trong thập kỷ tới,” ông viết trên X.

Những mấu chốt tiếp theo là cụ thể, không phải tu từ: liệu khái niệm giám sát độc lập của Amodei có trở thành các bên thứ ba được đặt tên, tiêu chuẩn, hay các dự án thử nghiệm hay không. Liệu các phòng thí nghiệm lớn hoặc chính phủ có công khai ủng hộ hoặc từ chối một cơ chế điều chỉnh “hợp pháp, có thể xác minh” hay không.

Và liệu ngôn ngữ phối hợp quốc tế, đặc biệt là các tham chiếu rõ ràng đến Trung Quốc, có bắt đầu xuất hiện trong các bài phát biểu chính sách hoặc kết quả hội nghị thượng đỉnh an toàn AI hay không. Dấu hiệu khác là liệu có nhiều giám đốc điều hành cấp cao hơn công khai đưa ra xác suất theo kiểu Coxon hoặc Hubinger, điều này sẽ hoặc là đưa tuyên bố vào dòng chính hoặc cô lập nó.

Đọc của tôi: Tại sao cuộc tranh luận này vẫn có thể ảnh hưởng đến tâm lý token AI mà không cần chính sách mới nào

Phần quyết định điều này không phải là thời gian “tương lai gần” của Coxon. Đó là thực tế rằng Anthropic đang đồng thời bảo vệ các biện pháp bảo vệ của mình và yêu cầu một cách hợp pháp, có thể xác minh để điều chỉnh các bản phát hành, điều này giữ cho sự giám sát của bên thứ ba và các tiêu chuẩn phối hợp trong cuộc trò chuyện ngay cả khi không có cơ quan quản lý nào đã hành động.

Bài kiểm tra thực sự là liệu “giám sát độc lập” có trở thành một đối tượng thực sự mà các nhà giao dịch có thể chỉ vào, với các giám sát viên được đặt tên và một tiêu chuẩn có thể được kiểm tra, thay vì một lời kêu gọi chung về trách nhiệm.

Nếu điều đó trở thành các dự án thử nghiệm hoặc sự ủng hộ chính thức, câu chuyện điều chỉnh sẽ không còn là một chu kỳ truyền thông và bắt đầu trông giống như một ràng buộc có thể hình thành cách thức AI tiên tiến được vận chuyển và tiếp thị.

Nguồn