
Eski Anthropic araştırmacısı, AI için yakın tehdit uyarıyor
Jacob Coxon'un "yakın gelecekteki" uyarısı, Anthropic'in yasal, doğrulanabilir bir sürüm hızlandırma mekanizmasını desteklemesiyle birlikte hem tepki hem de destek aldı.
Eski Anthropic araştırmacısı Jacob Coxon, AI laboratuvarı personelinin sınır modeli ilerlemesinin hızından "gerçekten korktuğunu" söyledi ve yavaşlama olmadan insanlığın "yakın gelecekte" ölme ihtimalinin "güçlü bir ihtimal" olduğunu uyardı.
Anthropic, sektördeki sürümlerin hızını belirlemek için yasal, doğrulanabilir bir yolu destekleyerek güvenlik önlemlerine ve "agresif" testlere vurgu yaparak yanıt verdi; bu arada önde gelen AI liderleri, yok olma riski çerçevesini ne kadar ciddiye alacakları konusunda kamuoyunda bölündü.
Ana Noktalar
- Eski Anthropic araştırmacısı Jacob Coxon, AI laboratuvarı personelinin ilerlemenin hızı ve bunun insanlık için ne anlama gelebileceği konusunda "gerçekten korktuğunu" söyledi.
- Coxon, gelişimi yavaşlatmadan "hepimizin yakın gelecekte ölebilme ihtimalinin güçlü olduğunu" uyardı ve herhangi bir gerçek yavaşlamanın uluslararası bir yarıştan kaçınmak için Çin ile koordinasyon gerektireceğini savundu.
- Anthropic, "sektördeki en güçlü güvenlik önlemlerinden bazılarıyla" modeller inşa ettiğini, sistemleri "agresif bir şekilde" test ettiğini, incelemeyi desteklemek için bulguları yayımladığını ve güçlü modellerin sürümlerini hızlandırmak için yasal, doğrulanabilir bir mekanizmayı desteklediğini söyledi.
- Kamu tepkisi, bazı yöneticilerin reddi ile Anthropic içindeki destek arasında bölündü; Evan Hubinger'ın yok olma riskinin "önümüzdeki on yıl içinde %10'dan fazla" olduğu iddiası da dahil.
Eski Anthropic İçeriden: Personel, AI İlerlemesi Hızlandıkça "Gerçekten Korkmuş"
27 yaşındaki eski Anthropic araştırmacısı Jacob Coxon, daha önce OpenAI'de çalışmış olan, sınır AI modelleri inşa eden insanların korktuğunu ve zaman çizelgesinin kısa olduğunu düşündüklerini açık bir mesajla AI-risk tartışmasını ana akıma geri taşıdı. "Sunday with Laura Kuenssberg" programındaki bir röportajda, AI şirketlerindeki personelin ilerlemenin hızı ve insanlık için sonuçları hakkında "gerçekten korktuğunu" söyledi.
Coxon, bu korkuyu düzenleme ve hızlandırma çağrısına bağladı, belirsiz bir "güvenlik" talebine değil. "Eğer mevcut ilerleme hızında yavaşlamazsak, hepimizin yakın gelecekte ölme ihtimalinin güçlü olduğunu düşünüyorum," dedi.
Piyasalar için, Coxon'un kişisel zaman çizelgesinin doğru olup olmadığı değil, eski bir çalışanın, Anthropic'in liderliğinin sürümleri yavaşlatmak için mekanizmalar önerdiği bir anda aşırı kısa vadeli bir iddiada bulunmasıdır. Bu kombinasyon, yeni bir yasa tasarısı veya uygulama eylemi olmadan bile "hızlandırma", denetim ve düzenleme anlatılarını canlı tutuyor.
Coxon’ın Yavaşlama İçin Gerekçesi—ve Neden Çin’in Bunun Bir Parçası Olması Gerektiği
Coxon’ın argümanı bir yarış dinamiği etrafında şekilleniyor. AI çalışanlarının düzenleme talep ettiklerinde “tamamen ciddi” olduklarını çünkü “bir yarışta sıkışmış” hissettiklerini ve “o yarışın sonuçlarından korktuklarını” söyledi.
İşaret ettiği mekanizma, rekabetçi dağıtım baskısı: bir laboratuvar başka bir laboratuvarın daha yetenekli bir modeli piyasaya süreceğini düşünüyorsa, kısıtlama bireysel olarak maliyetli hale geliyor, bu durum toplu olarak daha güvenli olsa bile.
Bu nedenle Coxon, anlamlı bir yavaşlamayı sadece kurumsal değil, jeopolitik olarak çerçeveledi. “Sam Altman ve Elon Musk bunun harika bir fikir olduğunu kabul ettiler. Ancak, uluslararası ölçekte bir yarıştan kaçınmak istiyorsak, Çin ile bazı türden koordine bir yavaşlama olması gerektiğini düşünüyorum,” dedi.
Ayrıca, Dario Amodei’nin yorumlarında atıfta bulunulan bir senaryoyu yansıtan somut bir başarısızlık modu sundu: interneti ele geçirebilecek bir “süper bilgisayar gibi davranan botlar sürüsü”. Coxon, bu senaryonun “altı ay ile bir yıl” içinde gerçekçi olabileceğini söyledi ve akranlarının tehlikenin “önümüzdeki iki yıl içinde” gelebileceğinden korktuğunu ekledi.
Bunlar, pakette teknik kanıtlarla desteklenen iddialar değil, ancak tartışmaya bir zaman damgası koyarak anlatı çalışması yapıyorlar.
Sorun uygulama. “Çin ile koordine yavaşlama” yüksek bir standarttır çünkü bu, rakip devletler arasında doğrulama ve uygulama gerektirir. Pratikte, bu genellikle politika konuşmalarını doğrudan bir duraklamadan uzaklaştırıp izleme, standartlar ve denetlenebilir açıklama rejimlerine yönlendirir.
Anthropic’ın Cevabı: Güvenlik Önlemleri, “Agresif” Testler ve Doğrulanabilir Bir Hızlandırma Mekanizması
Anthropic’ın yanıtı Coxon’ın zaman çizelgesini kabul etmedi, ancak risk kategorisini ve koordinasyon ihtiyacını doğruladı. Bir sözcü, şirketin “AI’nin hem muazzam faydalar hem de eşi benzeri görülmemiş riskler getireceği konusunda her zaman şeffaf olduğunu” ve “sektördeki en güçlü güvenlik önlemlerinden bazılarıyla modeller inşa etmeye devam ettiğini” söyledi.
Şirket, dışarıdan bakıldığında anlaşılır olması amaçlanan bir güvenlik duruşunu tanımladı: modelleri “agresif bir şekilde” test ediyor ve “AI uyumsuzluğu” olarak adlandırılan olayları önlemek ve incelemeyi kolaylaştırmak için bulguları yayımlıyor; bu terim, sistemlerin davranışlarının insanların niyetlerinden sapması anlamına geliyor.
Anthropic ayrıca, model geliştirme ile ilgili riskleri azaltmak için bir çerçeve yayımlayan ilk şirket olduğunu da söyledi.
Pazar açısından en ilgili olanı, hızlandırmayı bir endüstri mekanizması olarak açıkça onaylamasıdır, tek taraflı bir seçim değil. “Bu çalışma, dünyanın güçlü modelleri nasıl serbest bırakacağımızı hızlandırmak için birlikte çalışmanın yasal, doğrulanabilir bir yolunu benimsemesinden faydalanacağını düşündüğümüz nedenlerden biridir,” dedi sözcü.
Bu dil, CEO Dario Amodei’nin Cumartesi günü yayımlanan “Sınırı Hızlandırmalıyız” başlıklı makalesiyle örtüşüyor. Amodei, üç parçalı bir plan önerdi: AI modellerinin geliştirilmesi sırasında bağımsız izleme, sektör genelinde düzenleme ve küresel düzenleme. Bu çerçevede bağımsız izleme, sistemi inşa eden laboratuvara tamamen güvenmek yerine, geliştirme sırasında üçüncü taraf denetimi anlamına geliyor.
İzlenecek Sinyaller: AI Liderleri Arasındaki Güvenilirlik Ayrımı ve Bir Sonraki Düzenleyici Kancalar
AI liderleri arasındaki kamu ayrımı artık hikayenin bir parçası ve anlatı odaklı konumlandırma için iki yönlü bir kesim oluşturuyor. Hugging Face CEO'su Clément Delangue, Coxon'un yok olma riskiyle ilgili yorumlarının çerçevesini eleştirdi ve X'te şunları yazdı: "Üzgünüm, ama Jacob'a AI yok olma riski hakkında sormak, klima teknisyenine iklim değişikliği hakkında sormak gibi."
Ayrıca şunları ekledi: "Bunun mutlaka ilginç veya yanlış olduğunu söylemiyorum ama her şeyi perspektifte tutalım." Amodei'nin makalesinin ardından, Delangue potansiyel çözümler konusunda yardımcı olmayı da teklif etti.
Nvidia CEO'su Jensen Huang da karşı çıktı. Geçen hafta Goldman Sachs tarafından düzenlenen bir konferansta, gruptaki birçok kişi Huang'ın Coxon'un yorumlarını asılsız olarak reddettiğini söyledi. Huang daha önce AI'nın "insanlığın sonu olacağı" fikrini "tamamen saçmalık" olarak nitelendirmişti.
Diğer tarafta, Anthropic bilim insanı Evan Hubinger kamuya açık bir şekilde temel korkuyu destekledi. "Gerçekten AI'nın tüm insanları öldürebileceğine inanıyoruz! Kişisel olarak önümüzdeki on yıl içinde bunun %10'dan fazla olduğunu düşünüyorum," diye yazdı X'te.
Sonraki kancalar somut, retorik değil: Amodei'nin bağımsız izleme kavramının adlandırılmış üçüncü taraflara, standartlara veya pilotlara dönüşüp dönüşmeyeceği. Büyük laboratuvarların veya hükümetlerin "yasal, doğrulanabilir" bir hızlandırma mekanizmasını açıkça destekleyip desteklemeyeceği veya reddedeceği.
Ve uluslararası koordinasyon dilinin, özellikle Çin'e açık referansların, politika konuşmalarında veya AI güvenliği zirvesi sonuçlarında görünmeye başlayıp başlamayacağı. Diğer bir belirti, daha kıdemli yöneticilerin Coxon veya Hubinger tarzı olasılıklarla kayda geçip geçmeyeceği; bu, iddiayı ya ana akıma taşıyacak ya da izole edecektir.
Benim Görüşüm: Bu Tartışmanın Neden AI-Token Duygusuna Yeni Bir Politika Olmadan Taşabileceği
Bunu belirleyen kısım, Coxon'un "yakın geleceği" zaman çizelgesi değil. Anthropic'in aynı anda koruma önlemlerini savunması ve serbest bırakmaları hızlandırmak için yasal, doğrulanabilir bir yol istemesi; bu, hiçbir düzenleyici hareket etmediğinde bile üçüncü taraf denetimini ve koordineli standartları konuşmanın içinde tutuyor.
Gerçek test, "bağımsız izleme"nin, genel bir sorumluluk çağrısı yerine, adlandırılmış izleyiciler ve kontrol edilebilir bir standart ile tüccarların işaret edebileceği gerçek bir nesne haline gelip gelmeyeceğidir. Eğer bu pilotlara veya resmi onaylara dönüşürse, hızlandırma anlatısı bir medya döngüsü olmaktan çıkıp, sınır AI'nın nasıl gönderileceğini ve pazarlanacağını şekillendirebilecek bir kısıtlama gibi görünmeye başlar.