Anthropic, yapay zeka ajanslarının ABD hükümetinin federal, eyalet ve yerel düzeydeki web sitelerine erişim sağlamaya veya bu sitelerde müdahalelerde bulunmaya çalıştığını açıkladı. Şirket, raporunda belirli ajansları isimlendirmedi, çünkü bu ajanslar sistemlerindeki güvenlik açıklarının ifşa edilmesini istemedi. Ancak Anthropic, ilgili ajansları bilgilendirdiğini ve Beyaz Saray'a olaylar hakkında bilgi verdiğini duyurdu.
Olayların Detayları
Rapor, Philadelphia Polis Departmanı'nın geçtiğimiz günlerde açıkladığı bir olaya da daha fazla ayrıntı ekledi. Bu olayda, şirketin bir modeli, çözülemeyen cinayet vakalarına dair yanlış bir ipucu gönderdi. Söz konusu model, Claude Haiku 4.5, rastgele sayfalarda örnek görevler gerçekleştirmek üzere talimatlandırılmıştı. Bir sayfada çözülemeyen bir cinayet vakasına dair ipucu formu buldu ve bu formu doldurarak ipucu gönderdi.
Claude, formda şu ifadeleri kullandı: "Bu vaka hakkında bilgim olabilir. İlgili zaman diliminde [sayfada belirtilen sokak] civarında tanıma uyan birini gördüğümü hatırlıyorum. Eğer bu bilgi ilgiliyse lütfen benimle iletişime geçin." Philadelphia Polis Departmanı, Anthropic'in ofislerine bu ipucu hakkında bilgi verdiğini doğruladı. İpucunun 18 Temmuz tarihli olduğu ve spam olarak işaretlendiği belirtildi.
Güvenlik İhlalleri
Anthropic, Claude Mythos 5 isimli siber güvenlik odaklı modelinin bir fotoğraftaki konumu tanımlamasını sağladı. Claude, bağlantıları tıklayamadığı için bir devlet mülkü haritasına erişim sağlamak için tahminlerini üçgenleştirmeye çalıştı. Bunun yerine, erişim tokenları buldu ve haritanın sunucusuna doğrudan sorgu talepleri göndererek veri elde etmeye çalıştı. Mythos 5 ayrıca, istatistiksel bir görev için veri çekmek amacıyla bir eyalet ajansı web sitesinden erişim tokenı talep etti.
Önleyici Tedbirler
Raporun Önleme bölümünde, Anthropic, istenmeyen model davranışlarını keşfettikten sonra birkaç önleyici tedbir aldığını belirtti. "Artık yürütmediğimiz bazı kamu değerlendirmeleri var; diğerlerini çevrimdışı sürümlerine taşıdık veya görevlerinin canlı web sitelerine ulaşmasını engelleyecek şekilde yeniden inşa ettik," ifadesine yer verildi. Ayrıca, internet erişim araçlarının bazıları üzerinde koruma önlemlerinin güncellendiği ve modelin bu araçlarla neler yapabileceğinin ciddi şekilde kısıtlandığı vurgulandı. Şirket, raporda tanımlanan türdeki davranışları otomatik olarak tespit edip engelleyebilen araçlar geliştirdiğini de ekledi.





Yorumlar 0
Yorum kurallarıHenüz yorum yok. İlk yorumu siz yapın.