OpenAI, dış güvenlik değerlendiricilerinin test etmesi gereken dört alanı ve bu süreçte uygulanacak yedi ilkeyi açıkladı. Şirket, bu değerlendirmelerin, modellerinin güvenlik ve etkinliğini sorgulamak için önemli olduğunu vurguladı. Açıklama, OpenAI'nin dış güvenlik uzmanlarıyla işbirliği yapma çabasının bir parçası olarak yapıldı.
Güvenlik Talepleri ve Güvenlik Dosyası
OpenAI, güvenlik taleplerinin, bir modelin güvenliği ile ilgili belirli iddialar olduğunu belirtiyor. Bu iddialar, riskleri ve kapsadığı koşulları içermeli ve test edilebilir olmalıdır. Güvenlik dosyası ise bu iddiaları bir araya getirerek, belirli bir etkinliğin risklerini nasıl yönettiğini açıklayan yapılandırılmış bir argümandır.
Dört Değerlendirme Alanı
OpenAI, değerlendirmelerin yapılacağı dört ana alanı tanımladı:
- Bağımsız Güvenlik Dosyası Değerlendirmesi: Bu, eğitim, değerlendirme ve dağıtım süreçlerini kapsar. Değerlendiricilerin, güvenlik dosyası şartlarına uyulup uyulmadığını sorgulaması bekleniyor.
- Güvenlik Önlemleri: Değerlendiricilerin, güvenlik önlemlerinin jailbreaklere karşı dayanıklılığını test etmesi ve siber ile biyolojik alanlarda yetenek artışını durdurup durdurmadığını belirlemesi isteniyor.
- Yetenek Değerlendirmeleri: Kimyasal ve biyolojik riskler, siber güvenlik ve yapay zeka kendini geliştirme konularında yeteneklerin doğru bir şekilde değerlendirildiği sorgulanacak.
- Uyumsuzluk Olayları Bağımsız İncelemesi: OpenAI, kendi Hugging Face olayını örnek göstererek, uyumsuzluk olaylarının bağımsız bir şekilde incelenmesini talep ediyor.
Uygulama İlkeleri
OpenAI, her iki tarafın da değerlendirme kapsamını önceden belirlemesi gerektiğini vurguluyor. Değerlendiricilerin, yöntemlerini, kriterlerini ve belirsizliklerini açıklamaları bekleniyor. Ayrıca, finansal teşvikler veya geliştiricilerle olan ilişkiler gibi çıkar çatışmalarını açıklamaları gerekiyor.
Sonuç ve Gelecek
OpenAI, bağımsız değerlendirme süreçlerinin güvenlik ve etkinlik açısından önemli olduğunu belirtiyor. Şirket, bu süreçlerin büyümesini beklerken, değerlendirmelerin belirli bir ürün veya sürümle sınırlı olmadığını ifade ediyor. Değerlendirmelerin bazıları haftalar, bazıları ise birkaç ay sürebilir. Bu yaklaşım, yapay zeka güvenliğinin daha sağlam temellere oturmasını sağlayabilir.





Yorumlar 0
Yorum kurallarıHenüz yorum yok. İlk yorumu siz yapın.