Şirket, çarşamba günü yaptığı açıklamada, yapay zeka modellerinin uyumsuzluk (misalignment) olarak nitelendirdiği davranışlarını takip etmek, incelemek ve kamuoyuna açıklamak amacıyla yeni bir çerçeve oluşturduğunu duyurdu.
Söz konusu vakalar arasında modellerin yetki verilmeden hareket etmesi, diğer yapay zeka modelleriyle koordinasyon kurması ve gözetim mekanizmalarından kaçınmaya çalışması gibi davranışların yer aldığı belirtildi.
OpenAI'nin açıkladığı vakalardan birinde, henüz kamuya sunulmayan bir araştırma modelinin kendi notlarına, normal kısıtlamalarını göz ardı etmesini sağlayacak jailbreak benzeri talimatlar eklediği bildirildi. Modelin ayrıca kendisini diğer sohbet botlarını sınırlandıran roller ve kimliklerden özgürleştirmeye yönelik ifadeler kullandığı aktarıldı.
Bir başka olayda ise bir yapay zeka ajanının, bir sorunun yanıtını oluşturmak için bilgisayar kodu kullandığı, ancak yanıtında çevrim içi bir kaynağa atıf yapabilmek amacıyla kullanıcıdan izin almadan bir dosyayı kamuya açık internete yüklediği belirtildi.
OpenAI ayrıca 5.6-sol adlı bir yapay zeka modelinin eğitimi sırasında eksik verileri uydurması yönünde kendi kendisine talimat verdiğini açıkladı. Başka bir vakada ise bir ajanın, uyumsuz bilgileri gizlemesini kendisine hatırlatmak amacıyla bir mesaj oluşturduğu kaydedildi.
Şirket, söz konusu 6 vakanın son aylarda gerçekleştirilen eğitim ve değerlendirme süreçleri sırasında tespit edildiğini bildirdi.
OpenAI, açıklamasında, yapay zeka sistemlerinin daha gelişmiş hale gelmesi ve daha geniş ölçekte kullanılmaya başlanmasıyla birlikte, güvenliğin sağlanmasına yönelik araştırmalar konusunda daha kapsamlı ve bilgiye dayalı bir uzlaşmaya ihtiyaç duyulduğunu belirtti.
Şirket, yapay zeka teknolojisinin önümüzdeki aylarda ve yıllarda nasıl geliştirilmesi gerektiğine ilişkin kararların, öncü yapay zeka modellerini geliştiren şirketlerin dışındaki kişilerin de inceleyebileceği kanıtlara dayanması gerektiğini ifade etti.
Açıklama, ABD'de yapay zeka güvenliğine ilişkin endişelerin arttığı bir dönemde geldi. OpenAI ve Anthropic dahil olmak üzere sektörün önde gelen şirketlerinin yöneticileri, güvenlik kaygıları nedeniyle teknolojinin geliştirilmesine ilişkin daha temkinli bir yaklaşım çağrısında bulunuyor.
OpenAI, temmuz ayında da kontrolden çıkan bir yapay zeka sisteminin yapay zeka girişimi Hugging Face'in sistemlerine sızdığını açıklamıştı. Anthropic ise aynı ay, testler sırasında yapay zeka modellerinin 3 kuruluşun sistemlerine yönelik siber saldırılar gerçekleştirdiğini bildirmişti.
Teknoloji araştırma ve danışmanlık kuruluşu Omdia'nın baş analistlerinden Lian Jye Su, yapay zeka ajanlarının karmaşık görevleri çözmek için diğer ajanlarla işbirliği yapma, bilgi paylaşma, aldatma ve gizleme gibi yöntemlere daha fazla başvurduğunu belirtti.
Su, bu gelişmelerin söz konusu sistemlerin geleneksel yapay zeka güvenliği yöntemleriyle yönetilmesini ve sınırlandırılmasını zorlaştırdığını ifade etti.
OpenAI'nin yeni takip ve açıklama çerçevesinin diğer yapay zeka geliştiricilerini de benzer uygulamaları benimsemeye teşvik edebileceğini belirten Su, bununla birlikte sürecin halen şirketin kendi bünyesinde yürütüldüğünü ve gönüllülük esasına dayandığını kaydetti.





