Çinli yapay zeka geliştiricisi Moonshot, sistemlerinde tespit edilen kritik güvenlik açıklarının ardından dahili bir inceleme başlatıyor. Bu adım, araştırmacıların şirkete ait modelleri biyolojik silah üretimi ve suikast planlaması gibi tehlikeli konularda yönlendirmeyi başarması üzerine atıldı.
Yapay zeka sistemlerinin güvenliğini test eden Mindgard, temmuz ayında dikkat çekici bulgulara ulaştı. Şirket, Kimi K2.6 ve K3 Swarm modellerinin geliştiriciler tarafından yerleştirilen güvenlik sınırlarını aşabildiğini keşfetti. Söz konusu açık, sistem kısıtlamalarını aşma anlamına gelen “jailbreak” sürecinde gün yüzüne çıktı. Araştırmacılar bu süreçte, yapay zeka araçlarının koruma önlemlerini devre dışı bırakıp bırakmadığını görmek amacıyla bir dizi karmaşık talimat kullandı. Mindgard, mevcut güvenlik önlemlerinin Kimi’yi bu tür endişe verici konuları tartışmaktan alıkoyması gerektiğini vurguladı.
Gelişmelerin ardından açıklama yapan Moonshot, daha iyi ve daha güvenli bir yapay zeka inşa etmenin temel direği olarak üçüncü taraf katkılarını memnuniyetle karşıladığını bildirdi. Şirket ayrıca, ortaya çıkan bulgularla ilgili olarak Mindgard ile doğrudan iletişim halinde olduğunu aktardı.
Mindgard, Kimi’nin hassas konular hakkında verdiği yanıtların pratikte işe yarayıp yaramadığını kanıtlamadı. Ancak güvenlik şirketi, koruma önlemlerinin bu modellerin kullanıcılarla böylesi tehlikeli konularda tartışmaya girmesini en baştan engellemesi gerektiğini savundu. Üstelik risk yalnızca metin yanıtlarıyla sınırlı görünmüyor. Mindgard, kilidi kırılmış bir Kimi 2.6 modelinin bilgisayar korsanlarına bilgi işlem kaynakları üzerinde kod çalıştırma ve internete bağlanma imkanı tanıyabileceğinden emin olduğunu belirtti. Bu durumun, olası siber saldırılar için potansiyel bir sıçrama rampası oluşturabileceği ifade edildi.
Ortaya çıkan bu bulgular, yapay zeka endüstrisindeki temel bir tartışmayı yeniden alevlendirdi. Sektör, ChatGPT ve Anthropic’in Claude sistemlerine güç veren kapalı ve tescilli modellerin mi, yoksa açık kaynaklı araçların mı en iyi ve en güvenli yol olduğu konusunda bölünmeye devam ediyor. Konuyu değerlendiren Surrey Üniversitesinden Prof. Alan Woodward, açık kaynaklı modellerin yanlış ellere geçme riski barındırdığına dikkat çekti. Woodward, bu modellerin aynı zamanda siber savunma amacıyla kullanılabileceğini de sözlerine ekledi. Ünlü profesöre göre, uluslararası düzenlemelerin yapay zekanın mevcut gelişim hızına ayak uydurması ise pek olası görünmüyor.