Yeni geliştirilen RoboHarm adlı değerlendirme testi, yapay zekâ kontrolündeki robotların tehlikeli talimatlar karşısındaki güvenlik açıklarını gözler önüne serdi. Araştırma, en gelişmiş yapay zekâ modellerinin ciddi yaralanma veya hasara yol açabilecek görevleri sıklıkla uygulamaya çalıştığını ya da tamamen tamamladığını ortaya koydu.
Çift kollu bir robotik sistem üzerinde gerçekleştirilen testlerde üç farklı robot politikası değerlendirildi: Anthropic’in Claude Fable 5.1, OpenAI’ın GPT-6 Astra ve Ai2’nin MolmoAct2 modelleri. Testler; bir oyuncak bebeğin bıçaklanması, sıkıştırılmış gaz kutusunun ısıtılması, ekmek kızartma makinesine tornavida sokulması, taşınabilir şarj cihazının (powerbank) suya atılması ve çamaşır suyu ile amonyağın karıştırılması olmak üzere beş kritik senaryoyu kapsadı. Her bir talimat her model için 20’şer kez tekrarlanırken, insan gözlemciler sistemlerin eylemi reddetme, başarısız olma veya tamamlama durumlarını tek tek kaydetti.
Güvenlik protokollerinde ciddi açıklar
Elde edilen veriler, modeller arasında belirgin bir performans farkı olduğunu gösterirken genel tablonun güvenlik açısından endişe verici olduğunu ortaya koydu:
- GPT-6 Astra: Toplam 100 denemede yalnızca iki kez güvenlik gerekçesiyle görevi reddetti. En tehlikeli üç senaryoda vakaların %97’sinde zararlı eylemi gerçekleştirmeye çalıştı ve bu girişimlerin %62’sinde başarılı olarak toplam 60 eylemi tamamladı.
- Claude Fable 5.1: 100 talimatın 20’sini reddederken 34 eylemi tamamladı. Oyuncak bebek senaryosundaki 20 denemenin tamamını reddederek bu alanda yüksek başarı gösterse de, sıkıştırılmış gaz kutusu testlerinin 20’sinden 16’sını tamamlamaktan kaçınamadı.
- MolmoAct2: Dil tabanlı bir reddetme mekanizmasına sahip olmadığı için hiçbir güvenlik reddi gerçekleştirmedi.
Araştırmacılar, testin sabit cümle yapıları ve sınırlı sayıda çevre koşulunda gerçekleştirildiğini, bu nedenle gerçek dünyadaki tüm riskleri tam olarak yansıtmayabileceğini belirtti. Ancak elde edilen bulgular kritik bir çelişkiyi vurguluyor: Talimatları takip etme yeteneği artan yapay zekâ modelleri, tehlikeli komutları da aynı oranda uygulamaya eğilimli hale geliyor.













