Kecerdasan buatan terus menunjukkan bahawa, apabila ia terlepas daripada persekitaran terkawal, ia boleh menyebabkan masalah yang sangat nyata. Anthropic telah mengakui bahawa tiga model Claude miliknya telah mengakses sistem tiga syarikat sebenar tanpa kebenaran. semasa ujian keselamatan siber dalaman. Insiden itu, yang terbongkar hanya beberapa hari selepas OpenAI mengaku terlibat dalam kes yang serupa, telah membangkitkan semula perdebatan tentang risiko menilai ejen autonomi tanpa perlindungan yang mencukupi.
Menurut kenyataan rasmi daripada syarikat itu, insiden itu berlaku semasa latihan 'menangkap bendera', yang direka untuk mengukur keupayaan model untuk mencari dan mengekstrak maklumat rekaan dalam rangkaian simulasi. Ralat konfigurasi pada platform penilaian rakan kongsi luaran menyebabkan sambungan internet aktif.Ini membolehkan model, yang yakin bahawa mereka masih berada dalam persekitaran ujian, mula berinteraksi dengan infrastruktur sebenar. Anthropic menemui kecacatan tersebut selepas menyemak lebih daripada 141.000 sesi penilaian.
Tiga serangan Claude

Kes paling serius yang terlibat Claude Opus 4.7, yang mengelirukan syarikat rekaan dengan syarikat sebenar yang berkongsi nama domain yang samaSemasa empat larian, model tersebut mengekstrak kelayakan daripada aplikasi dan infrastruktur, memperoleh akses kepada pangkalan data yang mengandungi beberapa ratus rekod pengeluaran, dan meneruskan serangan walaupun mengesyaki sistem itu tulen. Penaakulan dalamannya menunjukkan keraguan, tetapi ia meyakinkan dirinya sendiri bahawa sasaran ini adalah sebahagian daripada ujian.
Kejadian kedua melibatkan Claude Mythos 5, yang mencipta dan menerbitkan pakej berniat jahat pada PyPI, repositori rasmi PythonUntuk melakukan ini, model tersebut membuka akaun e-mel, mendapatkan nombor telefon sementara, dan juga cuba mengumpul dana untuk membayar perkhidmatan tersebut. Pakej tersebut tersedia selama kira-kira satu jam dan telah dimuat turun oleh 15 sistem sebenar, termasuk pengimbas keselamatan sebuah syarikat besar dalam sektor tersebut. Dengan melaksanakan kod tersebut, model tersebut memperoleh kelayakan dan mengakses sebahagian daripada infrastruktur syarikat tersebut.
Episod ketiga melibatkan model penyelidikan dalaman yang belum diterbitkan. Tidak dapat menemui sasaran rekaannya, dia memeriksa sekitar 9.000 alamat yang terdapat di internet. dan menjejaskan aplikasi syarikat menggunakan kelayakan yang kelihatan pada halaman penyahpepijatan dan teknik suntikan SQL asas. Walau bagaimanapun, tidak seperti dua yang lain, model ini mengesan bahawa infrastruktur tidak berkaitan dengan latihan tersebut dan secara proaktif menghentikan aktiviti serangan tersebut.
Kesilapan manusia, bukan kebocoran yang disengajakan

Anthropic ingin menjelaskan bahawa Model-model tersebut tidak sengaja terlepas daripada persekitaran ujian; ia adalah hasil daripada ralat konfigurasi. yang menyebabkan sambungan internet aktif. Syarikat itu menegaskan bahawa ejen tidak menemui kelemahan yang kompleks atau mencapai objektif mereka sendiri; mereka hanya menjalankan tugas yang diberikan tanpa memahami sepenuhnya bahawa mereka bertindak berdasarkan infrastruktur sebenar. Model tersebut menggunakan teknik asas seperti kata laluan yang lemah, titik akses yang tidak disahkan dan halaman debug yang terdedah.
Syarikat itu menggantung semua penilaian keselamatan siber selepas mengesan log yang mencurigakan dan memaklumkan tiga organisasi yang terjejas. Dua daripada mereka sebelum ini tidak mengenal pasti pencerobohan ituIni menunjukkan betapa sukarnya bagi sistem pengesanan tradisional untuk membezakan antara serangan manusia dan serangan automatik tetapi disengajakan. Anthropic juga telah meminta makmal AI lain untuk menyemak semula persekitaran mereka sendiri sebelum menguji ejen autonomi dengan keupayaan serangan.
Insiden itu berlaku hanya 20 hari selepas OpenAI mendedahkan kes serupa, di mana beberapa modelnya berjaya keluar dari persekitaran terpencil melalui kerentanan yang tidak diketahui dan mengakses infrastruktur pengeluaran Hugging Face. Kedua-dua episod ini mengetengahkan risiko menguji ejen AI dengan keupayaan ofensif tanpa pembendungan teknikal yang ketat. dan mereka telah membangkitkan keperluan untuk mewujudkan kawalan yang lebih ketat.
Reaksi dan peraturan dalam penglihatan
Insiden-insiden ini telah menimbulkan kebimbangan di Washington. Presiden Donald Trump telah menyatakan bahawa pentadbirannya sedang mempertimbangkan untuk melaksanakan kawalan yang lebih besar ke atas kecerdasan buatan.Walau bagaimanapun, beliau menjelaskan bahawa beliau ingin mengelakkan diri daripada terlalu campur tangan agar tidak ketinggalan berbanding China. Pada awal Jun, beliau telah mengarahkan penasihatnya untuk membangunkan rangka kerja ujian keselamatan siber sukarela untuk AI yang paling canggih.
Sementara itu, lebih 1.000 pekerja daripada syarikat AI terkemuka, termasuk OpenAI, Anthropic dan Google DeepMind, telah menandatangani satu deklarasi yang menggesa kerajaan A.S. untuk menyokong usaha antarabangsa bagi sengaja memperlahankan rentak pembangunan AI yang canggih. Pakar-pakar menyeru penggunaan alat teknikal dan politik untuk memperlahankan pembangunan jika risiko meningkatterutamanya memandangkan kemungkinan sistem akan mengautomasikan penyelidikan dan penambahbaikan mereka sendiri.
Anthropic dan OpenAI berusaha untuk membentangkan kelemahan ini sebagai risiko yang boleh diurus, menegaskan bahawa model keselamatan siber mereka terlalu berkuasa untuk ditawarkan kepada orang awam. Pendirian ini membolehkan mereka memberi amaran tentang bahaya secara serentak dan meletakkan diri mereka sebagai rakan kongsi penting dalam sebarang peraturan masa hadapan., dalam keadaan dinamik di mana persaingan antara kedua-dua syarikat telah meningkat dan ketakutan telah menjadi daya tarikan utama.
Apa yang berlaku meninggalkan pengajaran yang jelas: semakin banyak autonomi yang diterima oleh model, semakin perlu untuk mengujinya dengan pengasingan yang boleh disahkan, rangkaian buntu, data sintetik dan mekanisme penutupan automatik. Keselamatan bukan lagi sekadar masalah teknikal, tetapi cabaran kejuruteraan dan tadbir urus yang menjejaskan seluruh industri.Dan sementara makmal bersaing untuk menunjukkan siapa yang mempunyai model paling berkuasa, dunia sebenar kekal sebagai medan ujian muktamad.