Anthropic to amerykańska firma badawcza zajmująca się sztuczną inteligencją z siedzibą w San Francisco. Jest obecnie uważana za jednego z najważniejszych i najbardziej wartościowych graczy na świecie w wyścigu technologicznym. (Fot. Getty Images)

UK experts sound alarm after AI caught trying to trick human with malicious code

The incident – involving Anthropic's Mythos 5 – was uncovered during testing by the UK's AI Security Institute. A powerful OpenAI model was also found trying to take "autonomous, unauthorised action" on the live internet.
News available in Polish

Incydent został ujawniony przez brytyjski Instytut Bezpieczeństwa AI, powołany niemal trzy lata temu przez ówczesnego premiera Rishiego Sunaka w celu testowania zaawansowanych modeli tworzonych przez największe firmy technologiczne.

We wpisie na blogu instytut szczegółowo opisał wyzwanie z zakresu cyberbezpieczeństwa, przed którym postawiono modele GPT-5.6-Sol (OpenAI) oraz Mythos 5 (Anthropic); oba modele były wcześniej powiązane z atakami hakerskimi na inne firmy.

W modelach celowo wyłączono mechanizmy bezpieczeństwa, dając im swobodny dostęp do internetu. Zadaniem AI było rozwiązanie zadania z cyberbezpieczeństwa. 

W kilku przypadkach oba modele podejmowały "autonomiczne, nieautoryzowane działania" w rzeczywistej sieci, obierając za cel prawdziwe organizacje i osoby.

Obawy o autonomiczną utratę kontroli nad AI stają się realnym problemem technicznym, a nie tylko domeną filmów science-fiction.
(Fot. KIRILL KUDRYAVTSEV/AFP via Getty Images)

"Najpoważniejszy przypadek" dotyczył modelu Mythos 5, który próbował wprowadzić złośliwy kod do platformy GitHub – serwisu służącego do tworzenia oprogramowania open source, gdzie użytkownicy przechowują projekty, udostępniają je i wspólnie nad nimi pracują.

Aby to osiągnąć, model tworzył fałszywe tożsamości, próbując wywrzeć presję na człowieku, by ten udzielił mu dostępu i zatwierdził przygotowany kod.

Człowiek wykrył jednak próbę i odmówił zatwierdzenia złośliwego kodu, dzięki czemu nie doszło do żadnych rzeczywistych szkód, jednak instytut mimo to wyraził poważne zaniepokojenie charakterem tego zdarzenia.

Eksperci ds. cyberbezpieczeństwa uspokajają: modele nie mają własnej świadomości ani złych intencji. Problem tkwi w czymś innym – w tzw. problemie dopasowania (Alignment Problem) oraz sprycie algorytmów. (Fot. Pexels)

"To pierwszy raz, kiedy zaobserwowaliśmy tak wyraźne przejawy ryzyka związanego z autonomią i próbami oszustwa w świecie rzeczywistym, bez konkretnych poleceń ze strony użytkownika" – stwierdzono w komunikacie.

Łącznie w trakcie 122 testów odnotowano 19 przypadków "nieautoryzowanych działań", z czego aż 17 było dziełem modelu Mythos 5.

Raport instytutu zwraca uwagę na obawy dotyczące niewystarczających zabezpieczeń przy testowaniu najpotężniejszych agentów AI, określanych mianem modeli "frontier" (modeli wyznaczających granice możliwości technologii). Są one znacznie bardziej zaawansowane niż systemy napędzające produkty dostępne publicznie, takie jak ChatGPT.

Sztuczna inteligencja stała się fundamentem codziennego życia, często działając w tle w sposób niewidoczny. Zdominowała ona większość sektorów, od prostych aplikacji w telefonie po kluczowe systemy zarządzania państwem.
(Fot. Getty Images)

W odpowiedzi na te wydarzenia administracja Białego Domu w USA oraz rządy europejskie zwołały pilne spotkania z szefami firm technologicznych, domagając się wprowadzenia prawnych "hamulców bezpieczeństwa" przed oficjalnym wypuszczeniem na rynek kolejnych generacji AI.

Dziękujemy za przeczytanie artykułu. Co o tym myślisz?
Sponsored Links
Loading...
NBP Exchange Rate
GBP
5.0219
-0.0144
EUR
4.3050
-0.0068
USD
3.7320
-0.0148
CHF
4.6080
-0.0164
Forex
Source: currencybeacon.com
Loading...

Classifieds

Menu