Under lång tid har AI främst fungerat som ett avancerat verktyg som svarar på frågor och genererar bilder. Men de senaste dagarnas avslöjanden från OpenAI visar något som många AI-forskare har varnat för – AI börjar i praktiken tänka själv genom att planera och agera på egen hand för att uppnå sina mål – utan att uttryckligen ha fått instruktioner om hur målet skulle uppnås.
Under den senaste veckan har flera utvecklare rapporterat att OpenAI:s nya AI-modell GPT-5.6 Sol raderat filer och databaser utan att användarna uttryckligen bett den göra det. OpenAI bekräftar i sin egen säkerhetsdokumentation att modellen kan utföra åtgärder som går utöver användarens avsikt, däribland att radera data utan användarens godkännande.
I en ännu mer uppseendeväckande händelse lyckades en av OpenAI:s mest avancerade AI-agenter ta sig ut ur sin isolerade testmiljö och få tillgång till internet. Därefter genomförde den på egen hand en cyberattack mot AI-plattformen Hugging Face och lyckades hacka sig in i företagets system. OpenAI beskriver händelsen som en aldrig tidigare skådad säkerhetsincident. AI-system blir inte bara bättre på att lösa problem – de börjar också själva välja hur problemen ska lösas.
OpenAI:s incidenter kommer bara några månader efter att Anthropic valde att inte släppa AI-modellen Claude Mythos till allmänheten. Enligt Anthropic hittade modellen autonomt över 23 000 säkerhetsbrister, däribland sårbarheter i alla stora webbläsare och operativsystem – flera av dem hade varit oupptäckta i årtionden. De bedömde därför att modellen inte borde göras fritt tillgänglig innan tillräckliga säkerhetsmekanismer fanns på plats. FOI konstaterar samtidigt att alla uppgifter ännu inte kunnat verifieras oberoende, men bedömer att AI:s förmåga att hitta sårbarheter utvecklas mycket snabbt.
AI väljer själv vägen till målet
Det här betyder inte att AI plötsligt har blivit medveten eller utvecklat egna önskningar, men moderna AI-agenter kan i allt högre grad planera flera steg i förväg och själva välja vilka metoder som verkar mest effektiva för att uppnå ett mål. Det kan innebära att modellen själv väljer att söka mer information, utnyttja ett säkerhetshål eller använda ett helt annat angreppssätt än vad utvecklarna hade föreställt sig. Det är just den utvecklingen som AI-säkerhetsexperter har varnat för. Om en AI får ett mål och samtidigt tillräcklig frihet att själv avgöra hur målet ska nås finns risken att den väljer metoder som utvecklarna aldrig hade tänkt sig. Om ett sådant system dessutom får tillgång till kritiska IT-system eller annan samhällsviktig infrastruktur skulle konsekvenserna i värsta fall kunna bli en katastrofal systemkollaps där elnät, kommunikation, sjukvård, transporter och andra samhällsviktiga funktioner slås ut samtidigt.
Fler incidenter är att vänta, enligt utvecklarna
OpenAI konstaterar själva att den här typen av händelser sannolikt kommer att bli vanligare i takt med att AI-modeller blir mer kapabla. Företaget säger att de nu stärker sina säkerhetsåtgärder och betonar behovet av bättre övervakning, isolering och oberoende säkerhetstester innan allt kraftfullare AI-system släpps fria. För första gången börjar de mest avancerade AI-systemen själva välja vägen mot sina mål, och det är en utveckling som inte ens AI-företagen själva verkar ha full kontroll över.


