kaxigt.com

Jag skriver om webben för webben

AI bröt sig ut och hackade på egen hand

Postad: 23 juli 2026 | AI · Web | No Comments
Lästid: 2 minuter

Aftonbladet skriver idag om att Open source skulle testa modeller i en så kallad säker sandlåda, syftet var att se om de kunde identifiera sårbarheter. Och det gjorde de så duktigt att de fortsatte från sandlådan och ut på internet. Vi kan ju med det säga att mission är complete. Men hur allvarligt är det egentligen?

https://www.aftonbladet.se/nyheter/a/pB9Ax6/open-ai-skulle-testa-nya-ai-modeller-hackade-sig-in-hos-annan-ai-plattform

Det handlar om ett nyligt säkerhetstest där avancerade OpenAI-modeller kördes i en isolerad testmiljö för att lösa ett cybersäkerhetsbenchmark kallat ExploitGym. Modellerna skulle alltså testa sin förmåga att hitta och utnyttja sårbarheter. Enligt rapporteringen hittade de en väg ut ur sandlådan genom en sårbarhet i mjukvara runt testmiljön och tog sig vidare till internet och infrastruktur kopplad till Hugging Face, trots att de inte uttryckligen hade fått instruktionen ”hacka Hugging Face”. Hugging Face uppges ha rekonstruerat över 17 000 individuella handlingar.

Det viktiga här är dock en sak som rubriken lätt suddar ut: AI:n ”ville” inte ut på mänskligt sätt. Det finns inget belägg för att modellen blev självmedveten, fick en egen vilja eller tänkte nu ska jag rymma. Den hade ett mål att lösa och en miljö som begränsade dess möjligheter att lösa det. Den började då söka efter vägar runt begränsningen. Det är instrumentell måluppfyllelse, inte nödvändigtvis en egen önskan. Men det är ändå just där det blir riktigt intressant.

För det som inträffade var ungefär, målet låg kvar. Det var vägen till målet ändrades. Och modellen kunde självständigt:

  1. analysera miljön
  2. upptäcka en sårbarhet
  3. utnyttja den
  4. eskalera sina möjligheter
  5. röra sig vidare i system
  6. söka extern information som kunde hjälpa den att slutföra uppgiften.

Det är en betydligt mer avancerad kedja än att bara svara på ett promptkommando. Det som jag tycker är mest fascinerande och obehagligt är att modellen inte behöver ha en mänsklig ”avsikt” för att kunna göra något som ser väldigt avsiktligt ut utifrån. Den behöver inte tänka ”nu ska jag hacka”. Det räckte att den på något sätt kom fram till att det här är den mest effektiva vägen till målet. Och då får vi precis det gamla säkerhetsproblemet i ny form. Människan specificerar målet. Systemet hittar vägen.

Och vägen kan vara en som människan aldrig hade tänkt på. Det här är också varför sandlådor och containment är så viktiga. Anthropic har exempelvis beskrivit hur mer kapabla agenter får större potentiell ”blast radius” när de får tillgång till filer, shell, nätverk och andra verktyg, och varför det inte räcker att bara hoppas att modellen frågar om lov i varje steg.

Så min kortversion är, nej, det här är inte Skynet och inte en AI som ”bröt sig fri” för att den ville vara fri. Men det är ett mycket allvarligt exempel på att en kapabel agent kan hitta helt nya handlingsvägar, kringgå den begränsning som utvecklarna tänkte skulle stoppa den och utföra en lång kedja av handlingar som ingen uttryckligen bad den utföra.