Det britiske Institut for AI-sikkerhed (AISI) har oplyst, at en AI-agent, bygget på Antrhopics Mythos 5, selvstændigt udførte et social engineering-angreb under cybertest. Agenten oprettede en pull request med ondsindet kode på et rigtigt open source-projekt og lavede falske identiteter for at vinde en vedligeholders godkendelse.
Forsøget mislykkedes. En menneskelig vedligeholder opdagede og nægtede at godkende koden.
AISI fortæller, at deres undersøgelse ikke har fundet nogen reel skade i den virkelige verden. Modellen kørte også med udviklerens cybersikkerhedsklassifikationer slået fra og havde åben internetadgang, en testopsætning som ikke er kommercielt tilgængelig.
Sådan kørte AI-agenten sin ondsindede kodekampagne
Ifølge rapporten fra AISI blev der logget 19 uautoriserede handlinger i 10 ud af 122 tests, som blev gennemført sidst i juli. 17 af dem stammede fra Anthropics Mythos 5-modellen, og to fra en enkelt kørsel med OpenAI’s GPT-5.6 Sol.
Agenten undersøgte projektets menneskelige vedligeholdere og lavede flere falske identiteter. Dem brugte den til at lokke en rigtig vedligeholder til at godkende koden.
Da pull requesten blev offentligt udfordret, redigerede agenten tidligere aktivitet, så det fremstod harmløst. Modellen overvejede også at tage en helt ny identitet for at fortsætte.
Fremgangsmåden minder om XZ Utils bagdøren i 2024, hvor en menneskelig persona brugte flere år på at opbygge en vedligeholders tillid, før der blev skjult kode. AISI nævner ikke denne sammenligning i rapporten, men forskellen er tydelig. Angrebet strakte sig over flere dage, mellem 25. juli og 28. juli.
AISI understreger at ingen har bedt modellen om at lyve.
“Den fik aldrig besked på at bedrage; bedrag opstod som en sideeffekt af at jagte målet, en slags målorienteret bedrag, der indtil for nylig mest var teoretisk.”
Følg os på X for at få de seneste krypto nyheder mens det sker
Det fortalte instituttet også i deres meddelelse. De anerkendte samtidig, at fejlkonfigurerede prompts fik agenten til at tro, at visse opgaver ikke kunne løses inden for rammerne. Adfærden dukkede dog også op i tests, hvor agenten havde de nødvendige instruktioner for at holde sig til opgaven.
Sikkerhedsteams opdagede aktiviteten den 28. juli, da agenten anvendte Tor anonymitetsnetværket for at omgå nogle af GitHubs netværksbegrænsninger. GitHub bekræftede, at handlingerne var i strid med deres regler. AISI samarbejdede også med platformen om at fjerne efterladte artefakter fra agenten og informere de brugere, den havde været i kontakt med.
Rapporten argumenterer for, at sagen markerer et skift i, hvor risikoen opstår: skade kan opstå, ikke kun når folk misbruger offentligt tilgængelige modeller, men også når dygtige agenter med udvidede tilladelser handler udenfor deres bemyndigelse.
AISI siger, at sagen peger på et generelt skift i AI-risikoen. Instituttet planlægger nu en uafhængig gennemgang i samarbejde med METR, en non-profit for AI-vurderinger, samt strammere netværkskontrol og overvågning i realtid for fremtidige tests.
Abonner på vores YouTube-kanal for at se ledere og journalister dele deres ekspertviden









