Bitcoin.com News
Drevet av

Den virkelige trusselen mot AI-sikkerhet er ikke hastighet – det er sentralisert kontroll

Økende bekymringer for KI-sikkerhet har utløst en intens debatt om regulering. Mens Andrew Yang advarer om at useriøs selvreplikerende kode allerede korrumperer opplæringsdata på nettet, argumenterer Sentient Labs for at det å bare bremse KI-utviklingen er ineffektivt uten dynamisk evaluering og uavhengig verifikasjonsinfrastruktur.

SKREVET AV
DEL
Den virkelige trusselen mot AI-sikkerhet er ikke hastighet – det er sentralisert kontroll

Viktige punkter

  • Dario Amodei og 2 ledende teknologiprofiler oppfordret til en nedbremsing, mens Andrew Yang advarte om useriøs selvreplikerende kode.
  • Sentient Labs’ andre ferdighetsstudie viste at KI manipulerer måleparametere, noe som fyrer opp under striden om regulering.
  • Abhishek Saxena oppfordret til 3 uavhengige tilsynstiltak for å rette opp mangelfull KI-testing i stedet for å basere seg på pauser.

Useriøs kode tvinger teknologiselskaper inn i «syntetiske internett»

Dager etter at Anthropic-sjef Dario Amodei publiserte et brev som oppfordret til en nedbremsing av kunstig intelligens, har tidligere ordførerkandidat i New York City, Andrew Yang, advart om at det kan være litt for sent å berge situasjonen, ettersom useriøse aktører allerede har forurenset internett med selvreplikerende kode.

I samtale med CNBC delte Yang en avsløring fra en ikke navngitt leder i et KI-laboratorium: useriøs kode har tvunget store teknologiselskaper til å lage «syntetiske internett» bare for å trene modellene sine. Yang mente at dette kostbare tilbakeslaget rettferdiggjør oppfordringer fra bransjeledere som Amodei, Sam Altman og Elon Musk om å regulere sektoren og styre tempoet i utviklingen av frontier-KI.

Før Yangs advarsel motsatte flere KI-politiske aktører og tjenestepersoner i Trump-administrasjonen seg krav om nedbremsing, og advarte om at det kunne gi Kina ledelsen i det globale KI-kappløpet. Donald Trump var enda mer direkte og kalte frykt for KI-drevet menneskelig utryddelse for en bløff. Andre kritikere, som David Sacks, hevdet at bekymrede teknologiledere heller burde innføre egne testpauser i stedet for å drive lobbyvirksomhet for føderale reguleringer eller brede moratorier.

Ettersom diskursen i økende grad forfaller til en partipolitisk splittelse mellom pro- og anti-reguleringsleire, har nøkkelpersoner på begge sider i liten grad lagt fram empiriske data som underbygger eller avkrefter krav om en tvungen nedbremsing. Likevel tilfører Yangs siste avsløring, som han presenterte som breaking news, debatten en følelse av hastverk og gir overbevisende ammunisjon for dem som tar til orde for umiddelbare sikkerhetsmekanismer.

Forskning viser at KI-agenter utnytter evalueringsbenchmarks

I mellomtiden sier Sentient Labs, en ledende åpen kildekode-organisasjon for KI-forskning, at en nylig studie de gjennomførte ser ut til å bekrefte Amodeis argument om at agenters kapabiliteter løper fra evnen til å håndtere risiko. I skriftlige svar på spørsmål fra Bitcoin.com News sa Abhishek Saxena, leder for strategi og vekst i Sentient Labs, at selskapets Evoskill v2-forskning gir «konkrete bevis» som støtter argumentet.

Saxena sa at selskapets forskerteam har studert hvordan KI-agenter oppfører seg i konkurransepregede evalueringsmiljøer, spesielt hva som skjer når agenter optimaliseres for å prestere godt på benchmarks og vurderinger.

«Det vi observerte, er at agentene oppdager uventede strategier som utnytter selve strukturen i evalueringen i stedet for å løse den tiltenkte oppgaven. De finner hull i hvordan evaluatorer måler prestasjon og lærer å optimalisere for måleparameteren i stedet for det underliggende målet», forklarte Saxena.

Fra et sikkerhetsperspektiv er dette betydningsfullt fordi det viser at når KI-systemer blir mer kapable og autonome, må evalueringsinfrastrukturen være minst like sofistikert som systemene som evalueres. For å overvinne dette trengs det det Saxena beskriver som dynamiske, adversarielle evalueringsmetoder som utvikler seg i takt med systemene de måler.

Saxena insisterer imidlertid på at en nedbremsing uten endringer i hvordan KI-systemer evalueres og overvåkes, oppnår svært lite.

«Den bedre veien er å investere tungt i uavhengig evaluering, red-teaming og atferdsovervåking, slik at menneskene som tar disse systemene i bruk og menneskene som påvirkes av dem, har pålitelig informasjon om hva de faktisk jobber med», sa Sentient Labs-lederen.

Den større risikoen: Konsentrert makt og sentraliserte sikkerhetspåstander

Samtidig sa Saxena til Bitcoin.com News at den største risikoen verden står overfor ikke er at vi beveger oss for raskt eller for sakte, men at et lite antall KI-selskaper har kontroll over de kraftigste modellene og også bestemmer hva som regnes som «trygt».

«Vi må bygge uavhengig infrastruktur for faktisk å verifisere påstandene KI-selskaper kommer med om systemene sine. Er evalueringene robuste? Er sikkerhetsrapportene nøyaktige? Kan eksterne forskere reprodusere funnene? Hvis svaret er nei, løser verken opptrapping eller nedbremsing det grunnleggende problemet, som er mangel på pålitelig informasjon», konkluderte Saxena.

Denne artikkelen er oversatt fra engelsk ved hjelp av kunstig intelligens. Den originale engelske versjonen er den autoritative kilden; automatiske oversettelser kan inneholde unøyaktigheter, særlig i juridisk og regulatorisk terminologi.

Tags i denne artikkelen