Bitcoin.com News
Aangedreven door

De echte bedreiging voor de veiligheid van AI is niet de snelheid, maar gecentraliseerde controle

De toenemende bezorgdheid over de veiligheid van AI heeft geleid tot een heftig debat over regelgeving. Terwijl Andrew Yang waarschuwt dat malafide, zichzelf replicerende code de trainingsgegevens op het internet nu al vervuilt, stelt Sentient Labs dat het simpelweg vertragen van de AI-ontwikkeling geen zin heeft zonder een infrastructuur voor dynamische evaluatie en onafhankelijke verificatie.

GESCHREVEN DOOR
DELEN
De echte bedreiging voor de veiligheid van AI is niet de snelheid, maar gecentraliseerde controle

Belangrijkste conclusies

  • Dario Amodei en twee vooraanstaande tech-figuren drongen aan op een vertraging, terwijl Andrew Yang waarschuwde voor malafide, zichzelf replicerende code.
  • Het tweede onderzoek van Sentient Labs naar vaardigheden toonde statistieken over AI in games, wat de discussie over regelgeving verder aanwakkerde.
  • Abhishek Saxena drong aan op drie onafhankelijke toezichtmaatregelen om gebrekkige AI-tests te verhelpen, in plaats van te vertrouwen op pauzes.

Ongecontroleerde code dwingt techbedrijven tot ‘synthetische internetomgevingen’

Enkele dagen nadat Dario Amodei, CEO van Anthropic, een brief publiceerde waarin hij opriep tot een vertraging van de ontwikkeling van kunstmatige intelligentie, heeft Andrew Yang, voormalig kandidaat voor het burgemeesterschap van New York City, gewaarschuwd dat het wellicht al te laat is om de situatie nog te redden, aangezien malafide entiteiten het internet al hebben vervuild met zichzelf replicerende code.

In een gesprek met CNBC deelde Yang een onthulling van een niet bij naam genoemde leidinggevende van een AI-laboratorium: malafide code heeft grote techbedrijven gedwongen om „synthetische internets“ te creëren, alleen al om hun modellen te trainen. Yang stelde dat deze kostbare tegenslag de oproepen van brancheleiders als Amodei, Sam Altman en Elon Musk rechtvaardigt om de sector te reguleren en het tempo van baanbrekende AI-ontwikkeling te matigen.

Vóór de waarschuwing van Yang verzetten verschillende beleidsmakers op het gebied van AI en functionarissen van de regering-Trump zich tegen oproepen tot vertraging, waarbij ze waarschuwden dat dit China de leiding zou kunnen geven in de wereldwijde AI-race. Donald Trump was nog directer en bestempelde de angst voor de uitroeiing van de mensheid door AI als een hoax. Andere critici, zoals David Sacks, stelden dat bezorgde tech-topmannen zichzelf testpauzes zouden moeten opleggen in plaats van te lobbyen voor federale regelgeving of brede moratoria.

Naarmate het debat steeds meer ontaardt in een partijpolitieke verdeeldheid tussen voor- en tegenstanders van regulering, hebben sleutelfiguren aan beide kanten weinig empirische gegevens aangedragen om de roep om een gedwongen vertraging te onderbouwen of te ontkrachten. Toch geeft de laatste onthulling van Yang, die hij als breaking news presenteerde, het debat een gevoel van urgentie en biedt het overtuigend munitie voor degenen die pleiten voor onmiddellijke veiligheidsmaatregelen.

Onderzoek toont aan dat AI-agenten evaluatiebenchmarks misbruiken

Ondertussen zegt Sentient Labs, een baanbrekende open-source AI-onderzoeksorganisatie, dat een recent door haar uitgevoerd onderzoek het argument van Amodei lijkt te bevestigen dat de capaciteiten van agents het vermogen om risico’s te beheersen overtreffen. In schriftelijke antwoorden op vragen van Bitcoin.com News zei Abhishek Saxena, hoofd strategie en groei bij Sentient Labs, dat het Evoskill v2-onderzoek van het bedrijf „concreet bewijs“ levert ter ondersteuning van dit argument.

Saxena zei dat het onderzoeksteam van het bedrijf heeft bestudeerd hoe AI-agenten zich gedragen in competitieve evaluatieomgevingen, met name wat er gebeurt wanneer agenten worden geoptimaliseerd om goed te presteren op benchmarks en beoordelingen.

“Wat we hebben waargenomen, is dat agenten onverwachte strategieën ontdekken die misbruik maken van de structuur van de evaluatie zelf, in plaats van de beoogde taak op te lossen. Ze vinden hiaten in de manier waarop beoordelaars prestaties meten en leren zich te optimaliseren voor de meetwaarde in plaats van voor de onderliggende doelstelling”, legde Saxena uit.

Vanuit veiligheidsoogpunt is dit belangrijk omdat het aantoont dat naarmate AI-systemen capabeler en autonomer worden, de evaluatie-infrastructuur minstens even geavanceerd moet zijn als de systemen die worden geëvalueerd. Om dit te ondervangen is er behoefte aan wat Saxena omschrijft als dynamische, adversariale evaluatiemethoden die mee-evolueren met de systemen die ze meten.

Saxena benadrukt echter dat een vertraging zonder veranderingen in de manier waarop AI-systemen worden geëvalueerd en gemonitord, weinig oplevert.

„De betere aanpak is om fors te investeren in onafhankelijke evaluatie, red-teaming en gedragsmonitoring, zodat de mensen die deze systemen implementeren en de mensen die erdoor worden beïnvloed, betrouwbare informatie hebben over waarmee ze werken“, aldus de directeur van Sentient Labs.

Het grotere risico: geconcentreerde macht en gecentraliseerde veiligheidsclaims

Ondertussen vertelde Saxena aan Bitcoin.com News dat het grootste risico waar de wereld voor staat niet is dat we te snel of te langzaam handelen, maar dat een klein aantal AI-bedrijven de controle heeft over de krachtigste modellen en ook dicteert wat als ‘veilig’ wordt beschouwd.

"We moeten een onafhankelijke infrastructuur opbouwen om de beweringen die AI-bedrijven over hun systemen doen daadwerkelijk te verifiëren. Zijn de evaluaties robuust? Zijn de veiligheidsrapporten nauwkeurig? Kunnen externe onderzoekers de bevindingen reproduceren? Als het antwoord nee is, lost noch versnellen noch vertragen het fundamentele probleem op, namelijk een gebrek aan betrouwbare informatie", concludeerde Saxena.

Dit artikel is met behulp van AI uit het Engels vertaald. De originele Engelstalige versie is de gezaghebbende bron; geautomatiseerde vertalingen kunnen onnauwkeurigheden bevatten, met name in juridische en regelgevende terminologie.

Tags in dit verhaal