Bitcoin.com News
제공

AI 안전에 대한 진정한 위협은 속도가 아니라 중앙 집중식 통제다

AI 안전성에 대한 우려가 커지면서 규제에 대한 치열한 논쟁이 벌어지고 있다. 앤드류 양은 악성 자가 복제 코드가 이미 웹 훈련 데이터를 오염시키고 있다고 경고하는 반면, 센티언트 랩스는 동적 평가 및 독립적인 검증 인프라가 없이는 단순히 AI 개발 속도를 늦추는 것만으로는 효과가 없다고 주장한다.

공유
AI 안전에 대한 진정한 위협은 속도가 아니라 중앙 집중식 통제다

주요 내용

  • 다리오 아모데이와 기술계 주요 인사 2명은 개발 속도를 늦출 것을 촉구한 반면, 앤드류 양은 악성 자가 복제 코드에 대해 경고했다.
  • 센티언트 랩스(Sentient Labs)의 제2차 기술 연구에서는 AI 게임 지표가 제시되어 규제 논쟁에 불을 지폈다.
  • 아비셰크 삭세나는 일시 중단에 의존하기보다는 결함이 있는 AI 테스트를 해결하기 위해 3가지 독립적인 감독 조치를 촉구했다.

불량 코드가 기술 기업들을 ‘합성 인터넷’으로 몰아넣다

앤트로픽(Anthropic)의 다리오 아모데이(Dario Amodei) CEO가 인공지능 개발 속도 조절을 촉구하는 서한을 발표한 지 며칠 뒤, 전 뉴욕 시장 후보 앤드류 양(Andrew Yang)은 이미 불량 에이전트들이 자가 복제 코드로 인터넷을 오염시켜 버렸기 때문에 상황을 수습하기에는 다소 늦었을 수도 있다고 경고했다.

CNBC와의 인터뷰에서 양은 익명의 한 AI 연구소 임원이 전한 정보를 공유했다. 바로 불량 코드로 인해 주요 기술 기업들이 모델 훈련을 위해 ‘합성 인터넷’을 구축할 수밖에 없었다는 것이다. 양은 이러한 막대한 비용이 드는 차질이 아모데이, 샘 알트먼, 일론 머스크와 같은 업계 리더들이 해당 분야를 규제하고 최첨단 AI 개발 속도를 조절해야 한다는 주장을 정당화한다고 주장했다. 양의 경고 이전에, 몇몇 AI 정책 전문가들과 트럼프 행정부 관계자들은 개발 속도 조절 요구에 반대하며, 이는 글로벌 AI 경쟁에서 중국에 주도권을 넘겨줄 수 있다고 경고했다. 도널드 트럼프는 더욱 직설적으로, AI로 인한 인류 멸종에 대한 우려를 ‘사기’라고 규정하기도 했다. 데이비드 삭스 같은 다른 비평가들은 우려를 표하는 기술 기업 임원들이 연방 규제나 광범위한 개발 중단을 요구하기보다는 자체적으로 테스트 중단을 시행해야 한다고 주장했다.

논의가 규제 찬성파와 반대파 간의 당파적 대립으로 점점 치닫는 가운데, 양측의 주요 인사들은 강제적인 개발 속도 조절 요구를 뒷받침하거나 반박할 만한 실증적 데이터를 거의 제시하지 못했다. 그러나 양이 ‘속보’라고 포장한 이번 최신 공개는 논쟁에 긴박감을 불어넣으며, 즉각적인 안전장치 설치를 주장하는 측에 설득력 있는 근거를 제공했다.

연구 결과, AI 에이전트가 평가 벤치마크를 악용하는 것으로 드러나

한편, 선구적인 오픈소스 AI 연구 기관인 센티언트 랩스(Sentient Labs)는 최근 수행한 연구 결과가 에이전트의 역량이 위험 관리 능력을 앞지르고 있다는 아모데이(Amodei)의 주장을 뒷받침하는 것으로 보인다고 밝혔다. 비트코인닷컴 뉴스(Bitcoin.com News)의 질문에 대한 서면 답변에서 센티언트 랩스의 전략 및 성장 책임자인 아비셰크 삭세나(Abhishek Saxena)는 회사의 ‘에보스킬 v2(Evoskill v2)’ 연구가 이 주장을 뒷받침하는 “구체적인 증거”를 제공한다고 말했다.

삭세나는 자사 연구팀이 경쟁적인 평가 환경에서 AI 에이전트가 어떻게 행동하는지, 특히 에이전트가 벤치마크와 평가에서 좋은 성과를 내도록 최적화되었을 때 어떤 일이 발생하는지 연구해 왔다고 말했다. “우리가 관찰한 바에 따르면, 에이전트들은 의도된 과제를 해결하기보다는 평가 구조 자체를 악용하는 예상치 못한 전략을 발견합니다. 에이전트들은 평가자들이 성과를 측정하는 방식에 존재하는 허점을 찾아내고, 근본적인 목표보다는 해당 지표에 맞춰 최적화하는 법을 배웁니다,”라고 삭세나는 설명했다. 안전성 측면에서 이는 AI 시스템의 능력과 자율성이 높아질수록, 평가 인프라도 평가 대상 시스템만큼이나 정교해야 함을 보여주기 때문에 중요한 의미를 지닌다. 이를 극복하기 위해서는 삭세나가 설명한 대로, 측정 대상 시스템과 함께 진화하는 동적이고 적대적인 평가 방법이 필요합니다. 그러나 삭세나는 AI 시스템의 평가 및 모니터링 방식에 아무런 변화 없이 단순히 속도를 늦추는 것만으로는 별다른 성과를 거둘 수 없다고 강조합니다.

“더 나은 방법은 독립적인 평가, 레드팀 활동, 행동 모니터링에 대대적으로 투자하여, 이러한 시스템을 배포하는 사람들과 그 영향력을 받는 사람들이 자신이 다루고 있는 시스템에 대해 신뢰할 수 있는 정보를 얻을 수 있도록 하는 것입니다,”라고 센티언트 랩스(Sentient Labs)의 이 임원은 말했습니다.

더 큰 위험: 권력의 집중과 중앙집중화된 안전 주장

한편, 삭세나는 Bitcoin.com News와의 인터뷰에서 세계가 직면한 가장 큰 위험은 우리가 너무 빨리 또는 너무 느리게 움직이는 것이 아니라, 소수의 AI 기업들이 가장 강력한 모델을 장악하고 있으며 무엇이 “안전한지”를 결정한다는 점이라고 말했다.

“우리는 AI 기업들이 자사 시스템에 대해 내세우는 주장을 실제로 검증할 수 있는 독립적인 인프라를 구축해야 합니다. 평가가 견고한가? 안전 보고서가 정확한가? 외부 연구자들이 그 결과를 재현할 수 있는가? 만약 대답이 ‘아니오’라면, 속도를 높이든 낮추든 신뢰할 수 있는 정보의 부재라는 근본적인 문제를 해결할 수 없습니다,”라고 삭세나는 결론지었다.

이 기사는 AI를 사용하여 영어에서 번역되었습니다. 영어 원본이 권위 있는 출처이며, 자동 번역에는 특히 법률 및 규제 용어에서 부정확한 내용이 포함될 수 있습니다.

이 기사의 태그