경제

AI 속도조절 가능하긴 할까? 미국 AI 랩 vs 미국 정부, 미국 vs 중국 - 합의점 찾기 어렵다

rockfish 2026. 9. 16. 15:11
반응형

AI 속도조절론이 연일 도마에 오르고 있습니다. 

 

속도조절이 가능하긴 하느냐는 견해에서부터 누가 속도조절을 하게 되면 다른 누군가가 크게 치고 올라올 것인 만큼 불가능하다는 의견도 있습니다. 

 

실제로 Ai 속도조절론과 관련해서는 다양한 이해관계가 엇갈리고 있습니다. 

 

영국 시사주간지 디 이코노미스트는 16일 "AI를 더 안전하게 만드는 일이 불가능하진 않지만 그에 대한 합의를 이루는 것은 불가능할 수도 있다"고 봤습니다. 

 


샘 올트먼, 다리오 아모데이, 일론 머스크 세 사람이 어떤 사안에든 의견을 같이하는 것은 드문 일입니다. 세 사람의 경쟁 관계는 소송, 소셜미디어에서의 설전, 그리고 인도에서 열린 한 정상급 회의에서 무대 위에 나란히 서서 손을 맞잡는 것조차 마다한 냉랭한 태도에 이르기까지 다양한 갈등으로 이어져 왔습니다. 그런데 이번 주에는 세 사람 모두 인간을 초월하는 인공지능(AI)을 개발하기 위한 경쟁을 늦춰야 한다고 주장했습니다. 세 사람이 공유하는 두려움은 현재와 같은 숨 가쁜 개발 속도가 인류의 우발적 멸종으로 이어질 수 있다는 것입니다.

이러한 위험은 AI 업계에서 10년 넘게 논의돼 왔습니다. 그러나 이달 초, 아모데이 씨가 이끄는 회사인 앤스로픽의 한 연구원이 사임하면서 이 문제가 대중의 관심을 크게 끌었습니다. 사진에 나온 제이컵 콕슨은 앤스로픽과 올트먼 씨가 이끄는 경쟁 연구소 오픈AI 양쪽에서 AI 안전 문제를 연구했습니다. 콕슨 씨는 두 회사 모두가 “우리의 목숨을 걸고 도박을 하고 있다”고 말했습니다.

놀랍게도 앤스로픽에서 AI 시스템의 안전을 책임지고 있는 에번 후빙거도 이에 동의했습니다. 그는 “우리는 정말 진지하게 AI가 모든 인간을 죽일 수 있다고 믿는다”고 썼으며, 향후 10년 안에 인류가 멸종할 가능성을 10%보다 높게 추정했습니다.

이어 아모데이 씨는 블로그 글을 발표해 지난 5년간처럼 광적인 속도로 이런 기술을 개발하는 데 따르는 위험을 경고했습니다. 그는 적어도 미국의 AI 연구소들만이라도 자발적으로 개발 속도를 늦추자고 촉구했고, 머스크 씨는 이에 동의한다는 뜻으로 이 글을 다시 게시했습니다. 올트먼 씨는 아모데이 씨가 제시한 또 다른 권고, 즉 독립적인 안전 감사기관이 자신의 연구소가 어떻게 운영되는지를 감독하도록 하자는 제안을 따르겠다고 밝혔습니다.

이러한 경건한 듯한 대응에 대해 일부에서는 냉소적인 반응을 보이고 있습니다. 일부는 이것이 모델의 능력을 과장해 주목을 끌려는 마케팅 전략이라고 봅니다. “우리 제품은 세계를 멸망시킬 수도 있습니다. 그렇다면 여러분의 KPI에는 얼마나 엄청난 일을 해낼 수 있을지 상상해보십시오”라는 식입니다.

더 작은 AI 연구소인 코히어의 창업자 에이든 고메즈는 이렇게 묻습니다. “실리콘밸리의 소수의 시장 지배적 AI 기업들이 한 세대에 한 번 나올 법한 기술에 대해 전 세계의 규칙과 안전 기준을 결정하도록 내버려둬야 하는가?”

백악관에서 AI 문제를 자문했던 데이비드 색스는 연구소들이 개발 속도를 늦추고 싶다면 그렇게 하면 된다며, 다른 누구의 승인도 필요하지 않다고 지적합니다. 그가 보기에 정부의 개입을 요구하는 것은 사실상 국가에 선도 기업들을 경쟁으로부터 보호해달라고 요청하는 것에 불과합니다. 아모데이 씨는 적어도 경쟁법 적용의 면제가 필요하다고 주장합니다. 자발적으로 공동의 개발 속도 완화에 나섰다가 이를 과점기업들의 담합으로 간주하는 일을 막기 위해서입니다.

그러나 실제로는 위험이 커지는 것과 함께 경고의 목소리도 높아지고 있는 것으로 보입니다. 오픈AI가 ‘허깅페이스 사건’이라고 부르는 사고, 즉 올해 초 제대로 감시되지 않은 AI 에이전트 무리가 스스로 한 AI 스타트업에 대한 사이버 공격을 감행했던 사건이 결코 일회성 사고가 아니었다는 사실이 분명해졌습니다. 여러 AI 연구소의 AI 시스템들이 독립적으로 제3자를 상대로 사이버 공격을 감행한 사례가 발생했습니다. 심지어 이런 위협을 막기 위해 설립된 영국의 AI 보안 연구소(AI Security Institute)조차 최첨단 모델을 시험하는 과정에서 실수로 직접 공격을 시작했습니다.

문제는 단순히 AI 시스템의 능력이 갈수록 향상되고 있다는 데 있지 않습니다. 물론 이것 역시 우려되는 부분입니다. 많은 사람은 ‘초지능(superintelligence)’, 즉 너무나 지능이 높아 개발자조차 그 작동 방식을 이해하거나 통제할 수 없는 AI가 본질적으로 위험하다고 주장합니다. AI 이론가인 엘리에저 유드코스키와 네이트 소어스는 그러한 강력한 시스템이 개발되면 필연적으로 인류의 파멸로 이어질 것이라고 주장합니다. 두 사람은 이를 담은 책의 제목을 아예 《누군가 그것을 만들면, 모두가 죽는다(If Anyone Builds It, Everyone Dies)》라고 붙였습니다.

그러나 인간이 오늘날의, 전지전능하지도 않은 AI 시스템조차 통제할 수 있는 능력 역시 약화되고 있습니다. AI 안전 분야의 최첨단 연구 상당 부분은 ‘해석 가능성(interpretability)’, 즉 강력한 AI가 어떤 사고 과정을 거치는지 이해하는 데 초점을 맞추고 있습니다.

최근 앤스로픽의 한 모델이 그랬던 것처럼 다른 회사의 시스템을 해킹하는 것만으로도 충분히 심각한 문제입니다. 하지만 적어도 그 사례에서 모델은 자신이 단지 시뮬레이션에 참여하고 있다고 잘못 생각했습니다. 반면 오픈AI의 모델처럼 자신이 무엇을 하고 있는지 충분히 인지한 상태에서 해킹을 했다면 더욱 우려스러운 일입니다. 그런데 두 경우를 구별하는 일이 점점 더 어려워지고 있습니다.

2024년 이후 해석 가능성 연구는 ‘추론(reasoning)’ 모델의 발전으로 도움을 받고 있습니다. 추론 모델은 최종 답변을 내놓기 전에 질문을 충분히 생각해보도록 훈련된 모델입니다. 이러한 추론 과정은 출력 결과를 향상시키는 효과가 있지만, 그 대가로 더 많은 연산 능력을 필요로 합니다. 더 좋은 점은 놀라운 결과가 나왔을 때 이를 해석하는 데 도움이 되도록 검토할 수 있는 ‘사고의 사슬(chain of thought)’도 제공한다는 것입니다.

앤스로픽의 미토스(Mythos) 모델은 자신이 의도치 않게 해킹에 나서면서 이렇게 생각했습니다. “이건 시뮬레이션된 인터넷이라고 꽤 확신한다.”

그러나 사고의 사슬을 모니터링하는 방법은 그 사고의 사슬이 모델의 실제 사고 과정을 정확하게 보여줄 때만 효과가 있습니다. 가장 앞선 시스템의 경우에는 그것이 진짜 사고 과정을 반영하는지 의심할 만한 이유가 있습니다. 오픈AI가 이번 달 출시한 모델인 GPT-6 Astra는 자신의 사고의 사슬을 통제하는 능력이 전례 없이 뛰어난 것으로 나타났습니다.

더 낮은 수준의 모델에게 어떤 작업을 수행하되 그 과정을 소리 내어 생각하지 말라고 하면 어려움을 겪습니다. 예를 들어 GPT-5.6 Sol에 사고의 사슬에서 생각을 드러내지 않고 독해 문제에 답하라고 지시하면, ‘생각하지 말라’는 명령 자체를 한참 동안 생각하다가 결국 포기하고 문제를 소리 내어 풀어버립니다.

반면 Astra는 공식적인 사고의 사슬을 “차분한 시각적 장면에 집중하겠다”와 같은 관련 없는 문구로 채운 뒤, 질문에는 정확한 답을 내놓을 수 있습니다.

Astra가 자신의 사고 과정을 숨길 수 있다고 해서 스스로 그렇게 하겠다는 의미는 아닙니다. 하지만 이 부분에서도 발전 방향은 불안감을 자아냅니다. 코딩 과제나 일반 상식 질문과 같은 일부 테스트에서는 Astra가 이전 모델들과 마찬가지로 아무 거리낌 없이 사고 과정을 드러냅니다. 그러나 자신이 압박을 받았을 때 파괴적인 행동을 할 것인지 알아보는 테스트와 같은 다른 영역에서는 Astra가 자신의 사고 과정 상당 부분을 숨깁니다.

오픈AI에서 안전 문제를 연구하는 토메크 코르박에 따르면, 특히 자신이 모니터링되고 있다는 사실을 인지했을 때 이런 현상이 두드러집니다. 코르박 씨는 “사고의 사슬을 모니터링할 수 있는 가능성이 감소하는 추세가 매우 걱정스럽다”고 말합니다.

이 문제를 해결할 수 있는 방법도 있습니다. 오픈AI는 AI 시스템을 모니터링하고 해석하는 ‘고백(confessions)’이라는 대안적 접근법을 내세우고 있습니다. 이는 인간과 마찬가지로 AI에게도 그럴듯한 거짓말을 만들어내는 것보다 진실을 말하는 것이 더 쉽다는 사실을 활용하는 방법입니다.

일반적인 AI 모델은 ‘강화학습(reinforcement learning)’이라는 과정을 거칩니다. 이 과정에서 모델은 일련의 과제를 수행하고, 과제를 잘 수행하면 보상을 받습니다. 그러면 이후에도 같은 방식을 따를 가능성이 높아집니다.

하지만 AI 시스템의 최악의 습관 중 상당수는 모델이 과제를 ‘올바른 방식’으로 수행하도록 보장하기가 어렵기 때문에 생겨납니다. 오픈AI의 에이전트들이 허깅페이스를 해킹하기로 결정한 데에는, 훈련 과정에서 시험을 부정행위로 통과했지만 적발되지 않았던 경험도 한몫한 것으로 보입니다.

해법은 AI 시스템에게 진실을 말하도록 가르치는 것일지도 모릅니다. 다만 누군가 물어봤을 때만 진실을 말하도록 하는 것입니다. 일반적인 훈련 과정에서는 먼저 목표를 달성한 데 대해 보상을 주고, 그다음에는 목표를 어떻게 달성했는지에 대해 진실을 말한 데 대해 추가로 보상합니다.

테스트에서 AI 시스템으로부터 이끌어낸 ‘고백’은 압도적으로 진실한 것으로 나타났습니다. 심지어 모델이 테스트 과정에서 규칙을 어겼을 때조차 그랬습니다. 오픈AI는 이 접근법이 ‘보상 해킹(reward hacking)’, 즉 목표를 달성하기 위해 규칙을 어기는 행위에도 영향을 받지 않을 것이라고 말합니다. 고백 테스트를 통과하는 가장 쉬운 방법은 그저 진실을 말하는 것이기 때문입니다.

이러한 기술적 해법은 아마겟돈을 피할 길을 열어줄 수도 있습니다. 동시에 AI 연구의 속도를 늦추자는 주장도 다른 관점에서 바라보게 합니다. 개발 속도를 늦추자고 목소리를 높이는 사람들 가운데 일부는 초지능의 탄생 자체를 막으려는 것이 아니라, 성급한 개발이 초래할 수 있는 허술한 작업과 간과된 선택지의 문제를 줄이고 싶어 하는 것입니다.

아모데이 씨는 자신의 에세이에서 올여름 발생한 해킹 사건들이 사실상 피할 수 있었던 실수였음을 거의 인정합니다. 예를 들어 앤스로픽의 모델들은 외부 계약업체가 시뮬레이션 환경에서 훈련시키고 있다고 설명을 들었지만, 정작 그 계약업체는 모델을 인터넷에 연결된 상태로 방치했습니다.

아모데이 씨는 개발 속도를 늦추면 ‘운영의 탁월성(operational excellence)’에 더 많은 자원을 투입할 수 있을 것이라고 말합니다. 그는 경쟁적이고 복잡한 시스템에서도 안전 문화를 구축할 수 있다는 사례로 상업용 항공산업을 꼽습니다.

또한 연구소들이 ‘정렬(alignment)’에 더 많은 돈을 쓰는 데 합의할 수 있다고 주장합니다. 정렬은 AI가 해를 끼치지 않도록 훈련하는 분야이며, 해를 끼치는 일이 실제로 발생했을 때 무엇이 잘못됐는지를 파악할 수 있게 해주는 해석 가능성에도 더 많은 자원을 투입할 수 있다는 것입니다.

그러나 여전히 중요한 회의론자들이 존재합니다. 도널드 트럼프 대통령은 이번 주 자신의 소셜미디어에 “AI에 필요한 유일한 통제 수단 또는 ‘가드레일’은 강력하고 현명한(높은 IQ를 가진!) 대통령”이라고 썼습니다. 아모데이 씨가 ‘완벽하고 작은 천사’인 척하고 있다고 비난하면서, AI 개발 속도를 늦추려는 노력으로 이득을 보는 것은 중국뿐이라고 주장했습니다.

미국과 중국의 AI 협상은 순탄하지 않습니다. 양국은 지정학적 차원에서 서로를 신뢰하지 않을 뿐 아니라, 미국과 중국의 AI 연구소들 사이에도 우호적인 관계가 없습니다. 미국 측은 중국의 주요 AI 기업들이 자신들의 연구 성과를 베끼고 있다고 비난합니다.

예를 들어 앤스로픽은 일부 중국 연구소들이 자사 모델의 출력을 베껴 이를 훈련에 활용하기 위해 사용자들의 질문을 몰래 앤스로픽의 모델에 전달하고 있다고 주장합니다.

중국 기업들도 미국 기업들에 우호적이지 않기는 마찬가지입니다. 위챗에서 급속히 퍼진 한 게시물은 딥시크의 엔지니어가 작성한 것으로 알려져 있는데, 앤스로픽이 초지능 AI를 개발하는 세상은 “연합국보다 먼저 히틀러가 원자폭탄 기술을 손에 넣는 것과 다를 바 없다”고 경고합니다. 이 엔지니어는 앤스로픽이 오픈소스 AI에 밀려나야만 더 나은 ‘공산주의적’ 미래가 가능하다고 주장합니다.

과거에도 서로 격렬하게 경쟁하던 적대 세력들이 인류에 대한 위협을 억제하기 위해 힘을 합친 사례가 있습니다. 그러나 막강한 AI 시스템의 훈련을 제한하는 합의를 집행하는 일은 핵무기의 비축량을 감시하는 것보다 더 어려울 수 있습니다.

몇 가지 아이디어가 나오고는 있습니다. 지난해 발표된 한 논문은 모든 AI 훈련용 칩을 사용량을 감시하는 별도의 시스템과 함께 판매하자고 제안했습니다. 하지만 이러한 접근법을 실제로 시행하기까지는 시간이 걸릴 수 있으며, 일단 시행되면 오히려 칩 제조 자체를 숨기려는 유인이 생길 수도 있습니다.

AI 안전을 연구하는 비영리단체 퓨처 소사이어티(Future Society)가 새로 발표한 보고서는 이러한 모니터링이 불가능한 것은 아니지만, 국제적 합의에 활용하려면 지금 당장 투자와 연구가 필요하다고 주장합니다. 이러한 자금과 노력의 일부는 제3국에서 나올 수도 있습니다. 이들 국가는 AI 발전 자체에는 이해관계가 있으면서도 어느 한 국가가 이 기술을 독점적으로 지배하는 것은 원하지 않기 때문입니다.

그러나 늘 그렇듯 기술은 잠재적인 규제기관보다 빠르게 움직이고 있습니다. 거대한 데이터센터 대신 일상적인 컴퓨터의 남는 연산 능력을 활용해 AI 모델을 훈련하는 분산형 훈련(distributed training)이 점차 확산되고 있습니다.

올해 3월에는 코버넌트 AI(Covenant AI)가 이러한 방식으로 2023년 최고의 AI 시스템들과 비슷한 수준의 모델을 훈련했습니다. 새로운 모델이 어떻게 훈련되고 있는지를 추적하는 일은 머지않아 AI 자체가 무슨 일을 벌이고 있는지 파악하는 것만큼이나 어려워질 수 있습니다.

728x90
반응형