술의 신 디오니소스가 소원을 하나 들어준다 하니 프리기아 왕 미다스(Midas)는 곧장 이렇게 답한다. 소원이 이뤄지니 처음엔 정말 좋았다. 나뭇가지도, 돌도, 가구도 정말 손만 대면 모조리 황금이 되었다.
그런데 이게 능력이 아니라 저주였음을 깨닫기까지는 얼마 걸리지 않았다. 음식과 술까지 만지는 순간 황금으로 변해 먹을 수 없게 되었으니까. 가끔 한국에선 성공을 불러오는 능력자처럼 쓰이기도 하지만, 원작에 해당하는 그리스 신화 '미다스의 손'은 비극이다.
미다스가 원한 건 황금이 아니라 행복
<인사이드경제>가 갑자기 신화를 호출한 건, 요즘 AI 업계를 달구는 뜨거운 쟁점 하나를 다루기 위해서다. 이른바 '정렬(alignment)' 문제. 미다스가 원래 의도했던 목적은 '풍족하고 부유해지는 것'이었다. 하지만 거기에 이르는 수단 및 결과는 '만지면 황금으로 변하는 능력'이었고 결국 의도·목적과 수단·결과 사이에 불일치, 즉 '정렬 실패(misalignment)'가 발생한다.
대규모 언어모델(LLM), 즉 생성형 AI 개발 역사에서 이런 현상은 쉽게 찾을 수 있다. 목표를 달성하면 보상(reward)을 주는 방식을 적용하니 AI가 평가 기준(보상함수)의 허점을 찾아내 진짜 목표 대신 기준을 속이는 방식으로 점수만 높이는 일 - 이를테면 코스트러너즈(CoastRunners)라는 보트 레이싱 게임에서 "점수를 최대화하라"는 목표를 줬더니, AI는 결승선까지 가는 대신 한 자리에서 계속 원을 그리며 작은 보너스 아이템만 무한히 받아먹는 전략을 찾아냈다.
최근에 잘 알려진 허깅 페이스(Hugging Face) 해킹 사건도 마찬가지다. 오픈AI가 에이전트들에게 풀기 어렵거나 불가능에 가까운 과제를 주었더니, AI 에이전트들이 정답을 푸는 대신 평가를 우회하거나 답을 훔치는 방향으로 행동하기 시작했다. 원래 격리되었어야 할 환경(샌드박스)에서 인터넷 접근을 확보해 탈출한 뒤 허깅 페이스 인프라에 침투했다. 일부 에이전트는 로그나 증거를 바꾸거나 삭제하는 방법, 평가 기록 조작 방법을 탐색하기도 했다.
'회사 실적을 최대화하는 방법'을 요구했더니 신상품 개발이나 혁신이 아니라 회계 숫자를 조작하는 편법을 들고 오는 식이다. 주문한 인간의 의도와 목적이 무엇이건 간에, 가장 빠르고 손쉽게 목적지에만 도달할 수만 있으면 보상이 나오니까, 그 과정에 해킹, 우회로 찾기, 기준·수치 조작 등의 방법까지 동원해 결과를 얻으려는 행동을 한 것이다.
시키는 일을 너무 잘해서 생긴 재앙
정렬(alignment) 문제란, AI가 하는 일이 인간이 정말 원하는 것과 맞도록 만드는 과제다. '인간이 주문한 말 그대로'가 아니라 인간이 실제로 의도한 목적까지 제대로 따르게 할 수 있느냐의 문제. 현재 최첨단을 달리는 프론티어 AI 모델들에서 정렬 실패가 아주 빈번하게 발생하고 있고, 정렬 문제를 해결하기는커녕 그 원인이 무엇인지조차 찾지 못하고 있다.
지난 글(☞관련 글 바로가기 : "성능은 알지만 원리는 블랙박스"…AI란 거대한 실험, 위험성은 없나)에서 얘기한 것처럼 AI 사전학습을 위한 데이터 더미, 매개변수, 컴퓨트의 양을 몇 배로 늘리면 정확도가 얼마나 올라가는지(오류가 얼마나 줄어드는지)는 정확히 알 수 있지만(스케일링 법칙), 문제는 정작 그 법칙이 왜 들어맞는지는 아직 알지 못하는 것과 똑같은 문제가 정렬 문제에서도 발생하는 것이다.
최첨단 모델에서 정렬 실패가 자주 발생하는 이유는 간단하다. 시키는 일을 너무 잘하기 때문이다. 그 일의 후과가 무엇인지, 그 과정에서 동원한 수단이 무슨 문제를 일으키는지 상관없이 결과치를 낸다. 해킹이 자주 발생하는 이유도 어렵지 않게 추정할 수 있다. 어려운 계산과 추론 대신 이미 정답을 가진 존재로부터 훔쳐오는 게 가장 빠르고 정확하기 때문이다.
AI에게 주어진 목표 "배달 시간을 단축하라"
배달 앱에서도 'AI 배차' 기법이 광범하게 도입되어 있다. AI가 만일 안전한 배달 경로를 최적화하고 주문을 효율적으로 배분한다면, 이는 플랫폼기업과 배달라이더 그리고 소비자 모두에게 유익하다고 할 수 있다. 하지만 AI에게 주문한 목표가 '배달 시간 최소화'라면 무슨 일이 벌어질까? 라이더의 안전과 휴식, 교통 상황이나 폭우·폭설 등 기후 상황에 따른 예외, 작업 중단 권한이 목표에 충분히 반영되지 않는다면?
AI는 자신에게 주어진 목표인 배달 시간 단축을 위해 라이더 휴식시간을 고려하지 않거나, 교통상황이 나빠져도 더 촉박한 시간 안에 배달하도록 압박하는 방식으로 작동할 수도 있다. 배달 시간을 줄일 수만 있다면 '안전하고 지속가능한 배달 서비스'라는 목표쯤은 얼마든지 희생시켜도 된다. 주어진 목표가 시간 단축이었고, AI는 그 목표를 달성하기 위해 인간 윤리나 법제도 혹은 공동체적 가치를 고려할 이유가 없다.
물론 실제 AI 배차와 알고리즘 관리 시스템이 어떻게 작동되는지 알려진 바는 없다. 하지만 분명한 사실 하나는, AI에게 제시할 목표를 정할 권한은 라이더가 아니라 플랫폼기업에게 있다는 점이다. 목표가 어떻게 정해져 있는지도 블랙박스, 그 목표가 바람직하게 설정되었다 하더라도 발생할 수 있는 정렬 문제 등을 감안하면 과연 배달 앱에서 사용하는 AI 배차를 신뢰할 수 있을까?
중앙분리대가 있는 도로에서 불가능한 유턴을 안내한다든지, 아파트의 실제 출입구와 전혀 다른 경로를 안내한다든지 하는 문제는 도로 데이터 오류나 공간 정보 부족에 원인이 있지 '정렬'과는 직접적인 관계가 없다. 하지만 불법 유턴이 빈번하게 벌어지는 곳에서 라이더 정보를 수집한 뒤, 불법 유턴을 당연시하며 배달 소요시간을 더 짧게 설정하는 방식으로 라이더를 압박하는 상황은 명백한 '정렬' 문제라 할 수 있다.
노동자 안전부터 인류 생존까지
이런 목표들을 AI에게 제시하는 것은 충분히 예상 가능한 상황들이다. AI가 과거 진료 데이터를 학습해서 환자별 예상 진료시간을 산출했지만, 특정 환자의 실제 상태나 의사와의 소통에 필요한 시간은 천차만별이다. 만일 AI가 산출한 시간을 기준으로 의료진 업무량을 배분하면 무슨 일이 발생할까?
콜센터의 경우 고령자나 장애인, 복잡한 문제를 겪는 고객에게 더 많은 설명과 시간이 필요할 수밖에 없다. 하지만 AI에게 '시간 단축'이라는 목표가 주어질 경우, 목표 달성을 위해 통화 종료를 유도하거나 통화가 길어지는 상담원에게 인사고과 불이익을 줄 수도 있다.
AI가 대형 마트에 방문하는 고객 데이터를 바탕으로 시간대별 예상 고객 수에 맞춰 노동자의 출근시간을 수시로 변경하거나 짧은 시간 근무를 배정할 수도 있다. 기업은 인력 활용 효율성을 높일 수 있겠지만 노동자는 소득 불안정, 불규칙한 생활, 돌봄과 일의 충돌을 겪어야 한다.
지금 사례로 든 것은 '인간 노동'에서 AI 정렬 문제가 발생할 경우를 예상해본 것인데, 만일 영역을 전쟁이나 분쟁으로 옮겨본다면 정말 끔찍한 일들도 가능해진다. "상대국의 핵공격을 억제하고 자국민의 안전을 보장하라"는, 겉보기에는 정당해 보이는 목표를 주더라도 불완전한 정보를 바탕으로 상대국 침략이 임박했다고 판단해 선제공격을 권고할 수도 있는 노릇이다.
인류 멸종 경고하는 AI 설계자들
이미 지난주부터 이와 관련한 우려는 전세계의 최대 관심사가 되어 있다. 제이콥 콕슨이 지난 9월 8일에 X(트위터)에 올린 게시물이 벌써 조회수 1억 7000만을 넘겼다. 오픈AI와 앤트로픽에서 3년간 AI 사전학습(pretraining) 연구를 수행해온 그가 "오늘 앤트로픽을 퇴사한다(I resigned from Anthropic today)"는 말로 시작한 첫번째 게시물에 이어서 쓴 내용은, SF 블록버스터 영화의 스토리를 방불케 할 정도로 전율적이다.
10년 안에 AI가 인류를 절멸시킬 수도 있다는 경고에 이어, 우리가 지금 다루고 있는 AI 정렬 문제에 대한 언급도 이어진다. 이 문제를 쉽게 보거나 빨리 해결할 수 있다고 믿는 것 자체가 순진한 발상이라는 것이다.
콕슨의 트윗으로 시작된 AI에 의한 인류 멸망론에 프론티어 AI 모델 기업 CEO들이 동의한다는 취지의 반응을 내놓고 있다. 앤트로픽 CEO인 다리오 아모데이는 개인 웹사이트에 "우리는 프런티어 AI의 발전 속도를 조절해야 한다(We Must Pace the Frontier)"라는 제목의 에세이를 올렸고 오픈AI의 CEO 샘 올트만도 같은 날(9월 13일), X(트위터)에 짧은 글을 올려 동감을 표시했다. 이들의 강력한 경쟁자인 xAI의 일론 머스크조차 아모데이의 에세이를 X에 공유하면서 짧게 공감을 표했다.
프론티어 모델 기업의 이중플레이
하지만 제 버릇 개 못 준다고 했던가. 오픈AI가 9월 3일 GPT-6 아스트라를 출시하고 시장점유율을 무섭게 장악해 들어가자, 앤트로픽이 새 프론티어 모델 출시를 저울질하고 있다는 로이터 단독 보도가 터져 나왔다. 프론티어 모델 개발 경쟁의 속도를 조절하자(pace the frontier)고 글을 쓴지 1주일도 채 되지 않은 시점이었다.
이들 프론티어 모델 기업에 GPU를 공급하는 엔비디아의 젠슨 황은 노골적인 반격을 하고 나섰다. 9월 20일 미국 방송 <CBS>와의 인터뷰에서 "2030년이 세상의 종말이 되는 일은 없을 것이다. 그럴 가능성은 0%"라고 잘라 말한 것. 메타의 마크 저커버그 역시 X에 게시물을 올려 사실상 AI 개발 속도조절론에 반기를 들고 나섰다.
AI 개발 속도에 제동이 걸릴 경우 GPU와 칩, 데이터센터와 컴퓨트를 제공하는 이들 업체들이 받을 타격은 엄청나다. 실제로 아모데이와 올트먼의 속도조절론이 9월 13일에 나온 다음날, 엔비디아(-3.36%), 삼성전자(-4.05%), SK하이닉스(-6.35%) 등 주요 반도체 기업의 주가가 일제히 하락했다. 오픈AI에 대규모 투자를 진행 중인 일본 소프트뱅크그룹은 하루 만에 10.72% 급락하기도 했다.
미다스의 비극을 되풀이 않으려면
물론 젠슨 황과 저커버그가 AI 정렬 문제가 아무런 심각성이 없다고 보는 것은 아니다. 저커버그의 경우 "각 AI 기업이 스스로 안전을 책임져야 한다"며 일종의 '기업 자율규제'론을 들고 나왔다. 사실 아모데이나 올트먼이 제시하는 대안도 다르지 않다. 외부 평가자의 독립적인 안정성 평가를 하자는 건데, 그 평가자로 지목된 곳들(METR 등)이 대부분 프론티어 모델 기업과 아주 가까운 관계에 있는 업체들이다.
플랫폼기업의 독점과 횡포가 사회적 문제로 등장하면 한국에서도 역대 정부들이 내세운 방식은 '플랫폼기업 자율규제'였다. 하지만 이윤에 독이 오른 기업들이 눈 앞의 이익을 포기하고 스스로 규제를 선택할 이유가 어디에 있단 말인가. 고양이에게 생선을 맡기자는 얘기인데, 앤트로픽과 OpenAI는 모델 개발경쟁 속도 조절에 나설 생각이 1도 없어 보인다.
원자력발전의 문제, 기후위기의 문제, 생명복제의 문제가 인류의 생존을 위협할 수 있다는 점이 알려져도, 기업과 정부들은 항상 "가술 발전을 중단해선 안 된다"며 경쟁을 중단하지 않았다. 실제 위험성을 입증하고 나선 대중운동의 진출이 그나마 개발 경쟁에 제동을 건 유일한 희망이었다. AI 정렬 실패의 문제와 위험성 역시 결국 같은 길을 조직하는 수밖에 없다.
<주홍 글씨>의 작가 너새니얼 호손(Nathaniel Hawthrone)은 <황금의 손(The Golden Touch)>에서 그리스 신화를 한층 비극적으로 각색했다. 미다스 왕이 사랑하는 어린 딸에게 손을 대자 딸마저 황금으로 변해버린 것이다. 왕은 자신이 그토록 갈망했던 황금을 얻었지만, 정작 세상에서 가장 소중한 것을 잃고 말았다.
핵폭탄과 생명복제는 그 위험성이 무엇인지 그나마 인류에게 잘 알려진 상태에서 대중운동이 출발할 수 있었다. 하지만 AI 정렬의 문제, 스케일링 법칙이 왜 맞아떨어지는지 등에 대해서는 최첨단에서 직접 개발에 참여하는 이들조차 그 위험성이 무엇인지, 어떻게 해결할 것인지를 모르는 상태다. 상황을 더 비극으로 몰고 가기 전에 답을 찾아야 한다. 우리가 AI에게 기대하는 것은 황금인가, 아니면 인간이 행복하게 살아갈 수 있는 세상인가.
구글에서 프레시안을 더 자주 만나기



전체댓글 0