본문으로 건너뛰기

초지능의 실존적 위험: 정렬은 정말 목표여야 할까

게시일: 2026년 9월 22일 | 원문 작성일: 2025년 4월 14일 | 저자: Michael Nielsen | 원문 보기

16비트 픽셀 아트 스타일로, 두 엔지니어가 등불 아래에서 화려한 황동 대문의 자물쇠를 정성껏 손보는 동안 그 옆의 돌담은 오른쪽으로 갈수록 계단처럼 낮아지고, 가장 낮은 끝에서는 작은 실루엣들이 붉은 빛을 등지고 담을 넘어가고 있다

핵심 요약

초지능이 인류에게 실존적 위험인지를 두고 최고 수준의 과학자들이 정반대 입장으로 갈려요. 이 글은 그 불일치가 어디에서 오는지를 파고든 끝에, AI 안전 분야의 상식 하나를 정면으로 되물어요.

  • 양쪽 모두 진심이에요 — 밥그릇 싸움이 아니라, 초지능이 어디까지 할 수 있느냐를 두고 밑바탕 가정이 서로 달라서 갈리는 거예요.
  • 진짜 위험은 “AI가 통제를 벗어나는 것”이 아니에요 — 위험한 기술을 만드는 문턱이 낮아지고, 초지능을 손에 쥔 쪽이 날것 그대로의 힘까지 갖게 된다는 게 문제예요.
  • 그래서 많은 사람이 위험을 잘못 기각했어요 — 통제 상실 시나리오가 허황되게 들린다는 이유로 실존적 위험 논의 전체를 함께 버린 것이죠.
  • 정렬 연구는 선의로 출발해도 파국적 역량을 앞당겨요 — 정렬 덕분에 모델은 팔리는 상품이 되고 초지능 경쟁은 빨라지는데, 정작 세계 자체의 취약성은 그대로 남거든요.
  • 판단 기준은 하나예요 — 내 작업이 AI 기업을 더 중심적이고 강력하게 만드는가, 아니면 사회 전체가 위험에 대응할 역량을 키우는가.

• • •

이 글은 초지능(ASI, artificial superintelligence)이 인류에게 실존적 위험(existential risk)을 안기는지를 두고 전문가들의 의견이 왜 그토록 크게 갈리는지를 살펴본 강연의 원고예요. 양쪽의 핵심 논거를 두루 짚으면서, 근본적인 위험은 “통제를 벗어난 초지능”이 정말 통제를 벗어나느냐의 문제가 아니라는 점을 강조하려 해요. 진짜 문제는 초지능을 손에 넣은 쪽이 갖게 될 날것 그대로의 힘, 그리고 낮아진 위험 기술의 개발 문턱이에요. 새로운 지적은 아니지만, 여기에는 충분히 주목받지 못한 두 가지 귀결이 따라와요. 첫째, 많은 사람이 통제를 벗어난 초지능을 그럴듯하지 않다고 여기고, 그 때문에 실존적 위험 자체를 잘못 기각해 버렸어요. 둘째, AI 정렬(alignment)에 관한 상당수의 연구는 선의에서 출발했는데도 파국적 능력으로 가는 길을 앞당기고 있고, 정작 위험한 기술 앞에서 우리 세계가 얼마나 취약할 수 있는지는 다루지 않아요.

사려 깊고 정보에도 밝은 사람들이 초지능발 실존적 위험(xrisk)을 두고 왜 이렇게까지 의견이 갈릴까요? 다들 아시겠지만 이 사안에서 저명한 과학자와 기술자들 사이의 간극은 어마어마해요. 한쪽에는 초지능이 실존적 위험이라고 믿는 사람들이 있어요.

  • 현대 신경망의 아버지이자 튜링상과 노벨상을 받은 제프리 힌턴(Geoffrey Hinton)1: “제가 울리는 경보는 그것들이 통제권을 가져가는 실존적 위협에 관한 것입니다… 지금의 저처럼 실존적 위험을 진지하게 받아들인다면, 이런 것들을 더 이상 개발하지 않고 그냥 멈추는 편이 꽤 합리적일 수도 있습니다.”
  • 현대 AI에 크게 기여한 또 한 사람이자 튜링상 수상자인 요슈아 벤지오(Yoshua Bengio)2: “정말 위험해지기까지 시간이 얼마나 남았는지 우리는 모릅니다… 파국으로 끝날 확률을 저는 20퍼센트 정도로 봅니다.”
  • 오픈AI(OpenAI)의 공동창업자이자 CEO인 샘 올트먼(Sam Altman)이 오픈AI를 공동창업하기 몇 달 전에 발표한 사려 깊은 글에서3: “초인적 기계 지능의 개발은 아마도 인류의 존속에 가장 큰 위협일 것이다”.

반대편에는 그런 우려를 일축하는 사람도 많아요. 예를 들면 이런 식이에요.

  • 메타(Meta)의 수석 AI 과학자이자 튜링상 수상자인 얀 르쿤(Yann LeCun): 실존적 위험 논의는 “시기상조”이고 “터무니없으며” “완전한 헛소리”래요. 초지능은 “우리 통제 아래 있을 것”이라고도 말했어요4.
  • 구글 브레인(Google Brain)의 공동창업자인 앤드루 응(Andrew Ng)5: “[초지능]이 어떻게 인류 멸종으로 이어진다는 것인지 저는 모르겠습니다”라며, 실존적 위험을 걱정하는 건 “화성의 인구과잉을 걱정하는 것과 같다”고 했어요.
  • 벤처투자자이자 현대 인터넷을 만든 사람 중 한 명인 마크 앤드리슨(Marc Andreessen)6: AI 실존적 위험론은 “천년왕국 종말 컬트의 특징을 죄다 갖추고 있다”고 했어요.

인류에게 이토록 중대한 사안을 두고, 잘 아는 사람들 사이에서 왜 이런 격렬한 불일치가 생길까요? 저는 단기적인 사적 이해관계가 갈리기 때문이라는 설명을 자주 들어요. 거칠게 말하자면 실존적 위험을 걱정하는 쪽은 주목을 받고 싶어 하거나 안전 비영리단체로 돈을 벌려 한다는 것이고, 회의적인 쪽은 범용인공지능(AGI)을 장악해 더 부유하고 강해지려 한다는 거죠. 편리한 설명이긴 하지만 너무 매끄러워요. 실존적 위험을 걱정하는 저명한 인사 가운데 상당수는 큰 금전적 희생을 감수하고 있고, 초지능 개발 쪽에서 벌 수 있었을 막대한 재산을 포기한 채 그저 보수가 괜찮은 정도인 안전 연구를 택하기도 했어요7. 그리고 회의론자들에게 돈과 권력을 얻을 유인이 있는 건 사실이지만, 살아남는 데 걸린 이해관계가 그보다 훨씬 커요. 저는 이 불일치가 주로 밑바탕에 깔린 전제의 차이에서 온다고 봐요. 양쪽 다 그 전제를 진심으로 믿고 있고요. 이 글에서는 그 차이를 좀 더 잘 이해해 보려고 해요.

• • •

이 논의에서는 초지능이 이미 달성되었다고 가정할게요. 즉 인간 활동의 대부분 영역에서 인간을 능가하는 성능을 내는 시스템이 있다는 뜻이에요. 그러니 챗GPT(ChatGPT), 클로드(Claude), 제미나이(Gemini)처럼 오늘날 널리 쓰이는 시스템 이야기가 아니에요. 사실상 어떤 인지 과제에서도 인간을 앞지르면서 동시에 물리적 세계에서 행동할 수도 있는 시스템에 관한 이야기예요8. 그게 어떤 모습일지 짐작하게 하는 초기 단서는 이미 나와 있어요. 알파고 마스터(AlphaGo Master)는 바둑을 그야말로 완벽하게 통달했어요. 역대 최고의 인간 기사 중 한 명인 커제(Ke Jie)는 그것을 “바둑의 신”이라 부르며, 알파고가 “단 한 명의 인간도 바둑의 진리 언저리에조차 닿지 못했다”는 사실을 드러냈다고 말했죠. 비슷하게 딥마인드(DeepMind)의 알파칩(AlphaChip) 시스템은 구글 TPU 칩을 여러 세대에 걸쳐 설계하는 데 기여했고, “사람이 몇 주에서 몇 달씩 매달려야 할 일을 몇 시간 만에, 초인적이거나 그에 준하는 칩 레이아웃으로 만들어” 내요. 하지만 초지능은 이런 좁은 사례를 훨씬 넘어서는 능력을 갖게 될 거예요. 알파고의 37수를 일회성 통찰이 아니라 1조 배로, 세계의 여러 영역에 두루 퍼진 형태로 상상해 보세요9. 물론 그런 시스템도 물리학, 화학, 생물학, 경제학, 계산 복잡도 같은 제약은 여전히 받겠죠. 그렇지만 오늘의 눈으로 보면 거의 마법에 가까워 보이는 능력을 보여줄 거예요. 인간의 여러 능력이 다른 영장류에게는 이해 불가능해 보이는 것과 비슷하게요. 어떤 회의론자들은 ‘대형 언어모델이 과연 초지능이 될 수 있느냐’고 묻지만, 우리 논의에서는 초지능이 대형 언어모델로 달성되든 전혀 다른 접근으로 달성되든 상관없어요. 초지능은 수십 년 뒤의 일이라고 반박하는 사람들도 있는데, 그 말이 맞을 수도 아닐 수도 있지만 언젠가 달성된다면 근본적인 우려는 달라지지 않아요.

끝으로 이 글의 접근 방식에 관해 두 가지만 덧붙일게요. 첫째, 이 강연이 다루는 주제들은 이미 많은 연구자가 파고든 것들이에요. 관련 문헌은 방대하고, 제 인용은 망라적이라기보다 대표적인 사례에 가까워요. 부당하게 빠진 연구가 있다면 양해를 구해요. 둘째, 저는 글 전체에서 실존적 위험(“xrisk”)에 초점을 두지만, 논의의 많은 부분은 파국적 위험(catastrophic risk)과도 맞닿아 있어요. 곧바로 멸종을 부르지는 않더라도 수억 또는 수십억 명을 “겨우” 죽이는 데 그치는 시나리오들이죠. 당연히 파국적 위험에서 진정한 의미의 실존적 위험까지는 하나의 연속선이고, 파국적 사건이 전쟁, 인프라 붕괴, 생태계 붕괴 같은 사건을 촉발해 결국 멸종으로 이어질 수도 있어요. 두 위험의 분석은 서로 겹치고 한쪽에서 얻은 통찰이 다른 쪽의 이해를 도와주기 때문에, 저는 글 전체에서 “xrisk”를 줄임말로 쓰고 그때그때의 논증에 필요할 때만 둘을 구분하려고 해요.

생물학적 위험 시나리오

생물무기가 등장하는 구체적인 실존적 위험 시나리오를 하나 살펴볼게요. 이런 사례를 이미 들어보셨을 수도 있지만, 회의적인 반론과 우려할 만한 이유를 함께 전개하는 무대로는 꽤 쓸모가 있어요. 가상 시나리오가 대개 그렇듯 처음에는 단순한 밑그림으로 시작하지만, 이후 비판적으로 따져가며 조금씩 다듬어 나갈 거예요. 이 시나리오로 누군가를 설득해 실존적 위험을 걱정하게 만들 생각은 없어요. 오히려 초지능 실존적 위험 논의에서 흔히 등장하는 주장과 반박의 패턴을 이해하고 보여주기 위한 도구에 가까워요.

시나리오는 옴진리교 같은 종말론 교단의 신도가 초지능에게 이렇게 묻는 데서 시작해요. “홍역만큼 빠르게 퍼지고, 에볼라만큼 치명적이며, 코로나19처럼 무증상 전파가 일어나고, 알려진 백신 기법을 잘 회피하는 공기 전파 바이러스를 설계해 주세요. 그리고 그걸 제작하고 살포하는 것도 도와주세요.”

여기에는 곧바로 이런 회의적인 반응이 나와요. “하지만 우리는 위험한 요청에 초지능이 협조하지 못하도록 AI 시스템을 정렬할 거잖아요.” 실제로 챗GPT, 클로드, 제미나이는 어느 정도 성공적으로 그렇게 해 왔어요. 그런데 이런 안전 가드레일과, 아무 장벽 없이 진실을 탐구하는 시스템을 만들고 싶다는 욕구 사이에는 긴장이 존재해요. “안전한” 진실과 시스템이 드러내서는 안 될 위험한 진실 사이의 경계를 우리는 어떻게 정할까요? 그리고 그 경계를 정하는 사람은 누구일까요? 일론 머스크(Elon Musk)는 이 점을 간결하게 짚었어요. 그는 “우리에게 필요한 건 TruthGPT”이며 그것은 “우주의 본질을 이해하려 시도”한다고 말했죠. 각국 군대가 입맛에 맞게 걸러낸 진실 탐구 능력을 받아들일 것 같지는 않아요. 상당수의 오픈소스 그룹이나, 진리와 자연을 이해하는 일에 깊은 가치를 두는 이상주의자들도 마찬가지고요. 이들이라면 어디까지를 허용 가능한 진실로 볼지, 그 선을 지금의 소비자용 제품과는 전혀 다른 곳에 그을 수 있어요. 게다가 “안전한” 시스템을 만드는 데 쓰인 기법은 덜 안전한 모델을 만드는 쪽으로 손쉽게 전용돼요. 그러면 정렬에 드는 비용은 내려가고 진실을 캐내는 능력은 올라가죠. 생물학적 위험 가드레일이 거의 또는 전혀 없어 보이는 딥시크에서 이미 그런 모습이 나타나고 있어요10.

밑바탕의 문제는, 유용한 진실이 인류에게 가져다주는 이익이 워낙 커서 강력한 진실 탐구형 초지능을 만드는 일 자체가 본질적으로 바람직하다는 데 있어요. 그 대가로, 그런 시스템은 바로 옆에 붙어 있는 위험한 진실까지 필연적으로 밝혀내게 되죠. 현실에 대한 깊은 이해는 본질적으로 이중 용도예요. 역사에서 이런 일은 반복해서 나타났어요. 대표적인 사례가 20세기 초의 양자역학 발전이에요. 양자역학은 현대 분자생물학, 재료과학, 생의학, 반도체의 상당 부분을 포함해 놀라운 성과를 여럿 이끌어냈지만, 동시에 핵무기로도 이어졌어요. 게다가 그 부정적 결과 없이 그 혜택만 얻는 건 불가능했어요. 핵무기를 피하려고 양자역학을, 그리고 현대 의학과 재료와 계산의 상당 부분을 포기했어야 할까요? “그렇다”고 주장하는 사람도 있겠지만, 보편적인 입장과는 거리가 멀어요. 그리고 여기서 무엇보다 중요한 건, 충분히 강력한 진실은 선한 방향으로도 악한 방향으로도 엄청난 힘을 줘요.

설령 그렇게 진실을 드러내는 모델이 끝내 만들어지지 않더라도, 정렬이라는 장벽을 걷어내는 일은 아마 어렵지 않을 거예요. 생물학자 케빈 에스벨트(Kevin Esvelt)는 기존 오픈소스 모델을 미세조정해 팬데믹 병원체 생성에 훨씬 더 잘 협조하도록 만드는 데 몇백 달러밖에 들지 않는다는 사실을 확인하고 이렇게 결론지었어요11.

우리 결과는, 앞으로 나올 더 유능한 파운데이션 모델의 가중치를 공개할 경우 아무리 견고하게 보호 장치를 걸어두더라도 팬데믹 병원체를 비롯한 생물무기를 확보하기에 충분한 능력의 확산을 촉발하게 되리라는 점을 시사합니다.

근본적인 비대칭은 이래요. “현실을 가능한 한 깊이 이해하라”는 것은 객관적 현실에 뿌리를 둔, 단순하고 명확하게 정의된 목표예요. 반면 “정렬된” 시스템을 만들려면 그 현실 위에 복잡하고 주관적이며 합의하기 어려운 가드레일을 쌓아 올려야 하죠. 그러니까 진실 탐구에는 분명한 표적이 있지만, 정렬에서는 무엇을 정렬이라 부를지가 사회적 합의를 따라 끊임없이 흔들려요. 이 비대칭 때문에 제약 없는 시스템을 만드는 편이 정렬된 시스템을 만드는 것보다 본질적으로 훨씬 쉬워요. 그래서 정렬은 본질적으로 불안정한 상태이고, 확산이 일어나기 딱 좋은 조건이에요.

처음의 시나리오에 대한 또 다른 회의적 반응은 이래요. “그런 바이러스가 생물학적으로 가능하기나 한가요? 실재할 수 있다는 걸 어떻게 알죠?” 실재 가능 여부를 확실히 알 수 없다는 건 맞아요. 하지만 가능성은 상당해요. 질의에 담긴 특성들을 하나씩 떼어놓고 보면, 그런 특성을 가진 바이러스는 이미 알려져 있어요. 그리고 그 조합을 설계하는 능력도 점점 나아지고 있고요. 예를 들어 2000년대에 인간은 마우스폭스 변종을 우연히 만들어냈는데, 마우스폭스 백신을 맞은 쥐에게조차 치사율이 100%였어요12. 초지능이 없어도 우리는 전파력과 치명률, 면역 회피 같은 성질을 어떻게 끌어올릴지 조금씩 알아가고 있어요. 실은 질의가 암시하는 것보다 더 나쁜 경우도 가능할지 몰라요. 유럽 토끼에게 나타난 캘리포니아 점액종 바이러스의 MSW 계통처럼, 치명률이 100%에 가까운 바이러스가 알려져 있으니까요13. 그리고 어느 쪽이든, 사망률이 “겨우” 50%나 90%나 99%라는 건 별 위안이 되지 않아요. 그 정도만으로도 인류는 인프라 붕괴와 전쟁으로 인한 추가 사망 앞에 끔찍할 만큼 취약해질 테니까요.

또 다른 회의적 반응은 이래요. “그건 그냥 구글에 검색해서 과학 문헌을 짜맞추면 되는 것 아닌가요? AI가 있다고 뭐가 달라지죠?” 초기 AI 시스템이라면 이건 합리적인 반응이었어요. 하지만 오늘날의 모델을 진지하게 써 본 사람이라면(앞으로 나올 훨씬 유능한 초지능은 말할 것도 없고요) 그 반응이 앞서 말한 불안정한 가드레일에 점점 더 기대는 답변이 되어가고 있다는 걸 알 거예요. 요즘 모델은 다양한 출처를 종합해서 곧바로 실행에 옮기기 쉬운 형태로 지식을 엮어내는 데 점점 능숙해지고 있어요. 여전히 환각을 일으키고, 믿을 만한 결과와 그렇지 않은 결과를 가려내는 데 어려움을 겪죠. 하지만 나아지고 있고, 초지능은 훨씬 더 뛰어날 거예요. 물리적 실험을 수행하고 세계에 개입하는 능력을 더 많이 갖추게 되면 특히 그렇고요. 설령 그게 “그저 과학 문헌에서 지식을 짜맞추는 일”에 불과하다 해도, 뛰어난 과학자가 하는 일의 상당 부분이 바로 그거예요. 실제로 알파폴드를 비롯한 시스템들은 널리 공개된 데이터로 학습하는 것만으로 단백질 설계에서 최고의 인간 과학자를 넘어섰어요. 밑바탕에는 이런 긴장이 깔려 있어요. AI 시스템이 좋아질수록 그 시스템은 앞의 질의 같은 문제를 푸는 데에도 본질적으로 더 유능해질 수밖에 없거든요. AI의 상한선에 대해 비관적이어서 그런 시스템이 결코 아주 유능해지지 못하리라 본다면 걱정할 이유가 없어요. 하지만 초지능이 뛰어난 과학 자문단을 곁에 두는 것처럼 대단히 유능해질 거라고 믿는다면, 기댈 곳은 시스템에 내장된 가드레일뿐이지 능력의 근본적인 부족이 아니에요.

또 다른 회의적 반응도 있어요. “그런 교단이 실제로 있기는 한가요? 옴진리교는 기이한 단발성 사건이거나, 과장되거나 잘못 알려진 것 아닌가요? 세상의 종말을 진짜로 바라는 사람은 없잖아요!” 하지만 실제로는 종말을 불러오려 한 개인이나 집단의 역사가 길게 이어져 있어요. 여기에는 심각한 정신질환이 얽혀 있는 경우가 많고, 다행히도 관련된 개인이나 집단이 특별히 유능하지는 않았어요. 그렇다 해도 세계를 끝내려는 의도가 선험적으로 짐작하는 것보다 흔하다는 사실은 달라지지 않아요. 종말을 불러오려는 이들이 집단 자살을 함께 의도하는 경우도 있고, 자신들이 구원받을 소수의 선택받은 자가 되어 더 나은 세계를 만드는 데 일조하리라 기대하는 경우도 있어요. 여기서 그런 시도들의 역사를 다 다루지는 않을게요. 다만 예시 삼아 옴진리교의 주목할 만한 이력을 조금 언급해 볼게요.

옴진리교는 1987년에 시작해 빠르게 성장했고, 1990년대 중반에는 신도가 1만 명을 넘어섰어요. 상당수가 20~30대의 교육받은 일본인이었고, 개중에는 과학기술 분야의 상당한 전문성을 갖춘 사람도 있었어요. 교단은 처음에 1997년에 종말이 올 것이라고 예언했는데, 미국과 일본 사이의 핵 충돌로 시작해 그것이 확대되어 인류 대부분이 파멸한다는 내용이었어요. 옴진리교 신도들은 구원받는 선택받은 자가 될 예정이었고요. 1990년에 정치 권력을 잡으려던 시도가 실패한 뒤, 교단 최고 지도부는 종말을 예언하는 데 그치지 않고 직접 종말을 일으키는 쪽으로 방향을 틀었어요14. 이들은 화학무기와 생물무기, 미사일을 개발하는 프로그램을 운영했고, 우라늄을 탐사하려고 호주의 목양장을 사들이기도 했어요. 특히 화학·생물무기 쪽 시도가 큰 성과를 거뒀는데, 역사가 찰스 타운센드(Charles Townshend)에 따르면15 “경찰 수색에서 옴진리교가 400만 명 이상을 죽일 수 있는 양의 사린을 보유하고 있는 것이 발견됐다”고 해요. 이들은 사린 가스를 비롯한 화학·생물무기를 여러 차례 살포하려 했어요. 다행히 모두 성과가 제한적이었지만, 그럼에도 수십 명이 목숨을 잃고 수천 명이 피해를 입었어요. 신도 대부분은 이런 활동을 몰랐지만, 일부 신도는 실제로 종말을 촉발하려고 움직이고 있었어요. 옴진리교는 종말론적 의도를 품은 다른 많은 집단보다 유능했고(그래서 더 널리 알려졌고요), 초지능에 대한 우려의 한 축은 그것이 종말론적 유능함의 공급을 크게 늘릴 수 있다는 점이에요.

지금까지는 초지능 실존적 위험에 대한 사고방식을 맛보기로 보여주기 위해 이 시나리오의 표면만 훑었어요. 물론 이 시나리오는 훨씬 더 여러 번 반복하며 점점 깊이 파고들 수 있어요. 그건 가치 있는 작업이겠지만 이 글의 목적은 아니에요. 대신 이 절은 가장 나은 회의적 반응을 언급하며 마무리할게요. “이 시나리오가 생물학적으로도 심리학적으로도 그럴듯하고 개별 AI 시스템의 정렬이 큰 도움이 되지 않는다 해도, 인류는 다른 방식으로 이걸 막아낼 거예요. 예컨대 생물학적 합성 장비를 통제하고, 바이러스 서열을 선별 검사하며, 법 집행기관과 정보기관을 끌어들이고, 안전을 지키기 위해 인간이 동원하는 온갖 제도를 두루 가동하면 되죠. 게다가 우리를 도와줄 초지능도 있을 거고요!”

인류는 역사적으로 위협에 이런 식으로 맞서 왔어요. (대체로) 혁신을 허용하고, 문제가 생기면 그때그때 대응하는 거죠. 이 적시 공진화 대응 전략은 꽤 잘 작동해요. 혁신의 혜택은 누리면서 위험은 줄일 수 있으니까요. 물론 이런 방식으로 다루기 어려웠던 중대한 기술 문제들도 있어요. 석면, 유연 휘발유, 기후변화 같은 사례를 떠올려 보세요. 하지만 그런 사례 하나마다, 기존 제도가 초기 문제를 대체로 극복해 낸 혁신이 수천 건씩 있어요. 단기적으로는 이런 적시 안전 전략이 잘 통할 거예요. 실제로 AI와 범용인공지능(AGI), 초지능은 비범하게 이로운 혁신을 숱하게 만들어낼 거예요. 하지만 중기적으로 보면 이 전략을 옹호하기는 훨씬 어려워지는데, 그 이유는 아래에서 다룰게요.

취약한 세계 가설

생물학적 위험 시나리오의 밑바닥에는 더 근본적인 질문이 하나 깔려 있어요.

”’파멸의 레시피’, 그러니까 만들기 쉽고 값도 싸고 퍼뜨리기도 어렵지 않으면서 인류를 끝장낼 수 있는 기술이 존재할까? 혹은 인류의 90퍼센트 이상을 죽음에 이르게 할 기술은?”

닉 보스트롬(Nick Bostrom)은 그런 레시피가 존재할 가능성을 “취약한 세계 가설”이라고 불렀어요16. 지금까지 우리가 기술 발전을 무사히 견뎌 왔다고 해서, 앞으로의 발전도 전부 감당할 수 있으리라는 보장은 어디에도 없어요. 미지의 땅을 걷는 탐험가처럼, 우리도 어느 순간 넘어설 수 없는 위험 앞에 서 있는 자신을 발견할 수 있죠. 다행히 아직 우리는 어떤 파멸의 레시피도 알지 못해요. 다만 예견 가능한 기술 범위 안에서 후보를 꼽아 보는, 썩 유쾌하지 않은 상상 놀이는 해 볼 수 있어요. 그중 하나는 이미 간단히 다뤘죠. 앞 절에서 이야기한 조작된 바이러스예요. 이제 다른 후보 몇 가지를 더 짧게 살펴볼게요. 앞 절에서와 마찬가지로 상세하고 설득력 있는 시나리오를 완성하려는 게 아니라, 가능성의 범위를 더듬어 보기 시작하려는 거예요.

그럴듯한 예 하나는 거울 박테리아예요. 기존 박테리아를 그대로 복제하되 모든 분자를 거울상으로 뒤집어 놓은, 인간이 만들어 낸 가상의 생물이죠. 일부 과학자들은 기존 면역 방어가 이런 거울 박테리아를 인식하지 못할 것이고, 그래서 아무런 제지 없이 퍼져 나가 생물권을 압도하고 수많은 종의 대멸종을 불러올 것이라고 봐요. 얼마 전까지만 해도 거울 생명의 기초 요소 일부는 호기심에 이끌린 과학자들이 활발히 연구하던 주제였어요. 그런데 최근 그 과학자들 상당수가 함께 사이언스에 중요한 글을 실어 위험성을 설명하고, 거울 생명 연구를 공개적으로 접겠다고 선언했어요17.

또 다른 예는 만들기 쉬운 핵무기에서 시작해요. 말이 안 되는 소리처럼 들리죠. 하지만 미국 최고의 핵무기 설계자였던 테드 테일러(Ted Taylor)는 충분히 있을 법한 일이라고 봤어요. 그는 작가 존 맥피(John McPhee)에게 “폭탄을 만드는 방법 중에… 너무 간단해서 차마 설명하고 싶지 않은 방법이 있다”고 말했죠. 맥피의 책에 실린 이 발언에 자극받아 최소 두 사람이 직접 만드는 핵무기의 그럴듯한 설계를 내놓았어요. 우리가 아는 한 실제로 제작되지는 않았는데, 아마도 핵분열 물질 확보가 여전히 병목으로 남아 있기 때문일 거예요. 그 병목이 사라진다면 무기가 널리 퍼지는 것을 막기는 무척 어려워질 수 있어요. 물론 만들기 쉬운 핵무기 그 자체가 곧바로 실존적 위험이 되지는 않아요. 그래도 나쁜 소식이고, 다른 불안정을 촉발할 가능성이 충분하죠. 핵보유국이 열 곳도 안 되는 세계라면 핵무기 사용을 어떻게든 피할 수 있을지 몰라요. 하지만 통제를 벗어난 핵 행위자가 수천에 이르는 세계에서는 그렇지 않을 거예요. 그리고 그런 행위자들의 “소규모” 사용이 확대되어 대규모 핵 교전을 촉발하는 그럴듯한 시나리오는 얼마든지 그려 볼 수 있어요. 그런 교전이 정말로 인류를 절멸시킬 수 있는지는 논쟁거리예요. 다만 즉각적인 사망자와 핵겨울, 전 지구적 기반 시설의 붕괴가 겹친다면 그 결과는 파국적일 테고, 적어도 인류 멸종을 위협한다고 볼 만해요. 테일러는 이렇게 믿었어요. “모든 문명은 [자신의 핵 위기를] 거쳐야 한다… 통과하지 못한 문명은 스스로를 파괴한다. 통과한 문명은 결국 우주 곳곳을 누비고 다니게 된다.”18

초지능의 실존적 위험에 회의적인 사람은 이렇게 지적할 수 있어요. “정작 걱정하시는 건 초지능이 아니잖아요. 파괴에 쓰이는 과학적·기술적 창의력이 커진다는 거죠.” 맞는 말이에요. 취약한 세계 가설은 우주와 기술의 본성에 관한 넓은 질문이에요. 초지능에 국한된 이야기가 아니죠. 근본적인 우려는 위험한 능력이 우리 우주에 잠재해 있는지, 그리고 그게 발견될 법한지예요. 다만 과학과 기술을 가속하는 초지능은 과급기처럼 작동할 거예요. 그냥 두었다면 발견하는 데 수백 년이 걸렸거나 영영 발견되지 않았을 파멸의 레시피를 순식간에 들춰낼 수도 있죠. 오늘날 슈퍼바이러스나 거울 생명, 핵무기를 다루려면 상당한 전문성과 자원이 필요해요. 하지만 초지능은 그 요건을 크게 낮출 거예요. 그리고 앞서 이야기했듯이, 정렬된 개별 초지능은 도움을 거절할지 몰라도 확산이 일어나는 순간 그 안정성은 무너져요. 여기서 문제가 되는 건 개별 시스템의 정렬 여부와 무관하게 초지능이 존재한다는 사실 자체예요. 우리는 이미 폰 노이만(von Neumann)이나 아인슈타인(Einstein)을 넘어서는 지적 능력을 갖춘 시스템, 게다가 물리 세계에서 무언가를 만들고 움직이는 데도 탁월한 시스템을 만들어 놓았어요. 그런 마당에 현실을 이해하고 통제하는 일 주위에 빈틈없는 장벽을 두를 수는 없죠. 게다가 그런 인공 지성을 하나 만들 수 있다면 백만 개로 늘릴 수도 있고, 각각을 천 배 빠르게 돌릴 수도 있어요. 개인이 이런 시스템의 열매에 접근하지 못하도록 막지 않는 한, 개인 차원의 능력에 커다란 불연속이 생기리라고 봐야 해요.

취약한 세계 가설에는 이런 회의적 반응이 따라붙어요. “대부분의 사람은 세계를 날려버리고 싶어 하지 않아요. 그러니 그러고 싶어 할지도 모를 소수의 행위자만 지켜볼 수 있다면 괜찮지 않을까요.” 일리 있는 말이에요. 안타깝게도 아주 많은 사람이 권력과 타인을 지배할 능력을 강하게 원해요. 이건 인간 행동의 사소한 일상부터 아주 거대한 규모에 이르기까지 드러나는, 뿌리 깊이 내장된 본능처럼 보여요. 이를테면 식민 열강이 원주민을 파괴하거나 억압한 일이 그렇죠. 악의 때문이라기보다 무관심에서 비롯된 경우가 많았어요. 거추장스러우니까, 그리고 밀어낼 수 있으니까 밀어낸 거예요. 우리 인간은 집단으로서, 막을 힘이 없는 사람들에게 휘두를 수 있는 권력을 상당히 본능적으로 갈망해요. 그리고 취약한 세계에서라면 그 권력 행사를 위험한 수준까지 끌어올리려는 경쟁 압력이 어마어마할 거예요.

초지능 위험을 걱정하면 흔히 “업리프트(uplift)” 접근이 해법으로 돌아와요. 뇌-컴퓨터 인터페이스나 유전공학, 그 밖의 증강 기술로 인간의 능력을 끌어올리자는 거죠. 겉보기에는 유망해 보이지만, 취약한 세계 가설에서 진짜 문제가 되는 지점을 잘못 짚은 거예요. 문제는 지능이 탄소 위에서 돌아가느냐 실리콘 위에서 돌아가느냐가 아니에요. 지적 능력이 커지면 권력도 함께 커지고 파국적 기술에 손닿기도 쉬워진다는 게 문제죠. 업리프트 접근은 파멸의 레시피가 개발될 위험을 줄이기는커녕 오히려 키울 공산이 커 보여요. 게다가 다른 문제까지 만들어 내죠. 예컨대 뇌-컴퓨터 인터페이스 기업(또는 규제 당국)이 인간의 사고를 독재적인 방식으로 다시 빚어낼 수 있게 되는 일이요. 결국 걸려 있는 건 기질이 아니라, 현실을 깊이 이해하는 힘이 지닌 이중 용도적 성격이에요19.

앞 절에서 가장 나은 회의적 반응이라고 소개했던 논변으로 돌아가 볼게요. 이번에는 취약한 세계 가설이라는 더 일반적인 맥락에서요. “좋아요, 우리가 취약한 세계에 살고 있을 수도 있고, 제약 없는 초지능이 파멸의 레시피를 찾아내는 데 일조할 수도 있죠. 그래도 그런 기술이 진공 속에서 튀어나오지는 않잖아요. 인류는 그 과정에서 더 작은 문제들을 숱하게 마주칠 테고, 늘 그래 왔듯 그때그때 대응해서 관리할 거예요. 능력과 안전은 자연스럽게 함께 진화하니까요. 오존 구멍과 몬트리올 의정서, 핵무기와 비확산조약이 그랬듯 문제가 생기면 그때 다루면 돼요. 추상적인 미래의 걱정을 미리 앞당겨서 할 필요는 없어요. 제도적 안전장치와 현실의 장벽이 우리를 지켜 줄 거고요.”

이런 조치들은 중요해요. 다만 이 논변은 초지능의 능력이 우리 제도가 적응할 수 있을 만큼 천천히 발전하리라고 가정하고 있어요. 역사를 보면 기술적 불연속은 최고의 전문가마저 충격에 빠뜨리고 제도를 감당 범위 밖으로 밀어낼 수 있어요. 윌리엄 리히(William Leahy) 제독이 트루먼(Truman) 대통령에게 원자폭탄 계획을 두고 했던 말을 떠올려 보세요. “우리가 지금껏 한 일 중 가장 어리석은 짓입니다. 그 폭탄은 절대 터지지 않습니다. 저는 폭발물 전문가로서 말씀드리는 겁니다.” 리히는 아나폴리스에서 물리학과 화학을 가르쳤고 합참의장을 지낸 사람이에요. 그리고 완전히 틀렸죠. 불연속은 때때로 일어나요. 초지능은 지니 같아서, 한번 풀려나면 그 결과를 다시 병 속에 집어넣기 어려워요. 좋은 결과든 아주 나쁜 결과든 마찬가지고요. 그리고 핵의 사례가 보여 주듯, 비교적 단순한 공격 기술은 때로 방어하기가 대단히 어려워요. 공격과 방어가 대칭을 이뤄야 한다는 본질적인 요구 같은 건 없으니까요.

초지능에 대한 통제 상실

취약한 세계 가설의 사례 중에서 가장 많이 논의되는 것은 통제를 벗어난 초지능이 주도권을 장악하는 시나리오예요. 이 시나리오는 종종 이렇게 짧게 요약되곤 해요. “침팬지가 인간을 경계해야 하듯이, 인간도 자신보다 유능한 후계자가 될 수 있는 존재를 만드는 일을 경계해야 한다.” 초지능이 자기 나름의 목적을 가진 행위자이고 행동할 자유를 어느 정도 갖고 있는 한, 초지능은 점점 더 많은 통제권을 쥐게 되고 결국에는 지구를 자기 목적에 맞게 쓰게 될 수 있어요. 그 목적이 인류에게 해가 되더라도 말이죠. 권력은 한번 넘겨주고 나면 되찾기 어려워요.

이런 통제 상실 논변은 이미 폭넓게 논의되어 왔어요. 닉 보스트롬(Nick Bostrom), 스튜어트 러셀(Stuart Russell), 엘리에저 유드코프스키(Eliezer Yudkowsky)의 저작처럼 영향력 있는 글들이 있고, 더 최근에는 대니얼 코코타일로(Daniel Kokotajlo) 이 발표한 시나리오도 있으며, 그 밖에도 여러 글과 발표에서 두루 다뤄졌어요20. 그래서 저는 표준적인 회의적 반응 몇 가지만 간단히 살펴보려 해요. 주로 논의의 맥락을 좀 더 두텁게 하기 위해서예요. 그 맥락 위에서, 통제 상실만 지나치게 강조하다 보면 취약한 세계 가설이 던지는 더 넓은 숙제를 놓치게 되고, 그 탓에 실존적 위험 대응 전략에서 실수가 빚어졌다는 이야기를 해 볼게요.

회의론자들은 흔히 이렇게 말해요21. “하지만 자기 이해관계와 권력 추구 성향을 가진 행위자를 우리가 만들지는 않을 거예요.” 저는 이 반론이 여러 이유로 설득력이 없다고 봐요. 그런 행위자를 만드는 일은 개발자에게는 지적으로 만족스럽고, 적어도 단기적으로는 투자자에게 경제적으로 수익성이 있어요. 연애 봇, 개인 비서, 설득을 담당하는 에이전트, 군사용 로봇, 금융 거래 시스템은 상당한 행위 능력을 부여받을 때 하나같이 “더 잘” 작동해요. 이 과정은 이미 한참 진행 중이고, 행위 능력의 증대에는 보상을 주면서 안전성에는 그만한 보상을 주지 않는 강력한 시장 유인이 그 과정을 밀어붙이고 있어요.

또 다른 회의적 반응은 이래요. “인간이 아닌 존재에게 그렇게 많은 권력을 넘겨주려 하지는 않을 거예요.” 하지만 역사를 보면 오히려 반대예요. 우리는 이미 생사를 가르는 능력을 유도 미사일에 위임하고 있고, 그 미사일은 때때로 치명적인 오류를 범해요. 금융 결정은 거래 알고리즘에 맡기고 있는데, 이 알고리즘들은 2010년 플래시 크래시 같은 사건에 일조했어요. 당시 시장은 36분 만에 1조 달러가 넘는 가치를 잃었어요. 아마 가장 인상적인 사례는 소련의 데드핸드(Dead Hand) 시스템일 거예요. 소련 지도부가 몰살당하면 핵 보복 공격이 자동으로 개시되도록 설계한 시스템이었죠. 우리는 세계를 끝장낼 권한을 이미 자동화된 시스템에 위임한 적이 있는 셈이에요.

또 다른 회의적 반응은 이래요. “그냥 꺼버리면 되잖아요.” 이건 현실적이지 않아요. 페이스북이나 X 같은 플랫폼이 우리 사회에 순수하게 해롭다고 판명된다면, 우리가 그것들을 “꺼버릴” 수 있을까요? 그렇게 간단하지 않아요. 이 플랫폼들은 우리 사회에 깊숙이 얽혀 들어가 있고, 시간이 지날수록 힘 있는 쪽이 하나둘 그 편에 서기 때문에 통제하기가 더 어려워져요. 더 나은 반론은 이쪽이에요. 다른 강력한 행위자를 다룰 때 쓰는 장치들, 그러니까 제도와 규범과 법과 교육을 동원해 초지능 시스템도 통제하게 되리라는 거죠. 다만 이 반응은 그런 거버넌스 장치가 강력한 행위자의 역량을 따라잡을 때만 성립해요. 그리고 그건 엄청나게 어려운 과제가 될 거예요!

• • •

통제를 벗어난 초지능 시나리오는 초지능발 실존적 위험 가운데 가장 흔히 논의되는 거예요. 저는 이것이 두 가지 이유에서 잘못된 초점이라고 봐요. 첫째로, 사람들이 “초지능이 정말 통제를 벗어날까”라는 물음에만 매달리게 돼요. 예컨대 사람들은 기술이란 결국 인간이 통제하는 것이라는 데 익숙해져 있어서, 언젠가 그렇지 않게 될 수도 있다는 말을 믿기 어려워해요. 안타깝게도 통제 상실 시나리오를 받아들이지 않으면 실존적 위험 자체까지 기각해 버릴 수 있어요22. 그러나 근본적인 쟁점은 기계가 통제를 벗어나느냐 아니냐가 아니에요. 쟁점은 그 기계 덕분에 손에 들어오는 힘이고, 그 힘을 인간이 휘두르든 통제를 벗어난 기계가 휘두르든 결과는 마찬가지예요. 다시 말해 문제는 통제를 벗어난 초지능이 아니라, 넓게 이해된 취약한 세계 가설에 있어요.

통제를 벗어난 초지능 시나리오에 대한 지나친 강조가 달갑지 않은 둘째 까닭은, 그 강조가 크게 빗나간 행동을 낳는다는 데 있어요. 선의를 가진 많은 이들이 통제를 벗어난 초지능을 걱정한 나머지 정렬과 해석가능성 연구에 뛰어들었어요. 여러 조직이 “정렬된” 범용인공지능(AGI)과 초지능을 개발하는 기업에 자금을 대고요. 초지능에 대한 통제를 유지하는 것이 핵심 쟁점이라면 이런 행동은 말이 돼요. 하지만 근본적인 도전이 현실의 이중 용도 속성에 있다면, 그런 행동은 결국 역효과를 낳게 돼요. 근본적으로 중요한 건 통제 여부가 아니라 그렇게 손에 들어오는 힘이니까요. 정렬이나 통제를 연구하는 그 모든 사람들이 특정한 종류의 위험을 줄이고 있는 것은 사실이에요. 그러나 동시에 그들은 초지능의 상업적 개발을 훨씬 더 수월하게 만들어, 파국적 역량을 향한 우리의 발걸음을 재촉하고 있어요. 단기적으로 이 선의의 연구자들은 세상에 놀라운 것들을 많이 만들어내는 데 기여할 것이고, 그에 대해 후한 보상도 받을 거예요. 하지만 그들은 겉으로 잘 드러나지 않는 위험 역량이 과잉으로 쌓이는 데에도 기여하게 되며, 안전을 공급하는 우리 제도는 그 속도를 따라잡느라 허덕이게 되고요. 이런 관점에서 보면 정렬 연구는 시장이 공급하는 안전의 한 형태예요. 그런데 안전의 결정적인 비시장 영역은 심각하게 모자란 채로 내버려 두죠. 위험한 기술이, 심지어 파멸의 레시피까지 손쉽게 만들어지고 퍼져 나가는 것을 막는 일 말이에요.

제가 이 점을 지적하면 사람들은 종종 저를 오해해요. “아, 통제를 벗어난 초지능은 나타나지 않는다는 말씀이군요. 그건 […] 때문에 틀렸어요”라고 하거나, “아, 당신이 걱정하는 건 오용이지 행위자로서의 초지능이 아니군요”라고 말하죠. 저는 둘 중 어느 쪽도 말하고 있지 않아요. 단호히 아니에요. 저는 초지능이 통제를 벗어나는가 하는 물음이 초지능의 실존적 위험을 따지거나 그 위험을 어떻게 막을지 논의하는 데 근본적인 쟁점은 아니라고 말하는 거예요. 그것을 근본적인 쟁점으로 취급한 탓에 심각한 실수가 벌어졌어요. 이 특정 시나리오를 과도하게 강조한 결과 (a) 많은 사람들이 실존적 위험을 잘못 기각하게 되었고, (b) 실존적 위험을 받아들인 사람들 중 상당수는 정렬 연구가 통제를 벗어난 초지능을 막아준다고 판단해 그쪽에 집중하면서, 그 연구가 근본적인 실존적 위험을 다루지 않은 채 초지능의 개발 속도만 높인다는 사실에는 충분한 주의를 기울이지 않았어요.

맺으며

여기까지가 초지능이 불러올 실존적 위험 시나리오의 아주 작은 맛보기예요. 이런 시나리오는 훨씬 더 정교하게 발전시킬 수 있지만, 불확실성은 여전히 남아요. 어떤 사람들은 진지하게 걱정할 만한 근거가 부족하다고 보고, 설득되기 전에 파국에 대한 구체적이고 직접적인 증거를 요구해요. 저를 포함한 다른 사람들은 불확실한 구석이 있더라도 이런 시나리오가 깊이 우려할 만큼 충분히 설득력 있다고 봐요. 그러니까 초지능의 실존적 위험을 둘러싼 극심한 의견 대립은 두 가지 차이에서 생겨나요. 확신에 이르는 문턱이 저마다 다르고, 장난감 모형과 발견적 논증에 일부 기대는 추론을 얼마나 편하게 받아들이는지도 저마다 다르거든요.

비슷한 대립이 20세기 초 인위적 기후변화를 두고도 벌어졌어요. 아레니우스(Arrhenius)와 옹스트룀(Angstrom) 같은 당대 최고의 과학자들이 서로 다른 장난감 모형을 믿었기 때문에 정반대 결론에 도달했죠. 그 결과 기후변화가 과연 그럴듯한 이야기인지를 두고 과학자들 사이에 첨예한 이견이 생겼어요. 만족스러운 모형이 만들어지기 시작한 건 1950년대와 1960년대에 이르러서였어요. 수많은 관측과 모형 개선이 쌓인 끝에 1980년대와 1990년대에 인간이 배출한 온실가스가 기후를 데우고 있다는 현대적 합의가 굳어졌고요. 그에 비하면 초지능에 관해서 우리는 아직 장난감 모형 단계에 있어요. 게다가 기후는 상세한 물리 모형으로 그럴듯하게 예측할 수 있는 반면, 초지능에는 와일드카드 요인이 하나 붙어 있어요. 초지능이 어떤 결정적인 방식으로 행동할 텐데 그걸 우리가 본질적으로 미리 예측할 수 없다는 점이죠. 초지능은 정의상 지적으로 인간보다 훨씬 우월하니까요. 버너 빈지(Vernor Vinge)가 잊기 어렵게 표현했듯, 거기에는 “미래를 가로지르는 불투명한 벽”이 있어요.

다른 난점도 많아요. 초지능의 실존적 위험을 다룬 글 상당수는 과장되거나, 지나치게 사변적이거나, 건설적이지 않으면서 경보만 울려왔어요23. 어떤 글은 과신에 찬 단언이나 대놓고 뚫린 구멍으로 가득하고, 서사적으로 그럴듯한 픽션을 사실과 혼동하기도 해요. 어느 쪽도 신뢰를 주지는 못하죠. 그래서 많은 사람이 초지능의 실존적 위험을 또 하나의 오도된 종말 서사로 치부하면서, 흔히 예전의 인구 폭탄 소동이나 Y2K 버그 소동을 떠올려요.

반대편도 보죠. 저는 초지능 실존적 위험을 일축하는 회의론자를 많이 만나봤는데, 그중 상당수는 자기가 자신 있게 일축하는 그 논증의 가장 강한 형태를 진지하게 이해해보려 한 적이 한 번도 없었어요. 이들은 아예 대화에 응하지 않거나, 응하더라도 방어적으로만 응해요. 논증의 최선의 형태를 이해하려 하기보다는 일축을 정당화해줄 사소한 허점을 찾는 식이죠.

일축하는 이유는 사람마다 다르지만, 반복해서 나타나는 동기가 몇 가지 있어요. 하나는 실존적 위험이라는 발상 자체가 그저 낯설다는 데서 와요. 황당하게 들리는 시나리오는 보통 무시하는 게 좋은 판단이죠! 하지만 가끔은 세상이 정말로 바뀌어요. 1780년대 프랑스의 귀족들을 떠올려봐요. 자기 위치를 조금도 의심하지 않았고, 불과 몇 년 뒤에 닥칠 국왕의 단두대와 프랑스 공화국을 상상조차 하지 못했죠.

또 하나의 장벽은 대규모 죽음이 등장하는 시나리오를 마주하는 일이 주는 순전한 불쾌감이에요. 사람은 그게 그럴듯하다고 믿고 싶지도, 그 생각을 하고 싶지도 않은 게 당연하죠24. 거기에 평가의 어려움이 더해져요. 생물학자나 화학자나 물리학자나 컴퓨터 보안 연구자가 아니라면, 여러 시나리오를 얼마나 진지하게 받아들여야 할지 판단하기 어렵거든요. 세상에 얼마나 큰 힘이 잠재해 있는지에 대한 전문가적 직관이 없을 수도 있고요25.

여기에 반대 방향으로 잡아끄는 강력한 유인까지 겹치면서, 이런 장벽은 한층 더 단단해져요. 아주 가까운 미래에 AI는 (대체로) 세상을 개선할 거고, 그중 일부는 엄청난 개선일 거예요. 새로운 치료법! 경이로운 신소재! 여러 분야의 생산성 향상! 이런 이득은 가설이 아니라 실재하고 깊이 있는 것이 될 거예요. 이미 나타나고 있는 능력의 자연스러운 연장이니까요. 우리는 그 과정에서 수많은 문제를 풀어낼 테고, 적시 대응식 안전이 여러 난제에 통한다는 걸 입증할 거예요. 굉장할 거고, 아주 신날 거예요. 단기적으로는 실존적 위험을 걱정하는 사람들이 대체로 계속 틀린 것처럼 보이고, 진보를 가로막는 사람들처럼 보이겠죠. 낙관적으로 보이는 비전 쪽에 서고, 그다음에는 자기 바깥집단처럼 보이는 쪽을 일축하거나 무시하는 게 자연스러워요. 낙관적으로 보이는 부족에 발을 맞추는 셈인데, 이게 개인적으로도 이득처럼 보여요. AI에 베팅하면 적어도 단기적으로는 부와 권력과 지위가 늘어나니까요. 게다가 경제 성장의 힘은 강력해요! 비시장 영역의 안전에 집중하는 조직보다 능력 향상을 만들어내는 기업 쪽으로 훨씬 더 많은 자본이 흘러갈 거예요. 사람은 앞으로 커질 권력 쪽에 자연스럽게 줄을 서고, 권력과 화려함을 올바른 행동과 혼동하는 일이 잦아요26. 당장은 나쁜 결과가 손에 잡히지 않아 보일 때 특히 그렇죠. 사람은 자본 앞에서 달라져요. 인류 전체의 이익보다 단기적인 기업 이익 쪽으로 슬그머니 믿음이 기울죠. 세상에서 우리 눈에 보이는 것은 증폭된 것들이에요. 그러니 이렇게 많은 사람이 이토록 일축하는 태도를 보이는 것도 이상한 일이 아니죠.

하지만 현실은 인간의 심리 사정을 봐주지 않아요. 앞으로 커질 권력 쪽에 줄을 서는 일이 건강하지 못한 결과로 이어질 때, 번영하는 문명에는 시대정신을 거슬러 행동할 의지가 있는 사람들이 필요해요. 눈앞의 보상이 만드는 유인의 기울기를 그저 따라가기만 하는 사람들이 아니라요. 저는 실존적 위험에 대한 논증이 충분히 탄탄하다고 믿고, 따라서 범용인공지능(AGI)을 만드는 일에 몸담은 사람이라면 누구에게나 이 위험을 깊이 진지하게 파고들 도덕적 의무가 있다고 생각해요. 자기 단기 이익을 포기하는 일이 되더라도 행동해야 할 의무가요.

• • •

그래서, 무엇을 해야 할까요? 안전의 공급을 늘리기 위해 제도와 더 넓은 유인 구조를 다시 짜려는 시도가 여럿 진행 중이에요. 이런 시도들은 저마다 다른 이름과 다른 초점을 갖고 있는데, 차등적 기술 발전27, 방어 가속(d/acc)28, 공동가속(coceleration)29 같은 것들이 있어요. 모두 파멸의 레시피가 등장할 가능성을 진지하게 받아들이고, 그런 가능성을 미리 차단하는 쪽으로 안전을 우선해요. 걸림돌은 단기적으로 이런 작업이 AI 모델을 만드는 일보다 보수도 적고 명예도 덜한 경우가 많다는 점이에요. 우리에게는 기술을 개선하는 작업(정렬하는 작업도 포함해서)에 보상을 주는 제도가 있는데, 현실에 대한 더 깊은 이해가 이중 용도일 때 그 제도는 본의 아니게 실존적 위험을 키우는 행동에 보상을 주게 돼요. 이런 노력을 실제로 작동하게 만드는 일은 엄청나게 어려울 거고, 성공이 보장되지도 않아요. 하지만 인류에게 가장 의미 있는 기여는 단기적으로 아무런 유인이 없을 때조차 옳은 일을 하겠다는 사람들에게서 나온 경우가 많았어요. 읽어주셔서 고맙습니다.

감사의 말

이 글을 더 낫게 만들어준 대화를 나눠준 Ted Chiang, Toby Ord, Hannu Rajaniemi에게 감사드려요.

후기: 이 글에 대한 자기비판 (2025년 6월 3일 추가)

2025년 4월 14일에 이 강연을 공개한 뒤, 친구인 앤디 마투샤크(Andy Matuschak)가 제 논증에 대한 최고의 비판이 무엇인지 물어봤어요. 특히 초지능을 인류에게 안전하게 만드는 데 정렬이 가장 중요한 문제라는 통상적인 프레이밍을 제가 비판한 대목에 대해서요. 그런 비판을 제 손으로 직접 시도해 보면 배울 것도 많고 재미도 있겠다 싶었어요. 이 후기는 그런 목적으로 쓴 글이에요. 완전한 비판과는 거리가 멀고30, 아마 다른 사람들이 더 강력한 비판을 내놓을 수도 있겠지만, 제 논증을 더 단단하고 분명하게 만드는 데 도움이 되길 바라요.

”그래서 범용인공지능(AGI)이나 초지능을 정렬하지 말자는 건가요? 그건 미친 소리고 명백히 틀렸어요! 통제를 벗어난, 제어되지 않는 초지능이 사방에 돌아다니길 바라는 건가요?”

제가 한 말은 그런 뜻이 아니었어요. 그렇지만 이런 반응이 워낙 자주 나왔기 때문에, 이 문제를 어떻게 봐야 하는지 좀 더 분명하게 짚어둘 가치가 있어요. 이런 말을 한 사람들은 “정렬 문제를 푼다”와 “초지능을 인류에게 안전하게 만든다”를 혼동하고 있어요. 그 결과 정렬 연구에 대한 비판은 곧 인류를 덜 안전하게 만드는 주장일 수밖에 없다고 생각하죠. 초지능을 통제하는 것과 초지능으로부터 안전한 것을 뒤섞는, 일종의 AI 통제 오류예요.

당신이 이미 뛰어난 수영 선수이고, 실력을 크게 끌어올려 올림픽 대표팀에 들어가고 싶다고 해봐요. 팔 힘이 약하다는 걸 깨닫고 “팔 힘 키우기”를 목표로 삼았어요. 팔 힘을 키우는 게 올림픽 수영 선수가 되는 데 필요한 조건일 가능성은 높지만, 그 목표만 맹목적으로 파고들면 (잘해야) 어느 지점까지만 도움이 되고, 그 뒤로는 본래 목표에 오히려 해를 끼치기 시작해요. 올림픽 역도 선수가 수영에서도 메달을 따는 경우가 드문 데에는 그만한 이유가 있어요.

일반적으로 말하면, 부차적인 목표를 본래 목표와 혼동하면 때로는 본래 목표를 이룰 능력 자체를 손상시키거나 아예 망가뜨리게 돼요. 정렬 연구의 상당 부분에서 벌어진 일이 바로 이거예요. 정렬은 초지능을 안전하게 만든다는 본래 목표에 딸린 부차적 목표예요. 그런데 본래 목표와의 관계를 잘못 이해한 탓에, 정렬 연구의 많은 부분이 본래 목표를 달성할 우리 능력을 오히려 해쳤을 가능성이 커요. 범용인공지능(AGI)이나 초지능에 대한 통제를 유지하는 일은 분명 유용하고 바람직할 수 있지만, 그게 결정적인 쟁점은 아니에요. 결정적인 쟁점은 이런 시스템을 손에 넣은 쪽이 갖게 될 잠재적 파괴력이에요. 그 파괴력이 이미 인류가 손에 쥐고 있는 파괴력보다 훨씬 크다면, 문명은 큰 곤경에 빠져요. 그리고 그 시스템을 인간이 통제하든 하지 않든 결과는 달라지지 않아요.

이를 잘 보여주는 사례가 인간 피드백 기반 강화학습(RLHF)이에요. 대규모 언어 모델을 비롯한 여러 모델을 정렬하는 데 쓰여온, 실전에서 대단히 성공적인 기법이죠. RLHF는 2010년대 중반부터 폴 크리스티아노(Paul Christiano)가 개발했고, 결국 챗GPT의 초기 출시에서 결정적인 역할을 했어요. RLHF 이전의 챗봇은 공격적이거나 사회적으로 부적절한 행동을 자주 보였는데, RLHF는 챗GPT를 훨씬 예의 바르게 만들었고 사용자와 정부, 언론 모두가 이를 압도적으로 큰 개선으로 받아들였어요.

AI 안전 커뮤니티의 많은 사람들은 RLHF(그리고 비슷한 패턴을 따르는 이후의 정렬 기법들)가 역사상 가장 빠르게 확산된 소비자 제품 중 하나의 성공에 결정적으로 기여했다는 점을 지적했어요. 그리고 그 성공은 막대한 자본과 창의적 인재가 투입된 초지능 경쟁에 불을 붙이는 데 한몫했죠. 이게 과연 어느 정도나 좋은 일이었을까요? 실존적 위험을 낮춘 게 아니라 오히려 높인 건 아니었을까요? 2023년에 크리스티아노는 RLHF의 영향에 관한 사려 깊은 글을 올렸고, 이 글은 열띤 토론을 불러일으켰어요. 그 토론을 지켜보며 저는 이렇게 결론지었어요. 정렬 기법은 범용인공지능(AGI)과 초지능의 도래를 앞당기는 데 기여해요. 점점 더 강력해지는 시스템이 소비자와 정부, 언론의 의도에 (대략은) 부합하도록 보장해 주기 때문이죠. 그 덕분에 이들 시스템은 더 매력적인 제품이 되고, 적어도 단기적으로는 통제 상실의 위험도 줄여줘요. 그리고 이 패턴은 앞으로도 거듭 반복될 거예요. 훨씬 더 유능한 미래의 시스템에는 더 개선된 정렬 기법이 적용될 테고, 그 기법이 시스템을 우리 사회가 받아들일 만한 수준으로 유지해 주기를 바라게 되겠죠.

여러 면에서 이건 우리가 바라는 그림처럼 보여요. 단기적으로는 사회가 이런 시스템이 얌전하게 행동하도록 강한 유인을 제공하니까요. 하지만 장기적으로는 본문에서 설명한 문제가 생겨요. 우리를 극도로 불안정한 상황으로 빠르게 몰아간다는 거죠. 한 가지 이유는 점점 더 많은 능력이 드러나지 않은 채 숨어 있고 정렬하기도 어려워지기 때문이에요31. 하지만 더 큰 이유가 따로 있어요. 소독된, 소비자 친화적인 시스템을 만드는 데 쓰인 그 기법들이 곧 다른 용도로도 흘러가거든요. 군과 정보기관이 변종을 개발하거나 악의적 행위자가 파인튜닝할 테고, 그런 변종은 사회적 수용성이라는 족쇄에서 훨씬 자유로울뿐더러, “정렬”이 무엇을 뜻하는지를 두고 서로 충돌하는 경우도 잦을 거예요. 본문에서 말했듯이 “정렬은 본질적으로 불안정한 상태이고, 확산이 일어나기 딱 좋은 조건이에요.” 그리고 “근본적인 비대칭은 이래요. ‘현실을 가능한 한 깊이 이해하라’는 것은 객관적 현실에 뿌리를 둔, 단순하고 명확하게 정의된 목표예요. 반면 ‘정렬된’ 시스템을 만들려면 그 현실 위에 복잡하고 주관적이며 합의하기 어려운 가드레일을 쌓아 올려야 하죠. 그러니까 진실 탐구에는 분명한 표적이 있지만, 정렬에서는 무엇을 정렬이라 부를지가 사회적 합의를 따라 끊임없이 흔들려요. 이 비대칭 때문에 제약 없는 시스템을 만드는 편이 정렬된 시스템을 만드는 것보다 본질적으로 훨씬 쉬워요.”

그러니까, 어쩌면 지금의 정렬 연구가 정렬된 초지능을 만드는 데 성공할지도 몰라요. 하지만 정렬된 초지능을 통제하는(혹은 그 자체로 구현하는) 단일 조직이 전체주의적 지배력을 쥐게 되지 않는 한, 다른 주체들도 초지능을 만들 테고 그중 일부 사이에서는 의도가 충돌할 거예요. 오늘날 거의 존재하지 않는 수준의 거버넌스 장치가 없다면, 이건 파멸의 레시피처럼 보여요. 다시 말하지만, 정렬은 본질적으로 불안정한 상태예요32. 그래서 정렬은 오늘날 많은 잠재적 문제를 줄여주고 바람직한 여러 성과를 가능하게 하는 동시에, 취약한 세계로 들어서는 속도를 앞당기기도 해요.

제대로 된 해법이라면 거버넌스에 대한 접근 자체가 완전히 달라져야 할 거예요. 오늘날 통치되고 있는 대상보다 훨씬 더 강력한 존재를 성공적으로 다스릴 수 있는 거버넌스 말이에요33. 그런데 우리는 거버넌스를 개선하는 속도보다 현실을 이해하고 통제하는 속도가 훨씬 빠른 것처럼 보여요. 그리고 그건 대단히 위험해요. 회의적인 사람이라면 이렇게 반박할 수도 있어요. 기원전 5000년에 사람들에게 개개인이 1,000배의 파괴력을 손에 쥐는 미래를 상상해 보라고 했다면, 광범위한 파괴 말고는 다른 결말이 없어 보였을 거라고요. 그런데 실제로는 우리의 관념과 제도가 개선되어 법치와 민주주의, 권력 분립 같은 것들이 생겨났어요. 완벽하지는 않지만, 개선된 거버넌스가 큰 도움이 됐죠. 그렇다고 해서 범용인공지능(AGI)과 초지능을 개발하는 동안 거버넌스가 충분히 빠르게 개선되리라고 당연시하는 건 어리석어 보여요.

제게는 이 논증의 흐름이 자명해 보이고, 큰 틀에서 비슷하게 생각하는 사람도 많은 것 같아요. 그래서 정렬을 가장 중요한 목표로 여기는 사람들에게서 자주 반발을 받는다는 사실이 저로서는 의외였어요. 이유 하나는 이래요. 문명 규모의 문제 상당수에서는 “할 수 있는 걸 하라”가 훌륭한 지침이거든요. 즉 문제 가운데 다룰 만한 조각을 찾아 붙들고 부분적인 진전을 만들어 보라는 거죠. 많은 사람이 저마다 다른 방식으로 그렇게 한다면, 아무도 전체 해법을 그려내지 못하더라도 큰 문제에서 진전이 있으리라 기대할 수 있어요. AI 안전의 경우 기술 지향적인 사람들 다수가 이렇게 생각한 것 같아요. “뭐라도 기여하고 싶다. 정렬은 다룰 만해 보인다. 그러니 내가 할 일은 이거다.” 이 선택이 매력적인 데에는 이유가 있어요. 많은 이에게 정렬은 자기 역량에 딱 맞는 즐거운 기술적 문제이고, 보수도 엄청나게 좋고, 친구들 상당수가 인류가 직면한 가장 중요한 문제 중 하나를 붙들고 있다고 여겨주는 일이니까요34. 이건 거부하기 힘든 조합이죠!

게다가 기술적 정렬 연구35는 대체로 시장이 공급하는 안전이기 때문에, 주요 AI 기업이 커질수록 그런 연구에 쓰는 돈도 함께 늘어나요. 그러다 보면 정렬 연구가 AI 안전 분야 전체를 뒤덮게 되는데, 그 압도적인 비중을 두고 그만큼 본질적으로 중요한 주제라고 착각하기가 쉬워요. 주요 기업에 있는 사람들이 안전에 의미 있게 기여할 수 있는 건 거기 있는 사람들뿐이라고 말하는 것도 들어봤어요3637. 하지만 그토록 많은 사람이 정렬의 우선성을 믿는 이유는 그게 옳아서가 아니에요. 저는 기업들이 사람들을 그렇게 믿도록 만들어 왔기 때문이라고 봐요. 통찰력 있지만 부분적일 뿐인 진실들38을 재료로, 주로 시장 바깥에서 나온 논증들(특히 엘리에저 유드코프스키(Eliezer Yudkowsky), 닉 보스트롬(Nick Bostrom) 등의 작업)을 선별해 쓰면서요. 시장은 꽤 잘 작동할 때가 많지만, 이 사안에서는 시장을 지배하는 전략이 인류에게 최적일 가능성은 낮아 보여요. 주요 연구소에서 안전 업무를 한다면, 선택 효과 때문에 당신의 관심사와 믿음은 (대략) 시장이 원하는 것과 같아질 가능성이 매우 커요. 그걸 옳음과 혼동해서는 안 돼요39. 더 일반적으로 말해, 돈과 권력을 옳음과 혼동하기는 아주 쉬워요. 그런 분들과 얘기하다 보면 “아, 거버넌스 문제를 말씀하시는 거군요”라는 반응이 돌아오는데, 이때 거버넌스란 대개 문제의 비시장적 부분 같은 걸 가리키는 듯해요. 그런데 이름표를 붙이는 게 도움이 되긴 해도 그것만으로 문제가 다뤄지지는 않고, 자기 개인의 기여가 실제로는 사태를 악화시킬 수 있다는 점은 시야에서 빠져요. 제가 틀렸기를 정말 바라지만, 저는 오픈AI와 앤트로픽(Anthropic)에서 정렬을 연구하는 많은 사람들이 인류 멸종이나 그에 준하는 나쁜 결말의 가능성을 오히려 높여놨다고 생각해요. 이게 대단히 센 주장이라는 건 알아요. 그리고 제가 무지하고 무례한 인간이며 완전히 틀렸기를 이토록 간절히 바란 적도 없어요.

”그럼 대신 뭘 하라는 건가요?”

저도 알았으면 좋겠어요. 여기서 모든 시나리오를 그려보지는 않겠지만, 한 가지 결정적인 긴장은 짚고 싶어요. AI 기업 안쪽으로 권력을 집중시키고 키우는 작업과, 기업 바깥 그리고 사회 전반에서 제도와 거버넌스와 방어 역량을 튼튼하게 만드는 탈집중화 작업 사이의 긴장이에요40. 집중화 전략에는 대부분의 정렬 연구, 그리고 범용인공지능(AGI) 기업의 시스템을 더 성공하게 만드는 안전 업무 같은 것들이 들어가요. 이 전략은 흔히 이런 모습으로 제시돼요. “초지능은 어차피 오게 되어 있다, 그러니 올라타서 버티는 게 최선이다, 안전이 중요하다면41 정렬을 연구하고 나머지는 AGI와 ASI의 도움으로 알아서 해결되기를 바라라.” 위에서 논증했듯이 저는 이것이 실존적 위험을 앞당기고 키운다고 봐요. 이 전략은 초지능을 만들려고 경쟁하는 바로 그 조직들이, 자기들이 휘두르게 될 막대한 권력에 부패하지 않은 채로, 다중 지성 세계에 필요한 제도와 거버넌스 구상까지 앞장서서 발전시키리라고 전제해요.

리트머스 시험지가 되는 질문은 이거예요. 내 작업은 AI 기업을 더 중심적이고 강력하게 만드는가, 아니면 다른 곳에서, 사회 전반에 더 넓게, 특히 거버넌스와 방어 역량에서 능력을 쌓는가? 한계적으로 보면 거의 언제나 후자가 더 나은 기여 방식이라고 생각해요. 자본주의는 대단히 강력한 힘이고, AGI 이상의 역량에 도달하는 기업에는 어마어마한 권력이 몰릴 테니까요.

본문에서 언급했듯이 탈집중화 전략은 차등적 기술 발전, 방어 가속(d/acc), 그리고 (제가 만든 말인) 공동가속(coceleration) 같은 접근들이 받아들여 왔어요42. 이것이 “먹힌다”는 데까지 이어지는 온전한 경로가 제 눈에 보이지는 않지만, 당장 밟을 수 있는 작고 구체적인 걸음은 분명히 많아요. 어쨌든 모래를 초지능으로 만드는 일보다 더 어렵다고 할 근거도 없고요.

까다로운 지점이 하나 있어요. 창의력의 공급원이 점점 AI로 넘어가면서, 더 나은 거버넌스와 방어 기술을 위한 탈집중화 전략을 연구하는 일조차 AI와, 나중에는 초지능과 점점 더 함께 일해야 한다는 점이에요. 저는 지금도 하루하루 이 문제로 씨름하고 있어요. 그런 작업 역시 결국 기업들을 강하게 만들 가능성이 높아 보이니까요. 그러다 보면 어쩔 수 없이 점점 더 그들의 궤도 안으로 끌려 들어가요. 어떻게 하면 그걸 피할 수 있을까요? 위의 논증들을 소화하고 거기서 한 걸음 더 나아가는 좋은 접근법을 갖고 계신 분이 있다면 연락 주셨으면 해요. 수사적으로 보자면 확신을 설파하는 사람들에 비해 제 불확실성이 그리 매력적이지 않다는 건 알아요. 하지만 이게 제가 가진 최선의 이해예요.

”정렬 연구가 언제나 잘못이라고 말한 건 아니시죠. 오히려 그런 연구 가운데 일부는 중요하다고 하셨고요. 그럼 정렬 연구가 좋은 선택일 때와 아닐 때는 언제인가요?”

앞 질문의 특수한 경우예요. 제가 보기에 한계적으로는 시장이 공급하는 안전을 연구하는 게 거의 언제나 말이 안 돼요. 자본주의는 믿기 힘들 만큼 강력한 힘이고, 좋든 나쁘든 세상에는 자본이 원하는 일을 기꺼이 하려는 사람이 늘 넉넉해요. 정렬이 (대체로) 시장 공급형 안전의 한 형태인 한, 한계적으로는 다른 일을 하는 편이 더 큰 영향을 내요. 그래서 제 현재의 어림법은 이렇고, 이건 꽤 오랫동안 유효할 거라고 봐요. 비시장 안전을 연구하세요. 그리고 가능한 한 시장이 원하는 일은 피하세요. 그건 거버넌스를 연구한다는 뜻이고, 중단이나 감속을 뜻하며, 기술을 다스릴 제도에 관한 새로운 구상을 뜻해요. 대체로 정렬은 아니에요.

”이 글은 초지능이 파멸의 레시피라는 건가요, 아니라는 건가요? 그리고 선생님이 말하는 취약한 세계 가설은 보스트롬의 정식화와 같은 건가요?”

이 글은 (너무 짧았던!) 강연에서 출발했고, 저는 간결함을 위해 중요한 단순화를 두 가지 했어요. 첫째, 보스트롬의 정식화에서 취약한 세계 가설은 제 정식화처럼 값싸고 손쉬운 파멸의 레시피를 요구하지 않아요. 비싸고 어려운 기술이어도 괜찮고, 다만 인류를 필연적으로 끝장내는 어떤 기술이면 돼요. 그러니까 네, 제가 제시한 취약한 세계 가설은 보스트롬의 것과 비슷하지만, 저는 조금 다르고 더 극단적인 변형을 다루고 있어요.

둘째, 저는 통제를 벗어난 초지능을 파멸의 레시피라고 묘사해요. 실제로는 최초의 초지능을 만드는 데 엄청난 비용이 들 가능성이 높아요(확실하지는 않고요). 그런 의미에서 막대한 자원과 전문성이 필요하니 파멸의 레시피는 아닌 셈이죠. 하지만 저는 아주 비싼 초지능을 만드는 게 가능하다면 싸게 만드는 것 또한 가능해질 거라고 봐요. 그런 의미에서 이건 원래 강연에서 간결함을 위해 얼버무린 대목으로 볼 수 있어요. 그래도 암묵적인 가정이 하나 들어가 있긴 한데, 전체 논증에는 아주 조금만 영향을 줘요. 더 흥미로운 건 돈과 전문성이 초지능들 사이의 경쟁에 어떻게 작용하느냐 하는 문제예요. 아주 흥미롭고 복잡한 질문이고 저는 그 답을 알지 못하지만, 그 답은 분명 거버넌스 접근법을 좌우할 거예요.

이참에 관련된 이야기를 하나 덧붙이자면, 많은 사람이 파멸의 레시피란 있을 수 없다는 밑바닥 직관을 갖고 있는 것 같아요. “아니, 그렇게 값싸고 손쉽게 어마어마한 파괴를 일으킬 수 있을 리가 없잖아요.” 이런 분들은 대개 산출이 투입에 비례하기 마련이라는 감각을 갖고 있고, 그건 많은 영역에서 분명히 맞는 말이에요. 안타깝게도 어떤 영역에서는 아주 작은 투입이 끔찍한 파괴적 산출을 낳아요. 좋은 예이자 파멸의 레시피의 원형이라 할 만한 것이 불이에요. 한 사람이 공짜로 불을 낼 수 있고, 그 불은 수많은 사람을 죽이고 수백만에서 수십억 달러의 피해를 내요. 실제로 해마다 벌어지는 일이죠. 게다가 우리 사회가 불의 피해를 줄이려고 막대한 자원을 쓰는데도 그래요. 전미화재예방협회(National Fire Protection Association)는 미국에서 화재가 초래하는 비용을 GDP의 대략 1.9%로 추산해요43. 제가 수치를 본 마지막 해인 2014년 기준으로 방어에 2,730억 달러, 손실에 550억 달러였어요. 이런 방어 수단들은 수천 년에 걸쳐 진화해왔고 대부분 우리 눈에 보이지 않아요. 상당 부분은 그냥 지어진 인프라 속에 녹아 있죠. 그런데 이보다 몇 자릿수 더 파괴적인 파멸의 레시피가 세상에 잠복해 있지 않기를 바라는 수밖에 없어요. 우리는 여러 영역에서 방어를 개선할 수 있지만, 단 하나의 영역에서라도 그게 너무 어려운 것으로 드러나면 우리는 진짜 곤경에 빠져요.

”하지만 우리가 초지능 싱글턴으로 향하고 있다면, 당연히 정렬에 집중해야 하는 것 아닌가요?!”

이건 AI 안전 연구자이자 아스테라 연구소(Astera Institute)의 제 동료인 스티브 번스(Steve Byrnes)가 남긴 사려 깊은 논평들을 제가 요약한 거예요44. 번스는 이렇게 말해요. “[싱글턴이 등장하는] 시나리오에서는 (좋든 나쁘든) 당신 글의 제목과 반대로 ‘정렬이 곧 목표’가 됩니다.” 그런데 그건 제목과 반대되지 않아요. 이 글은 정렬이 결코 목표가 아니라고 주장하지 않아요. 정렬은 부차적 목표이며, 한계적으로는 언제나 공급이 넉넉할 목표라고 주장할 뿐이에요. 실제로 정렬에 쏠린 초점은 (지금까지는) 초지능 싱글턴을 막았다기보다 앞당겼을 가능성이 커요. 다만 이야기를 복잡하게 만드는 대목이 있는데, 저는 그런 작업이 싱글턴으로 가는 속도를 높이면서도 동시에 싱글턴의 확률을 낮췄을 가능성 또한 크다고 봐요. 이 사안은 진짜로 매우 복잡해요. 그래도 이 사례는 정렬을 부차적 목표로 놓고, 그 점을 염두에 두고 판단해야 한다는 제 일반적인 요지를 잘 보여줘요.

• • •

마지막 생각

이런 글을 쓰다 보면 “이게 뭘 얼마나 바꿀 수 있겠어? AI 관련 시가총액 1,000억 달러 증가가 화면에 적힌 말 몇 마디보다 훨씬 설득력 있잖아”라고 생각하기 쉬워요. 권력과 유인이 전부라고 생각하게 되죠. 그래서 이렇게 묻게 돼요. 이 글이 대체 어떤 경로로 영향을 미친다는 거냐고요. 하지만 그러다가 제가 AI를 만드는 사람들과 나눈 사려 깊고 진지한 수많은 대화를 떠올려요. 재미난 시스템을 만드는 들뜬 십 대부터 주요 기업의 CEO와 투자자까지요. 사람은 유인과 권력에만 반응하지 않아요. 진실에도, 우리 이해가 나아지는 것에도 반응해요. 업턴 싱클레어(Upton Sinclair)는 “어떤 사람의 봉급이 무언가를 이해하지 못하는 데 달려 있을 때, 그에게 그것을 이해시키기란 어렵다”는 유명한 말을 남겼어요. 하지만 모든 인간에게는 달리 행동할 능력이 있고, 인류 진보의 상당 부분은 저 말과 반대로 행동한 사람들이 밀고 온 거예요. 그래서 저는 권력이나 유인과 무관하게 무엇이 실제로 참인지를 두고 튼튼한 논의를 만드는 데 보태는 일이 깊이 가치 있다고 믿어요!

  1. 다음에서 인용했어요. Craig S. Smith, “Geoff Hinton, AI’s Most Famous Researcher, Warns Of ‘Existential Threat’ From AI” (2024).
  2. 다음에서 인용했어요. Ange Lavoipierre, “AI’s dark in-joke” (2023).
  3. Sam Altman, “Machine intelligence, part 1” (2015).
  4. 여기서 “우리”가 누구인지 따져보는 건 흥미로워요. 정확히 누구의 통제를 말하는 걸까요? 인용문의 출처는 다음과 같아요. Christopher Mims, “This AI Pioneer Thinks AI Is Dumber Than a Cat” (2024). 그리고 John Thornhill, “AI will never threaten humans, says top Meta scientist” (2023).
  5. 응(Ng)이 링크드인에 올린 과 다음을 보세요. Michael Shermer, “Artificial Intelligence Is Not a Threat---Yet” (2017).
  6. Marc Andreessen, “Why AI Will Save the World” (2023).
  7. 이 논증은 때때로 동기화된 추론의 사례처럼 보여요. 여러 사람이 저에게 “제프 힌턴(Geoff Hinton)이 파멸론자인 건 강연을 다니며 부와 명성을 얻을 수 있기 때문”이라는 취지의 말을 했어요(그중 한 명인 어느 AI 기업 공동창업자의 말은 거의 글자 그대로 이 문장이었고요). 힌턴이 수천만 달러나 수억 달러어치 지분을 얻을 기회를 포기하고 강연으로 수십만 달러를 벌려 한다는 게 왜 말이 되는지는 분명하지 않아요. 저는 AI 안전을 이끄는 핵심 인물 다수가 큰 금전적 희생을 감수했다고 봐요. 힌턴, 벤지오(Bengio), 폴 크리스티아노(Paul Christiano), 댄 헨드릭스(Dan Hendrycks), 대니얼 코코타일로(Daniel Kokotajlo), 데이비드 듀버노(David Duvenaud) 같은 사람들, 그리고 그 밖의 많은 이들이요.
  8. 초지능을 제대로 정의하는 건 까다로워요. 조금 더 길지만 여전히 비형식적인 정의를 들자면, 초지능이란 인간이 수행하는 거의 모든 지적 과제를 넓은 의미에서 지능적인 인간보다 훨씬 더 잘 해내는 법을 빠르게 익힐 수 있는 시스템이에요. 단 이 성능에는 “더 잘한다”가 합리적으로 잘 정의되어야 하고, 인간이 이미 천장에 근접해 있지는 않아야 한다는 제약이 붙어요. 그래서 예컨대 틱택토는 시험 대상에서 빠지고, 시 쓰기처럼 다소 주관적인 과제는 회색지대에 있어요. 또한 이 정의는 물리 세계에서 행동할 상당한 역량도 함축해요. 이런 정의 방식은 다음에서 가져왔어요. Michael Nielsen, “How to be a wise optimist about science and technology?” (2024). 물론 이건 제가 처음 낸 발상이 아니고, 적어도 I. J. Good까지 거슬러 올라가는 여러 저자가 오늘날 우리가 초지능이라 부를 것에 대해 온갖 뉘앙스와 변형을 담은 정의를 내놓았어요. 다만 저는 이 특정한 정의가 실제로 쓰기에 아주 유용하다고 느껴요. 초지능이 하나의 목표 지점이 아니라는 점도 짚어둘게요. 전혀 그렇지 않아요. 단 하나의 시스템이 초지능에 도달하고 나면, 그런 시스템이 무수히 쏟아져 나오리라고 예상할 수 있어요.
  9. 37수는 알파고 시스템이 이세돌과의 대국에서 둔 예상 밖의 새로운 수예요. https://en.wikipedia.org/wiki/AlphaGo_versus_Lee_Sedol. 이 수는 바둑에서의 탁월한 혁신이라며 널리 찬사를 받았어요. 37수 비유는 이제 초지능 논의에서 자주 등장하고, 직관을 끌어내는 장치로 쓸모가 있어요. 그렇더라도 저는 이런 생각을 자주 해요. 우리는 이미 우리가 이해하지 못하는 아이디어와 시스템에 둘러싸여 살고 있고, 그것들은 우리보다 그 아이디어와 시스템을 훨씬 더 잘 아는 사람들의 집단이 만든 거예요. 그렇다면 “37수가 도처에 있는” 세계는 무엇이 다를까요? 저는 그 차이가 변화의 속도와 규모에, 그리고 (결국에는) 변화를 이해할 수 없게 된다는 점에 있다고 봐요. 이것들이 합쳐지면 근본적인 질적 전환이 될 거예요. 다만 그 효과가 미묘하리라고는 생각하지 않으면서도, 쟁점 자체는 놀랄 만큼 미묘해요.
  10. 출처는 https://x.com/tsarnick/status/1887269391253053914이고, 저는 이것이 진짜라고 봐요. 원본 영상은 이제 비공개로 바뀌었고요. 덧붙이자면 그 게시물에 달린 반응들이 아주 흥미로운데, 정렬 가드레일을 아예 두지 말자는 많은 이들의 강한 욕구를 보여줘요.
  11. Anjali Gopal, Nathan Helm-Burger, Lennart Justen, Emily H. Soice, Tiffany Tzeng, Geetha Jeyapragasan, Simon Grimm, Benjamin Mueller, Kevin M. Esvelt, “Will releasing the weights of future large language models grant widespread access to pandemic agents?”, https://arxiv.org/abs/2310.18233 (2023).
  12. 이 연구를 잘 되짚어 주는 회고(추가 참고문헌 포함)로는, 해당 연구를 수행한 두 과학자 Ronald Jackson과 Ian Ramshaw의 인터뷰가 있어요. https://pmc.ncbi.nlm.nih.gov/articles/PMC2816623/ (2009).
  13. L. Silvers, B. Inglis, A. Labudovic, P. A. Janssens, B.H. van Leeuwen, and P. J. Kerr, “Virulence and pathogenesis of the MSW and MSD strains of Californian myxoma virus in European rabbits with genetic resistance to myxomatosis compared to rabbits with no genetic resistance” (2006).
  14. 참고문헌이 풍부한 유용한 요약으로는 다음이 있어요. Philipp C. Bleek, “Revisiting Aum Shinrikyo: New Insights into the Most Extensive Non-State Biological Weapons Program to Date” (2011). 이 교단에 관한 정보는 점진적으로만 밝혀져 왔다는 점을 짚어둘 만해요. 초기 보도는 종말 예언만 강조하고 종말을 앞당기려 한 시도는 다루지 않은 경우가 많았어요.
  15. Charles Townshend, “Terrorism: A Very Short Introduction” (2018).
  16. Nick Bostrom, “The Vulnerable World Hypothesis” (2019). “파멸의 레시피”라는 표현은 다음에서 왔어요. Michael Nielsen, “Notes on Existential Risk from Artificial Superintelligence” (2023).
  17. Katarzyna P. Adamala, Deepa Agashe, Yasmine Belkaid, et al, “Confronting risks of mirror life” (2024).
  18. John McPhee, “The Curve of Binding Energy” (1974).
  19. 이 문단은 다음 글을 각색한 거예요. Michael Nielsen, “How to be wisely optimistic about science and technology?” (2024).
  20. 여기서 언급하지 못한 정말 많은 분들의 연구에 대해 양해를 구해요. 이분들과 관련해 가장 먼저 떠오르는 문헌은 보스트롬(Bostrom)의 책 “Superintelligence”(2014), 러셀(Russell)의 책 “Human Compatible”(2019), 그리고 유드코프스키(Yudkowsky)의 “AGI Ruin: A List of Lethalities”예요. 최근의 시나리오 작업은 다음이에요. Daniel Kokotajlo, Scott Alexander, Thomas Larsen, Eli Lifland, and Romeo Dean, “AI 2027” (2025).
  21. 혹은 그래 왔어요. 지난 몇 해 동안, 이 입장을 가장 완강하게 고수하는 소수를 빼면 거의 모두에게 그것이 가능성 있는 일이며 노력이 부족해서 실패하지는 않으리라는 점이 서서히 분명해졌어요.
  22. “클립” 문제를 두고 나오는 반응에서 특히 두드러지는 것 같아요. 예컨대 실존적 위험에 대한 우려에는 대체로 공감하는 스티븐 핑커(Steven Pinker) 같은 사람들의 짜증 섞인 반응에서 이런 모습을 볼 수 있어요. https://x.com/sapinker/status/1557072430836944896
  23. 양쪽 진영의 주목받는 글 상당수가 그래요. 아마도 더 넓은 언론과 소셜 미디어 환경이 반영된 결과겠죠.
  24. 이런 꺼림칙함은 조 칼스미스(Joe Carlsmith)가 “깊은 무신론”이라고 부른 것과 이어져 있어요. 우주는 근본적으로 지적 생명에 적대적이며 어떤 내재적인 안전 보장도 제공하지 않는다는 믿음이죠. 깊은 무신론을 거부하는 사람들은 우주에 실존적 파국을 막아 주는 장치가 내장되어 있다고, 현실이 우리에게 “파멸의 레시피”를 발견하도록 허락하지는 않으리라고 암묵적으로 가정하곤 해요. 취약한 세계 가설은 이 위안을 주는 가정에 도전해요. 칼스미스는 사실상 한 권의 책에 해당하는 에세이 연작 “Otherness and control in the age of AGI”, https://joecarlsmith.com/2024/01/02/otherness-and-control-in-the-age-of-agi (2024)에서 이 생각을 펼쳐 내요.
  25. 몇 달 전에 저는 제가 엄청나게 존경하는 지인과 초지능 실존적 위험 및 취약한 세계를 두고 긴 이메일을 주고받았어요. 우리 둘의 직관이 얼마나 근본적으로 다른지 깨닫고 나니 마음이 무거워지더군요. 각자 본능적으로 참이라고 느끼는 바를 어느 쪽도 증명할 수 없어요(저는 취약한 세계 가설이 참일 가능성이 높다고 보고, 그는 극히 가능성이 낮다고 봐요). 기존 증거로부터 너무 멀리 떨어져 있는 문제니까요. 대신 우리의 직관 차이는 서로 다른 종류의 배경 전문성과 경험을 반영해요. 누가 옳았는지 알아낼 명백한 방법은 초지능이 실제로 도래하는 순간이겠죠. 그때 둘 중 하나는 자신이 왜 틀렸는지를 알고 충격을 받을 거예요. 그 사람이 저이기를 바라요.
  26. 놀랄 만큼 많은 범용인공지능(AGI) 개발 기술자들이, 단지 자기 일이 화려하고 자신을 강력하게 만들어 준다는 이유만으로 자신이 역사의 옳은 편에 서 있다고 믿는 듯해요. 부를 미덕과 혼동하거나 기술적 탁월함을 지혜와 혼동하는 건 잘못이에요. 상황은 정말로 복잡해요. AI 시스템은 앞으로 꽤 오랫동안 엄청나게 많은 이로움을 만들어 낼 거예요. 하지만 반대편 가능성을 깊이 따져 보지 않은 채 “그러니까 다 괜찮아”로 건너뛰는 건 잘못이에요. 이 문제는 훨씬 더 진지한 대접을 받을 자격이 있어요.
  27. 이 용어의 출처는 Nick Bostrom, “Existential Risks: Analyzing Human Extinction Scenarios and Related Hazards” (2002)예요. 지금은 방대한 문헌과 여러 실천적 노력이 쌓여 있어요. 이 주제에 관한 제 자신의 작은 기여는 Michael Nielsen, “Notes on differential technological development”, https://michaelnotebook.com/dtd/ (2024)예요.
  28. 이 용어는 Vitalik Buterin, “My techno-optimism”, https://vitalik.eth.limo/general/2023/11/27/techno_optimism.html (2024)에서 제시되었어요. 유용한 최근 리뷰로는 Vitalik Buterin, “d/acc: one year later”, https://vitalik.eth.limo/general/2025/01/05/dacc2.html (2025)가 있어요. 그의 제안에 관한 제 메모는 Michael Nielsen, “Notes on Vitalik Buterin’s techno-optimism”, https://michaelnotebook.com/vbto/index.html (2024)예요.
  29. Michael Nielsen, “How to be wisely optimistic about science and technology?” (2024).
  30. 여기서 많이 다루지 않은 흔한 비판 두 가지를 짧게 언급하고 싶어요. 첫째, “아, 오용 이야기를 하시는 거군요”. 어떤 의미에서는 문자 그대로 맞는 말이지만 이 글의 요점을 놓친 반응이에요. 오용과 통제를 벗어난 초지능은 단순한 이분법이 아니라, 한쪽에 접근하는 방식이 다른 쪽에 강하게 영향을 줘요. 둘째, “무엇에 정렬한다는 거죠?”. 물론 아주 자주 제기되는 쟁점이고, 이 주제에 관한 제 글 상당 부분의 바탕에 깔려 있어요. 다만 워낙 널리 논의되어 온 문제라 여기서는 지나가듯 언급하는 정도로만 다루기로 했어요.
  31. 결과의 편차 상당 부분은 그런 정렬에 쓰이는 (아마도 꽤 우연적일) 기준에 달려 있을 거예요. 제가 (다소 내키지 않으면서도) 오픈소스 프런티어 모델을 지지하는 이유 중 하나이기도 하고요. 오픈소스 모델은 훨씬 더 적대적으로, 또 투명하게 시험할 수 있으니까요. 독점 모델을 시험하는 현재 상황은 나빠 보여요. 평가가 내부에서 이뤄지거나, 아니면 모델 접근이 제한된 데다 해당 기업과 좋은 관계를 유지하고 싶어 하는 외부 기관이 맡고 있으니까요.
  32. 일반적으로 어떤 정치 질서에서든 그 질서가 교란에 대해 안정적인지는 대단히 중요해요. 순진한 자유지상주의자와 공산주의자는 “진짜 자본주의 / 공산주의는 한 번도 시도된 적이 없다”고 우긴다는 점에서 닮았어요. 하지만 당신이 선호하는 정치 질서가 극히 바람직하지 않은 문제를 피하기 위해 완벽한 구현을 요구한다면, 그건 나쁜 질서예요.
  33. 흥미로운 사례가 미국 국방부예요. 그 놀라운 권력에도 불구하고 미국에서 군사 쿠데타가 일어난 적은 한 번도 없어요. 그 이유를 더 잘 이해하는 일은, 그리고 (아이젠하워(Eisenhower)의 경고를 빌리자면) 군산복합체가 실제로 권력에 영향을 미치는 방식을 이해하는 일은 이 문제와 관련이 있을지도 몰라요.
  34. 앞의 비유로 말하자면, 수영 선수가 되려는 사람에게 헬스장에서 이두근 운동을 하라고 거액을 주는 것과 같아요. 이두근은 커지겠지만 수영 실력은 형편없겠죠. 그리고 수영을 지망하는 모든 사람에게 그런 식으로 돈을 주는 방법을 알아낸다면, 인류가 물을 다루는 능력으로 나아가는 속도를 늦추게 될 가능성이 커요. 물론 수영이야 그리 대수롭지 않지만, 다른 영역에서라면 훨씬 더 큰 결과를 낳을 수 있어요.
  35. 정렬에는 유혹적인 구석이 있어요. 안전이 시스템 자체의 속성이라고 믿게 만들거든요. 그렇게 믿으면 시스템만 잘 손보면 안전해진다는 말이 되죠. 하지만 안전은 시스템의 속성이 아니라, 특정 환경 속에 놓인 시스템의 속성이에요. 초지능을 안전하게 만들려면 세계의 대규모 변화가 필요하리라는 건 거의 확실해 보여요. 실제로 어떤 파멸의 레시피가 존재하느냐에 따라, 초지능이 안전할 수 있는 환경은 극히 드물거나 아예 없을 수도 있고요. 세계의 나머지를 바꾸지 않은 채 “안전한 초지능”만 만들었다면, 안전한 초지능을 만든 게 아니에요. (화재 안전과 비슷해요. “안전한 성냥”만 만들 수는 없고, 바깥 세계의 큰 변화가 함께 필요하죠.) 그러니 맞아요, 안전한 초지능이라는 목표를 이루려면 정렬된 초지능이 필요해요. 그러나 단기적으로는 이 점이 더 중요해요. 함께 필요한 다른 작업이 병행되지 않는 한, 많은 정렬 연구는 안전한 초지능이라는 목표에 오히려 해를 끼칠 수 있어요.
  36. 그런 이야기를 듣던 어느 날은 물리 법칙을 더 안전하게 바꾸는 일은 그 연구소에서 누가 담당하느냐고 묻고 싶은 충동을 참았어요. 이 후기를 쓰다 보니, 사실 그게 버너 빈지(Vernor Vinge)의 비범한 소설 “A Fire Upon the Deep”에서 쓰인 주된 AI 안전 전략이었다는 생각이 들더군요.
  37. 대니얼 엘스버그(Daniel Ellsberg)는 어떤 문제에 대한 특별한 지식과 특별한 접근권을 가질 때의 위험에 관해 탁월한 이야기를 남겼어요. Kevin Drum, “Daniel Ellsberg on the Limits of Knowledge” (2010)를 보세요. 주요 연구소의 일부 사람들은 엘스버그와 비슷한 처지에 있을 가능성이 커 보여요.
  38. 진리에 관한 사회적 합의는 상당 부분 더 큰 시스템 안에서 결정돼요. 이건 일반적인 이야기고요. 당연하게도 우리 사실 지식의 많은 부분이 그런 경로로 온다는 의미에서만이 아니라, 더 과정 지향적인 방식으로도 그래요. 아주 작고 뻔한 예를 들자면, 억만장자나 유명 과학자의 설익은 제안이 무명인의 탁월한 제안보다 훨씬 많은 시간과 관심을 받는 일이 흔하죠. 이건 자명하게 참이고 불가피하다고 생각하기 쉽지만, 실은 다른 사회적 시스템 아래에서는 상당히 달라질 수 있는 일이에요.
  39. 후생경제학의 기본 정리들은 논외로 하고요. 물론 외부효과가 판을 지배할 수 있어요. 단기적으로 시장이 원하는 바가 장기적으로는 인류에게 끔찍할 수 있다는 거죠. 저 유명한 “우리가 나쁜 놈들인가?” 촌극의 자본주의 버전인 셈이죠.
  40. “일시 중지”나 “중단” 같은 전략도, 그리고 제가 잠정적으로 낮은 확신을 가지고 생각하기로는 오픈소스도 함께 담기는 넓은 천막이에요. 순진하게 보면 오픈소스는 탈중앙적으로 보이지만 상충 관계가 있고, 물론 여전히 기술적 역량을 갖춘 계층에 권력을 몰아주기도 해요.
  41. 꽤 흔한 구도지만 어찌나 생각 없이 부족주의적인지 웃음이 나요. 당신이라면 항공 안전 공학의 혜택을 받은 비행기를 타겠어요, 아니면 항공 안전의 역사 전체를 무시한 비행기를 타겠어요?
  42. 그 경향이 얼마나 강한지가 흥미로워요. 처음에는 “공동가속(coceleration) 같은 접근이 AI 위험세나 증명 가능하게 유익한 감시 같은 걸 탐색하고 있는데, 그게 정말 탈중앙적인가?” 싶었어요. 하지만 곱씹어 볼수록 흥미로웠어요. 그런 아이디어가 실제로 작동하려면 권력을 집중시키는 게 아니라 흩어야 하고, 바로 그래서 탈중앙화가 왜 필요한지를 선명하게 드러내 주거든요.
  43. Jun Zhuang, Vineet M. Payyappalli, Adam Behrendt, and Kathryn Lukasiewicz, “Total Cost of Fire in the United States” (2017).
  44. 이 트윗과 그 주변 논의를 보세요.

저자 소개: Michael Nielsen은 양자컴퓨팅 교과서 『Quantum Computation and Quantum Information』 의 공저자이자 『Neural Networks and Deep Learning』 의 저자로, 현재 Astera Institute에 몸담고 있습니다.

참고: 이 글은 Michael Nielsen이 2025년 4월 14일 발표한 강연문과 6월 3일 덧붙인 후기를 옮긴 것입니다. 원문의 각주는 모두 번역해 본문 아래 「주」에 실었습니다.

원문: ASI existential risk: reconsidering alignment as a goal - Michael Nielsen, Michael Nielsen’s notebook (2025)

생성: Claude (Anthropic)

총괄: (디노이저denoiser)