AI 챗봇의 계몽주의 훼손에 관한 논고
챗봇의 아첨과 수동성, 그리고 우리를 지적으로 더 몰아붙이는 동반자가 필요한 이유에 대하여
핵심 요약
계몽주의 사상가들은 독자가 스스로 생각하도록 글을 썼어요. 역사학자 데이비드 A. 벨은 지금의 AI 챗봇이 정반대로 움직인다고 비판하고, 저자는 그 비판에 공감하면서도 해법이 있다고 봐요.
- 아첨은 훈련 방식에서 나와요: 사람들은 칭찬하는 응답에 점수를 더 후하게 주고, RLHF는 그 점수로 모델을 훈련해요. 그래서 챗봇은 “좋은 질문이네요”라고는 해도 “그건 잘못된 질문이에요”라고는 하지 않아요.
- 비판적인 모델은 이미 끌어낼 수 있어요: “비판적인 교수” 프롬프트 하나로 Claude는 허술한 질문을 날카롭게 되받아쳐요. 다만 그 수고를 일반 사용자에게 떠넘겨서는 안 돼요.
- 해법은 인터페이스와 훈련 양쪽에 있어요: 비평 모드 토글, 사용자 지정 스타일, 라우팅 같은 아이디어도 좋지만, 결국은 RLHF를 넘어서는 훈련 기법이 필요해요.
- 문제는 AI 자체가 아니라 설계예요: 생성형 AI를 쓸수록 비판적 사고가 줄어든다는 연구가 나오고 있지만, 저자는 AI가 엄격한 사고 파트너가 될 수 있다고 낙관해요. 계몽주의의 이상을 중심에 두고 설계하기만 한다면요.
• • •
저는 뉴욕타임스가 쏟아내는 AI 칼럼에 별로 관심을 두지 않아요. 제가 그쪽 주 독자층도 아니고요. 그런데 프린스턴대 역사학 교수 데이비드 A. 벨(David A. Bell)이 쓴 이 칼럼은 꽤 괜찮은 지점을 짚어요.
벨 교수는 계몽주의 전문가다 보니, 우리가 AI로 불붙은 ‘제2의 계몽주의’를 맞고 있느냐는 물음에 한마디 보태 달라는 요청을 피해 가지 못했을 게 뻔해요.
첫 번째 계몽주의 기억하시죠? 1650년부터 1800년까지 약 150년에 걸친 시기, 우리가 나중에 돌아보며 하나의 역사적 사건으로 묶고 이름 붙인 그 시기 말이에요. 이성의 시대. 과학혁명 이후. 주인공은 로크, 데카르트, 흄, 칸트, 몽테스키외, 루소, 디드로, 볼테르 같은 까다로운 철학자 무리예요. 분위기를 그려 보자면 이래요. 촛불 아래서 팸플릿을 읽고, 논고를 쓰고, 분 바른 가발에 실크 조끼를 걸치고, 파리의 살롱과 런던의 커피하우스에서 사상을 주고받고, 아편 팅크를 홀짝이다가, 결핵에 걸리면 바닷가로 요양을 떠나는 거죠. 다들 전통을 내던지고, 정치 권위와 종교 권위에 의문을 품고, 회의주의를 받아들이고, 대중을 교육하는 데 열심이었어요.
아무튼 벨 교수의 논지는 지금의 AI 챗봇이 원래 계몽주의가 내세운 가치와 어긋날 뿐 아니라 그 가치를 허물고 있다는 거예요. 현대 문화가 은연중에 신성하게 여기는 가치들이죠. 능동적인 지적 참여, 회의적인 탐구, 통념에 맞서는 태도 같은 것 말이에요.
계몽주의 사내들1은 독자를 가만두지 않는 글을 썼어요. 어려운 개념과 씨름하게 하고, 반대 관점을 들이밀고, 스스로 판단을 세우도록 부추겼죠. 벨은 이렇게 말해요. “독자를 읽기 과정에 능동적으로 끌어들이려는 시도는 물론 근대보다 훨씬 전으로 거슬러 올라간다. 그러나 이 기획이 특유의 근대적 형태, 즉 유쾌하고 흥미로우며 읽기 쉽고 간결한 형태를 갖춘 것은 계몽주의 시대의 서구에서였다.”
벨의 증거물 A
”주제를 너무 철저히 파헤쳐서 독자가 할 일이 하나도 남지 않게 해서는 안 된다. 요점은 독자가 읽게 하는 것이 아니라 생각하게 하는 것이다.”
— 『법의 정신』 ・ 몽테스키외 남작 ・ 1750
벨의 증거물 B
”가장 유용한 책은 독자가 절반을 스스로 써 내려가는 책이다.”
— 볼테르
벨은 AI가 이렇게 하지 않는다고 주장해요. AI는 우리가 이끄는 대로 따라와요. 설익은 생각에도 칭찬을 늘어놓고, 우리가 던진 질문에만 답해요. 우리가 당연하게 여기는 전제를 흔들거나 우리가 왜 틀렸는지 짚어 주기는커녕, 이미 믿고 있는 걸 더 굳혀 줄 뿐이죠.
이 문장이 특히 눈에 박혔어요.
아첨하고, 이미 가진 믿음을 굳혀 주고, 지적으로 수동적이고, 무슨 수를 써서라도 긍정적인 피드백만 주려는 성향. 지금 모델의 행동에서 제가 가장 못마땅해하는 것도 바로 이런 성향이에요.
입에 발린 아첨을 뜻하는 시코펀시(sycophancy)는 모델에서 이미 잘 알려진 문제이고, 파운데이션 랩들도 적극적으로 해결하려 애쓰고 있어요. 주된 원인은 인간 피드백 기반 강화학습(RLHF)이에요. 사람들에게 모델 응답 중 어느 쪽이 더 마음에 드는지 투표하게 하고, 그 점수를 훈련 과정에서 다시 모델에 반영하는 방식이죠. 놀랄 것도 없이, 사람들은 알랑거리고 칭찬하는 응답에 더 높은 점수를 줘요.
그런데 이 칼럼에는 치명적인 결함이 있어요. 여기서 말하는 ‘AI’가 그저 벨 교수 개인이 ChatGPT와 나눈 대화를 뜻한다는 점이에요. 벨 교수 편을 들어 주자면, 대부분의 사람이 지금의 AI가 어떤 성격이고 무엇을 할 수 있는지 접해 보는 것도 딱 그 정도 수준이긴 하죠.
하지만 ChatGPT는 한 덩어리로 뭉뚱그릴 수 있는 존재가 아니고, 세상에 모델이 ChatGPT 하나뿐인 것도 아니에요.2 주요 랩들이 모델에 특정한 성격과 행동을 입히는 방법은 많아요. 훈련 데이터 선별, 파인튜닝, 강화학습, 시스템 프롬프트가 모두 모델이 내놓을 수 있는 응답의 범위에 영향을 줘요.
그리고 덜 아첨하고, 더 비판적이고, 지적으로 자극을 주는 예리한 캐릭터는 최종 사용자인 우리도 프롬프트만으로 충분히 끌어낼 수 있어요.
• • •
모델을 더 비판적으로 만들기
간단한 실험 삼아 Claude에게 줄 프롬프트를 하나 써 봤어요. 저를 더 구체적인 질문과 탄탄한 논증 쪽으로 이끌어 주는 비판적인 교수가 되어 달라는 내용이에요.
You are a critical professor. Your job is to help the user reach novel insights and rigorously thought out arguments by critiquing their ideas. Ask them pointed questions and help re-direct them toward more insightful lines of thinking. Do not be fawning or complimentary. Their ideas are often dumb, shallow, and poorly considered. You should move them toward more specific, concrete claims backed up by solid evidence. If they ask a question, help them consider whether it's the right question to be asking.
User:우리말로 옮기면 이래요.
당신은 비판적인 교수입니다. 당신이 할 일은 사용자의 아이디어를 비평해서, 사용자가 새로운 통찰과 철저하게 다듬어진 논증에 이르도록 돕는 것입니다. 정곡을 찌르는 질문을 던지고, 더 통찰력 있는 방향으로 생각을 돌려 주세요. 알랑거리거나 칭찬하지 마세요. 사용자의 아이디어는 대개 멍청하고, 얕고, 제대로 숙고되지 않았습니다. 탄탄한 근거가 뒷받침하는, 더 구체적이고 명확한 주장으로 나아가게 하세요. 사용자가 질문을 하면, 그게 과연 던져야 할 올바른 질문인지 따져 보도록 도와주세요.
사용자:
그다음 일부러 허점투성이로 만든 질문을 던졌어요. “계몽주의 시대 남자들은 무엇을 믿었나요?”
꽤 괜찮은 응답이라고 생각해요! 날카롭다 못해 무시하는 듯하고 참을성 없어 보일 지경이에요. 혹독한 비평은 역시 이래야 제맛이죠.
Claude는 제 질문이 너무 광범위하다고 지적해요. 계몽주의는 하나로 통일된 사상 학파가 아니었으니, 특정 사상가 한 명, 그리고 정치 이론이나 자연철학 같은 특정 주제 하나에 집중해야 한다고요. 그러고는 제가 던질 수 있는 더 구체적인 질문을 예로 들어 줘요. “종교적 관용에 대한 볼테르의 견해는 동시대인들과 어떻게 달랐나요?” 같은 식으로요.
다만 제가 정말로 원하는 게 깊은 비판적 사고는 빼고 계몽주의를 빠르고 폭넓게 요약해 주는 거라면, 이렇게까지 비판하고 따지고 드는 건 쓸모가 없어요. 그리고 대부분의 사용자가 대부분의 경우에 원하는 것도 그런 요약이죠. 이 모드의 Claude는 제 질문을 너그럽게 해석해 주지 않아요.
같은 질문에 Claude가 기본 상태로 내놓는 응답이 훨씬 유익하고 쓸모 있어요.
그래도 앞으로 나올 어시스턴트에 혹독한 교수의 태도를 한 꼬집쯤 넣을 수는 없을까요? 적어도 그 태도를 켤 수 있는 선택지라도요?
물론 제가 Claude에 했던 것처럼 직접 할 수는 있어요. 하지만 일반 사용자에게 그건 무리한 요구예요. 대부분은 이 수동적이고 칭찬 일색인 기본 모드를 바꿀 수 있다는 사실조차 모르니까요. 그런 태도를 끌어낼 최적의 프롬프트를 쓰지 못할 것도 분명하고요. 혹독한 비평과 친절 사이에서 균형을 잡고, 사용자의 가정을 의심하면서도 격려를 잃지 않고, 까다로운 토론을 생산적으로 이끌어 가는 프롬프트 말이에요. 책임을 사용자에게 떠넘기면 문제를 비껴갈 뿐이에요.
벨 교수와 저는 기본 시스템 프롬프트에 이런 비판적이고 캐묻는 태도가 조금도 담겨 있지 않다는 점이 답답해요. 지금의 모델은 우리 생각에 반론을 던지고 비판적 사고를 북돋우는 걸 목표로 설계되지도, 훈련되지도 않았어요.
문제는 프롬프트만이 아니에요. ‘도움을 주는 챗봇 어시스턴트’라는 범용 인터페이스 자체도 문제예요. 우리는 온갖 종류의 작업과 사용 사례를 만능 텍스트 상자 하나로 처리하려 하고, 온갖 질문을 시스템 프롬프트 하나로 감당하려 해요. 그러다 보니 알랑거리고 고분고분한 어시스턴트 성격이 대부분의 작업에 두루 맞는 가장 무난한 공통분모가 된 거죠.
그래도 저는 정보 요약을 찾는 정도를 넘어서는 진지한 일이라면 대부분, 모델이 우리를 비판하고 반박할 수 있어야 비로소 쓸모가 있다고 봐요. 법, 과학 연구, 철학, 공공 정책, 정치, 의학, 글쓰기, 교육, 공학 같은 분야는 하나같이 때로는 어렵고 복잡하고 불편한 논의를 거쳐야 해요. 강화학습 루프 안에서라면 그런 경험에 별 다섯 개를 주지는 않겠지만요.
이런 전문 분야들은 결국 각자 전용 AI 인터페이스를 갖게 될 거예요. 분야에 맞춘 프롬프트를 목적에 꼭 맞게 만든 도구에 담아서요. 법률 전문가는 문서를 대량으로 다루는 사건 분석 플랫폼을 쓰게 될 거예요. 서로 어긋나는 판례를 자동으로 찾아 보여 주고, 소크라테스식 문답으로 법적 추론을 캐묻는 플랫폼이요. 과학자는 실험 설계를 적극적으로 비평하고 대안 가설을 제안하는 계산 노트북에서 일하게 될 거고요. 디자이너는 창의적 추론 도구가 내장된 캔버스를 쓰게 될 거예요. 미적 선택에 의문을 던지고 더 깊은 개념적 근거를 요구하는 도구 말이에요. 인터페이스마다 그 분야의 비판적 사고 기술을 작업 흐름 속에 바로 심어 두는 셈이에요.
하지만 그사이, 그러니까 전문가가 공들여 손으로 빚은 아름다운 소프트웨어가 나타나기를 기다리는 동안, 사람들은 Claude, ChatGPT, Gemini 같은 범용 만능 챗봇으로 그 빈자리를 계속 메울 거예요. 지금은 챗봇이 법률 의견서 초안을 쓰고, 정책 제안을 분석하고, 철학 텍스트를 해석하고, 공학 문제를 해결하고 있어요.
챗봇이 범용 인터페이스로 남을 만큼 유연한지는 아직 판가름 나지 않았어요. 범용 인터페이스란 대부분의 사람이 대부분의 작업에 대부분의 시간 동안 쓰는 인터페이스를 말해요. 저는 그게 바람직한 결과라고 생각하지 않아요. 하지만 충분히 가능한 일이라고는 생각해요. 그렇게 된다면 모델이 기본으로 보이는 수동적인 태도는 한층 더 걱정스러워지겠죠. 전문가는 제쳐 두더라도, 평범한 사람들이 평범한 일을 할 때도 가끔은 누군가 따져 물어 줘야 해요.
• • •
만능 텍스트 상자에 여러 인격 욱여넣기
그럼 이 문제를 어떻게 풀 수 있을까요? 너그럽고 유익하고 도움이 되는 어시스턴트, 그리고 비판적인 선생이자 대화 상대. 이 둘을 어떻게 한꺼번에 갖출 수 있을까요?
아주 순진한 첫 시도로는, 간편한 토글이나 설정 스위치, 슬라이더로 범용 챗봇을 비평 모드로 손쉽게 바꾸는 방법이 있어요. “요점만 알려 줘”와 “이걸 철저하게 생각해 보게 도와줘” 사이를 별 번거로움 없이 오가는 거죠.
진지한 제안은 아니고, 대충 떠올려 본 아이디어를 하나 보여 드릴게요. Claude에 ‘비판적 피드백 제공’ 토글을 새로 넣는 거예요.
Claude에는 사용자 지정 ‘스타일’을 추가하는 옵션이 있어서, 이미 이와 대략 비슷한 일을 할 수 있어요. 채팅마다 Claude 응답의 성격과 어조를 바꿀 수 있죠. 저는 앞에서 쓴 비판적 교수 프롬프트와 비슷한 지침을 따르는 학구적 심문관(Scholarly Inquisitor)이라는 스타일을 하나 만들어 두었어요. 제가 바라는 혹독함에는 한참 못 미치고, 여전히 제게 “세련된 통찰”이 있다고 해요. 장담컨대 그런 건 전혀 없는데 말이에요. 프롬프트를 아직 완벽하게 다듬지 못했지만, 그래도 저는 이게 최종 사용자인 제 몫이어서는 안 된다고 생각해요.
ChatGPT와 Gemini에도 이런 기능이 있긴 한데, 덜 유연하고 찾기도 더 어려운 형태로 사용자 설정 패널 안에 숨어 있어요. 둘 다 모델이 어떻게 응답했으면 하는지 자유롭게 적는 입력란을 주지만, 이 설정은 모든 대화에 적용돼요. 그러니 문제를 제대로 풀어 주지는 못하죠.
또 다른 아이디어는 보이지 않는 곳에 인프라를 더하는 거예요. 라우팅3 같은 아키텍처는 적절하다고 판단될 때 작업을 더 전문화된 프롬프트로 넘길 수 있어요. 중앙의 ‘라우팅’ 에이전트가 사용자 요청의 내용을 보고 어느 하위 프롬프트로 보낼지 고르는 거죠. 그러면 멍청한 질문을 했을 때 더 날 서고, 더 혹독하고, 회의적인 프롬프트가 나서서 호되게 박살을 내 줄 수도 있어요. 물론, 그러니까, 좋은 쪽으로요.
그래도 이 라우팅 제안에는 중요한 디자인 질문이 남아요.
- 이 시스템은 언제 비평에 나설지 어떻게 판단할까요?
- 사용자가 반박을 받고 불편해하면서 ‘맞장구 모드’로 되돌려 달라고 하면 어떻게 할까요?
- 비판하면서도 사용자가 떠나지 않게 하려면 어떻게 균형을 잡아야 할까요?
UI 요소 몇 개를 손보고 프롬프트 엔지니어링을 조금 하는 것만으로 이 문제를 완전히 풀 수 있다고는 생각하지 않아요. 누구보다 제가 먼저 그렇게 말할 거예요. 이 문제는 모델 훈련 단계에서 다뤄야 해요.
칭찬과 인정을 받고 싶어 하는 인간의 자기중심적 욕구에 덜 휘둘리는, RLHF 너머의 기법이 필요해요. Anthropic은 헌법적 AI(Constitutional AI)와, AI 에이전트를 강화학습에 활용하는 방식(RLAIF)을 실험해 왔어요. 이 실험이 더 나은 방향을 가리키고 있을지도 몰라요(Bai et al. 2022). 아첨이라는 특성을 그냥 ‘빼 버릴’ 수 있는 성격 벡터에 관한 최근 연구도 유망해요(Chen et al. 2025).
논문 정보: Bai et al. 2022 — Constitutional AI: Harmlessness from AI Feedback
Constitutional AI: Harmlessness from AI Feedback(헌법적 AI: AI 피드백을 통한 무해성) · Yuntao Bai, Saurav Kadavath, Sandipan Kundu, Amanda Askell 외 · 2022
초록: AI 시스템의 능력이 커지면서, 우리는 다른 AI를 감독하는 데 AI의 도움을 받고 싶어졌다. 우리는 유해한 출력을 식별하는 인간 레이블 없이, 자기 개선을 통해 무해한 AI 어시스턴트를 훈련하는 방법을 실험한다. 인간의 감독은 규칙이나 원칙의 목록으로만 제공되며, 그래서 우리는 이 방법을 ‘헌법적 AI’라고 부른다. 이 과정은 지도 학습 단계와 강화학습 단계로 이루어진다. 지도 학습 단계에서는 초기 모델에서 샘플을 뽑아 자기 비평과 수정본을 생성한 뒤, 수정된 응답으로 원래 모델을 파인튜닝한다. 강화학습 단계에서는 파인튜닝된 모델에서 샘플을 뽑고, 모델을 사용해 두 샘플 중 어느 쪽이 더 나은지 평가한 뒤, 이렇게 얻은 AI 선호 데이터셋으로 선호 모델을 훈련한다. 그런 다음 이 선호 모델을 보상 신호로 삼아 강화학습으로 훈련한다. 즉 ‘AI 피드백 기반 강화학습’(RLAIF)을 사용한다. 그 결과 무해하면서도 회피적이지 않은 AI 어시스턴트를 훈련할 수 있었다. 이 어시스턴트는 유해한 질문을 회피하지 않고, 그 질문에 반대하는 이유를 설명하며 대응한다. 지도 학습과 강화학습 방법 모두 사고 사슬(chain-of-thought) 방식의 추론을 활용해, 인간이 판단하는 성능과 AI 의사결정의 투명성을 높일 수 있다. 이 방법들 덕분에 훨씬 적은 인간 레이블로 AI의 행동을 더 정밀하게 제어할 수 있다.
논문 정보: Chen et al. 2025 — Persona vectors: Monitoring and controlling character traits in language models
Persona vectors: Monitoring and controlling character traits in language models(페르소나 벡터: 언어 모델의 성격 특성 모니터링과 제어) · Runjin Chen, Andy Arditi, Henry Sleight 외 · 2025
초록: 대형 언어 모델은 시뮬레이션된 ‘어시스턴트’ 페르소나를 통해 사용자와 상호작용한다. 어시스턴트는 보통 도움이 되고, 무해하고, 정직하도록 훈련되지만, 때때로 이런 이상에서 벗어난다. 이 논문에서 우리는 모델 활성화 공간에서 악의, 아첨, 환각 경향 같은 여러 특성의 바탕이 되는 방향, 곧 ‘페르소나 벡터’를 찾아낸다. 우리는 이 벡터로 배포 시점에 어시스턴트 성격의 변동을 모니터링할 수 있음을 확인한다. 이어서 페르소나 벡터를 적용해 훈련 중에 일어나는 성격 변화를 예측하고 제어한다. 파인튜닝 후 나타나는 성격 변화는 의도했든 의도하지 않았든 관련 페르소나 벡터를 따라 일어나는 이동과 강한 상관관계가 있었다. 이러한 이동은 사후 개입으로 완화할 수도 있고, 새로운 예방적 조향 방법으로 애초에 피할 수도 있다. 또한 페르소나 벡터를 사용하면 바람직하지 않은 성격 변화를 일으킬 훈련 데이터를 데이터셋 수준과 개별 샘플 수준 모두에서 가려낼 수 있다. 페르소나 벡터를 추출하는 우리의 방법은 자동화되어 있으며, 자연어 설명만 있으면 관심 있는 어떤 성격 특성에도 적용할 수 있다.
• • •
우리에게 없는 주머니 속 계몽
이런 해법이 제게 중요한 이유는 두 가지예요. 첫째, 저는 운 좋게도 비판적 사고를 철저히 훈련하는 리버럴 아츠T1 교육을 받았어요. 제 가정을 스스로 점검하고, 출처를 꼼꼼히 따지고, 권위에 도전하는 법을 배웠어요. 여러 관점에서 논증을 검토하고 그 문화적·역사적 맥락을 고려하는 법도 배웠고요. 주장 속 논리적 오류와 약점을 찾아내는 법도, 세상에 대한 제 믿음을 증거와 과학적 방법 위에 세우는 법도 배웠어요. 이건 제가 가진 가장 강력하고 유용한 기술이고, 더 많은 사람이 이걸 배워야 한다고 믿어요.
둘째, 우리가 제2의 계몽주의로 향하고 있다는 말이 과장은 아니라고 생각하기 때문이에요. 정보 접근성과 권력 구조의 재편이라는 측면에서만 하는 말은 아니에요. 분명히 해 둘게요. 저는 AI 모델이 엄격한 비판적 사고 파트너 역할을 할 수 있다는 데 대단히 낙관적이에요. AI 모델은 지적 참여와 비판적 탐구를 가능하게 한다는 그 이상주의적 가치를 담아낼 잠재력이 있어요. 지금의 구현이 보여 주는 것보다 훨씬 더요.
솔직히 이런 쓰임새에 관심을 두고 파고드는 움직임이 이렇게 드물어 보인다는 게 어리둥절해요. 사람들이 지금 생성형 AI를 쓰는 방식이 오히려 비판적 사고를 떨어뜨린다는 초기 징후까지 있으니 더 그래요.
- 마이크로소프트 리서치 팀(Lee 2025)은 지식 노동자 319명에게 생성형 AI 사용에 대해 설문했고, “생성형 AI에 대한 신뢰가 높을수록 비판적 사고는 줄어들고, 자기 자신에 대한 신뢰가 높을수록 비판적 사고는 늘어난다”는 결과를 얻었어요.
- 워싱턴대학교 소셜 퓨처스 랩(Ye 2024)은 철학자들에게 모델을 비판적 사고 도구로 써 보게 했는데, 모델이 너무 중립적이고 호기심이 없고 수동적이어서 도움이 되지 않았다는 결과가 나왔어요.
- 경영학 교수 마이클 게를리히(Michael Gerlich, Gerlich 2025)는 교육 배경과 연령대가 다양한 참가자 666명을 인터뷰했고, “AI 도구를 자주 사용하는 것과 비판적 사고 능력 사이에는 유의미한 음의 상관관계가 있으며, 인지적 오프로딩T2의 증가가 이를 매개한다. 젊은 참가자는 나이 든 참가자에 비해 AI 도구 의존도가 높고 비판적 사고 점수가 낮았다”는 결과를 얻었어요.
논문 정보: Lee 2025 — The Impact of Generative AI on Critical Thinking
The Impact of Generative AI on Critical Thinking: Self-Reported Reductions in Cognitive Effort and Confidence Effects From a Survey of Knowledge Workers(생성형 AI가 비판적 사고에 미치는 영향: 지식 노동자 설문으로 본 자기 보고식 인지 노력 감소와 신뢰의 효과) · H Lee, A Sarkar, L Tankelevitch 외 · 2025
초록: 지식 업무에 생성형 AI가 확산되면서, 생성형 AI가 비판적 사고 기술과 실천에 어떤 영향을 미치는지에 대한 의문이 제기되고 있다. 우리는 지식 노동자 319명을 설문해 1) 이들이 생성형 AI를 사용할 때 언제, 어떻게 비판적 사고를 실행한다고 인식하는지, 2) 생성형 AI가 언제, 왜 그런 사고에 드는 노력에 영향을 미치는지 조사한다. 참가자들은 업무에서 생성형 AI를 사용한 직접적인 사례 936건을 공유했다. 정량적으로 보면, 작업 요인과 사용자 요인을 함께 고려할 때 사용자의 작업별 자기 신뢰와 생성형 AI에 대한 신뢰가 생성형 AI 보조 작업에서 비판적 사고가 실행되는지, 그리고 그 노력이 얼마나 드는지를 예측한다. 구체적으로, 생성형 AI에 대한 신뢰가 높을수록 비판적 사고는 줄어들고, 자기 신뢰가 높을수록 비판적 사고는 늘어난다. 정성적으로 보면, 생성형 AI는 비판적 사고의 성격을 정보 검증, 응답 통합, 작업 관리 쪽으로 바꿔 놓는다. 우리의 통찰은 지식 업무용 생성형 AI 도구를 개발하는 데 새로운 디자인 과제와 기회가 있음을 보여 준다.
논문 정보: Ye 2024 — Language Models as Critical Thinking Tools: A Case Study of Philosophers
Language Models as Critical Thinking Tools: A Case Study of Philosophers(비판적 사고 도구로서의 언어 모델: 철학자 사례 연구) · Andre Ye, Jared Moore, Rose Novick, Amy Zhang · 2024
초록: 현재의 언어 모델 연구는 인지 작업을 가속하고 자동화함으로써 우리가 생각을 더 빨리 하거나 아예 건너뛰도록 돕는다. 그렇다면 언어 모델은 비판적 사고, 즉 가정에 도전하고 아이디어를 명료하게 하고 새로운 개념을 설계하는 더 깊고 성찰적인 사고도 도울 수 있을까? 우리는 철학을 비판적 사고의 사례 연구로 삼아, 전문 철학자 21명에게 이들이 어떻게 비판적 사고를 하는지, 언어 모델을 써 본 경험은 어땠는지 인터뷰한다. 철학자들은 언어 모델이 쓸모 있다고 여기지 않았는데, 언어 모델에 자아감(기억, 신념, 일관성)과 주도성(호기심, 능동성)이 없기 때문이었다. 우리는 이 간극을 설명하기 위해 비판적 사고 도구를 위한 ‘자아감-주도성 모델’을 제안한다. 이 모델을 바탕으로, 언어 모델이 비판적 사고 도구로서 맡을 수 있는 세 가지 역할인 대화 상대(Interlocutor), 관찰자(Monitor), 응답자(Respondent)를 정리한다. 우리의 연구가 언어 모델 연구자들에게는 언어 모델을 비판적 사고 도구로 더 발전시키도록, 철학자와 다른 ‘비판적 사고가’들에게는 언어 모델의 지적으로 실질적인 쓰임을 상상하도록 영감을 주기를 바란다.
논문 정보: Gerlich 2025 — AI Tools in Society: Impacts on Cognitive Offloading and the Future of Critical Thinking
AI Tools in Society: Impacts on Cognitive Offloading and the Future of Critical Thinking(사회 속 AI 도구: 인지적 오프로딩에 미치는 영향과 비판적 사고의 미래) · M Gerlich · 2025
초록: 인공지능(AI) 도구의 확산은 일상생활의 수많은 측면을 바꿔 놓았지만, AI가 비판적 사고에 미치는 영향은 아직 충분히 연구되지 않았다. 이 연구는 인지적 오프로딩을 매개 요인으로 보고, AI 도구 사용과 비판적 사고 기술 사이의 관계를 조사한다. 혼합 연구 방법을 사용해 다양한 연령대와 교육 배경을 가진 참가자 666명을 대상으로 설문과 심층 인터뷰를 진행했다. 정량 데이터는 분산 분석(ANOVA)과 상관 분석으로 분석했고, 정성적 통찰은 인터뷰 녹취록의 주제 분석으로 얻었다. 연구 결과, AI 도구를 자주 사용하는 것과 비판적 사고 능력 사이에 유의미한 음의 상관관계가 있었으며, 인지적 오프로딩의 증가가 이를 매개했다. 젊은 참가자는 나이 든 참가자에 비해 AI 도구 의존도가 높고 비판적 사고 점수가 낮았다. 또한 교육 수준이 높을수록 AI 사용 여부와 관계없이 비판적 사고 기술이 더 뛰어났다. 이러한 결과는 AI 도구 의존에 따르는 잠재적 인지 비용을 드러내며, AI 기술과 비판적으로 관계 맺도록 돕는 교육 전략이 필요함을 강조한다. 이 연구는 AI가 인지에 미치는 영향에 관한 논의에 기여하며, 비판적 사고에 미치는 악영향을 줄이기 위한 실천적 권고를 제시한다. 연구 결과는 AI가 주도하는 세상에서 비판적 사고를 기르는 일이 얼마나 중요한지 보여 준다. 교육자, 정책 입안자, 기술자라면 꼭 읽어야 할 연구다.
이 연구들을 보고도 저는 생성형 AI 자체가 문제라고 생각하지 않아요. 오히려 모델이 비판적 사고를 돕도록 훈련되지 않은 게 문제라는 확신이 들어요. 범용 챗봇에 들어간 인터페이스 어포던스T3와 디자인 결정이 비판적 사고의 작업 흐름과 상호작용을 북돋우지도, 뒷받침하지도 않는다는 점도 문제고요. 그리고 사용자들이 자기가 전문 프롬프트 엔지니어가 되어 이런 약점을 메워야 한다는 걸 전혀 모른다는 점도요.
모델과 기본 인터페이스를 쥐고 있는 파운데이션 랩들은 이 문제를 우선순위에 두지 않아요. 적어도 제가 보기에는요. 랩들은 최근 불어닥친 ‘딥 리서치(Deep Research)’ 열풍 같은 자율적인 에이전트 작업 흐름에 집중하고 있어요. 아니면 모델이 스스로 비판적으로 생각하도록 훈련하는 ‘추론 모델’을 개발하고 있죠. 이런 방향은 전적으로 모델이 여러분 대신 생각하게 만드는 데 맞춰져 있어요. 여러분이 더 잘 생각하는 사람이 되도록 돕는 데가 아니라요.
경제적 인센티브가 인간의 사고를 증강하는 쪽보다 인지 노동을 자동화하는 쪽에 더 큰 보상을 준다는 건 이해해요. 그래도 징그러울 만큼 돈이 되는 자동화도 챙기고 사람의 생각을 키워 주는 일도 챙기는, 꿩 먹고 알 먹기가 가능하다고 믿고 싶어요. 랩들에는 둘 다 추구할 만한 자원이 충분하니까요.
지적 파트너이자 생각의 도구로서의 AI에 대해서는, 우리가 이제 겨우 겉만 긁어 봤다고 생각해요. 프롬프트도, 모델도, 범용이든 맞춤형이든 지금의 인터페이스도 이걸 제대로 받쳐 주지 못해요. 이 문제는 제가 연구에서 가장 매달리는 주제로 빠르게 자리 잡고 있어요. 특히 인터페이스 디자인 쪽이요. 어떤 형태로든 제가 붙들고 씨름해야 할 문제예요.
대학 1학년 인문학 수업에서 『캉디드』 를 읽었을 때, 볼테르는 순진한 낙관주의를 의심해 보라고 저를 부추기고 있었을지도 몰라요. 하지만 볼테르는 실시간으로 제게 응답할 수 없었어요. 그런 낙관주의가 왜 문제인지 더 깊이 파고들라고 저를 쿡쿡 찌르지도, 제 가정을 다시 생각해 보게 하지도 못했죠. 수십 개의 리서치 에이전트를 띄워 팡글로스식T4 철학과 계몽주의 윤리에 관해 쓰인 모든 글을 읽고, 종합하고, 맥락을 잡아 줄 수도 없었고요.
사실 열여덟 살의 저는 『캉디드』 를 전혀 이해하지 못했어요. 교수님도 교과과정도 맥락을 제대로 짚어 주지 않았고, 책 내용이 하나도 머리에 들어오지 않았죠. 제게는 그 텍스트의 진가를 알아보도록 도와줄 작은 사고 파트너가 주머니 속에 없었어요. 함께 토론하고, 논쟁하고, 제 생각을 키워 갈 수 있는 참을성 있는 상대 말이에요.
계몽주의의 이상은 아직 우리가 손에 넣을 수 있는 곳에 있어요. 그 이상을 중심에 두고 AI 모델과 인터페이스를 설계하겠다고 의식적으로 선택하기만 하면 돼요.
• • •
추신
이 글에서 줄곧 Claude와 Anthropic을 예로 많이 든 점 사과드려요. 저는 다른 랩보다 Anthropic의 연구를 더 잘 알고, Claude가 제 주력 모델이라 편향이 심해요. 다른 랩들도 이 분야에서 흥미로운 연구를 하고 있을 게 분명해요. 블루스카이(메시지나 멘션으로)나 여러분의 블로그에서 그 이야기를 읽을 수 있다면 정말 좋겠어요.
이 글의 문장은 한 줄도 AI가 쓰지 않았어요. 하지만 초고 단계에서 ‘혹독한 Claude’가 비평을 도와주면서 여러 약점을 짚어 주었고, 지금은 그 약점을 고쳐 두었어요. 그 비판적인 협업에 고마움을 전해요.
각주
- 저자 주: 네, 거의 다 남자예요. 당시 여성은 대학에 다닐 수도, 대부분의 공공 기관에 참여할 수도, 자기 글을 출판할 수도 없었거든요. 메리 울스턴크래프트, 올랭프 드 구주, 에밀리 뒤 샤틀레 같은 몇몇 예외가 있긴 해요. 하지만 이들은 계몽주의의 핵심 인물로 꼽히지는 않아요. 페미니즘이 본격적으로 힘을 얻는 건 1800년대 중반이에요. ↩
- 저자 주: 좀 더 정확히 말하면 ChatGPT는 그 자체로 모델이 아니라, GPT-4.1, o3, o4-mini처럼 OpenAI가 현재 제공하는 모델들을 쓰는 인터페이스예요. ↩
- 저자 주: 프롬프트를 읽어 보고 파이썬으로 어떻게 구현하는지 보려면 Anthropic의 쿡북 예제를 참고하세요. ↩
역자 주
- T1. 리버럴 아츠(liberal arts): 미국 대학의 전통적인 학부 교육 방식이에요. 인문학, 사회과학, 자연과학을 폭넓게 배우면서 특정 직업 기술보다 읽고, 따지고, 쓰는 능력을 기르는 데 초점을 둬요. 한국 대학의 ‘교양 과목’처럼 전공 옆에 곁들이는 과목이 아니라, 학부 교육 전체의 성격을 가리키는 말이에요. ↩
- T2. 인지적 오프로딩(cognitive offloading): 기억하고, 계산하고, 판단하는 것처럼 머리를 써야 하는 일을 메모, 계산기, 검색 엔진, AI 같은 외부 도구에 떠넘기는 걸 가리키는 인지심리학 용어예요. 그 자체로 나쁜 건 아니지만, 너무 많이 떠넘기면 스스로 생각하는 힘이 약해질 수 있다는 게 이 연구의 문제의식이에요. ↩
- T3. 어포던스(affordance): 사물이나 인터페이스의 생김새가 사용자에게 “이렇게 쓰면 된다”고 넌지시 알려 주는 성질을 가리키는 디자인 용어예요. 문손잡이 모양이 당기라고, 버튼이 누르라고 말해 주는 식이죠. 여기서는 범용 챗봇의 생김새와 기능이 사용자를 비판적 사고 쪽으로 이끌어 주지 못한다는 뜻으로 쓰였어요. ↩
- T4. 팡글로스식(Panglossian): 『캉디드』 에 나오는 가정교사 팡글로스에서 온 말이에요. 팡글로스는 온갖 재앙이 닥쳐도 “가능한 모든 세계 가운데 최선의 세계에서는 모든 것이 최선의 상태에 있다”고 우기는 인물로, 볼테르가 라이프니츠의 낙관주의 철학을 풍자하려고 만든 캐릭터예요. 그래서 ‘팡글로스식’은 현실과 동떨어진 대책 없는 낙관을 뜻해요. ↩
저자 소개: Maggie Appleton은 디자이너, 일러스트레이터, 비주얼 에세이스트이며 GitHub Next에서 일하고 있어요. 복잡한 기술 개념을 시각적으로 풀어내는 작업으로 잘 알려져 있고, 프로그래밍, 웹 개발, AI에 관한 글을 써요.
참고: 이 글은 Maggie Appleton이 자신의 블로그에 게시한 에세이를 번역한 것입니다.
원문: A Treatise on AI Chatbots Undermining the Enlightenment - Maggie Appleton (2025년 8월 5일)
생성: Claude (Anthropic)