본문으로 건너뛰기

스킬에 반대하며

게시일: 2026년 9월 24일 | 원문 작성일: 2026년 7월 16일 | 저자: Laura Entis | 원문 보기

16비트 픽셀 아트. 청록색 로봇이 등에 게임 카트리지를 위태롭게 쌓아 올린 채 버티고, 발판에 선 감사원이 금빛으로 빛나는 카트리지 하나를 들어 살펴보며 세 개의 상자에 나누어 담는다

핵심 요약

X(옛 트위터)에서는 거대한 스킬 라이브러리가 일종의 과시 수단이 됐지만, 최신 모델에게는 스킬이 오히려 방해가 될 수 있어요.

  • 대부분의 스킬은 효과가 없어요: 공개 스킬 49개를 시험한 벤치마크에서 성능을 올린 건 7개뿐이었어요. 39개는 영향이 없었고, 3개는 오히려 역효과를 냈어요.
  • 스킬에도 유통기한이 있어요: 모델의 약점을 메우던 지시문은 다음 버전이 그 능력을 흡수하는 순간 쓸모없어지거나 해로워져요. 오래가는 건 내부 데이터, 템플릿, 개인 취향처럼 모델이 알 수 없는 비공개 정보를 담은 스킬이에요.
  • 스킬을 만들었다면 효과를 증명하세요: 이상적인 결과물 예시(골든 데이터셋)를 모으고, 평가를 좁은 지표로 쪼개 자동화하고, 스킬을 켰을 때와 껐을 때의 결과를 비교해 보세요.
  • 살아남은 스킬도 있어요: OpenClaw의 autoreview는 코드 리뷰를 다른 모델에게 맡겨요. 한 개발자는 이 스킬 덕분에, 자는 동안 에이전트가 만들어 둔 기능을 처음으로 큰 수정 없이 병합했어요.

• • •

스킬 때문에 AI가 더 나빠지고 있을지도 몰라요

공들여 쌓아 올린 스킬 라이브러리를 한번 점검해 볼 때가 된 것 같아요. 스킬은 지시문을 재사용할 수 있게 묶어 둔 꾸러미예요. 예시나 도구가 함께 들어 있기도 하고, AI에게 시킨 일과 관련이 있을 때마다 불려 와요. 취지는 에이전트의 성능을 끌어올리는 데 있고요. Anthropic이 대중화한 이 형식은 요즘 X에 넘쳐나요. 거기서는 끝없이 불려 놓은 맞춤 스킬 라이브러리를 일종의 과시 수단처럼 내보이죠.

Every의 기술 컨설팅 책임자 마이크 테일러(Mike Taylor)는 어떤 스킬이든 결과를 개선한다는 게 증명돼야 라이브러리에 남을 자격이 있다고 봐요. 그의 주장은 이래요. 프런티어 모델이 충분히 똑똑해진 덕에, 소셜 미디어에서 유행하는 스킬 대부분이 맡던 역할을 모델이 이미 흡수했다는 거예요. 모델이 혼자 추론해서 해낼 수 있는 일이라면(그리고 Fable 5나 GPT-5.6이라면 아마 해낼 거예요) 지시문을 더 얹어 봐야 명확해지기는커녕 혼란만 생겨요. 마이크는 이렇게 말해요. “모델이 훈련받은 대로가 아니라 여러분 방식대로 하라고 억지로 밀어붙이는 건, 모델의 가중치T1와 싸우는 거예요.” 여러분의 지시가 모델의 훈련과 어긋날 때마다 모델은 실수할 가능성이 커져요. 게다가 스킬이 불러오는 텍스트가 늘어나는 만큼 비용도 불어나요. 그러니 쓰기로 한 스킬이 하나하나 제값을 하는지 확인해야 해요.

마이크는 스킬이 여전히 쓸모 있다고 말해요. 다만 모델이 워크플로를 꼭 특정한 방식으로 끝내야 할 때에 한해서예요. 브랜드 스타일 가이드 지침을 담은 맞춤 파워포인트 템플릿을 만들거나, 회사 내부 데이터를 참조하는 경우가 그렇죠. 마이크는 최근 Fable 5를 시험하다가, Opus 4.8이 실수를 피하는 데 필요했던 스킬 일부가 새 모델의 성능을 도리어 떨어뜨린다는 걸 알게 됐어요. 2023년에 프롬프트 엔지니어로 일하던 시절이 떠올랐다고 해요. “GPT-3 때는 제대로 돌아가는 코드를 얻으려면 온갖 꼼수와 마법 주문 같은 문구를 동원해야 했어요. 그러다 GPT-4가 나오니 지시를 더 잘 따르더라고요. 그동안 모아 둔 요령이 필요 없어졌죠.”

왜 중요할까요?

데이터도 그의 말을 뒷받침해요. SWE-Skills-Bench는 에이전트 스킬이 정말로 에이전트의 소프트웨어 엔지니어링 실력을 높여 주는지 따져 보는 연구용 벤치마크예요. 여기서 공개된 소프트웨어 엔지니어링 스킬 49개를 시험해 봤더니, 39개는 성능에 아무 영향이 없었고 3개는 오히려 역효과를 냈어요. 그런가 하면 상당수 스킬은 결과를 개선하지도 못하면서 연산만 더 잡아먹었어요. (최악의 스킬은 토큰 사용량을 451퍼센트나 늘렸어요.)

결과를 개선한 스킬은 7개뿐이었어요. 연구진에 따르면 이 스킬들은 하나같이 금융 리스크 공식이나 교통 관리 지침처럼 모델 혼자서는 내놓을 수 없는 전문 지침을 담고 있었어요.

SWE-Skills-Bench 결과스킬 수
결과 개선7개
영향 없음39개
역효과3개
합계49개

무슨 의미일까요?

스킬의 쓸모에는 유통기한이 있어요. 모델의 사각지대를 메우던 지시문은 새 버전 모델이 그 능력을 흡수하는 순간 필요 없어지거나, 아예 역효과를 내기도 해요. 오래가는 스킬은 여러분의 사업이나 일하는 방식에 관해, 공개된 적이 없어서 모델이 알 수 없었던 정보를 알려 주는 스킬이에요. 글쓰기 스타일에 관한 개인 취향, 회사 고유의 템플릿, 회사 내부 데이터, 정확한 작업 순서 같은 것들이죠. 남이 만든 스킬을 쓸 때는 만든 사람이 꾸준히 업데이트하고 군더더기를 쳐내는지 확인하세요.

이번 주에 해 보세요: 스킬 점검

  • 남기기: 비공개 맥락, 맞춤 도구 연결, 개인 취향, 회사 고유의 워크플로처럼 회사 밖 사람은 모를 내용을 담은 스킬
  • 다시 시험하기: 현재 모델의 일반적인 약점이나 버릇을 보완하는 스킬. 모델이 좋아지면 유통기한이 지나 버릴 가능성이 커요.
  • 정리하기: 결과를 개선한다는 게 입증되지 않은 스킬. 즐겨 쓰는 AI 에이전트에게 같은 프롬프트를 스킬을 켜고 한 번, 끄고 한 번 돌린 뒤 결과를 비교해 달라고 하면 돼요.

• • •

스킬을 평가해서 원하는 결과가 나오는지 확인하세요

“스킬을 잔뜩 만드는 건 보여 주기식 생산성에 그치지 않아요. 오히려 성능을 해치고 있을 수도 있어요. 스킬을 만들 거라면 효과가 있다는 걸 증명하세요.” 마이크 테일러의 말이에요.

마이크가 실제로 증명하는 방법은 이래요.

1단계. 이상적인 결과물의 예시를 골라 스킬이 무엇을 해내야 하는지 정의하세요. 마이크는 맞춤 파워포인트 스킬을 만들 때, 처음에는 사람이 실제로 만든 잘된 발표 자료 두 개를 참고용으로 삼았고, 나중에는 15~20개까지 늘렸어요. 그는 “그게 골든 데이터셋이에요”라고 말해요.

2단계. 골든 데이터셋을 기준 삼아 스킬을 만들고 고치세요. 데이터셋의 어떤 점이 마음에 드는지 파고들어서, ‘좋다’의 기준을 스킬 지시문에 글로 못 박아 두세요. 같은 입력을 계속 돌려 보면서, 스킬을 고칠 때마다 결과물이 골든 데이터셋에 가까워지는지 확인하세요.

3단계. 평가는 한 번에 문제 하나씩만 붙잡고 자동화하세요. 마이크의 파워포인트 스킬은 자간을 계속 틀렸어요. 그래서 그는 자간이 잘된 발표 자료와 잘못된 발표 자료를 예시로 LLM 심판 (LLM judge)T2을 훈련해, 그 지표 하나로만 결과를 채점하게 했어요. 감에 의존하는 주관적인 평가를 좁은 측정 항목으로 잘게 쪼갤수록, 모델에게 맡길 수 있는 일이 늘어나요.

4단계. 기본 점검을 하세요. 모델에게 같은 입력을 스킬을 쓸 때와 안 쓸 때 각각 주고, 스킬이 결과를 의미 있게 바꾸는지 보세요.

• • •

autoreview 만세

Monologue의 총괄 매니저 나빈 나이두(Naveen Naidu)는 스킬을 아껴 써요. 쓰더라도 주로 AI가 맞춤 워크플로를 따르게 하고 싶을 때예요. 한때 스킬로 묶어 두었던 일반적인 지시문, 예컨대 주석을 언제 달지 정해 둔 스킬 같은 것들은 상당수가 이제 필요 없어졌다고 해요. “모델이 워낙 좋아졌거든요.”

그래도 공개 스킬 하나는 그의 작업 환경에 당당히 자리를 잡았어요. 코드를 병합하기 전에 리뷰해 주는 OpenClaw의 autoreview 스킬T3이에요. OpenClaw 창업자 피터 슈타인베르거(Peter Steinberger)가 만든 이 스킬은 에이전트가 바꾼 코드를 모아 별도의 모델에게 리뷰를 맡겨요. (현재 기본 리뷰어는 GPT-5.6 Sol을 high 설정으로 쓰는 Codex예요.)

나빈은 Monologue Notes에 녹취록마다 ‘업무’, ‘개인’ 같은 태그를 마음대로 붙일 수 있는 기능을 새로 내놓았어요. 밤새 9시간 동안 한 번 돌린 작업으로요. 여기서 결정적인 역할을 한 게 autoreview예요. 좀 더 정확히 말하면, 나빈이 자는 동안 Fable이 GPT-5.6 Sol의 도움을 받아 Monologue의 백엔드, Mac 앱, iPhone 앱, 웹 앱 전체에 걸쳐 이 기능을 만들어 냈고, 그걸 가능하게 한 게 autoreview였어요.

Fable은 코드 1차 작업을 끝내자 autoreview 스킬을 실행했어요. 스킬은 Fable이 바꾼 내용을 묶어 Codex에게 넘겼고, Codex는 문제 목록을 돌려줬어요. Fable은 지적 사항을 하나하나 검토해서 타당하다고 판단한 문제를 고친 다음, 수정한 코드로 autoreview를 다시 돌렸어요. autoreview가 더는 문제를 찾아내지 못할 때까지 이 과정이 몇 시간 동안 되풀이됐어요. 나빈이 일어나 보니 풀 리퀘스트가 올라와 있었어요.

AI가 생성한 코드를 나빈이 큰 수정 요청 없이 병합한 건 이때가 처음이었어요. 전에는 코드를 직접 리뷰하곤 했죠. 나빈의 말을 빌리면, autoreview를 쓰고부터는 “버그를 제가 직접 찾을 필요 없이 Codex가 대신 찾아 줬어요.” 덕분에 나빈은 기능을 테스트하고 그 기능이 자기 취향에 맞는지 확인하는 데 집중할 수 있었어요.

직접 해 보세요

Codex에 autoreview를 설치하세요.

git clone https://github.com/openclaw/agent-skills.git
cd agent-skills
scripts/install-skills --mode copy --target ~/.codex/skills autoreview

그런 다음 Codex에서 코딩 프로젝트를 열고 이 프롬프트를 입력하세요.

Use the autoreview skill to review this branch against origin/main. Verify every finding against the code. Fix only problems introduced by this change, rerun the relevant tests, and repeat the review until there are no accepted, actionable findings. Stop and ask me before making any fix that would expand the original task.

아직 커밋하지 않은 작업이라면 첫 문장을 “Use the autoreview skill to review my uncommitted changes.”(autoreview 스킬로 커밋하지 않은 변경 사항을 리뷰해)로 바꾸세요.

• • •

스킬 이후의 삶

그로스 책임자 오스틴 테데스코(Austin Tedesco)는 스킬을 “완전히 버렸다”고 해요. 예외는 딱 하나, 컴파운드 엔지니어링(compound engineering)T4이에요. AI 에이전트에게 재사용 가능한 워크플로를 제공하는 플러그인으로, 에이전트가 작업을 계획하고, 완수하고, 리뷰하고, 그 작업에서 배우도록 도와줘요.

Every의 All-Access 출시를 앞두고, 오스틴은 Codex에서 마케팅 이메일 시리즈를 사실상 단번에 뽑아냈어요. 코딩 에이전트에게 관련 맥락이 담긴 Slack 메시지를 가리켜 주고, 컴파운드 엔지니어링으로 카피와 구성을 제대로 잡았죠.

Codex에게 관련 맥락을 가리켜 주고 ‘이거 해 줘’라고 하는 게 오스틴이 즐겨 쓰는 방법이에요. (스크린숏 제공: 오스틴 테데스코)

• • •

요즘 눈여겨보는 소식

Thinking Machines, 첫 모델 공개

이름은 Inkling이에요. 오픈 웨이트 모델이고, 가격 경쟁력, 그리고 개발자가 직접 내려받아 입맛대로 고쳐 쓸 수 있다는 점을 무기로 내세워요. 전 OpenAI CTO 미라 무라티(Mira Murati)가 이끄는 Thinking Machines는 프런티어 연구소와 정면으로 맞붙기보다는, 중국에서 나오는 더 비용 효율적인 오픈 웨이트 모델의 미국산 대안으로 자리매김하려 하고 있어요.

OpenAI, AI 동반자 기기 개발 중

블룸버그의 마크 거먼(Mark Gurman)T5이 익명 소식통을 인용해 보도한 바에 따르면, 이 프런티어 연구소의 첫 소비자용 기기는 화면 없는 스마트 스피커가 될 거예요. 사람 같은 AI 동반자 역할을 하는 기기죠. 아직 개발 중인 이 기기는 한층 발전한 ChatGPT 음성 모드를 바탕으로 스마트홈 기기를 관리하고, 음악을 틀고, 질문에 답하고, 이메일과 문자에 답장하는 등의 일을 하게 될 거예요.

Siri가 쓸 만해졌어요

Apple의 iOS 27 베타에는 AI 비서 Siri의 새롭게 개선된 버전이 들어 있어요. 엔지니어링 리드 안드레이 갈코(Andrey Galko)는 “대체로 인상적이에요”라고 말해요. 그가 보기에 Siri는 음성 인식이 더 좋아졌고, 그동안 iPhone에서 써 본 어떤 로컬 모델보다 똑똑해요. “Apple은 늘 하던 대로 할 것 같아요. 좋은 기술을 가져다가 대중 시장에 내놓는 거죠.”

역자 주

  1. 가중치(weights): 신경망이 훈련 과정에서 학습한 수많은 매개변수 값이에요. 모델이 무엇을 어떻게 하는지는 결국 이 값들에 새겨져 있어서, ‘가중치와 싸운다’는 건 훈련으로 몸에 밴 습관을 지시문으로 거스르려 한다는 뜻이에요. ↩
  2. LLM 심판(LLM judge): 사람 대신 LLM이 다른 모델의 출력을 평가하고 점수를 매기게 하는 방식이에요. 흔히 ‘LLM-as-a-judge’라고 불러요. ↩
  3. OpenClaw: 피터 슈타인베르거가 만든 오픈소스 AI 에이전트 프로젝트예요. autoreview는 이 프로젝트가 공개한 에이전트 스킬 모음에 들어 있는 스킬 중 하나고요. ↩
  4. 컴파운드 엔지니어링(compound engineering): 여기서 compound는 ‘복리(compound interest)‘의 그 compound예요. 작업할 때마다 배운 점을 쌓아 두어서 다음 작업이 점점 쉬워지게 한다는, 복리처럼 불어나는 효과를 노린 이름이에요. Every가 내놓은 방법론이자 이를 구현한 플러그인의 이름이기도 해요. ↩
  5. 마크 거먼(Mark Gurman): 원문에는 ‘Marc Gurman’으로 적혀 있지만, Apple 관련 보도로 잘 알려진 블룸버그 기자 Mark Gurman을 가리키는 것으로 보고 이름을 바로잡았어요. ↩

저자 소개: 로라 엔티스(Laura Entis)는 Every의 스태프 라이터예요. LinkedIn에서 팔로할 수 있어요.

참고: 이 글은 Laura Entis가 Every의 뉴스레터 Context Window에 게시한 글을 번역한 것입니다. 뉴스레터를 메일로 받아 보려면 가입하세요. 이런 글을 더 읽으려면 Every를 구독하고, X의 @every와 LinkedIn에서 팔로하세요.

원문: The Case Against Skills - Laura Entis, Every — Context Window (2026년 7월 16일, 9월 17일 업데이트)

생성: Claude (Anthropic)

총괄: 존 (디노이저denoiser)