클레어라는 친구가 앤트로픽의 새로운 Sonnet 5를 가지고 직접 벤치마크를 돌려봤다고 한다. 그런데 놀랍게도, 가격은 저렴하지만 실제 성능이 자동으로 더 좋지는 않다는 걸 발견했다. 심지어 특정 작업에서는 구형 모델인 Sonnet 4.6이나 더 비싼 Opus 4.8이 훨씬 나은 결과였다고 한다.

이게 무슨 이야기냐면, 우리 회사에서 챗봇이나 코딩 보조 도구를 만들 때, 그냥 "최신 모델이 좋겠지?" 하고 덥석 물면 안 된다는 말이다. 벤치마크를 직접 돌려봐야 한다.

획일적인 벤치마크로는 우리 상황을 알 수 없다

클레어가 강조하는 건 바로 ‘반복 가능한 커스텀 벤치마크’다. GPT-5.5나 GLM-5.2 같은 모델들을 테스트하면서 느낀 게, ‘한 번 돌려보고 느낌이 좋다’는 식의 '바이브 체크'는 의미가 없다는 거다. 어제 괜찮았던 모델이 오늘 우리 팀 워크플로우에 정말 맞는지, 다른 모델과 비교해서 어떤 강점이 있는지는 전혀 알 수 없다.

그래서 클레어는 `How I AI Bench`라는 걸 만들었다. 고정된 입력값, 일정한 평가 기준, 그리고 동일한 작업으로 새로운 모델이 나올 때마다 계속 돌려볼 수 있게 만든 거다. 중요한 건 여기서 나온 ‘사람의 신호’다. 그녀는 64개의 결과물을 직접 눈으로 보며 1점에서 5점까지 점수를 매겼는데, 이게 LLM이 내놓은 자동 평가보다 훨씬 유용했다고 한다.

LLM이 평가한 결과는 대부분 중간 점수에 몰려있어서, 사람이 봤을 때 명백한 오류나 와이어프레임 무시 같은 문제점을 놓치는 경우가 많았다. 특히 클레어의 ‘취향’이 반영된 평가와 LLM의 평가가 거의 정반대인 경우도 있었다니, 실무에서는 결국 사람이 직접 보고 판단하는 게 결정적이라는 뜻이다. 예를 들어, 그녀는 Sonnet 4.6의 '대화하는 방식(personality)'이 좋아서 일상적인 에이전트 작업에 여전히 쓴다고 한다. 벤치마크 점수 때문이 아니라!

에이전트 구축도 '내 기준'과 '범용성'이 답이다

클레어의 이야기는 AI 에이전트를 도입하는 우리에게도 시사하는 바가 크다. 황현태 님 글에서 본 '개별 AI 에이전트 구축은 지옥'이라는 표현이 딱 맞다. 회사 업무마다 에이전트 1,000개를 만들면 어떻게 될까? 비즈니스 환경이 바뀔 때마다 그 많은 에이전트를 누가 업데이트하고 관리할 수 있을까? 상상만 해도 끔찍한 유지보수 지옥이 펼쳐질 거다.

이미 클로드 코드나 코덱스 같은 '범용 슈퍼 에이전트'가 있다. 이 친구들은 세금 신고, 미팅 정리, 카드 뉴스 제작 등 웬만한 일을 다 처리할 수 있다. 그런데 굳이 특정 업무용 에이전트를 다시 만들어서 시간과 돈을 낭비할 필요가 있을까? 우리 리더들이 이런 범용 AI 활용을 독려하는 '토큰 맥싱' 전략을 적극적으로 펼쳐야 하는 이유다. 특정 도구에 얽매이지 않고, 우리 워크플로우에 맞는 최적의 모델과 방법을 찾아 유연하게 적용하는 게 중요하다는 말이다.

결국 AI 시대의 핵심은 '사람'이다

이정민 님의 글을 보면, AI 분야의 인재 이동이 얼마나 큰 파급력을 가지는지 알 수 있다. Andrej Karpathy, John Jumper 같은 몇몇 핵심 인재들이 Anthropic이나 OpenAI로 옮겨가자마자 기업의 주가가 출렁이고 모델 순위가 뒤바뀌는 현상이 발생했다. 중국의 Xiaomi MiMo와 Tencent Hunyuan도 인재 영입 전에는 눈에 띄지 않던 팀이었지만, 뤄푸리, 야오순위 같은 인물이 합류하면서 글로벌 AI 모델 순위권에 이름을 올렸다.

이건 클레어가 자기 '취향'을 반영해서 LLM 벤치마크 결과를 뒤집은 것과 일맥상통한다. 결국 AI 모델을 평가하고, 최적의 에이전트 전략을 짜고, 나아가 새로운 모델을 개발하는 이 모든 과정에서 '사람'의 판단, '사람'의 역량, '사람'의 통찰이 결정적인 역할을 한다는 뜻이다.

그러니까 앞으로 AI 관련 의사결정을 할 때는 "무슨 모델이 최고 성능인가?" 같은 일반적인 질문에서 벗어나야 한다. "우리 팀의 이 작업에는 어떤 모델이 가장 적합할까?", "우리 워크플로우에서 이 에이전트가 어떤 가치를 줄 수 있을까?" 그리고 "이런 결정을 내릴 수 있는 뛰어난 인재가 우리 팀에 있는가?" 같은 질문에 답하는 것이 훨씬 중요하다고 본다.

우리 일터에 AI를 더 똑똑하게 적용하기 위해, 당신만의 ‘AI 벤치마크 철학’은 무엇인가?

참고

  • How I AI: Sonnet 5 review & How to run autonomous coding agents from your phone (by Lenny Rachitsky)
  • 개별 AI 에이전트 구축은 지옥, 범용 AI 활용하라 (by 황현태)
  • AI 인재 대이동, 산업 경쟁력과 모델 순위 바꾼다 (by 이정민 (Jeongmin Lee))