"모두가 빌더다. 특히 C-level이. 그리고 3개월마다 지금까지 만든 걸 전부 버리고 워크플로우를 다시 상상할 각오가 되어 있다."

이정민 님이 AI 네이티브 기업의 특징 30가지를 공유했는데, 첫 문장부터 뒤통수를 맞은 기분이었어. "C-레벨이 코딩을 한다고?" 하는 놀라움도 잠시, "3개월마다 모든 걸 버리고 워크플로우를 재상상"한다는 말에, 아, 우리가 AI를 대하는 태도가 얼마나 보수적이었는지 다시 생각하게 되더라고.

AI 네이티브는 '업무 재상상'이다

그냥 AI 도구를 가져다 쓰는 걸 넘어, AI 네이티브 기업은 아예 회사 운영 방식 자체를 AI에 맞춰 재설계하는 모습이야. 사람의 감각과 판단은 '의도 정의'와 '최종 승인'이라는 첫 단계와 마지막 단계에만 투입하고, 그 사이의 모든 개발, 운영, 기획 프로세스는 AI 에이전트 군단이 처리한다는 거지.

예를 들어, 핵심 소프트웨어 지표가 "Cost per Accepted PR"(하나의 승인된 PR에 드는 비용)인데, 이걸 토큰 효율 개선으로 계속 낮춘대. 이건 단순히 개발자들이 AI 코딩 도구를 쓰는 수준이 아니야. AI 에이전트들이 계획, 작성, 테스트, 리뷰, 배포까지 도맡고, 사람은 그 결과물에 대한 의도와 수락 기준만 정의하는 "에이전트 네이티브 개발 체계"인 거야.

여기서 중요한 건 "모든 것을 기록한다"는 원칙이야. 기록하지 않으면 AI가 쓸 수 있는 업무로 전환할 수 없으니까. 그리고 "Earned Autonomy"라는 개념도 흥미로웠어. 에이전트가 관찰 → 제안 → 승인 후 실행 → 단독 실행 순으로 사다리를 올라가며 스스로 학습하고 발전한다는 건데, 최종 목표는 사람이 기준만 세우면 에이전트가 정해진 경계 안에서 전체 워크플로우를 운영하는 시스템이야.

이런 기업들은 AI를 단순 도구가 아니라, 비즈니스의 새로운 OS로 보고 모든 것을 재설계하는 데 투자하고 있어. 마케팅 에이전트가 수천 개의 크리에이티브를 먼저 테스트 배포하고, 성과가 검증된 후에야 사람이 만든 광고에 예산을 태우는 방식 같은 거지.

AI 모델, 발표 수치를 믿어도 될까?

이렇게 AI가 비즈니스의 심장 역할을 하게 된다면, 어떤 AI 모델을 쓰고 어떻게 평가할지는 엄청나게 중요해지겠지? 마침 정상록 님이 GPT-6 Astra 모델 발표와 실제 성능 간극에 대한 글을 공유했어.

오픈AI 공동창업자는 AGI 시대의 개막이라고까지 표현했지만, 독립 벤치마크 기관의 종합 지능 지수는 전작 GPT-5.6 Sol과 큰 차이가 없었고, 심지어 다른 모델보다도 낮았다고 해. 더 충격적인 건, 가장 화제가 된 ARC-AGI-3 벤치마크 99.9%라는 수치가 오픈AI 자체 도구를 허용한 특정 조건에서만 나온 수치였다는 점이야. 같은 시험을 표준 방식으로 치르면 62.7%로 뚝 떨어진대.

이건 우리에게 시사하는 바가 커. 벤더가 제시하는 화려한 숫자를 그대로 믿고 우리 워크플로우에 적용했다가는 큰 코 다칠 수 있다는 거지. API 가격은 2.5배 인상되고, 컨텍스트는 늘었지만 실제 작업당 비용은 75% 더 비싸졌고, 심지어 사이버보안 항목에서 최고 위험 등급을 받은 첫 모델이기도 하대.

우리만의 평가 체계가 핵심이다

두 기사를 함께 읽으니까 AI를 도입하고 활용하는 방식에 대한 관점이 더 명확해지더라. AI 네이티브 기업이 강조하는 것 중 하나가 "Eval이 비즈니스의 핵심 인프라"라는 점이야. 새 모델이 나올 때마다 핵심 프로세스 대비 비용과 성능을 테스트하는 체계를 갖춰야 한다는 거지.

결국, AI를 활용해 우리 일을 재상상하고 워크플로우를 혁신하는 건 미래 생존과 직결된 문제야. 하지만 동시에, 어떤 모델을 어떤 조건에서 어떻게 평가하고 우리 시스템에 적용할지에 대한 냉철한 기준과 검증 능력이 반드시 필요하다는 걸 다시 한번 깨닫게 돼. 화려한 발표 자료 뒤에 숨겨진 진짜 성능을 파고들고, 우리 환경에 맞게 직접 검증하는 문화가 중요해진 거야.

우리 팀에서는 어떤 기준으로 AI 모델의 실제 성능을 평가하고 있어? 그리고 지금 우리 워크플로우 중에서 AI 에이전트에게 맡겨볼 만한 부분은 어디부터 있을까?

참고

  • 이정민 (Jeongmin Lee). "4년 만에 4일간 휴가 와서 생각해본 AI 네이티브 기업의 30가지 특징." LinkedIn, 2026년 8월 31일.
  • 정상록 (Sangrok Jung). "GPT-6 Astra: 발표와 실제 성능 간극." LinkedIn, 2026년 9월 4일.
  • 오픈AI. "GPT-6 Astra 출시 발표 (가상)." (본 글에서 인용된 기사의 가상 출처)