"어이, 이거 봤어? 재밌는 거 있어서—"
Codex 쓰면서 GPT-5.6 Sol만 고집했다면 지금 당장 `~/.codex/agents/luna-worker.toml` 파일 열고 `model = "gpt-5.6-luna"`로 바꿔봐. 안 그러면 토큰 비용을 최대 50배 비싸게 쓰고 있다는 글을 봤는데, 충격적이지 않아?
토큰 비용 50배 차이, 이제는 모델 분업 시대
이정민 님의 글을 보면서 솔직히 좀 놀랐다. GPT-5.6 Luna 가격이 80% 내려가고, DeepSeek V4 Flash도 성능이 확 좋아졌는데 가격은 그대로라고 하더라. 지금까지는 그냥 Sol 하나로 다 때려 박는 게 편하다고 생각했는데, 이제는 그렇게 하면 '호갱'이 되는 시대가 온 거다.
핵심은 이거다. "무작정 Sol을 쓰기보다 작업 별로 모델을 나눌 시점입니다." 이제는 Sol이 설계나 최종 검토 같은 고난도 작업에 집중하고, Luna나 DeepSeek 같은 가성비 모델이 조사나 구현 같은 대량 작업을 맡는 식으로 분업해야 한다는 얘기다. 안 그러면 비용 격차가 너무 커져서 배보다 배꼽이 더 커질 수 있다. 개발자 입장에서 이런 워크플로우 최적화는 단순히 비용 절감을 넘어, 프로젝트의 지속 가능성을 결정짓는 중요한 요소가 될 수 있다. 결국 같은 돈으로 더 많은 AI 작업을 돌릴 수 있다는 거니까.
유료 서비스의 대안, 오픈소스의 반란
그런데 유료 모델만 생각할 필요는 없다. 정상록 님의 'openwork' 소개 글을 보면서 또 한 번 머리를 한 대 맞은 기분이었다. Anthropic의 유료 서비스인 Claude Cowork를 무료로 쓸 수 있는 오픈소스 대안이 나왔다니! 그것도 macOS, Windows, Linux 다 지원하는 데스크톱 앱으로 말이야.
openwork는 사용자가 모델을 직접 고르고 데이터를 로컬에 저장할 수 있게 해준다. 이게 왜 중요하냐면, 데이터를 외부로 내보낼 수 없는 보안 민감 조직이나, 특정 모델에 종속되고 싶지 않은 개발자들에게 엄청난 자유를 주기 때문이다. 당장 Ollama로 `qwen3:8b`를 로컬에서 돌리는 예시를 보면서 "이거 완전 격리된 환경에서 AI 개발하는 데 딱이겠는데?" 싶더라. 유료 서비스의 기능만큼은 아니더라도, 최소한의 기능으로도 충분히 작업 흐름을 개선할 수 있다면 오픈소스는 매력적인 대안이 된다. 심지어 기존 Claude Code, Codex, Cursor 같은 도구에 그대로 얹을 수도 있다고 하니, 기존 워크플로우를 크게 바꾸지 않고도 활용할 수 있다는 점도 강점이다.
파이썬 스택의 한계, C/C++ 엔진의 부활
LocalAI가 왜 직접 C/C++ 추론 엔진을 개발하는지에 대한 글도 흥미로웠다. 파이썬 스택의 무거움과 예측 불가능한 메모리 사용 때문에 직접 엔진을 만들었다는 건데, 이게 개발자 입장에서는 큰 울림을 준다.
"Model2Vec 임베더와 NER 추론을 ONNX Runtime에서 순수 C로 포팅해서 Wasm 크기를 30MB에서 300KB로 줄이고 속도를 1.5배 높이는 데 성공했습니다." 이 한 문장에서 모든 것이 설명된다. 30MB가 300KB로 줄어들고 속도가 1.5배 빨라진다? 이건 단순히 성능 개선을 넘어, 임베디드 시스템이나 엣지 디바이스처럼 리소스 제약이 있는 환경에서의 AI 배포 가능성을 완전히 바꿔놓는 얘기다. 9.1 GiB짜리 vLLM 가상 환경을 66 MiB짜리 C++ 바이너리로 대체하고도 거의 동일한 처리량을 낸다는 건, 파이썬 기반의 AI 개발 스택이 가진 한계를 정면으로 돌파하려는 시도라고 볼 수 있다.
결국, AI 개발은 선택의 영역이다
이 세 가지 글을 보면서 다시 한번 느꼈다. 이제 AI 개발은 하나의 정해진 길만 있는 게 아니라는 것을. 토큰 비용을 50배나 줄일 수 있는 멀티 모델 전략부터, 유료 서비스를 대체하는 오픈소스 대안, 그리고 리소스 효율성을 극대화하기 위한 C/C++ 엔진 개발까지. 모든 것이 비용, 성능, 보안, 유연성 사이에서 최적의 균형점을 찾아가는 과정이다.
Sol 하나로 모든 걸 해결하려던 시대는 끝났다. 이제는 우리 프로젝트의 특성, 예산, 보안 요구사항 등을 고려해서 가장 적합한 모델과 도구를 '조합'하는 능력이 중요해졌다. 이 조합이 곧 우리만의 경쟁력이 될 것이다.
당신은 지금 어떤 조합을 고려하고 있는가?
참고
- 이정민 (Jeongmin Lee). 2026-08-02. Codex 토큰 50배 절약: 최적 모델 설정 가이드. LinkedIn.
- 정상록 (Sangrok Jung). 2026-08-02. Claude Cowork 써보려고 들어갔다가 뒤로가기 누르신 분 있으세요? Pro든 Max든 Team이든, 일단 유료 플랜부터 결제해야 열려요. 근데 그걸 무료로 대체하겠다는 오픈... LinkedIn.
- LocalAI. 2026-07-31. Why we write our own C and C++ inference engines. localai.io/blog.