[Key keywords] Claude Code CLI, 토큰(Token) 절약, 컨텍스트(Context) 최적화, /compact, /clear, CLAUDE.md — AI 코딩 비용을 절반 이하로 줄이는 실전 가이드입니다.

Claude Code CLI나 비슷한 AI 코딩 도구를 사용하다 보면, 분명 앞서 설명했던 내용을 AI가 다시 묻거나, 심지어 완성된 코드를 전혀 다른 방식으로 처음부터 다시 짜는 황당한 경험을 하신 적이 있을 것입니다. 이런 현상이 반복되다 보면 "이게 정말 인공지능이 맞나?"라는 생각이 들 정도로 당혹스럽습니다.
그런데 사실, 이것은 버그(bug)가 아닙니다. 인공지능의 근본적인 작동 방식, 즉 컨텍스트(Context)와 토큰(Token) 구조에서 비롯된 현상입니다. 독자 여러분이 이 문제의 원인을 정확히 이해하고, 간단한 명령 몇 가지로 토큰 낭비를 절반 이상 줄일 수 있는 방법을 이 글에서 안내해 드리겠습니다.
AI는 왜 앞에서 한 말을 잊어버릴까요? '컨텍스트(Context)의 한계'
인간의 뇌는 훈련하고 경험하는 방식에 따라 기억 공간이 사실상 무한히 확장됩니다. 하지만 인공지능은 다릅니다. 컨텍스트(Context)라고하는 형식의 물리적 메모리 제약 안에서 작동하기 때문입니다. 쉽게 말해, AI가 한 번의 대화에서 기억할 수 있는 정보의 총량에 한계가 있다는 뜻입니다.
대형 언어 모델(LLM)과 대화할 때, 이 모델은 제한된 '작업 메모리'인 컨텍스트 윈도우 안에서 작동합니다. 이 윈도우가 허용하는 범위 내에서는 대화 내용을 모두 기억하고 일관된 응답을 내놓지만, 대화가 길어져 한계를 넘기 시작하면 앞부분의 내용을 잊어버리고 응답의 신뢰도가 떨어집니다. 그래서 AI가 "그런 말씀 하신 적 없습니다"라고 딱 잡아떼는 황당한 상황이 벌어지는 것입니다.
Claude Code Cli가 인식하는 context는 현재 세션의 전체 대화 기록, 시스템 프롬프트, 그리고 읽어 들인 파일 내용을 모두 포함합니다. 새 메시지를 보낼 때마다 이 전체 대화 기록이 함께 전송되기 때문에 대화가 길어질수록 매 요청마다 소비되는 토큰이 누적 방식으로 증가합니다. 결과적으로 10번째 요청을 처리할 때는 1번부터 9번까지의 모든 대화 기록을 포함한 상태로 작동합니다. 그리고 이건 대화의 연속성을 이어가야 만 하는 LLM 프롬프트 구조와도 연관되어 있습니다.
AI에게 더 많은 정보를 주면 더 똑똑해질 것 같지만, 실제로는 반대입니다. 2025년 Chroma의 연구에서 GPT-4.1, Claude, Gemini 등 18개의 최첨단 모델을 대상으로 테스트한 결과, 입력 정보가 늘어날수록 모든 모델의 성능이 저하되었습니다. 저하 폭도 상당했는데, 어떤 모델은 특정 길이를 넘자 정확도가 95%에서 60%로 급락했습니다.

토큰(Token)은 왜 낭비되는 것일까요?
토큰은 AI가 정보를 처리하는 최소 단위로, 텍스트의 글자나 단어 묶음 하나하나에 해당합니다. Claude 같은 생성형 AI는 사용자의 지시를 읽을 때도, 필요한 정보를 탐색할 때도, 그리고 결과를 출력할 때도 모두 토큰을 소비합니다. API를 통해 팀 단위로 사용하면 소비한 API 토큰에 비례해 요금이 청구되며, Claude Code를 사용하는 개발자의 평균 비용은 Sonnet 4.6 기준으로 월 약 100~200달러에 달하고, 사용 방식에 따라 편차가 큽니다.
한편으로는, AI가 매번 질문을 받을 때마다 이전 전체 대화 기록을 처음부터 다시 훑어보는 구조가 토큰을 엄청나게 중복 소비하게 만듭니다. 이것은 RAG(검색 증강 생성, Retrieval-Augmented Generation)라는 기술이 작동하는 방식과도 관련이 있는데, 질문이 들어올 때마다 관련 문서를 검색해 결과를 AI에게 전달하는 이 방식은 토큰 절약 측면에서 긍정적인 면이 있지만, 동시에 방대한 이전 기록을 반복 처리하면서 비용이 눈덩이처럼 불어나는 문제도 유발합니다.
이 상황을 비유하자면 이렇습니다. 매일 아침 출근하면 전날까지 진행된 모든 업무 기록을 처음부터 다시 읽고 나서야 당일 업무를 시작하는 시간제 직원을 고용한 것과 같습니다. 처음에는 기록이 적어 금방 읽지만, 프로젝트가 진행될수록 기록이 쌓이고 기록 읽는 시간만 하루 종일 걸려 정작 실제 업무는 10분 남짓 하고 퇴근하는 상황이 벌어집니다. 그리고 독자 여러분은 그 '기록 읽는 시간'에도 계속 시간당 비용을 지불해야 합니다. 토큰 비용은 컨텍스트 크기에 비례해 증가하며, Claude가 처리하는 컨텍스트가 많을수록 더 많은 토큰을 사용합니다.
주의 사항
하나의 작업이 끝나고 전혀 다른 작업으로 전환할 때 '/clear' 명령으로 새로운 대화를 시작하지 않으면, 이전 세션의 낡은 컨텍스트가 이후의 모든 메시지에서 지속적으로 토큰을 낭비시키게 됩니다. 이 습관 하나만 바꿔도 토큰 소비를 크게 줄이실 수 있습니다.

방법 1 — '/compact' 명령으로 대화 내용을 압축하세요
Claude Code CLI에서 /compact 명령을 실행하면 지금까지 진행된 모든 대화와 그 결과를 AI가 압축·요약합니다. 불필요한 내용은 걷어내고 핵심 정보만 남겨 이후 대화에서 토큰 소비를 획기적으로 줄일 수 있습니다.
대부분의 사용자가 컨텍스트가 거의 꽉 찼을 때 '/compact'를 실행하는데, 그때는 이미 효율이 떨어진 상태입니다. 주요 기능 구현이 완료되거나 버그가 수정된 시점처럼 자연스러운 작업 완료 지점마다 선제적으로 '/compact'를 실행하는 것이 좋습니다. 이렇게 하면 깔끔한 요약이 생성되고 활성 컨텍스트를 가볍게 유지할 수 있습니다.
'/compact' 명령 실행 시 "Focus on code samples and API usage"처럼 어떤 내용을 보존할지 직접 지정하는 맞춤형 압축 지시를 추가하는 것도 가능합니다. 또한 '/clear' 명령과 정교하게 작성된 CLAUDE.md 파일을 함께 활용하는 것만으로도 토큰 소비를 50~70% 줄일 수 있다고 많은 개발자들이 보고하고 있습니다.
방법 2 — '/clear' 명령으로 작업 간 세션을 초기화하세요
하나의 작업이 완전히 끝났을 때는 /clear 명령을 실행해 새로운 대화 세션을 시작하시기 바랍니다. 많은 분들이 Claude Code CLI를 완전히 종료하지 않고 이어서 새 작업을 시작하는 경우가 많습니다. CLI 재시작 시 각종 설정과 지침을 다시 읽어들이는 과정이 번거롭기 때문입니다. 그런데 이렇게 하면 이전 작업의 방대한 기록이 고스란히 컨텍스트에 남아 새 작업의 토큰을 갉아먹게 됩니다.
'/clear' 명령은 대화 기록을 완전히 삭제하고 초기 상태로 만들어 줍니다. '/compact'와는 달리 이전 컨텍스트가 전혀 남지 않으며, 작업의 성격이 완전히 바뀌거나 이전 대화가 현재 작업에 방해가 될 때 사용하기 적합합니다. 이 방법은 Claude Code CLI뿐만 아니라 웹 브라우저에서 작동하는 모든 생성형 AI에도 동일하게 적용됩니다. 새로운 작업을 시작할 때는 반드시 새 대화 창을 여십시오.
방법 3 — 'CLAUDE.md' 파일을 군더더기 없이 최적화하세요
세 번째 방법은 Claude Code CLI가 시작될 때 가장 먼저 읽어 들이는 CLAUDE.md 파일을 최적화하는 것입니다. 이 파일이 길어질수록 CLI 시작 시마다 더 많은 토큰이 낭비됩니다.
'CLAUDE.md' 파일은 Claude Code의 영구적인 기억 장치로, 매 세션 시작 시 자동으로 읽힙니다. 잘 구성된 'CLAUDE.md' 파일은 Claude의 작업 효율을 높이는데 있어서는 필수적이지만, 지나치게 비대해진 'CLAUDE.md' 파일은 모든 인터랙션에서 토큰을 낭비하는 원인을 제공하게 됩니다.
'CLAUDE.md' 파일의 내용을 Claude Code가 최초 실행될때 가장 먼저 모든 내용을 읽고 그 내용을 지침으로 적용해서 작업해야 하기 때문에 Claude Code가 시작되면서 이미 Token의 일부를 소비하기 때문입니다.
'CLAUDE.md' 파일의 Token 낭비의 가장 큰 숨겨진 원인 중 하나는 현재 작업과 관련 없는 지침까지 전부 불러오는 '컨텍스트 비대화(context bloat)' 현상에 있습니다.
현재 작업에 필요한 도메인 지식만 그때그때 불러오는 방식으로 설계할 수 있다면 세션당 상당한 양의 토큰을 회수할 수 있습니다. 그래서 'CLAUDE.md'파일은 200줄에서 최대 500줄을 넘지 않도록 유지하시고, 정말 핵심적인 규칙과 지침만 남기는 것이 가장 좋은 방법입니다.
시간이 지나면서 자꾸 내용을 추가하고 싶은 유혹이 생기지만, 그럴수록 'CLAUDE.md'파일이 무거워지고 CLI 시작이 느려지며, 심한 경우 실제 작업시 Claude code cli가 'CLAUDE.md'파일안에 정의된 내부 지침 일부를 무시하거나 건너뛰고 작업을 수행하는 현상까지 발생합니다.
AI 코딩 도구를 활용한 개발이 점점 보편화되는 지금, 토큰 관리는 단순한 비용 절감을 넘어 개발 생산성 자체를 좌우하는 핵심 역량이 되고 있습니다. '/compact'는 주요 작업 완료 시점마다, '/clear'는 새로운 작업을 시작할 때마다, 그리고 CLAUDE.md 파일은 언제나 군더더기 없이' — 이 세 가지 원칙을 습관으로 만드는 것만으로도 독자 여러분의 소중한 토큰을 절반 이상 아낄 수 있습니다. 처음에는 번거롭게 느껴질 수 있지만, 이 습관이 쌓이면 AI와의 협업이 훨씬 더 빠르고, 정확하고, 경제적으로 변하는 것을 직접 느끼시게 될 것입니다.
참고 사항 — /cost 명령으로 현재 사용량을 수시로 확인하세요
'/cost' 명령을 사용하면 현재 세션의 토큰 사용량을 즉시 확인하거나, 상태 표시줄에 지속적으로 표시되도록 설정할 수 있습니다. 사용량을 눈으로 직접 확인하는 것이 최고의 절약 동기가 됩니다.
FAQ

1). 본 아티클은 제작자의 창작물이며, 지적 재산권에 의해 보호됩니다. 저작자의 허락 없이 다른 저작물에 도용하거나, 저작자 허락 없이 상업적 목적에 이용하거나 유출하는 경우, 민형사상의 불이익과 처벌을 받게 되니 주의하시기 바랍니다.
2). 본 컨텐츠의 원문은 저작자가 직접 자료조사를 통해 작성했으며, 그 다음에 블로그용 글을 다듬는 작업만을 AI로 작업한 글입니다.
3). 본 컨텐츠에 사용된 이미지는 AI 이미지 생성 도구에서 주제를 입력하여 생성한 이미지를 사용합니다.
'꿈을 그리는 A.I' 카테고리의 다른 글
| AI가 쓴 글 vs 사람이 쓴 글, 차이를 만드는 결정적 요소와 극복 전략 (0) | 2026.04.26 |
|---|---|
| 클로드 코드 토큰절약Tip-Part Two (0) | 2026.04.12 |
| 폐쇄환경에서 생성형 AI를 설치, 활용하는 방법 (0) | 2026.03.02 |
| CLI (Claude, Gemini)의 하이브리드 메타추론 적용방법 (1) | 2025.10.16 |
| A.I가 학습하는 방법 (학습모델) (1) | 2025.10.06 |