작성 김지광 (운영자)마지막 업데이트 bal.pe.kr

어떤 AI 모델을 써야 할까 — 2026 LLM 선택 가이드

업데이트 2026-06-20 · 일반 참고 정보 · 가격·사양은 공식 발표에 따라 변동됩니다.

1. '가장 좋은 모델'은 없습니다

2026년 현재 LLM 시장은 단일 분기에 수백 개의 신규 모델이 쏟아지는 선택 피로의 시대입니다. 한때는 "그냥 ChatGPT 써"가 통했지만, 지금은 그 답이 게으르고 비싼 선택이 되었습니다. 프런티어 모델들이 태스크별 특화로 쪼개지면서, 중요한 질문은 "가장 똑똑한 모델은 무엇인가"가 아니라 "내 작업에 달러당 가장 똑똑한 모델은 무엇인가"로 바뀌었습니다. 어떤 모델은 다른 모델보다 10배 이상 비싸지만 특정 작업에서는 결과가 거의 같습니다. 따라서 선택은 작업·예산·컨텍스트·우선순위라는 4가지 축에서 이루어져야 합니다.

2. 선택의 4가지 축

  • 태스크 유형 — 코딩, 수학·추론, 장문 분석/RAG, 창작, 번역, 이미지 생성, 요약·분류, 에이전트·툴 콜, 일상 대화 중 무엇인가.
  • 예산 — 무료(무료 티어·오픈 웨이트)만 쓸지, 저가 위주인지, 비싸도 최고 품질을 원하는지.
  • 컨텍스트 길이 — 한 번에 넣을 입력의 최대 길이. 8K로 충분한지, 책 한 권·대형 코드베이스를 통째로 넣어야 하는지.
  • 우선순위 — 품질(가장 똑똑한 답), 속도(빠른 응답), 비용(달러당 성능) 중 무엇을 가장 중시하는가.

이 도구는 위 4축 입력을 받아 모델별 가중 점수를 계산하고 상위 3개를 근거와 함께 추천합니다. 같은 작업이라도 예산이나 우선순위가 바뀌면 추천이 달라집니다.

3. 작업별 가이드

코딩·개발

코드 작성·디버깅·리팩터링은 추론 정확도와 긴 컨텍스트가 핵심입니다. 품질 우선이라면 Claude Opus 4.8이 코딩에서 가장 강하고, Claude Fable 5GPT-5.5가 뒤를 잇습니다. 예산이 빡빡하다면 오픈 웨이트인 DeepSeek V4가 프런티어급 코딩 성능을 저가로 제공합니다.

장문 분석·RAG

긴 문서·대형 코드베이스를 통째로 넣으려면 컨텍스트 윈도우가 결정적입니다. Gemini 3.1 Pro가 약 2M 토큰으로 가장 크고, Claude 계열(Fable 5/Opus 4.8/Sonnet 4.6)이 1M을 제공합니다. 비용을 아끼려면 1M 컨텍스트를 저가로 주는 Gemini 3 Flash나 오픈 웨이트 Llama 4 Maverick도 좋습니다.

번역·다국어

다국어 번역은 Qwen 3 Max가 특히 아시아권에서 강하고, 유럽권은 Mistral Large 3, 범용 고품질은 Gemini 3.1 Pro가 우수합니다. 대량 번역 파이프라인이라면 저가·고속 모델로 비용을 크게 낮출 수 있습니다.

이미지 생성

이미지를 만드는 작업은 텍스트 전용 모델로는 불가능합니다. 이미지 생성을 지원하는 모델은 GPT-5.5, Gemini 3.1 Pro, Gemini 3 Flash, Grok 4.3입니다. Claude 모델은 이미지를 입력으로 읽을 수는 있지만 생성하지는 못합니다. 이 도구에서 '이미지 생성'을 선택하면 텍스트 전용 모델은 자동으로 제외됩니다.

창작·요약·에이전트·대화

창작·카피라이팅은 GPT-5.5와 Fable 5가 강합니다. 요약·분류처럼 속도가 중요한 대량 작업은 저렴하고 빠른 Claude Haiku 4.5GPT-5 nano가 효율적입니다. 도구를 호출하며 자율적으로 작업하는 에이전트는 Fable 5와 Opus 4.8이 장기 작업에서 안정적입니다.

4. 컨텍스트 윈도우 이해하기

컨텍스트 윈도우는 모델이 한 번에 '기억'할 수 있는 토큰 수입니다. 1 토큰은 영어 기준 약 0.75단어, 한국어는 글자에 따라 더 많은 토큰을 차지합니다. 8K는 짧은 채팅, 128K는 중간 길이 문서, 1M 이상은 책 한 권 또는 수십 개 파일의 코드베이스를 한 번에 넣는 수준입니다. 단, 컨텍스트가 크다고 항상 좋은 것은 아닙니다 — 긴 입력은 비용과 지연을 늘리고, 모델이 중간 내용을 놓치는 경우도 있습니다. 필요한 만큼만 선택하세요.

5. 가격과 가성비(CPP)

가격은 입력·출력 토큰당 따로 매겨지며, 보통 출력이 더 비쌉니다. 이 도구는 출력 가중 혼합 가격(입력 25% + 출력 75%)으로 1M 토큰당 대략적인 단가를 계산합니다. '비용' 우선순위를 선택하면 단순히 싼 모델이 아니라 달러당 성능(가성비)이 높은 모델을 상위로 올립니다. 예를 들어 일상 대화나 분류 작업에서는 Fable 5보다 GPT-5 nano·Gemini 3 Flash가 훨씬 합리적입니다.

6. 주요 모델 한눈에

Claude(Anthropic): 코딩·에이전트·추론 강자. Fable 5는 최고 난도, Opus 4.8은 코딩 표준, Sonnet 4.6은 균형, Haiku 4.5는 고속·저가. 모두 1M 컨텍스트(Haiku는 200K)이며 이미지 생성은 없습니다.
GPT-5.x(OpenAI): 창작·멀티모달·이미지 생성에 강하고 mini/nano로 저가 옵션까지 폭넓습니다.
Gemini(Google): 2M 초대형 컨텍스트와 멀티모달이 강점. Flash는 저가·고속.
오픈 웨이트(DeepSeek·Llama·Qwen): 가성비와 셀프 호스팅·데이터 주권이 필요할 때 유리합니다.

7. 실전 선택 팁

  • 먼저 작업을 정하고, 그 작업에 점수가 높은 모델 중 예산 안에 드는 것을 고르세요.
  • 프로토타입은 저가·고속 모델로 시작하고, 품질이 부족할 때만 상위 모델로 올리세요.
  • 대량 운영은 가성비(비용 우선)로, 중요한 추론·코딩은 품질 우선으로 분리해 모델을 섞어 쓰세요.
  • 가격·사양은 자주 바뀌므로 결제 전 반드시 공급사 공식 페이지에서 확인하세요.