작성 김지광 (운영자)마지막 업데이트 bal.pe.kr

임베딩 모델 비교 완전 가이드 — 차원·MTEB·컨텍스트·가격과 벡터 스토리지 비용

RAG(Retrieval-Augmented Generation) 파이프라인에서 임베딩 모델 선택은 검색 품질과 운영 비용을 동시에 좌우합니다. 같은 텍스트라도 어떤 모델로 임베딩하느냐에 따라 토큰 단가가 20배 이상 차이 나고, 차원이 커지면 벡터 스토리지 비용도 비례해 늘어납니다. 이 가이드는 임베딩 모델을 고를 때 봐야 할 4가지 지표(차원·컨텍스트·가격·MTEB)와 벡터 스토리지 비용 계산 공식을 정리합니다.

본 가이드의 모든 가격·MTEB 점수는 공개 자료를 정리한 참고용·변동 가능 추정치입니다(기준일 2026-06-20). 가격은 공급사 정책에 따라 자주 바뀌므로 실제 청구액은 각 공급사 콘솔에서 확인하세요.

1. 임베딩 차원 (Dimension) — 비용을 결정하는 핵심

임베딩 차원은 한 텍스트를 표현하는 벡터의 숫자 개수입니다. 모델별로 384~3072 차원을 사용하며, 차원이 클수록 더 풍부한 의미를 담을 수 있지만 그만큼 저장 용량과 검색 비용이 커집니다. 벡터는 보통 float32(숫자 1개당 4byte)로 저장되므로, 1,024차원 벡터 1개는 1,024 × 4 = 4,096byte(4KB)를 차지합니다. 문서 1,000만 개를 저장하면 4,096 × 10,000,000 ≈ 40GB가 됩니다. 차원이 3,072라면 같은 문서 수에 약 120GB가 필요합니다.

그래서 최근 모델들은 Matryoshka(마트료시카) 임베딩을 지원합니다. 한 번 학습한 벡터를 앞에서부터 잘라 256·512·1,024 차원으로 축소해도 품질 손실이 작도록 설계된 방식입니다. text-embedding-3-large(3,072차원)를 256차원으로 줄이면 스토리지가 1/12로 감소합니다. 이 도구의 "Matryoshka 차원" 옵션으로 절감 효과를 직접 시뮬레이션할 수 있습니다.

2. 최대 컨텍스트 (Context) — 청크 크기의 상한

최대 컨텍스트는 한 번에 임베딩할 수 있는 입력 토큰 수입니다. 모델마다 격차가 큽니다. Cohere embed-english-v3.0은 512토큰에 불과한 반면, Voyage 모델은 32,000토큰, Cohere embed-v4.0은 128,000토큰까지 지원합니다. 컨텍스트가 작은 모델은 문서를 더 잘게 쪼개야(chunking) 하므로 청크 수가 늘고, 결과적으로 스토리지와 임베딩 토큰이 증가합니다. 긴 문서를 다루는 RAG라면 컨텍스트가 넉넉한 모델이 청크 관리 부담을 줄여줍니다.

3. MTEB 점수 — 검색 품질의 벤치마크

MTEB(Massive Text Embedding Benchmark)는 분류·검색·클러스터링 등 수십 개 과제에 대한 임베딩 성능을 평균낸 점수입니다. 점수가 높을수록 범용 검색 품질이 우수하다고 볼 수 있지만, 당신의 도메인·언어에서의 성능을 보장하지는 않습니다. 예를 들어 한국어 RAG라면 MTEB(영어) 점수가 약간 낮아도 다국어에 강한 BGE-M3나 voyage·gemini 계열이 더 나을 수 있습니다. MTEB는 후보를 좁히는 1차 필터로 쓰고, 최종 선택은 자체 평가셋으로 검증하는 것이 정석입니다.

4. 토큰 단가 (Price) — 임베딩 비용 공식

대부분의 임베딩 API는 per-1M-tokens 단가로 과금합니다. 임베딩 비용 공식은 다음과 같습니다.

  • 임베딩 비용(USD) = (총 토큰 수 ÷ 1,000,000) × per-1M 단가
  • 총 토큰 수 = 문서 수 × 문서당 평균 토큰
  • 월 비용 = 1회 인덱싱 비용 × 월 재임베딩 횟수 + (월 쿼리 수 × 쿼리 토큰 ÷ 1M × 단가)

예를 들어 문서 10만 개 × 평균 500토큰 = 5,000만 토큰을 OpenAI text-embedding-3-small($0.02/1M)로 임베딩하면 50 × $0.02 = $1입니다. 같은 작업을 text-embedding-3-large($0.13/1M)로 하면 $6.5, Google text-embedding-005($0.006/1M)로 하면 $0.3입니다. 한 번 인덱싱한 뒤 문서가 자주 바뀌지 않는다면 임베딩 비용은 일회성에 가깝고, 이후에는 스토리지와 쿼리 비용이 매월 발생합니다.

5. 벡터 스토리지 비용 — 차원이 만드는 차이

벡터를 어디에 저장하느냐(Pinecone·Qdrant·pgvector)에 따라 월 비용이 달라집니다. 본 도구는 단순화를 위해 스토리지 단가($/GB·월)만 반영합니다. 스토리지 용량은 위에서 본 대로 차원 × 문서 수 × 4byte로 계산되므로, 차원을 줄이거나(Matryoshka) int8/binary 양자화로 4~32배 압축하면 스토리지 비용을 크게 낮출 수 있습니다. (양자화 절감은 본 도구에 반영되지 않으며, 실제 벡터 DB 요금은 읽기/쓰기 단위·RAM·복제본 비용이 추가됩니다.)

6. 모델 한눈에 비교

모델공급사차원컨텍스트$/1MMTEB
text-embedding-3-smallOpenAI15368,191$0.0262.3
text-embedding-3-largeOpenAI30728,191$0.1364.6
voyage-3-largeVoyage AI102432,000$0.1865.5
voyage-3.5Voyage AI102432,000$0.0664.0
voyage-3.5-liteVoyage AI102432,000$0.0262.0
embed-english-v3.0Cohere1024512$0.164.5
embed-v4.0Cohere1536128,000$0.1265.0
jina-embeddings-v3Jina AI10248,192$0.0265.0
text-embedding-005Google7682,048$0.00662.0
gemini-embedding-001Google30722,048$0.1568.3
BGE-M3BAAI10248,19259.5
mistral-embedMistral AI10248,000$0.159.0

결론적으로 "가장 저렴한 모델"과 "가장 점수 높은 모델"이 항상 정답은 아닙니다. 문서 수·갱신 빈도·쿼리량·차원에 따라 총비용 순위가 바뀌므로, 계산기에 본인 시나리오를 입력해 월 총비용으로 직접 비교하세요.