임베딩(Embedding)은 데이터를 숫자로 표현한 것으로, 보통 벡터라고 부르는 숫자 목록이며 의미를 담아 비슷한 것끼리 가까이 놓이게 만듭니다. 환불 정책에 관한 문장과 돈을 돌려받는 방법을 묻는 질문은 겹치는 단어가 거의 없어도 가까운 벡터로 매핑됩니다. 텍스트, 이미지, 오디오, 테이블 행 모두 임베딩할 수 있습니다.
임베딩은 시맨틱 검색, 추천, 클러스터링, 그리고 검색 증강 생성(RAG)을 움직입니다. 키워드 일치가 아니라 벡터 비교로 관련 문서를 찾는 방식입니다. 모델은 학습 중에 임베딩을 익히고, 전용 임베딩 모델은 어떤 입력이든 즉시 벡터로 바꿔 줍니다.
임베딩은 학습되고 적용된 데이터의 모든 것을 물려받습니다. 낡거나 어긋난 원천 기록은 검색을 조용히 엉뚱한 방향으로 이끄는 벡터를 만들므로, 임베딩 파이프라인에도 다른 데이터 파이프라인과 같은 버전 관리 규율이 필요합니다.
관련 용어: Vector Database · Retrieval-Augmented Generation (RAG) · Unstructured Data · Semantic Layer