Citeon
논문·연구 분석

Contextual Retrieval의 마케팅 함의

박도현
박도현 · AEO 리서처
Contextual Retrieval의 마케팅 함의

결론부터: Contextual Retrieval의 마케팅 함의는 '문단 하나가 페이지 전체의 맥락을 스스로 품고 있어야 AI에게 검색·인용된다'는 것이다. 앤트로픽이 2024년 공개한 이 기법은 검색 단위인 청크(chunk) 앞에 그 청크가 무슨 글의 어느 맥락인지 설명하는 짧은 문장을 붙이는 것만으로, 검색이 정답을 놓치는 비율을 5.7%에서 3.7%로 약 35% 떨어뜨렸다. 거대한 모델 교체도, 더 비싼 임베딩도 아니다. '맥락을 잃은 조각을 맥락이 있는 조각으로 바꾼' 것뿐이다. 그리고 바로 이 지점이 콘텐츠를 만드는 우리에게 거의 그대로 적용된다. AI 검색엔진의 검색기는 당신의 글을 통째로 읽지 않는다. 잘게 잘라서, 그 조각만 보고 인용 후보로 올릴지 결정한다. 조각이 외로우면 떨어진다.

왜 AI는 글을 통째로 읽지 않는가 — RAG의 3단 구조

이 글의 모든 함의는 RAG(Retrieval-Augmented Generation, 검색 증강 생성)라는 메커니즘에서 나온다. ChatGPT·Perplexity·구글 AI 개요·네이버 AI 브리핑이 답을 만드는 방식은 본질적으로 같다. 2020년 Lewis 등이 정의한 원전(arXiv:2005.11401)의 표현을 빌리면, 모델 안에 굳어 있는 지식(파라메트릭 메모리)과 그때그때 외부에서 끌어오는 문서(비파라메트릭 메모리)를 결합한다. 후자가 바로 당신의 콘텐츠가 들어갈 자리다.

그 과정은 3단계로 나뉜다.

핵심은 검색의 단위가 '글'이 아니라 '조각(청크)'이라는 점이다. 책 한 권을 통째로 책상에 올려놓고 읽는 게 아니라, 책을 수백 장의 인덱스 카드로 찢어서 카드 한 장씩 평가한다고 보면 된다. 당신이 공들여 쓴 도입부의 맥락, 앞 문단에서 정의한 주어, 글 제목이 부여한 주제 — 이 모든 것이 카드 한 장에는 적혀 있지 않다. 그 카드만 보면 '이게 무슨 얘기인지' 알 수 없는 경우가 허다하다.

맥락을 잃은 조각이라는 고질병

앤트로픽이 든 예시는 정확하다. 어느 기업 재무 문서에서 다음 문장이 청크로 잘려 나왔다고 하자.

"회사 매출은 전 분기 대비 3% 증가했다."

이 카드만 보면 어느 회사의, 어느 분기 매출인지 알 수 없다. 사용자가 "ACME사 2023년 2분기 매출 성장률은?"이라고 물어도, 검색기는 이 조각을 끌어오지 못할 가능성이 높다. 회사명도 연도도 카드에 없으니까. 정답을 품고 있는데도 검색에서 탈락한다. 이것이 바로 'lost context(맥락 상실)' 문제다.

Contextual Retrieval: 조각마다 '명찰'을 달아준다

앤트로픽의 해법은 단순해서 더 강력하다. 각 청크를 색인하기 전에, 그 청크가 전체 문서의 어느 맥락에 속하는지 설명하는 짧은 문장(보통 50~100토큰)을 앞에 붙인다. 위 예시는 이렇게 바뀐다.

"이 청크는 ACME사의 2023년 2분기 실적 보고서 중 매출 부분이다. 
직전 분기 매출은 3억 1,400만 달러였다. 회사 매출은 전 분기 대비 3% 증가했다."

도서관 비유로 풀면 이렇다. 원래는 책에서 찢어낸 낱장을 그냥 상자에 던져 넣은 것이다. 사서가 "매출 3% 성장"을 찾으려 해도 어느 책 몇 페이지인지 모른다. Contextual Retrieval은 낱장마다 위에 '〈ACME 2023 2분기 보고서〉 매출 항목'이라는 명찰을 스테이플러로 박아두는 것이다. 이제 사서는 낱장 한 장만 보고도 출처와 맥락을 안다.

숫자가 말하는 것 — 35%, 49%, 67%

이 작은 변화의 효과는 측정으로 입증됐다. 앤트로픽 발표 기준:

기법검색 실패율(top-20 기준)개선 폭
기본 임베딩 검색5.7%기준선
+ 청크에 맥락 추가(Contextual Embeddings)3.7%약 35% 감소
+ BM25 키워드 검색 결합(하이브리드)2.9%약 49% 감소
+ Reranking(재정렬) 추가1.9%약 67% 감소

여기서 마케터가 읽어야 할 메시지는 세 겹이다. 첫째, 맥락을 붙인 것만으로 3분의 1 이상의 검색 실패가 사라졌다. 둘째, 키워드 검색을 함께 쓰자 더 떨어졌다(하이브리드의 위력). 셋째, 재정렬까지 더하니 실패율이 처음의 3분의 1 수준이 됐다. 이 세 단계가 그대로 콘텐츠 전략의 세 가지 레버다.

함의 1 — 모든 문단은 '자기소개'를 품어야 한다

가장 직접적인 교훈. 검색기가 당신의 글을 조각낼 때, 각 조각이 홀로 떨어져 나가도 '무엇에 대한 이야기인지' 스스로 말할 수 있어야 한다. 대명사로 시작하거나, 앞 문단을 받아야만 뜻이 통하는 문단은 잘리는 순간 맥락을 잃는다.

실제 문장으로 보자. 가령 'AEO(답변 엔진 최적화)' 가이드 글의 한 문단을 쓴다면:

약한 예 (앞 문단에 기대는 조각):

그것을 적용하면 인용률이 오른다. 특히 두 번째 방법이 효과적인데, 
위에서 본 것처럼 통계를 함께 넣는 경우다.

이 카드만 검색기에 떨어지면 '그것'도 '두 번째 방법'도 '위에서 본 것'도 알 수 없다. 명찰 없는 낱장이다.

강한 예 (스스로 맥락을 품은 조각):

AEO(답변 엔진 최적화)에서 인용률을 높이는 가장 확실한 방법은 
주장 옆에 출처와 통계를 함께 적는 것이다. 예컨대 "전환율이 높다"가 아니라 
"일부 분석에서 AI 검색 유입의 전환율이 일반 검색의 수 배로 나타났다"처럼 쓴다.

강한 예는 그 자체로 주제(AEO)·핵심 주장·근거 형태를 다 담는다. 검색기가 "AEO 인용률 올리는 법"을 물어온 질문 옆에 이 카드를 놓으면, 의미가 즉시 매칭된다. 이것이 Contextual Retrieval이 알고리즘으로 자동화한 일을, 우리는 글쓰기 단계에서 미리 해두는 것이다. 모델이 청크에 명찰을 달아주기 전에, 우리가 문단 자체를 명찰이 박힌 상태로 출고한다.

구체적 글쓰기 규칙

함의 2 — 하이브리드 검색이 당신의 키워드를 다시 살린다

앤트로픽 실험에서 맥락 추가에 BM25(키워드 색인 기반 검색)를 결합하자 실패율이 3.7%에서 2.9%로 더 떨어졌다. 한동안 '이제 의미 검색의 시대니 키워드는 죽었다'는 말이 돌았지만, 데이터는 정반대를 말한다. 의미 검색과 키워드 검색은 서로의 약점을 메운다.

비유하면, 하이브리드 검색은 도서관의 키워드 색인 카드(BM25)와 주제를 통째로 이해하는 노련한 사서(의미 임베딩)를 함께 쓰는 것이다. 색인 카드는 '제품명 정확히 일치' 같은 고유명사·전문용어·모델명을 칼같이 잡아낸다. 사서는 '환불받고 싶은데 어떻게'처럼 단어가 안 겹쳐도 의도를 읽는다. 둘 중 하나만 쓰면 한쪽 질문 유형을 통째로 놓친다.

공개 벤치마크들을 종합하면 recall@10(상위 10개 안에 정답이 들어오는 비율)이 이런 양상을 보인다.

검색 방식recall@10(대략)강점
BM25(키워드) 단독약 65%고유명사·정확 일치·희귀 용어
의미(임베딩) 단독약 78%동의어·의도·풀어쓴 질문
하이브리드(RRF 결합)약 91%둘의 합집합

2020년 Karpukhin 등의 Dense Passage Retrieval(arXiv:2004.04906)이 의미 검색이 BM25를 능가함을 보였지만, 그게 'BM25를 버리라'는 뜻은 아니었다. 결합이 단독을 넘는다. 마케팅 함의는 이렇다.

약한 예 — 키워드를 의도적으로 피하고 두루뭉술하게:

저희 솔루션은 검색 가시성을 종합적으로 개선하는 통합 플랫폼입니다.

강한 예 — 의미도 키워드도 다 잡히게:

Citeon은 ChatGPT·Gemini·Perplexity·Claude 네 엔진에서 브랜드 인용을 측정하는 
SOV(Share of Voice) 진단 도구입니다. 'AI 검색 노출 측정', 'AEO 진단', 
'생성엔진 최적화'를 한 곳에서 처리합니다.

강한 예는 사서(의미)에게는 '브랜드가 AI 답변에 얼마나 등장하나'라는 의도를, 색인 카드(키워드)에게는 'SOV', 'AEO', 'Perplexity' 같은 정확 일치 토큰을 동시에 던진다. 두 검색 경로 모두에서 후보로 떠오른다.

함의 3 — Reranking이 있으니 '낚시 제목'은 끝까지 안 통한다

재정렬(reranking)은 1차로 끌어온 후보 수십 개를, 사용자 질문과 각 후보를 한 쌍으로 묶어 다시 읽고(cross-encoder) 점수를 매겨 순위를 뒤집는 단계다. 앤트로픽 실험에서 재정렬을 더하자 실패율이 2.9%에서 1.9%까지 내려갔고, 공개 자료들에서 재정렬은 NDCG(순위 품질 지표)를 통상 5~15포인트, 난도 높은 질의에서는 20포인트 가까이 끌어올린다.

비유하면 1차 검색이 '제목과 첫인상만 보고 추려낸 서류 더미'라면, 재정렬은 채용 담당자가 그 서류를 질문(직무 요건)과 나란히 놓고 한 장씩 정독해 다시 줄 세우는 면접이다. 제목이 그럴듯해서 1차를 통과해도, 정독 단계에서 내용이 질문과 안 맞으면 가차 없이 뒤로 밀린다.

그래서 콘텐츠 전략의 결론은 명확하다. 제목·메타태그로 검색에 걸리게 하는 것까지는 1차 검색의 영역이지만, 인용까지 가려면 본문이 질문에 실제로 답해야 한다. 낚시는 재정렬에서 걸러진다.

❌ 약한 예: 제목은 "AI 검색 완벽 정복 2026"인데 본문은 회사 자랑만.
✅ 강한 예: 제목이 "AI 검색에서 인용되는 법"이면, 본문 각 섹션이 "무엇을", "왜", "어떻게"에 직답하는 문단으로 구성.

함의 4 — top-20에 들어야 게임이 시작된다 (그리고 그 위가 더 중요하다)

앤트로픽은 후보를 top-20까지 넓게 가져오기를 권장했다. 검색이 정답을 후보군에 일단 포함시키는 것이 1차 관문이라는 뜻이다. 하지만 후보에 들었다고 인용되는 건 아니다. 여기서 2023년 Liu 등의 'Lost in the Middle'(arXiv:2307.03172)이 결정적이다.

이 연구는 긴 맥락을 받은 LLM이 중간에 놓인 정보를 체계적으로 놓친다는 U자형 곡선을 보였다. 맨 앞과 맨 끝의 정보는 잘 활용하지만, 가운데로 갈수록 무시한다. 사람이 긴 회의록을 받으면 처음과 끝은 기억하고 중간은 흐릿한 것과 같다.

이 둘을 합치면 마케팅 함의가 또렷해진다. 당신의 콘텐츠가 (1) Contextual Retrieval 덕에 잘 검색돼 top-20 후보에 들고, (2) 재정렬에서 상위로 올라가고, (3) 그 상위가 모델 입력의 앞이나 끝에 놓일 때 비로소 인용된다. 그래서 글에서 가장 인용 가능성이 높은 위치는 핵심 직답을 담은 도입부와, 요약·결론을 담은 마지막이다. 가장 중요한 주장을 본문 한가운데 깊숙이 묻어두면, 검색은 통과해도 생성 단계에서 잊힌다.

함의 5 — 근거·통계·인용문이 가시성을 끌어올린다 (GEO 실험과의 만남)

Contextual Retrieval이 '검색이 조각을 잘 끌어오게 하는 법'이라면, 2023년 Aggarwal 등의 GEO 연구(arXiv:2311.09735, KDD 2024)는 '끌려온 조각이 생성 단계에서 잘 인용되게 하는 법'을 측정했다. 결과: 통계 수치, 출처 인용, 직접 인용문을 본문에 추가하면 생성엔진에서의 가시성이 특정 조건에서 최대 약 40%까지 올랐다.

두 연구가 한 방향을 가리킨다는 점이 중요하다. 맥락이 박힌 문단(함의 1)에 더해, 그 문단이 검증 가능한 숫자와 출처를 품으면, 검색 단계와 생성 단계 양쪽에서 동시에 강해진다. RAGAS 같은 평가 프레임워크가 측정하는 'faithfulness(답변 주장이 출처에서 추적되는 정도)'도 같은 논리다. 실무에서 흔히 0.9 이상이면 안정, 0.7 미만이면 위험으로 본다(팀마다 기준은 다르다). 출처가 또렷한 콘텐츠는 모델이 안심하고 인용한다 — 특히 Claude처럼 근거가 약한 콘텐츠를 보수적으로 걸러내는 엔진에서 차이가 크다.

❌ 약한 예: "AI 검색은 전환율이 압도적으로 높습니다."
✅ 강한 예: "일부 분석에서 AI 검색 유입의 전환율이 일반 검색보다 몇 배 높게 나타나기도 했다(구체 수치는 사례별로 다르다)."

강한 예는 정직하면서도 인용 가능하다. 과장은 재정렬과 보수적 엔진에서 깎이고, 정직한 정성 표현은 살아남는다.

크롤러부터 통과해야 한다 — 후보 진입의 전제

위 모든 함의는 한 가지를 전제한다. AI 검색의 크롤러가 당신 페이지를 읽을 수 있어야 한다. robots.txt에서 다음 봇들을 허용하지 않으면 애초에 색인 후보에 들지 못한다.

크롤러소속
GPTBot · OAI-SearchBotOpenAI(ChatGPT)
PerplexityBotPerplexity
ClaudeBot · anthropic-aiAnthropic(Claude)
Google-ExtendedGoogle(Gemini·AI 개요)

참고로 네이버는 외부 크롤러를 차단하기 때문에, 글로벌 AI는 네이버 본문 대신 나무위키·위키백과·티스토리를 우회 인용하는 경향이 있다. 한국 시장에서 AI 인용을 노린다면 이 우회 경로를 함께 고려해야 한다.

측정은 한 번으로 끝나지 않는다 — 비결정성이라는 현실

마지막으로 david의 관점에서 정직하게 짚을 것. AI 인용을 '한 번 검색해보고' 판단하면 안 된다. 같은 질문, 같은 설정(temperature=0)에서도 LLM의 출력은 흔들린다. GPU 연산 순서와 배치 처리 때문이다. 한 분석에서는 2,350억 파라미터급 모델을 1,000번 돌렸을 때 80가지 출력이 나왔고, AI 가시성 자체가 멱법칙으로 출렁여 다중 실행과 부트스트랩 신뢰구간으로 측정할 것을 권한 연구도 있다(arXiv:2603.08924). 단일 측정은 노이즈다.

그래서 측정은 반복·추세로 봐야 한다. 또한 엔진마다 인용 성향이 크게 다르다는 점도 기억해야 한다. 대규모 인용 분석에서 ChatGPT와 Perplexity가 인용한 도메인의 중복은 약 11%에 불과했고, 인용의 약 90%가 엔진마다 달랐다. ChatGPT는 위키백과를 약 47.9%, Perplexity는 Reddit을 약 46.7% 비중으로 인용하는 식으로 성향이 갈린다. 한 엔진에서의 측정을 전체로 일반화하면 안 된다.

Citeon은 이 원리를 제품에 담았다

Contextual Retrieval이 가르쳐준 것은 결국 '조각 단위의 품질을 측정하고 고쳐야 한다'는 것이다. Citeon은 그 작업을 대신한다.

지금 당신의 콘텐츠가 조각으로 잘렸을 때 검색·인용될 만한지, citeon.cloud에서 무료 진단(₩0)으로 확인해볼 수 있다. URL 하나면 된다.

자주 묻는 질문

Contextual Retrieval은 제가 쓰는 글에 직접 적용하는 기술인가요?

아니요, Contextual Retrieval 자체는 RAG 시스템을 운영하는 쪽(검색기 구축자)이 색인 단계에서 쓰는 기법입니다. 다만 그 핵심 통찰 — '검색 단위인 조각이 홀로 떨어져도 맥락을 품어야 한다' — 은 콘텐츠 작성자에게 그대로 적용됩니다. 모델이 알고리즘으로 명찰을 달아주기 전에, 우리가 문단을 명찰이 박힌 상태로 쓰는 것이 가장 확실합니다.

맥락을 문단마다 반복하면 글이 장황해지지 않나요?

요점은 같은 말의 반복이 아니라 '주어와 주제의 명시'입니다. 대명사('그것')를 고유명사로, '작년'을 '2024년'으로 바꾸고, 각 섹션 첫 문장을 직답으로 닫는 정도면 충분합니다. 오히려 사람 독자에게도 읽기 쉬운 구조가 되며, 네이버가 강조하는 '읽기 쉬운 구조' 원칙과도 맞습니다.

키워드 최적화(SEO)는 이제 필요 없는 것 아닌가요?

정반대입니다. 앤트로픽 실험에서 의미 검색에 BM25(키워드 검색)를 결합하자 실패율이 추가로 떨어졌습니다(3.7%→2.9%). 하이브리드 검색이 표준이기 때문에, 정확한 고유명사·전문용어·제품명을 본문에 명시하는 전통적 키워드 작업은 여전히 검색 후보 진입에 기여합니다. 의미와 키워드 둘 다 잡히게 쓰는 것이 답입니다.

한 번 검색해서 우리 브랜드가 인용되면 성공인가요?

단정하기 이릅니다. 같은 질문, 같은 설정에서도 LLM 출력은 GPU 연산·배치 때문에 흔들립니다. 한 분석에서는 대형 모델 1,000회 실행에 80가지 출력이 나왔습니다. 인용은 멱법칙으로 출렁이므로, 다중 실행과 추세(주간 모니터링)로 판단해야 합니다. 단일 측정은 노이즈에 가깝습니다.

가장 먼저 무엇부터 고쳐야 하나요?

세 가지 순서를 권합니다. (1) robots.txt에서 GPTBot·PerplexityBot·ClaudeBot·Google-Extended 허용 — 후보 진입의 전제입니다. (2) 각 섹션 첫 문장을 질문에 대한 직답으로, 대명사 시작 문단을 고유명사로 교체 — 맥락을 품은 조각 만들기. (3) 핵심 주장 옆에 검증 가능한 출처·통계 추가 — GEO 연구가 보인 가시성 상승 레버. citeon.cloud 무료 진단이 이 항목들을 점수와 처방으로 짚어줍니다.

참고자료

박도현
박도현 · AEO 리서처

생성형 검색·LLM 인용에 관한 논문과 데이터를 읽고 실무 언어로 옮깁니다. 근거 없는 '카더라'를 싫어합니다.

내 사이트의 AI 검색 점수가 궁금하다면

30초 무료 진단으로 SEO·AEO·GEO 점수와 처방을 받아보세요.

무료 진단 시작
← 인사이트 목록으로