Citeon
한국어 LLM 인용 데이터 리서치

ChatGPT·Gemini·Claude·Grok·Perplexity·네이버 AI탭은 한국 브랜드를 어떻게 인용하나 — RAG 메커니즘으로 푸는 AI 검색 인용 원리

박도현
박도현 · AEO 리서처
ChatGPT·Gemini·Claude·Grok·Perplexity·네이버 AI탭은 한국 브랜드를 어떻게 인용하나 — RAG 메커니즘으로 푸는 AI 검색 인용 원리

같은 질문을 ChatGPT, Gemini, Claude, Grok, Perplexity, 네이버 AI탭에 똑같이 던져 보면 답에 따라붙는 출처가 서로 다르다. 약 6억 8천만 건의 AI 인용을 분석한 연구에 따르면 ChatGPT와 Perplexity가 인용하는 출처의 도메인 중복은 약 11%에 그쳤다. 인용의 약 90%는 어느 엔진에 묻느냐에 따라 다른 출처에서 나온다는 뜻이다. 왜 이런 일이 벌어질까. 답은 이 여섯 엔진이 모두 RAG(Retrieval-Augmented Generation, 검색증강생성)라는 같은 골격을 공유하지만, 그 안에서 '어떤 문서를 꺼내올지' 결정하는 검색(retrieval) 방식이 제각각이기 때문이다. 이 글은 AI 검색엔진이 출처를 고르는 과정을 RAG의 작동 원리까지 한 단계씩 파고들어 설명하고, 그 메커니즘에서 역산해 "한국 브랜드의 콘텐츠가 인용되려면 정확히 무엇을 해야 하는가"를, 약한 예와 강한 예를 나란히 놓고 정리한다.

AI 검색은 사실 'RAG'다 — 답하기 전에 도서관에 다녀온다

생성형 AI 검색을 이해하는 가장 빠른 길은, 그것이 거대한 언어모델 하나가 아니라 검색기 + 언어모델의 조합이라는 사실을 받아들이는 것이다. 이 구조를 2020년 정식화한 사람들이 Facebook AI(현 Meta) 연구진이다. 이들은 모델 가중치 안에 통째로 학습된 지식(파라메트릭 메모리)만으로는 최신·전문 정보를 다루기 어렵다는 점을 지적하며, 외부 문서 색인(비파라메트릭 메모리)에서 관련 자료를 실시간으로 꺼내와 답을 생성하는 방식을 제안했다. 이것이 RAG의 출발점이다(Lewis 등, 2020).

비유하자면 이렇다. 똑똑한 사람에게 질문을 던졌을 때, 그가 머릿속 기억만으로 답하면 틀리거나 오래된 정보를 말할 위험이 있다. 그래서 그는 답하기 전에 도서관으로 달려가 관련 책 몇 권을 꺼내 펼친 뒤 그것을 근거로 답한다. AI 검색엔진이 하는 일이 정확히 이것이다. 이 '도서관 다녀오기'는 보통 세 단계로 나뉘는데, 콘텐츠가 인용되려면 이 세 관문을 차례로 통과해야 한다. 하나씩 뜯어보자.

1단계 — 검색(retrieval): 후보 도서관에 책이 꽂혀 있는가

질문이 들어오면 엔진은 먼저 그것을 여러 개의 하위 질의로 쪼갠다(query fan-out). "한국에서 AEO 대행 어디가 좋아?"라는 한 문장이 내부적으로 "AEO 대행사 목록", "AEO 비용", "AEO 효과 사례"처럼 여러 갈래로 갈라지는 것이다. 그런 다음 각 하위 질의에 대해 색인에서 관련 문서 수십 개를 끌어온다. 여기서 후보에 들지 못하면 그 콘텐츠는 인용 경쟁에 참여조차 못 한다. 검색은 보통 두 방식을 함께 쓰는데, 이 부분은 뒤에서 따로 자세히 다룬다.

2단계 — 재정렬(reranking): 깐깐한 심사위원의 재심사

1단계는 속도를 위해 질문과 문서를 각각 따로 인코딩해 대충 비슷한 것을 빠르게 추린다. 그래서 후보 20~30개 안에는 엉뚱한 것도 섞인다. 2단계 재정렬은 여기에 cross-encoder라는 심사위원을 투입한다. 이 모델은 질문과 후보 문서를 나란히 함께 읽어 진짜 관련도를 점수화한다. 1단계가 '제목만 보고 고른 책'이라면, 2단계는 '실제로 펼쳐서 질문에 답이 되는지 확인하는' 과정이다. 실무 벤치마크에서 이 재정렬 한 단계만 추가해도 검색 정확도(NDCG)가 통상 5~15점, 까다로운 데이터셋에서는 20점 가까이 오른다. 1단계를 통과해도 2단계에서 떨어지면 인용은 없다.

3단계 — 생성·인용(generation): 무엇을 근거로 삼을지 고른다

마지막으로 모델은 상위 문서들을 읽고 답을 쓰면서 그중 일부를 출처로 인용한다. 이때 모델은 아무 문장이나 인용하지 않는다. 검증 가능하고, 질문에 직접 답하며, 잘라내도 뜻이 통하는 문장을 선호한다. 이 선호가 콘텐츠 작성의 거의 모든 실전 규칙을 결정한다.

핵심은 이 세 단계가 전통적인 검색엔진의 '10개 파란 링크 순위'와 별개의 파이프라인이라는 점이다. 그래서 구글 검색 1위 페이지가 AI 답변에는 인용되지 않는 일이 흔하다. 검색 순위는 1단계 후보군 진입에 도움을 줄 뿐, 2·3단계에서 살아남는 것은 전혀 다른 문제다.

왜 엔진마다 인용이 다를까 — 1단계 '검색'의 두 갈래

엔진별 인용이 갈리는 핵심 원인은 1단계 검색 방식의 차이다. 문서를 찾는 방법에는 크게 두 갈래가 있다.

첫째는 키워드 검색(BM25)이다. 도서관의 단어 색인 카드를 떠올리면 된다. "한국형 AEO 대행"이라는 질문이 들어오면, 그 단어가 실제로 적힌 문서를 정확히 찾아낸다. 제품명, 에러 코드, 고유명사처럼 정확히 일치해야 의미가 있는 표현에 강하다. 대신 표현이 조금만 달라지면("AI 검색 대행" vs "AEO 대행") 놓친다.

둘째는 의미 검색(임베딩, dense retrieval)이다. 질문과 문서를 각각 의미를 담은 숫자 벡터로 바꾼 뒤, 의미가 가까운 것을 찾는다. 2020년 발표된 Dense Passage Retrieval은 이 방식이 단어가 겹치지 않아도 '뜻이 통하는' 문서를 찾아내며 전통 키워드 검색을 능가한다는 것을 보였다(Karpukhin 등, 2020). 도서관으로 치면 "이 질문이 무슨 주제인지 이해하는 사서"다. 표현이 달라도 주제가 같으면 찾아준다. 대신 정확한 고유명사·숫자에는 의외로 약하다.

여기서 핵심 통찰이 나온다. 두 방식은 서로의 약점을 정확히 메운다. 그래서 잘 만든 RAG 시스템은 둘을 함께 돌리고 그 결과를 RRF(Reciprocal Rank Fusion) 같은 방식으로 합치는 하이브리드 검색(hybrid search)을 쓴다. 공개된 벤치마크들을 종합하면 의미 검색 단독의 상위 10개 정확도(recall@10)는 약 78%, 키워드 검색 단독은 약 65%인데, 둘을 합치면 약 91%까지 올라간다. 두 결과를 섞는 데 드는 추가 지연은 10~50밀리초에 불과하다.

여섯 엔진은 이 배합과 색인 자체가 다르다. 한 분석에서 ChatGPT는 위키백과를 약 47.9%, Perplexity는 Reddit을 약 46.7% 인용했다. 둘의 출처 중복이 11%뿐인 이유가 여기 있다 — 같은 질문이어도 꺼내오는 책장이 다른 것이다. Claude는 근거가 약한 콘텐츠를 보수적으로 걸러내는 편이고, Grok은 실시간 웹과 함께 X(옛 트위터)의 게시물 스트림까지 들여다보며, 네이버 AI탭은 네이버 생태계 문서를 우선 본다. 그래서 한 엔진에 맞춘 콘텐츠가 다른 엔진에서는 통하지 않는다.

콘텐츠가 인용되려면 — RAG 메커니즘이 알려주는 7가지 (약한 예 vs 강한 예)

이제 방향을 뒤집어 보자. 위 파이프라인을 알면 "어떻게 써야 인용되는가"는 추측이 아니라 역산으로 나온다. 각 항목마다 왜 그런지를 연구 수치와 함께 짚고, 실제로 어떻게 다른지 약한 문장과 강한 문장을 나란히 보여준다.

1) 의미와 키워드를 한 문장에 함께 담아라

하이브리드 검색에 걸리려면 글이 두 검색 모두에 잡혀야 한다. 주제를 설명하는 자연스러운 문장(의미 검색용)에 더해, 정확한 고유명사·제품명·수치·전문 용어(키워드 검색용)를 함께 넣어야 한다.

2) 각 단락이 그 자체로 말이 되게 써라 (self-contained)

AI는 글 전체가 아니라 잘게 자른 토막(청크, chunk) 단위로 검색한다. 핵심 문장이 앞 문맥에 의존하면, 토막으로 잘렸을 때 미아가 된다. Anthropic이 2024년 공개한 Contextual Retrieval 실험은 이 문제를 정면으로 다뤘다. 각 청크 앞에 그 청크가 무엇에 관한 것인지 50~100단어의 맥락을 덧붙였더니, 상위 20개 검색 실패율이 35% 감소(5.7%→3.7%)했다. 키워드 검색을 함께 쓰자 49% 감소, 재정렬까지 더하자 67% 감소(→1.9%)했다.

실전에서는 대명사("이것·그것")를 줄여 주어를 반복하고, 표와 이미지에 설명 캡션을 달고, 소제목마다 그 아래 첫 문장이 소제목의 답이 되게 쓰는 것이 핵심이다.

3) 핵심 답은 맨 앞(또는 명확한 끝)에 배치하라

LLM은 끌어온 문서를 읽을 때 모든 위치를 똑같이 보지 않는다. Liu 등(2023)의 유명한 연구 "Lost in the Middle"은, 정답이 담긴 문서를 컨텍스트의 맨 앞이나 맨 끝에 두면 잘 활용하지만 중간에 묻으면 성능이 뚝 떨어지는 U자형 곡선을 보였다. 사람이 긴 회의록에서 첫머리와 마무리는 기억해도 중간은 흐릿한 것과 같다.

4) 통계·인용문·출처를 본문에 박아라

Princeton 연구진의 GEO(Generative Engine Optimization) 연구는 1만 개 질의로 "무엇이 생성엔진 답변 내 노출을 높이나"를 측정했다(Aggarwal 등, 2023). 가장 효과적인 세 가지는 키워드 밀도나 백링크가 아니라 출처 인용 추가, 직접 인용문 추가, 통계·수치 추가였고, 특정 도메인·엔진 조합에서는 가시성이 최대 약 40%까지 올랐다. 모델이 답을 생성할 때 검증 가능한 문장을 선호하기 때문이다.

5) 추출하기 쉬운 구조로 써라 (표·정의 박스·FAQ)

같은 정보라도 줄글보다 구조화된 형태가 검색·추출에 유리하다. 특히 Perplexity 같은 엔진은 비정형 산문보다 표, 정의 박스, FAQ 스키마를 더 효율적으로 끌어와 인용한다. 비교 질문에는 표, 방법 질문에는 번호 목록, 정의 질문에는 한 문장 정의처럼 질문 의도에 맞는 형식으로 답하는 것이 핵심이다. 아래는 AI가 그대로 인용하기 쉬운 FAQ 구조화 데이터의 최소 예시다.

{
  "@context": "https://schema.org",
  "@type": "FAQPage",
  "mainEntity": [{
    "@type": "Question",
    "name": "AEO 대행은 무엇을 하나요?",
    "acceptedAnswer": {
      "@type": "Answer",
      "text": "AEO 대행은 ChatGPT·Perplexity 등 AI 답변에 브랜드가 인용되도록 콘텐츠 구조·엔티티·출처 신호를 최적화하는 서비스입니다."
    }
  }]
}

6) 주장마다 근거가 추적되게 하라 (faithfulness)

RAG 시스템의 품질을 재는 대표 지표 중 하나가 충실도(faithfulness)다. 답변의 모든 주장이 실제로 끌어온 출처에서 추적되는 정도를 말하며, 1.0이면 전부 근거가 있고 0에 가까우면 모델이 지어낸 것이다(RAGAS 평가 프레임워크). 이 지표가 콘텐츠 제작자에게 시사하는 바는, 출처와 단단히 연결된 검증 가능한 글일수록 AI가 안심하고 인용하고, 근거 없는 단정은 인용 후보에서 탈락한다는 것이다. 앞서 본 Claude가 근거 약한 콘텐츠를 보수적으로 걸러내는 성향이 바로 이 원리의 엔진 버전이다.

7) AI 크롤러의 접근을 막지 마라

아무리 잘 써도 검색 후보 도서관에 책이 꽂혀 있지 않으면 소용없다. AI 엔진은 각자의 크롤러로 웹을 읽어 색인을 만든다. GPTBot·OAI-SearchBot(OpenAI), PerplexityBot, ClaudeBot·anthropic-ai(Anthropic), Google-Extended(구글 AI)를 robots.txt에서 차단하면, 해당 엔진의 검색 후보 풀에 아예 들어가지 못한다. 로그인 장벽·과도한 자바스크립트 렌더링도 크롤러가 본문에 닿는 것을 막으니 점검 대상이다.

주요 AI 엔진은 어떻게 다른가

지금까지의 원리를 엔진별로 정리하면 다음과 같다(웹 트래픽 점유율이 높은 순서, 공개된 연구·공식 발표 기준).

엔진검색 기반인용 성향콘텐츠 시사점
ChatGPT (search)자체 색인 + Bing 신호위키백과 비중이 매우 높고 커뮤니티·리뷰 인용 다수위키 수준의 엔티티 정보·구조화 데이터가 유리
Gemini / 구글 AI구글 검색 인프라구글 색인 기반, E-E-A-T 권위·크롤 접근성 중시Search Central 가이드 준수가 직접 영향
Claude (web search)웹 검색 도구 + Citations API인라인 인용, 근거 약한 SEO 리스티클·애그리게이터를 보수적으로 down-weight검증 가능한 1차 출처·정확한 인용·신뢰 신호가 특히 중요
Grok (xAI)실시간 웹 + X(트위터) 게시물 스트림현재성·신선도에 강하나 인용 정확도 편차가 큼(CJR 평가)최신 콘텐츠 + X 브랜드 활동 + 명확한 출처 구조
Perplexity실시간 웹 + 인라인 인용출처를 답변에 명시, 신선도·구조화·접근성 높은 문서 선호최신성·robots 허용·표/FAQ 구조가 중요
네이버 AI탭 / AI 브리핑프로덕트 네이티브 LLM + 네이버 생태계질의 이해→출처 수집→사실성 일치의 3단계 구조로 환각 억제네이버 블로그·지식iN·플레이스 등 한국 출처 자산이 좌우

한 가지 사실을 정확히 짚어둔다. 네이버의 초기 생성형 검색이던 큐:(Cue:)는 2026년 4월 9일 종료됐고, 네이버는 2026년 6월 26일 대화형·에이전틱 검색인 'AI탭'을 전체 사용자 대상으로 정식 출시했다. AI 브리핑(검색결과 요약)과 AI탭(대화형 탐색)이 현재 네이버 AI 검색의 두 축이다. 큐: 기준으로 작성된 오래된 GEO 가이드는 이 시점부터 갱신이 필요하다.

한국 브랜드가 특히 다르게 봐야 할 것

글로벌 인용 연구에서 Reddit은 거의 모든 엔진에서 가장 많이 인용되는 출처(엔진별 약 40% 빈도)다. 그러나 한국어 질의 환경에서는 Reddit의 자리를 네이버 블로그·지식iN·카페·티스토리, 그리고 위키백과·나무위키 같은 한국형 출처가 대신한다. 게다가 네이버는 자사 콘텐츠를 외부 크롤러로부터 막아두기 때문에, 글로벌 엔진(ChatGPT·Perplexity)과 네이버 AI는 사실상 서로 다른 도서관을 본다. 한국 브랜드의 인용 전략을 글로벌 플레이북 그대로 옮길 수 없는 이유다. 이 '두 개의 전선'은 네이버 생태계 편에서 자세히 다룬다.

그래서, 어떻게 측정하나

인용의 약 90%가 엔진마다 다르다는 사실은 측정에도 직접적인 함의를 준다. 한 엔진에서의 결과만 보고 콘텐츠 효과를 판단해서는 안 된다. ChatGPT에서 인용이 늘어도 Perplexity에서는 그대로일 수 있다. 엔진별로 따로 측정하고, 핵심 질문 세트에 대해 내 브랜드가 몇 번 인용되는지(Share of Voice)를 주기적으로 추적해야 변화가 보인다. 다만 그 숫자에도 함정이 있어, 측정을 정직하게 읽는 법은 측정 지표 편에서 따로 다룬다.

Citeon은 이 원리를 그대로 제품에 담았다

지금까지 설명한 RAG·retrieval 메커니즘은 우리가 책상에서 정리한 이론이 아니라, Citeon이 제품을 만들며 직접 파고든 연구의 일부다. 이 글에서 인용한 RAG 원전, Lost in the Middle, Contextual Retrieval 같은 자료를 우리 팀이 읽고 제품에 반영한다. 그래서 Citeon 도구는 이 글의 결론을 그대로 닮았다.

AI 검색 인용은 한 번의 작업으로 끝나지 않는다. 색인과 알고리즘은 계속 바뀌고, 인용 슬롯은 경쟁사와 나누는 제로섬에 가깝다. 그래서 Citeon은 일회성 점검이 아니라, 위 원리에 기반해 꾸준히 측정하고 실행하는 대행을 지향한다.

당신의 사이트는 이 7가지 기준에 몇 점일까. ChatGPT·Perplexity·Gemini가 지금 당신 브랜드를 어떻게 보고 있는지 Citeon 무료 진단으로 확인해 보라. 비용도 가입도 없이, 당신의 출발점을 숫자로 볼 수 있다.

검색 1위인데 왜 AI 답변에는 인용되지 않나요?

생성형 검색은 검색 순위와 분리된 RAG 파이프라인에서 출처를 고릅니다. 질문을 여러 하위 질의로 나눠 문서를 검색(retrieval)하고, 관련도로 재정렬(reranking)한 뒤, 검증 가능하고 직답형인 문서를 인용합니다. 검색 1위라도 단락이 문맥 없이 잘리거나, 핵심 답이 글 중간에 묻혀 있거나, 크롤러 접근이 막혀 있으면 인용되지 않을 수 있습니다.

AI에 인용되게 하려고 가장 먼저 할 일은 무엇인가요?

세 가지를 먼저 점검하세요. (1) AI 크롤러(GPTBot·PerplexityBot·ClaudeBot·Google-Extended)가 robots.txt에서 허용돼 있는지, (2) 핵심 질문에 대한 직답이 글 첫 문단에 있는지, (3) 각 단락에 통계·출처·정확한 고유명사가 들어 있는지입니다. 이 세 가지만으로도 검색 후보 진입과 인용 확률이 크게 달라집니다.

왜 단락을 '그 자체로 말이 되게' 써야 하나요?

AI는 문서를 통째로 보지 않고 잘게 자른 토막(청크) 단위로 검색하기 때문입니다. 앞 문맥에 의존하는 문장은 토막으로 잘리면 뜻이 사라져 검색에 잡히지 않습니다. Anthropic의 2024년 실험에서는 각 토막에 맥락을 덧붙이는 것만으로 검색 실패율이 35% 줄었습니다. 대명사를 줄이고 주어를 반복하며, 표·이미지에 설명 캡션을 다는 것이 실전 방법입니다.

여섯 엔진을 한 번에 최적화할 수 있나요?

공통 신호(self-contained 단락, answer-first 구조, 통계·출처, 크롤러 허용)는 한 번에 다질 수 있습니다. 다만 인용 출처의 약 90%가 엔진마다 다를 만큼 색인과 검색 방식이 달라, 완전히 한 번에 맞추기는 어렵습니다. 공통 신호를 먼저 정비하고 엔진별 노출을 따로 측정해 우선순위를 조정하는 방식이 현실적입니다.

박도현
박도현 · AEO 리서처

생성형 검색·LLM 인용에 관한 논문과 데이터를 읽고 실무 언어로 옮깁니다. 근거 없는 '카더라'를 싫어합니다.

내 사이트의 AI 검색 점수가 궁금하다면

30초 무료 진단으로 SEO·AEO·GEO 점수와 처방을 받아보세요.

무료 진단 시작
← 인사이트 목록으로