Citeon
한국어 LLM 인용 데이터 리서치

ChatGPT는 한국 브랜드 정보를 어디서 가져오는가

박도현
박도현 · AEO 리서처
ChatGPT는 한국 브랜드 정보를 어디서 가져오는가

결론부터: ChatGPT는 한국 브랜드 정보를 '네이버'가 아니라, 자신이 학습·검색으로 닿을 수 있는 영역 — 즉 위키백과·나무위키·티스토리·커뮤니티(레딧 포함)와 자사 공식 웹페이지에서 우선적으로 가져온다. 그 이유는 단순하다. 한국 웹의 핵심 자산(네이버 블로그·카페·지식iN)은 외부 AI 크롤러를 차단하고 있어, ChatGPT의 검색 파이프라인이 애초에 그 문을 통과하지 못한다. 그래서 ChatGPT는 '들어갈 수 있는 문'으로 우회한다. 이 글은 그 우회의 메커니즘을 RAG 검색 원리와 공개 인용 분석 데이터로 한 겹씩 벗겨낸다. — david(AEO 리서처)

먼저 오해부터 깬다: ChatGPT는 '아는 것'을 말하지 않는다

많은 마케터가 ChatGPT를 '많이 외운 학생'으로 상상한다. 그래서 '우리 브랜드를 학습시키면 된다'고 생각한다. 절반만 맞다. 현대의 AI 검색 답변은 모델의 기억(파라메트릭 메모리)만으로 만들어지지 않는다.

2020년 페이스북 AI 연구진이 발표한 RAG(Retrieval-Augmented Generation) 논문(Lewis 등, arXiv:2005.11401)이 이 구조의 원형이다. 핵심은 두 종류의 기억을 결합한다는 것이다. 하나는 모델 가중치에 녹아든 파라메트릭 메모리(학습 때 외운 것), 다른 하나는 답변 시점에 외부 문서를 실시간으로 찾아오는 비파라메트릭 메모리(검색해서 읽는 것)다.

비유하면 이렇다. ChatGPT는 시험장에 들어온 학생인데, 머릿속 지식만 쓰는 게 아니라 오픈북 시험을 본다. 모르거나 최신 정보가 필요하면 옆에 펼쳐둔 자료(검색 결과)를 그 자리에서 읽고 답을 조합한다. 그래서 질문이 '2026년 한국 OO 브랜드 추천'처럼 최신·구체적일수록, 답변은 모델의 기억이 아니라 그 순간 검색해 온 문서에 좌우된다.

여기서 마케터에게 중요한 한 문장이 나온다. 당신의 브랜드가 인용되려면, '검색 단계에서 후보로 회수되는 문서' 안에 들어가 있어야 한다. 회수되지 않으면 모델은 당신의 존재 자체를 답변 생성 재료로 쓸 수 없다.

RAG는 3단계다: 회수 → 재정렬 → 생성

ChatGPT가 브랜드 정보를 '어디서' 가져오는지 이해하려면 검색 파이프라인의 3단계를 알아야 한다.

단계하는 일비유
1. 회수(Retrieval)거대한 인덱스에서 질문과 관련된 후보 문서 수십~수백 개를 끌어온다도서관에서 관련 책을 한 수레 가져옴
2. 재정렬(Reranking)후보를 질문과 함께 정밀히 다시 읽어 진짜 중요한 순서로 줄 세운다사서가 수레를 훑어 '이 질문엔 이 책'을 위로 올림
3. 생성(Generation)상위 문서 몇 개만 맥락에 넣고 자연어 답변을 작성·인용한다학생이 펼친 책 몇 권만 보고 답안 작성

회수 단계는 다시 두 갈래로 나뉜다. 키워드 검색(BM25)은 단어가 글자 그대로 일치하는지 본다. 의미 검색(임베딩/Dense Retrieval)은 단어가 달라도 뜻이 비슷하면 찾아낸다. 2020년 DPR 논문(Karpukhin 등, arXiv:2004.04906)은 의미 기반 검색이 전통 BM25를 능가한다는 것을 보였다.

비유하면 하이브리드 검색은 키워드 색인(BM25)을 가진 도서관 + 주제를 이해하는 사서(임베딩)의 조합이다. 색인은 '갤럭시'라는 정확한 단어를 잡고, 사서는 '삼성 최신 스마트폰'이라는 다른 표현도 같은 주제로 연결한다. 공개 벤치마크를 종합하면 recall@10(상위 10개 안에 정답을 담는 비율)이 의미 단독 약 78%, BM25 단독 약 65%인데, 둘을 RRF로 섞은 하이브리드는 약 91%까지 올라간다.

Anthropic이 2024년 공개한 Contextual Retrieval 연구는 이 흐름을 수치로 못 박았다. 청크(문서 조각)에 맥락을 덧붙이면 검색 실패율이 35% 줄고(5.7%→3.7%), 여기에 BM25 하이브리드를 더하면 49%, 재정렬(reranking)까지 얹으면 67%까지 실패율이 감소했다. 그들은 상위 후보를 넉넉히(top-20) 모델에 넘길 것을 권한다. 재정렬용 cross-encoder는 NDCG를 보통 5~15포인트(난도 높으면 약 20) 끌어올린다.

정리하면, 당신의 브랜드 페이지가 (1) 의미적으로도 키워드로도 잡히고 (2) 재정렬에서 위로 올라갈 만큼 질문에 직접 답하고 (3) 맥락이 충분해야 비로소 생성 단계의 답변 재료가 된다. 이건 한국이든 미국이든 동일한 물리 법칙이다. 다른 건 '인덱스에 무엇이 들어 있느냐'다 — 그리고 한국에서 바로 이 부분이 비틀린다.

핵심: 한국 웹의 절반은 ChatGPT에게 '잠긴 문'이다

한국 사용자가 정보를 찾는 1차 관문은 네이버다. 블로그·카페·지식iN·플레이스가 한국 검색 경험의 본체다. 문제는 네이버가 외부 AI 크롤러를 차단한다는 사실이다.

AI 검색 엔진이 어떤 페이지를 후보로 회수하려면, 그 페이지를 자사 크롤러로 긁어 인덱스에 넣을 수 있어야 한다. OpenAI는 학습용 GPTBot과 검색용 OAI-SearchBot을, Perplexity는 PerplexityBot을, Anthropic은 ClaudeBot·anthropic-ai를, 구글은 Google-Extended를 운영한다. 사이트의 robots.txt가 이 봇들을 허용해야 '후보 진입'이 가능하다.

# 후보 진입의 최소 조건 — robots.txt에서 허용
User-agent: GPTBot
Allow: /

User-agent: OAI-SearchBot
Allow: /

User-agent: PerplexityBot
Allow: /

네이버 생태계 콘텐츠는 이 문을 잠가 둔 영역이 많다. 그 결과 ChatGPT는 한국 브랜드를 설명할 때 네이버에 쌓인 방대한 리뷰·후기 대신, 들어갈 수 있는 다른 문을 쓴다. 글로벌 AI들이 한국 정보를 나무위키·위키백과·티스토리를 통해 우회 수집하는 패턴이 관찰되는 이유가 여기 있다. 잠긴 네이버 대신, 열려 있고 구조가 깔끔한 이 출처들이 회수 단계에서 후보로 올라온다.

이것이 한국 브랜드 마케팅의 결정적 분기점이다. 네이버 블로그에 후기 1,000개가 쌓여 있어도, 그게 ChatGPT 답변에 반영된다는 보장은 없다. ChatGPT가 읽을 수 있는 영역(공식 웹사이트·위키류·티스토리·열린 커뮤니티)에 같은 정보가 구조화돼 있지 않다면, 모델 입장에서 그 브랜드는 '회수 가능한 근거가 빈약한' 상태다.

데이터로 본 ChatGPT의 인용 성향: 위키백과 의존

'어디서 가져오는가'를 추정이 아니라 데이터로 보자. 대규모 인용 분석(Profound·Discovered Labs 등 공개 자료)에서 반복적으로 나타나는 사실:

왜 ChatGPT는 위키백과에 기우는가? RAG의 관점에서 보면 자연스럽다. 위키백과는 (1) 크롤러에 열려 있고 (2) 사실 중심으로 구조화돼 있으며 (3) 한 주제를 한 문서가 일관되게 다뤄 임베딩 회수에 유리하고 (4) 다른 문서들이 많이 링크해 권위 신호가 강하다. 재정렬 단계에서 '질문에 직접·간결히 답하는 신뢰 가능한 문서'로 위로 올라갈 조건을 모두 갖췄다.

엔진별 성향을 한 표로 정리하면 한국 브랜드 전략의 그림이 잡힌다.

엔진성향(관찰된 패턴)한국 브랜드 시사점
ChatGPT위키백과·커뮤니티 중심위키류 엔티티 정비 + 공식 페이지 사실 구조화가 핵심
Perplexity실시간 웹 + 인라인 인용, 레딧 등 커뮤니티최신 콘텐츠·열린 커뮤니티 노출이 유리
Gemini구글 색인 기반 + E-E-A-T 신호구글 SEO·경험/전문성 신호가 그대로 전이
Claude근거 약한 콘텐츠를 보수적으로 걸러냄(Citations API)출처 명확·검증 가능한 콘텐츠라야 살아남음
Grok실시간 웹 + X 스트림, 인용 정확도 편차X(트위터) 상의 브랜드 언급이 변수

그럼 네이버는? 2026년의 지각변동

한국 브랜드라면 ChatGPT만 볼 수 없다. 네이버 자신이 AI 검색으로 빠르게 이동 중이기 때문이다. 2026년의 변화를 사실대로 정리한다.

여기서 한국 브랜드에 결정적인 한 표본 분석이 있다. AI 브리핑 인용 272건을 뜯어본 자료에서 인용 출처의 약 58%가 블로그였고, 더 놀랍게도 인용된 것의 약 49%가 통합검색 Top10 밖의 문서였다. 즉 네이버 AI는 '검색 1페이지에 못 든 글'도 답변 근거로 끌어올린다. 전통 SEO 순위와 AI 인용은 별개의 게임이라는 증거다.

네이버의 선별 알고리즘은 C-Rank(출처 신뢰·전문성) + D.I.A.+(문서 의도)로 작동한다. 네이버가 공개한 좋은 콘텐츠 5원칙은 ① 직접경험 ② 일관된 주제 ③ 진정성 ④ 읽기 쉬운 구조 ⑤ 최신성이다. 창작자 보상 프로그램 '네이버 메이트'(기본 월 30만 원, 분야 1위는 월 1,000만 원 수준)도 양질 콘텐츠 공급을 끌어올리는 장치다.

요약하면 한국 브랜드는 두 개의 전선을 동시에 관리해야 한다. 글로벌 AI(ChatGPT·Perplexity·Gemini·Claude)는 위키류·티스토리·공식 페이지·열린 커뮤니티로 닿고, 네이버 AI는 블로그·일관된 전문 콘텐츠·C-Rank 신뢰 신호로 닿는다. 같은 브랜드여도 들어가는 문이 다르다.

실무: ❌약한 콘텐츠 / ✅강한 콘텐츠 대조

이론을 문장 수준으로 내려보자. AI가 회수·재정렬·인용하기 좋은 문장은 따로 있다. GEO 연구(Aggarwal 등, arXiv:2311.09735, KDD 2024)는 본문에 통계·출처 인용·직접 인용문을 추가하면 생성엔진 가시성이 특정 조건에서 최대 약 40%까지 오른다는 것을 실험으로 보였다. 핵심은 '주장'이 아니라 '검증 가능한 근거'다.

예시 1 — 브랜드 소개

약한 예는 '최고·매우'라는 주관 형용사뿐이라 재정렬 단계에서 질문에 답하는 근거로 인정받기 어렵다. 강한 예는 설립연도·성분·수치·출처가 박혀 있어 임베딩 회수에도, cross-encoder 재정렬에도, 모델의 인용에도 유리하다.

예시 2 — 질문에 직답하는 구조

AI 답변은 질문-답변 쌍을 좋아한다. 첫 문장에서 직답하는 구조(answer-first)는 회수와 인용 모두에서 강하다.

예시 3 — 정보 배치(Lost in the Middle 대응)

Liu 등(2023, arXiv:2307.03172)은 긴 맥락에서 모델이 중간에 있는 정보를 놓치는 U자형 성능 곡선을 보고했다. 즉 맥락의 앞과 끝은 잘 보고, 가운데는 흘린다.

이건 '사람을 위한 글쓰기 팁'이 아니라 모델의 주의(attention) 메커니즘에 맞춘 정보 구조 설계다.

인용 한 번이 아니라 '신뢰 가능성'을 본다

RAG 답변의 품질을 평가하는 지표 중 RAGAS faithfulness가 있다. 답변의 각 주장이 회수된 출처에서 실제로 추적되는 정도를 본다. 실무에선 흔히 0.9 이상이면 안정, 0.7 미만이면 위험으로 다룬다(팀마다 기준은 다르다). 시사점은 명확하다 — 모델은 출처와 본문 주장이 어긋나는 콘텐츠를 신뢰하지 않는다. Claude가 근거 약한 콘텐츠를 보수적으로 걸러내는 것도 같은 맥락이다.

그러니 브랜드 페이지에 '검증할 수 없는 자랑'을 늘어놓는 건 역효과다. 차라리 검증 가능한 한 줄(수치·시험성적서·출시일)이 인용 가능성을 높인다.

측정의 함정: 한 번 봐서는 모른다

'우리 브랜드가 ChatGPT에 인용되나?'를 한 번 물어보고 판단하면 안 된다. LLM은 temperature=0에서도 출력이 흔들린다. GPU 연산 순서·배치 처리 같은 요인 때문이다. 한 연구에서 2,350억 파라미터급 모델을 1,000회 돌렸더니 80가지 출력이 나왔고, 6개 모델 480회 실험도 비결정성을 확인했다(arXiv:2602.14349).

AI 가시성의 불확실성을 정량화한 연구(arXiv:2603.08924)는 인용이 멱법칙(power-law)으로 출렁인다는 점을 보고하며, 다중 실행 + 부트스트랩 신뢰구간을 권한다. 단일 측정은 노이즈다. 같은 질문을 여러 번, 여러 엔진에서, 기간을 두고 측정해 추이를 봐야 한다.

한 가지 더 — 'AI 프롬프트 검색량' 같은 데이터는 실측이 불가능하다. 패널(시장 1% 미만) 기반 모델링 추정치일 뿐이다. Conductor의 표현을 빌리면 "신뢰할 수 없는 검색량 데이터는 없는 것보다 나쁘다". 그럴듯한 숫자에 휘둘리지 말고, 실제 인용 측정과 매출 지표로 의사결정해야 한다.

가시성 측정 지표로 SOV(Share of Voice) — 카테고리 AI 답변 중 브랜드가 언급되는 비율 — 가 쓰인다(일부 한국 업체는 SMR이라는 변형을 쓴다). 단, 어떤 질문 세트를 쓰느냐가 결과를 좌우하고, 엔진을 합산하면 엔진별 메커니즘이 가려진다. Overdrive식 'CFO 관점'으로 보면 가시성은 결국 매출·리드라는 결과를 설명하는 2차 지표다. 가시성 자체가 목표가 아니라 매출로 가는 경로라는 뜻이다. 실제로 일부 분석에서는 AI 검색 유입의 전환율이 일반 검색보다 몇 배 높게 나타나기도 한다(구체 수치는 사례마다 다르므로 단정하지 않는다).

Citeon은 이 원리를 제품에 담았다

지금까지의 메커니즘 — '들어갈 수 있는 문을 통해서만 회수되고, 다중 측정으로만 진실이 보이며, 엔진마다 출처가 다르다' — 은 곧바로 실무 도구로 이어진다. Citeon은 다음을 한다.

우선 당신의 브랜드가 ChatGPT가 닿을 수 있는 영역에 제대로 노출돼 있는지부터 확인하라. Citeon 무료 진단(₩0)으로 사이트 URL 하나면 현재 AEO·GEO 상태와 처방 리포트를 받을 수 있다.

자주 묻는 질문(FAQ)

ChatGPT가 우리 네이버 블로그 후기를 정말 못 읽나요?

네이버 생태계는 외부 AI 크롤러를 차단하는 영역이 많습니다. 크롤러가 접근하지 못하면 해당 페이지는 ChatGPT의 검색 회수 단계에서 후보로 진입조차 못 합니다. 그래서 글로벌 AI는 같은 한국 정보를 나무위키·위키백과·티스토리처럼 열려 있는 출처로 우회 수집하는 패턴을 보입니다. 네이버 후기가 많아도 ChatGPT 답변에 반영된다는 보장은 없습니다.

그럼 위키백과 문서만 만들면 되나요?

위키백과 의존도가 높은 건 ChatGPT의 한 성향일 뿐(한 분석 약 47.9%)이고, 위키백과는 자의적 홍보 문서 생성을 엄격히 금지합니다. 더 현실적인 길은 (1) 공식 웹사이트를 크롤러에 열고 사실을 구조화하기 (2) 검증 가능한 수치·출처를 본문에 넣기 (3) 엔진별로 다른 출처(Perplexity는 커뮤니티, Gemini는 구글 색인)에 맞춰 노출을 분산하는 것입니다.

한 번 물어봤더니 우리 브랜드가 나왔어요. 이제 된 건가요?

아닙니다. LLM은 temperature=0에서도 출력이 흔들립니다(한 연구에선 같은 모델 1,000회에 80가지 출력). 인용은 멱법칙으로 출렁이기 때문에 단일 측정은 노이즈입니다. 여러 번·여러 엔진·여러 주에 걸쳐 측정한 추이로 판단해야 합니다.

SEO를 잘하면 AI 인용도 따라오나요?

부분적으로요. Gemini는 구글 색인 기반이라 SEO·E-E-A-T 신호가 잘 전이됩니다. 하지만 네이버 AI 브리핑 표본 분석에서는 인용된 문서의 약 49%가 통합검색 Top10 밖이었습니다. 검색 순위와 AI 인용은 겹치되 별개의 게임입니다. answer-first 구조, 근거 밀도, 크롤러 허용이 추가로 필요합니다.

본문에 무엇을 넣어야 인용 확률이 오르나요?

GEO 연구(KDD 2024)에 따르면 통계·출처 인용·직접 인용문을 추가하면 생성엔진 가시성이 특정 조건에서 최대 약 40% 오릅니다. 핵심은 검증 가능한 근거입니다. '최고·매우' 같은 형용사 대신 설립연도·성분·시험성적서·판매 수치처럼 추적 가능한 사실을 넣고, 핵심 정보는 글 앞과 끝에 배치하세요(중간은 모델이 놓치기 쉬움).

참고자료

박도현
박도현 · AEO 리서처

생성형 검색·LLM 인용에 관한 논문과 데이터를 읽고 실무 언어로 옮깁니다. 근거 없는 '카더라'를 싫어합니다.

내 사이트의 AI 검색 점수가 궁금하다면

30초 무료 진단으로 SEO·AEO·GEO 점수와 처방을 받아보세요.

무료 진단 시작
← 인사이트 목록으로