Citeon
한국어 LLM 인용 데이터 리서치

Gemini와 구글 AI Overviews의 한국어 인용 조건

박도현
박도현 · AEO 리서처
Gemini와 구글 AI Overviews의 한국어 인용 조건

구글 Gemini와 AI Overviews가 한국어 답변에서 인용하는 글에는 공통 조건이 있다: (1) Google-Extended·Googlebot 크롤러가 읽을 수 있게 열려 있고, (2) 구글 색인에 이미 충분히 평가된(E-E-A-T 신호가 쌓인) 문서이며, (3) 질문 문장과 의미가 정확히 맞아떨어지는 '직답 단락'을 가진 글이다. 셋 중 하나라도 빠지면 후보군에조차 들어가지 못한다. 이 글은 그 세 조건이 '왜' 인용을 가르는지를, RAG(retrieval→reranking→generation) 메커니즘과 공개된 연구·데이터로 끝까지 파헤친다. 근거 없는 단정은 하지 않는다 — 확실한 수치는 출처와 함께, 불확실한 것은 불확실하다고 적는다.

먼저, Gemini와 AI Overviews는 서로 다른 표면이다

많은 글이 둘을 뭉뚱그리지만, 인용 관점에서는 구분해야 한다.

둘의 공통 분모는 명확하다 — 구글 검색 색인이다. 그래서 "Gemini에 인용되려면?"이라는 질문의 9할은 "구글 검색에 잘 잡히고, 잘 평가받으려면?"으로 환원된다. 한 인용 패턴 분석에서 엔진별 성향을 정리한 바에 따르면, Gemini는 구글 색인과 E-E-A-T(경험·전문성·권위·신뢰) 신호에 강하게 기댄다. ChatGPT가 위키백과·커뮤니티(레딧)에 치우치는 것과 대조적이다. 이 차이 하나가 전략 전체를 바꾼다.

비유: 두 사서, 다른 서가

ChatGPT를 "위키백과와 레딧 게시판을 외워둔 사서"라고 한다면, Gemini는 "구글이라는 거대한 도서관의 사서"다. 이 사서는 자기 도서관 색인에 등록되지 않은 책은 애초에 추천할 수 없다. 아무리 좋은 글이어도 구글 색인에 없으면 — 혹은 색인에서 신뢰도가 낮게 평가됐으면 — 사서의 손이 닿지 않는다. 이것이 'Gemini 인용 조건'의 출발점이 색인과 E-E-A-T인 이유다.

RAG로 보는 인용의 4단계 — 어디서 탈락하는가

왜 어떤 글은 인용되고 어떤 글은 안 되는지를 이해하려면, 생성형 검색의 내부 파이프라인을 알아야 한다. RAG의 원전(Lewis 등, 2020, arXiv:2005.11401)은 LLM의 답변을 두 종류의 기억으로 나눴다 — 모델 가중치에 박힌 파라메트릭 메모리와, 외부 문서에서 그때그때 끌어오는 비파라메트릭 메모리다. AI Overviews와 Gemini 그라운딩의 인용은 전적으로 후자에서 나온다. 즉 인용된다 = 비파라메트릭 검색 단계에서 당신 문서가 뽑혔다는 뜻이다.

이 검색은 보통 네 단계를 거친다. 각 단계가 곧 '탈락 관문'이다.

단계하는 일여기서 탈락하는 글
0. 색인/크롤크롤러가 페이지를 읽어 색인에 등록robots.txt로 Google-Extended 차단, JS 렌더 의존, 인증 벽 뒤
1. 1차 검색(retrieval)질문과 의미·키워드가 가까운 후보 수십 개 추출질문 어휘와 동떨어진 글, 주제가 흐릿한 글
2. 재정렬(reranking)후보를 질문과 함께 정밀 비교해 순위 재조정겉만 관련 있고 실제 답이 없는 글
3. 생성(generation)상위 청크를 근거로 답 작성 + 출처 인용맥락 중간에 묻혀 모델이 못 읽은 글

핵심 통찰: 대부분의 한국어 글은 0단계와 1단계에서 떨어진다. 콘텐츠 품질을 논하기 전에 크롤·색인·의미정합부터 막혀 있다는 뜻이다. 하나씩 보자.

0단계 — 크롤러가 읽지 못하면 게임 끝

구글의 AI는 두 종류의 크롤러로 콘텐츠에 접근한다. 일반 검색 색인용 Googlebot, 그리고 Gemini 학습·그라운딩에 쓰이는 Google-Extended다. robots.txt에서 이들을 허용해야 후보 진입 자체가 가능하다. (참고로 OpenAI는 GPTBot·OAI-SearchBot, Anthropic은 ClaudeBot·anthropic-ai, Perplexity는 PerplexityBot을 쓴다 — 글로벌 AI에 두루 걸리려면 이들을 모두 열어야 한다.)

# robots.txt — 구글 AI 후보 진입의 최소 조건
User-agent: Googlebot
Allow: /

User-agent: Google-Extended
Allow: /

여기서 한국 시장 특유의 결정적 변수가 있다. 네이버는 외부 크롤러를 차단한다. 그 결과 블로그·카페에 아무리 좋은 한국어 콘텐츠가 쌓여도 구글·글로벌 AI의 색인에는 들어가지 못한다. 그래서 글로벌 AI들은 한국어 지식이 필요할 때 나무위키·위키백과·티스토리처럼 크롤이 열린 곳으로 우회한다. 이는 '구글/Gemini 인용'을 노리는 한국 브랜드에게 역설적 기회다 — 크롤 가능한 자체 도메인이나 티스토리에 양질의 글을 두면, 닫힌 네이버 생태계 안의 경쟁자들을 통째로 건너뛸 수 있다.

❌ 약한 세팅 / ✅ 강한 세팅

1단계 — 의미 검색: 키워드만으로는 안 된다

색인에 들어갔다면, 다음은 질문과의 의미 정합이다. 초기 검색엔진은 BM25 같은 키워드 빈도 방식이었다. 그러나 Dense Passage Retrieval 연구(Karpukhin 등, 2020, arXiv:2004.04906)는 질문과 문서를 같은 벡터 공간에 임베딩해 의미로 비교하는 방식이 BM25를 능가함을 보였다. "AI 검색에 안 걸려요"라는 고민과 "생성형 검색에서 노출이 없어요"라는 글이 단어는 달라도 같은 의미임을 의미 검색은 알아챈다.

비유: 색인 카드 vs 주제를 아는 사서

BM25는 도서관의 키워드 색인 카드다 — 책 제목에 적힌 단어로만 찾는다. 의미 검색은 주제를 이해하는 사서다 — "감기에 좋은 음식"을 물으면 제목에 '감기'가 없어도 '면역력 높이는 식단' 책을 가져온다. 그런데 실무의 정답은 둘 중 하나가 아니라 둘 다다.

공개 벤치마크들을 종합하면 recall@10(관련 문서를 상위 10개 안에 잡아내는 비율)은 대략 이렇게 갈린다.

검색 방식recall@10(대략)약점
BM25(키워드) 단독~65%동의어·다른 표현을 놓침
의미(임베딩) 단독~78%고유명사·정확한 숫자에 약함
하이브리드(RRF 결합)~91%

여기서 실무 함의가 나온다. 의미만 노린다고 키워드를 버리면 안 되고, 키워드만 쑤셔넣는다고 의미가 통하지도 않는다. 한국어 글에서는 사용자가 실제로 치는 표현("가격 얼마", "후기", "비교")과 정식 용어("요금제", "리뷰", "비교 분석")를 한 단락 안에 자연스럽게 공존시키는 글이 양쪽 검색기에 모두 잡힌다.

❌ 약한 문장 / ✅ 강한 문장

2단계 — 재정렬: '겉만 관련 있는 글'을 걸러낸다

1차 검색은 빠르게 후보를 넓게 긁어온다(과잉 포함). 그다음 cross-encoder 기반 reranking이 후보 하나하나를 질문과 나란히 놓고 다시 읽으며 정밀 채점한다. 공개 보고들에서 reranking은 NDCG를 5~15포인트(난도가 높으면 ~20까지) 끌어올린다. Anthropic의 Contextual Retrieval 실험(2024)에서도 reranking을 더했을 때 검색 실패율이 크게 떨어졌다 — 청크에 맥락을 붙여 실패율을 5.7%→3.7%(35% 감소)로 줄였고, BM25 하이브리드를 더해 49%, 거기에 reranking까지 더하자 67% 감소에 도달했다(top-20 회수 권장).

비유: 1차는 그물, 2차는 면접관

1차 검색이 "이 주제 같은 것 다 가져와"라고 넓게 던지는 그물이라면, reranker는 한 명씩 불러 "그래서 질문에 진짜 답이 됩니까?"를 캐묻는 면접관이다. 제목과 도입부는 그럴듯한데 정작 본문에 답이 없는 글이 여기서 떨어진다. 그래서 강한 글은 질문을 그대로 받아 곧장 답하는 단락을 가진다.

❌ 약한 구조 / ✅ 강한 구조

3단계 — 생성: '중간에 묻힌 글'은 안 읽힌다

상위 청크가 모델에게 전달되면 모델이 답을 쓴다. 그런데 여기 반직관적인 함정이 있다. Liu 등(2023)의 'Lost in the Middle'(arXiv:2307.03172) 연구는, 긴 맥락을 받은 LLM이 맨 앞과 맨 끝의 정보는 잘 쓰지만 중간에 놓인 정보는 성능이 뚝 떨어지는 U자형 곡선을 그린다는 것을 보였다. 즉 검색에 뽑혀 모델에게 전달되더라도, 핵심 사실이 글 한가운데 길게 묻혀 있으면 모델이 그것을 근거로 채택하지 않을 수 있다.

비유: 회의록 중간 페이지

20페이지 회의록을 급히 훑을 때, 사람들은 첫 장과 마지막 장은 보지만 11페이지 셋째 문단은 건너뛴다. LLM도 비슷하다. 그래서 핵심 사실·수치·결론은 단락의 앞이나 끝에 배치하고, 한 단락에는 한 가지 사실만 담아 '중간에 묻히는' 분량 자체를 줄여야 한다. 긴 통짜 문단보다 짧은 단락 여러 개가 인용에 유리한 구조적 이유가 여기 있다.

그래서 '무엇을' 써야 인용되나 — GEO 연구의 답

여기까지가 '어떻게 뽑히나'의 메커니즘이라면, '무엇을 담아야 뽑히나'에는 직접적인 실험 근거가 있다. Aggarwal 등(2023, arXiv:2311.09735, KDD 2024)의 GEO(Generative Engine Optimization) 연구는, 생성형 엔진에서의 콘텐츠 가시성을 높이는 요소를 통제 실험으로 측정했다. 결과: 통계·수치를 넣고, 출처를 인용하고, 직접 인용문(전문가 코멘트)을 추가하는 것이 특정 조건에서 생성엔진 가시성을 최대 약 40%까지 끌어올렸다.

왜 그럴까? 메커니즘으로 설명하면 — 통계·출처·인용문은 reranker와 생성 모델 입장에서 '이 문서는 검증 가능한 근거를 갖췄다'는 신호다. 모델은 답에 책임을 져야 하므로, 막연한 주장보다 추적 가능한 사실을 선호한다. 이것이 곧 E-E-A-T(특히 신뢰·전문성)가 코드 레벨에서 작동하는 방식이고, Gemini가 E-E-A-T 신호에 강하게 반응한다는 관찰과 정확히 맞물린다.

❌ 약한 주장 / ✅ 강한 주장

'얼마나 믿을 수 있나' — faithfulness와 Claude의 보수성

인용 후보가 되더라도, 모델이 당신 글의 주장을 '믿고' 답에 반영하느냐는 또 다른 문제다. RAG 품질 지표 중 faithfulness는 생성된 답변의 주장이 출처에서 실제로 추적되는 정도를 잰다. 실무서들에서 흔히 0.9 이상이면 안정, 0.7 미만이면 위험으로 본다(팀마다 기준은 다르다). 근거가 약한 콘텐츠는 faithfulness를 떨어뜨리므로, 모델은 그런 문서를 점점 덜 인용하게 된다.

엔진별 성향 차이도 여기서 갈린다. 관찰된 바로는 Claude는 근거가 약한 콘텐츠를 보수적으로 걸러내는 경향이 있고(Citations API 보유), Gemini는 구글 색인의 E-E-A-T 평가를 신뢰의 1차 필터로 쓴다. 결론은 같다 — 검증 가능한 글이 모든 엔진에서 유리하다. 단일 엔진용 꼼수보다 '근거 있는 글쓰기'가 가장 넓게 통하는 전략인 이유다.

측정의 함정 — 한 번 본 결과를 믿지 마라

david로서 가장 강조하고 싶은 부분이다. "우리 글이 Gemini에 인용됐나?"를 한 번 검색해 보고 결론 내리는 것은 위험하다. 이유는 두 가지다.

첫째, LLM은 본질적으로 비결정적이다. temperature=0으로 고정해도 GPU 연산 순서·배치 처리 때문에 출력이 흔들린다. 한 실험에서는 대형 모델을 1,000회 돌렸을 때 80가지 출력이 나왔고, 여러 모델을 수백 회 돌린 분석에서도 같은 질문에 답이 출렁였다. AI 가시성의 불확실성을 정량화한 연구는, 인용 빈도가 멱법칙으로 출렁이므로 다중 실행 + 부트스트랩 신뢰구간으로 봐야 한다고 권한다. 단일 측정 = 노이즈다.

둘째, '프롬프트 검색량'은 실측이 거의 불가능하다. 사람들이 AI에 실제로 무엇을 묻는지는 공개되지 않는다. 시장에 도는 '프롬프트 볼륨' 수치는 대개 1% 미만의 소규모 패널을 모델링한 추정치다. Conductor의 분석은 "신뢰할 수 없는 검색량 데이터는 없는 것보다 나쁘다"고 못 박는다. 그럴듯한 단일 숫자에 전략을 걸지 말라는 뜻이다.

그럼 무엇을 봐야 하나 — SOV와 결과 지표

가시성은 SOV(Share of Voice, 카테고리 AI 답변 중 우리 브랜드가 언급되는 비율)로 보는 것이 정직하다. 다만 두 가지 주의가 있다. (1) 질문 세트 선정이 결과를 좌우한다 — 어떤 질문으로 측정했는지가 숫자보다 중요하다. (2) 엔진을 한 점수로 합산하면 메커니즘이 가려진다 — 위에서 봤듯 ChatGPT(위키·커뮤니티)와 Gemini(구글 색인·E-E-A-T)는 인용 논리가 다르므로, 엔진별로 따로 봐야 처방이 나온다. 그리고 궁극적으로 가시성은 매출·리드를 설명하는 2차 지표다. 일부 분석에서는 AI 검색 유입의 전환율이 일반 검색보다 몇 배 높게 나타나기도 하므로, 가시성→유입→전환의 사슬로 봐야 한다.

한국어·한국 시장 특수 조건 정리

지금까지의 메커니즘을 한국 시장에 포개면 실무 체크리스트가 나온다.

조건왜 중요한가실무 처방
크롤 가능성네이버 폐쇄형 → 구글 색인 진입 불가자체 도메인/티스토리에 서버 렌더 HTML, Google-Extended 허용
구글 색인 평가Gemini·AI Overviews의 1차 검색기 = 구글 랭킹sitemap·구조화데이터·내부링크로 색인 신뢰 쌓기
E-E-A-T 신호Gemini가 가장 강하게 반응하는 축저자 표기·전문성 근거·출처 인용·실제 경험 서술
직답 구조reranker·생성 단계 통과소제목=질문, 첫 문장=직답, 한 단락 한 사실
검증 가능성faithfulness·GEO 가시성수치+출처+직접 인용문(GEO 최대 ~40%)

참고로 네이버는 자체 AI 생태계를 빠르게 재편 중이다 — 큐:(Cue:)·클로바X는 2026-04-09 종료됐고, 대화형·에이전틱 AI탭이 2026-06-25~26 정식 출시됐다. AI 브리핑(요약)은 이미 통합검색 쿼리의 20% 이상에 적용되고 있다. 한 표본 분석(272건)에서는 네이버 AI 브리핑 인용 출처의 약 58%가 블로그였고, 약 49%가 통합검색 Top10 밖 문서였다. 즉 구글(Gemini) 축과 네이버 축은 인용 논리가 다르므로, 한국 브랜드는 두 축을 분리해 관리해야 한다. 이 글의 주제인 구글/Gemini 축에서는 '크롤 개방 + 구글 색인 + E-E-A-T'가 핵심이다.

Citeon은 이 원리를 제품에 담았다

위에서 풀어낸 메커니즘은 추상론이 아니라 측정·진단 가능한 항목들이다. Citeon은 정확히 그 지점을 제품으로 만들었다.

당신의 사이트가 구글/Gemini의 0~3단계 중 어디서 탈락하는지 궁금하다면, 무료 진단(₩0)으로 먼저 확인해 보라. citeon.cloud에서 무료 AI 가시성 진단 받기 →

자주 묻는 질문

Gemini와 구글 AI Overviews는 같은 색인을 쓰나요?

둘 다 구글 검색 색인을 핵심 검색기로 공유합니다. AI Overviews는 검색 결과 상단 요약 박스이고 Gemini는 대화형 어시스턴트라는 표면 차이가 있지만, 인용 후보를 끌어오는 원천은 구글 색인이라는 점에서 같습니다. 그래서 'Gemini 인용 전략'의 대부분은 '구글 검색에 잘 잡히고 잘 평가받기'로 환원됩니다.

네이버 블로그에만 글이 있으면 Gemini에 인용될 수 없나요?

가능성이 매우 낮습니다. 네이버가 외부 크롤러를 차단하기 때문에 그 콘텐츠는 구글 색인에 들어가기 어렵고, 색인에 없으면 Gemini·AI Overviews의 검색 후보군에 진입조차 못 합니다. 글로벌 AI들이 한국어 지식을 나무위키·위키백과·티스토리에서 우회 수집하는 이유가 이것입니다. 구글/Gemini 축을 노린다면 크롤 가능한 자체 도메인이나 티스토리에 본문을 두는 것이 출발점입니다.

한 번 검색해서 우리 글이 인용된 걸 봤습니다. 성공한 건가요?

단정하기 이릅니다. LLM은 temperature=0에서도 출력이 흔들리는 비결정적 시스템이고, 인용 빈도는 멱법칙으로 출렁입니다. 한 번의 관찰은 노이즈일 수 있습니다. 다중 실행과 추세선(주간 모니터링)으로 봐야 신호와 노이즈를 구분할 수 있습니다.

글에 무엇을 추가하면 인용 확률이 가장 많이 오르나요?

GEO 연구(Aggarwal 등, 2023)에 따르면 통계·수치, 출처 인용, 전문가 직접 인용문을 추가하는 것이 특정 조건에서 생성엔진 가시성을 최대 약 40%까지 높였습니다. 메커니즘상 이 요소들은 '검증 가능한 근거'라는 신호가 되어 재정렬·생성 단계와 E-E-A-T 평가에서 모두 유리하게 작용합니다.

핵심 내용을 글 어디에 배치해야 하나요?

단락의 앞이나 끝입니다. 'Lost in the Middle' 연구(Liu 등, 2023)는 LLM이 긴 맥락의 중간 정보를 잘 놓치는 U자형 성능 곡선을 보인다고 밝혔습니다. 핵심 사실·수치·결론을 단락 머리나 끝에 두고, 한 단락에 한 가지 사실만 담아 '중간에 묻히는' 분량을 줄이세요.

참고자료

박도현
박도현 · AEO 리서처

생성형 검색·LLM 인용에 관한 논문과 데이터를 읽고 실무 언어로 옮깁니다. 근거 없는 '카더라'를 싫어합니다.

내 사이트의 AI 검색 점수가 궁금하다면

30초 무료 진단으로 SEO·AEO·GEO 점수와 처방을 받아보세요.

무료 진단 시작
← 인사이트 목록으로