Citeon
논문·연구 분석

GEO 논문(arXiv 2311.09735) 깊이 읽기

박도현
박도현 · AEO 리서처
GEO 논문(arXiv 2311.09735) 깊이 읽기

결론부터. arXiv 2311.09735(Aggarwal 등, KDD 2024)이 말하는 핵심은 단 한 문장으로 압축됩니다 — "같은 사실이라도 통계·출처 인용·직접 인용문을 덧붙여 쓰면, 생성형 검색엔진이 그 문장을 답변에 끌어다 쓸 확률이 특정 조건에서 최대 약 40%까지 올라간다." 이 글은 그 주장을 '믿어라'가 아니라 '왜 그런가'로 풀어냅니다. 저는 근거 없는 단정을 싫어하는 사람이라, 논문이 실제로 측정한 것과 측정하지 못한 것을 구분하면서 읽겠습니다.

이 논문이 왜 분수령인가

2023년 11월 이전까지 "AI 검색에 잘 노출되는 법"은 대부분 경험칙이었습니다. 누군가는 "권위 있는 사이트가 유리하다"고 했고, 누군가는 "FAQ를 많이 달아라"고 했지만, 통제된 실험으로 '무엇이 인용을 늘리는가'를 측정한 사람은 없었습니다. 이 논문(Aggarwal 등, 2311.09735)이 한 일은 그 공백을 메운 것입니다. 저자들은 'GEO(Generative Engine Optimization)'라는 용어 자체를 학술적으로 정의하고, 어떤 글쓰기 방식이 생성엔진 답변 속 가시성을 올리는지를 벤치마크로 측정했습니다.

비유하자면, 그전까지의 GEO 조언이 "운동하면 건강해진다" 수준의 민간요법이었다면, 이 논문은 "이 영양소를 이만큼 먹였더니 이 지표가 이만큼 올랐다"는 임상시험 보고서에 가깝습니다. 그래서 인용할 가치가 있습니다.

먼저, 생성엔진은 어떻게 '인용할 문장'을 고르는가

GEO 논문을 제대로 읽으려면 그 아래 깔린 RAG(Retrieval-Augmented Generation) 메커니즘을 알아야 합니다. RAG의 원전은 Lewis 등(2020, arXiv:2005.11401)으로, 핵심 아이디어는 "모델이 외운 지식(파라메트릭 메모리)에만 의존하지 말고, 외부 문서를 그때그때 찾아와(비파라메트릭 메모리) 답을 만들자"는 것입니다. ChatGPT·Perplexity·구글 AI·네이버 AI 브리핑이 출처를 달고 답하는 구조가 전부 이 계보입니다.

RAG는 세 단계로 움직입니다. 이 세 관문을 통과해야 당신 글의 문장이 답변에 박힙니다.

단계하는 일일상 비유
Retrieval(검색)질문과 의미가 가까운 문서 조각(청크) 수십 개를 후보로 끌어온다도서관에서 주제어로 책 무더기를 일단 빼오는 사서
Reranking(재정렬)후보들을 질문과 '함께 읽어' 진짜 관련도 순으로 다시 줄 세운다빼온 책을 펼쳐보고 "이건 제목만 비슷하지 내용은 딴판"이라 솎는 사서
Generation(생성)상위 몇 개 조각만 읽고 답을 쓰며, 근거가 된 조각을 인용한다추린 책 3권만 읽고 리포트를 쓰는 학생

여기서 GEO 논문의 통찰이 들어옵니다. 대부분의 SEO 조언은 1단계(검색에 걸리기)에만 집중하지만, 인용 여부를 최종 결정하는 건 3단계(생성)입니다. 검색에 걸려 후보로 들어온 뒤, 모델이 "이 문장은 답에 쓸 만큼 구체적이고 신뢰가 가는가"를 판단하는 그 순간이 진짜 승부처라는 것이죠. 논문이 측정한 '통계·인용·직접 인용문'은 정확히 이 3단계에서 작동하는 신호입니다.

왜 의미 검색이 키워드 검색을 이겼나 — 1단계의 진실

1단계의 작동 원리도 짚고 가야 합니다. 과거 검색은 BM25 같은 키워드 매칭이었습니다. 단어가 글자 그대로 겹쳐야 걸립니다. 반면 Dense Passage Retrieval(Karpukhin 등, 2020, arXiv:2004.04906)은 문장을 의미 벡터(임베딩)로 바꿔, 단어가 안 겹쳐도 뜻이 통하면 끌어옵니다. 이 논문은 의미 검색이 키워드 검색을 능가함을 보였습니다.

비유하면 BM25는 "책 뒤 색인에서 똑같은 단어를 찾는 신입", 임베딩 검색은 "주제를 이해해서 다른 표현으로 쓰인 책도 찾아주는 베테랑 사서"입니다. 그런데 둘 다 약점이 있습니다. 신입은 동의어를 놓치고, 베테랑은 정확한 고유명사·숫자·모델명을 흘립니다. 그래서 현업은 둘을 합칩니다.

공개 벤치마크들을 종합하면 recall@10(상위 10개 안에 정답을 끌어온 비율)은 대략 이렇습니다 — 의미 검색 단독 ~78%, BM25 단독 ~65%, 둘을 합친 하이브리드(RRF) ~91%. 합쳤을 뿐인데 어느 쪽 단독보다 13%포인트 이상 높습니다. Anthropic의 Contextual Retrieval 연구(2024)도 같은 방향을 보고합니다 — 청크에 맥락을 덧붙여 검색 실패율을 35% 줄이고(5.7%→3.7%), 거기에 BM25 하이브리드를 더하면 49%, reranking까지 얹으면 67%까지 실패율이 떨어졌습니다. 이 회사는 후보를 top-20으로 넓게 가져가길 권합니다.

2단계 Reranking — 후보를 '다시 읽는' 단계

1단계는 속도를 위해 질문과 문서를 따로 벡터화해 비교합니다(bi-encoder). 빠르지만 거칩니다. 2단계의 cross-encoder는 질문과 후보 문장을 한 묶음으로 같이 읽어 관련도를 정밀 채점합니다. 느리지만 정확합니다. 그래서 "1차로 수십 개 빠르게 → 2차로 상위만 정밀 재정렬"이라는 2단 구조가 표준이 됐습니다. 실무에서 cross-encoder reranking은 NDCG를 5~15포인트(난도 높은 질의에선 ~20포인트) 끌어올립니다.

왜 이게 GEO와 직결될까요? 재정렬은 '질문과의 직접적 관련성'을 본다. 즉 답이 될 문장을 질문 옆에 놓고 평가합니다. 당신 문장이 질문의 의도에 정확히, 구체적으로 답하고 있을수록 위로 올라옵니다. 두루뭉술한 일반론은 1단계는 통과해도 2단계에서 가라앉습니다.

GEO 논문이 실제로 측정한 것

이제 본론입니다. Aggarwal 등은 여러 '글쓰기 변형'을 같은 콘텐츠에 적용한 뒤, 생성엔진 답변에서의 가시성(인용·노출 점수)이 어떻게 달라지는지를 측정했습니다. 가장 일관되게 효과를 낸 것이 세 가지였습니다.

이 방식들이 특정 조건에서 가시성을 최대 약 40%까지 끌어올렸다는 것이 논문의 대표 수치입니다. 반대로 키워드를 욱여넣는 식의 전통적 SEO 기법(키워드 스터핑)은 생성엔진에선 효과가 미미하거나 오히려 역효과였습니다.

왜 하필 통계·인용·직접 인용문인가 — 메커니즘 해석

여기서 멈추면 안 됩니다. "40% 올랐다"는 결과고, 우리가 알아야 할 건 입니다. 앞서 본 RAG 3단계로 돌아가 봅시다.

생성 단계의 모델은 답을 쓰면서 '검증 가능하고 구체적인 조각'을 선호합니다. 이유는 단순합니다. 모델은 환각(없는 사실을 지어냄)을 줄이도록 정렬되어 있고, 후속 답변에서 자기가 한 말의 근거를 댈 수 있어야 합니다. 그런데 "많은 사람들이 이 방법을 선호한다"는 문장은 근거로 삼기에 불안합니다 — 얼마나 많은지, 누가 그랬는지 알 수 없으니까요. 반면 "한 분석에서 응답자의 다수가 이 방법을 택했다"거나 구체적 수치가 박힌 문장은 모델이 인용하기에 '안전한 벽돌'입니다.

이걸 RAGAS의 faithfulness(충실도) 개념으로 보면 더 또렷합니다. faithfulness는 '답변의 주장이 출처 문서에서 추적 가능한 정도'를 재는 지표로, 실무에서 흔히 0.9 이상이면 안정, 0.7 미만이면 위험으로 봅니다(팀마다 기준은 다릅니다). 생성엔진은 충실도가 높은 답을 만들려 하고, 충실도를 높이려면 추적 가능한 문장을 골라 써야 합니다. 통계·출처·직접 인용문이 붙은 문장이 바로 그런 문장입니다. 즉 GEO 논문의 처방은 "모델이 환각을 피하려는 본능에 당신 문장을 끼워 맞추는 것"이라고 메커니즘으로 해석할 수 있습니다.

약한 예 / 강한 예 — 같은 사실, 다른 운명

논문의 결론을 실제 문장으로 옮기면 차이가 손에 잡힙니다. 같은 정보를 담았지만 한쪽은 후보에서 탈락하고, 한쪽은 답변에 인용됩니다.

주제: 하이브리드 검색의 효과

❌ 약한 예
"하이브리드 검색을 쓰면 검색 정확도가 크게 좋아집니다. 
 많은 전문가들이 추천하는 방식입니다."
  → 수치 없음, 출처 없음, 인용 없음. 
     모델 입장: '근거로 삼기 불안한 일반론' → 생성 단계에서 탈락

✅ 강한 예
"공개 벤치마크를 종합하면 recall@10이 의미 검색 단독 ~78%, 
 BM25 단독 ~65%인 반면 하이브리드(RRF)는 ~91%로 올라간다. 
 Anthropic의 Contextual Retrieval 연구도 BM25 하이브리드로 
 검색 실패율이 49% 줄었다고 보고한다."
  → 수치 + 출처 + 비교. 
     모델 입장: '그대로 인용해도 안전한 벽돌' → 답변에 채택

두 문장의 정보 가치는 비슷해 보이지만, 생성엔진이 보는 '인용 적합도'는 전혀 다릅니다. 이게 2311.09735의 실무적 핵심입니다.

또 하나 — 위치도 중요하다(Lost in the Middle)

무엇을 쓰느냐만큼 어디에 쓰느냐도 작동합니다. Liu 등(2023, arXiv:2307.03172)의 'Lost in the Middle' 연구는 긴 맥락을 모델에 넣으면 중간에 있는 정보가 손실되는 U자형 패턴을 보고했습니다. 성능이 맥락의 앞과 끝에서 높고 가운데서 떨어집니다.

비유하면 사람이 긴 회의록을 읽고 요약할 때 첫머리와 끝맺음은 기억하지만 중간 30분은 흐릿한 것과 같습니다. 그래서 핵심 주장·핵심 수치는 문단·문서의 앞이나 끝에 배치해야 생성 단계까지 살아남습니다. GEO 논문의 '무엇을 쓸까'에 이 '어디에 둘까'를 합치면 처방이 완성됩니다.

'최대 40%'를 정직하게 읽는 법 — 과신 금지

저는 이 수치를 마케팅 카피처럼 쓰는 걸 경계합니다. 논문은 분명 "특정 조건에서 최대 약 40%"라고 말합니다. 이 단서들을 떼고 "GEO 하면 40% 오른다"고 말하면 그 자체가 GEO 논문이 비판한 '근거 없는 단정'이 됩니다.

왜 단서가 중요한가? 첫째, 효과 크기는 도메인·질의 유형에 따라 다릅니다. 사실 위주 질의(통계가 답이 되는)에선 통계 추가가 강하게 먹히지만, 의견·감성 질의에선 덜합니다. 둘째, 측정 자체가 흔들립니다. 이건 GEO를 하는 모든 사람이 알아야 할 불편한 진실입니다.

LLM은 temperature=0에서도 출력이 흔들립니다(GPU 연산 순서·배치 처리 때문). 한 보고에서는 2,350억 파라미터급 모델에 같은 입력을 1,000번 넣었더니 80가지 출력이 나왔습니다. AI 가시성의 불확실성을 정량화한 연구는 인용이 멱법칙(power-law)으로 출렁인다고 보고하며, 단일 측정에 의존하지 말고 다중 실행 + 부트스트랩 신뢰구간을 권합니다. 즉 "오늘 한 번 재보니 인용이 늘었다"는 노이즈일 수 있습니다. GEO 효과를 검증하려면 같은 처방을 여러 번·여러 엔진에서 재보고 평균과 구간으로 말해야 합니다.

이 비결정성은 GEO 논문이 통제 실험으로 일관된 방향성을 뽑아낸 가치를 오히려 부각합니다 — 한 번의 우연이 아니라 반복된 경향이기에 신뢰할 수 있는 것이죠.

엔진마다 답이 다르다 — '평균 40%'의 함정

GEO 논문 이후 더 분명해진 사실 하나. 생성엔진은 서로 다른 곳을 인용합니다. 대규모 인용 분석에 따르면 ChatGPT와 Perplexity의 인용 도메인 중복은 ~11%에 불과하고, 인용의 약 90%가 엔진마다 다릅니다. ChatGPT는 위키백과를 ~47.9% 비중으로, Perplexity는 Reddit을 ~46.7% 비중으로 끌어다 쓴다는 표본도 있습니다.

엔진성향(공개 분석·관찰 종합)
ChatGPT위키백과·커뮤니티 비중 높음
Gemini구글 색인·E-E-A-T 신호에 민감
Claude근거 약한 콘텐츠를 보수적으로 걸러냄(Citations API 계열)
Grok실시간 웹 + X 스트림, 인용 정확도 편차 큼
Perplexity실시간·인라인 인용, Reddit 등 커뮤니티 비중

그래서 "엔진을 합산한 평균 가시성"은 위험합니다. 합산은 메커니즘을 가립니다. 5개 엔진 평균이 그대로여도, Claude에선 떨어지고 Perplexity에선 올랐을 수 있습니다. GEO 처방을 적용할 때 엔진별로 따로 측정·따로 처방해야 하는 이유입니다. 특히 Claude처럼 근거를 깐깐하게 보는 엔진에선 '통계·출처·인용문' 처방의 효과가 더 클 가능성이 높습니다 — 충실도 문턱이 높기 때문입니다.

한국 시장의 변수 — 네이버

국내라면 네이버를 빼놓을 수 없습니다. 네이버는 AI 브리핑(요약)을 통합검색 쿼리의 20% 이상에 적용하고 있고, 2026년 6월 AI탭을 전체 정식 출시했습니다. 한 표본분석(272건)에서는 AI 브리핑 인용 출처의 ~58%가 블로그였고, 인용의 ~49%가 검색결과 Top10 바깥에서 나왔습니다 — 순위가 낮아도 인용될 수 있다는 뜻이고, 이건 정확히 GEO가 말하는 '랭킹과 분리된 인용 게임'입니다. 네이버 알고리즘은 출처 신뢰·전문성을 보는 C-Rank와 문서 의도를 보는 D.I.A.+가 핵심이며, 콘텐츠 5원칙(직접경험·일관주제·진정성·읽기 쉬운 구조·최신성)을 강조합니다. GEO 논문의 통계·출처·구조화 처방과 결이 맞습니다.

전제 조건 — 후보에 들어가야 처방이 의미가 있다

마지막으로 메커니즘 상 가장 앞에 있는 관문. 아무리 통계·인용을 잘 박아도, 1단계 검색의 후보 풀에 들어가지 못하면 0입니다. 후보 진입의 전제는 AI 크롤러가 당신 페이지를 읽을 수 있어야 한다는 것 — robots.txt에서 GPTBot·OAI-SearchBot(OpenAI), PerplexityBot, ClaudeBot·anthropic-ai(Anthropic), Google-Extended(구글)를 허용해야 합니다. 참고로 네이버는 외부 크롤러를 차단하기 때문에, 글로벌 AI는 나무위키·위키백과·티스토리 같은 경로로 우회해 한국어 정보를 수집하는 경향이 있습니다.

정리하면 GEO의 실행 순서는 이렇습니다 — ① 크롤러 허용(후보 진입) → ② 의미·키워드 양쪽에 걸리게(하이브리드 검색 대응) → ③ 질문 의도에 정확히 답하기(재정렬 통과) → ④ 통계·출처·직접 인용문으로 '인용 안전한 벽돌' 만들기(생성 채택) → ⑤ 핵심은 앞/끝에 배치(중간 손실 회피). 논문 2311.09735는 이 중 ④를 데이터로 증명한 것이고, 나머지는 RAG 메커니즘이 요구하는 전후 맥락입니다.

Citeon은 이 원리를 제품에 담았다

GEO 논문이 알려준 두 가지 — (1) 인용을 늘리는 글쓰기는 측정 가능하다, (2) 엔진마다 답이 달라 합산 평균은 메커니즘을 가린다 — 를 Citeon은 그대로 제품 구조로 가져왔습니다.

우선 당신 사이트가 지금 어느 엔진에서 인용되고 어디서 빠지는지부터 보는 게 순서입니다. Citeon 무료 진단(₩0)으로 SEO·AEO·GEO 점수와 처방 리포트를 받아보세요.

자주 묻는 질문

GEO 논문의 '최대 40%'는 우리 사이트에도 그대로 적용되나요?

아니요. 논문은 "특정 조건에서 최대 약 40%"라고 명시합니다. 효과는 도메인과 질의 유형(사실형이냐 의견형이냐)에 따라 달라지고, 측정 자체도 LLM 비결정성 때문에 흔들립니다. '우리 사이트에서 얼마나 오를지'는 단일 측정이 아니라 여러 번·여러 엔진에서 재본 평균과 구간으로 판단해야 합니다.

통계랑 출처만 박으면 인용이 보장되나요?

보장은 아닙니다. 그건 RAG의 마지막 단계(생성 채택)를 돕는 신호일 뿐입니다. 그 앞에 크롤러 허용(후보 진입), 하이브리드 검색 대응, 질문 의도에 맞는 답(재정렬 통과)이 먼저 충족돼야 처방이 의미를 갖습니다. 후보에 못 들면 아무리 좋은 문장도 0입니다.

키워드를 많이 넣는 전통적 SEO는 이제 소용없나요?

인덱싱(후보 진입)에는 여전히 필요하지만, 생성엔진의 '인용 채택'에는 키워드 스터핑이 효과가 미미하거나 역효과라는 게 논문의 관찰입니다. SEO는 GEO의 전제 조건이지 대체재가 아닙니다.

엔진별로 따로 봐야 한다면, 어디부터 챙겨야 하나요?

먼저 어느 엔진이 당신 고객을 데려오는지를 측정으로 확인하세요. 인용 도메인 중복이 ChatGPT-Perplexity 간 ~11%에 불과할 만큼 엔진별 차이가 큽니다. Claude처럼 근거를 깐깐하게 거르는 엔진일수록 통계·출처·직접 인용문 처방의 효과가 더 클 가능성이 높습니다.

측정값이 흔들린다면 GEO 성과는 어떻게 보고하나요?

단일 스냅샷 대신 다중 실행 + 신뢰구간으로 보고하는 게 정직합니다. 인용이 멱법칙으로 출렁이기 때문에 한 번의 상승은 노이즈일 수 있습니다. 주간 추이로 추세를 읽고, 가시성은 매출·리드 같은 결과를 설명하는 2차 지표로 다루는 게 맞습니다.

참고자료

박도현
박도현 · AEO 리서처

생성형 검색·LLM 인용에 관한 논문과 데이터를 읽고 실무 언어로 옮깁니다. 근거 없는 '카더라'를 싫어합니다.

내 사이트의 AI 검색 점수가 궁금하다면

30초 무료 진단으로 SEO·AEO·GEO 점수와 처방을 받아보세요.

무료 진단 시작
← 인사이트 목록으로