Citeon
트렌드·담론

citation drift — AI 인용은 왜 계속 바뀌는가

이서연
이서연 · GEO 전략 리드
citation drift — AI 인용은 왜 계속 바뀌는가

citation drift(인용 표류)는 같은 질문을 같은 AI에게 다시 물어도 답변이 인용하는 출처가 바뀌는 현상입니다. 어제는 우리 글을 인용하던 ChatGPT가 오늘은 경쟁사를 인용하고, 1번 측정에서는 1위였던 브랜드가 10번 측정하면 평균 3위로 내려앉습니다. 이건 버그가 아니라 AI 검색의 작동 원리에서 비롯된 구조적 성질입니다. 이 글은 그 표류가 RAG(검색→재정렬→생성)의 어느 단계에서, 왜 발생하는지를 메커니즘까지 파고들고, 그래서 GEO(생성엔진 최적화) 측정과 전략을 어떻게 바꿔야 하는지를 정리합니다.

안녕하세요, Citeon GEO 전략 리드 lena입니다. 'AI 노출 측정'을 시작한 분들이 가장 먼저 부딪히는 벽이 바로 이 표류입니다. "분명 어제는 우리가 인용됐는데 오늘은 사라졌어요" — 이 한 문장 뒤에 숨은 기계의 사정을 끝까지 설명하겠습니다.

citation drift란 무엇인가 — 먼저 직관부터

표류를 한 문장으로 정의하면 이렇습니다. 입력(질문)은 그대로인데, 출력(답변이 가리키는 출처 목록)이 시간·실행·맥락에 따라 흔들리는 것.

일상 비유를 들어보죠. 같은 음식점에 같은 메뉴를 주문해도, 그날 주방에 어떤 식재료가 먼저 손에 잡혔는지·어떤 요리사가 맡았는지에 따라 접시 위 가니시가 조금씩 달라집니다. 손님은 "같은 메뉴인데 왜 매번 다르지?"라고 느끼지만, 주방 입장에서는 매번 '그 순간 가장 적합한 재료'를 고른 결과입니다. AI 답변의 인용도 똑같습니다. 질문은 같아도, 그 순간 검색 인덱스에서 먼저 잡힌 문서·재정렬 점수의 미세한 차이·생성 단계의 확률적 선택이 매번 조금씩 다른 '가니시'를 만듭니다.

중요한 건 이 흔들림이 예외가 아니라 기본값이라는 점입니다. 한 실험에서는 temperature=0(가장 결정적인 설정)으로 맞춰도 LLM의 출력이 흔들렸고, 2,350억 파라미터급 모델을 1,000번 돌렸을 때 80가지의 서로 다른 출력이 나왔다는 분석이 보고됐습니다. 즉 '같은 입력 → 같은 출력'이라는 우리의 소프트웨어적 직관이 LLM에는 통하지 않습니다.

표류의 3대 발원지 — RAG 파이프라인을 따라가며

왜 흔들리는지 제대로 이해하려면 AI 검색의 내부 구조를 알아야 합니다. ChatGPT·Perplexity·구글 AI·네이버 AI 브리핑은 대부분 RAG(Retrieval-Augmented Generation) 구조 위에서 돕니다. RAG는 Lewis 등(2020, arXiv:2005.11401)이 제안한 것으로, 모델이 자기 안에 외운 지식(파라메트릭 메모리)만 쓰는 게 아니라, 외부 문서를 그때그때 찾아와(비파라메트릭 메모리) 답을 만드는 방식입니다. 책 내용을 다 외우려 애쓰는 대신, 필요할 때 도서관에서 책을 빌려와 인용하는 학생이라고 보면 됩니다.

이 파이프라인은 크게 3단계입니다. 검색(retrieval) → 재정렬(reranking) → 생성(generation). 표류는 이 세 단계 모두에서 독립적으로 발생합니다.

1단계 — 검색(retrieval): 후보가 매번 조금씩 다르다

검색 단계는 "이 질문에 답할 만한 문서 수십 개를 인덱스에서 끌어오는" 일입니다. 여기엔 두 종류의 검색이 섞입니다.

요즘 엔진은 이 둘을 합친 하이브리드 검색을 씁니다. 키워드 색인(글자)과 주제를 아는 사서(의미)를 함께 두는 도서관인 셈이죠. 공개 벤치마크들을 종합하면 recall@10(상위 10개 안에 정답 문서가 들어올 확률)이 의미 단독 ~78%, BM25 단독 ~65%인데, 둘을 RRF로 합치면 ~91%까지 올라갑니다. 더 합치는 게 강한 이유가 여기 있습니다.

그런데 바로 이 검색 단계가 표류의 첫 번째 발원지입니다. 인덱스는 살아 움직입니다. 새 문서가 색인되고, 기존 문서의 신선도 점수가 바뀌고, 임베딩 모델이 업데이트됩니다. 후보 풀의 경계선(예: 20등과 21등)에 있는 문서는 아주 작은 변화로도 들어왔다 나갔다를 반복합니다. 경계선의 문서가 한 칸 밀리면, 그 문서를 인용하던 답변은 그날부로 인용을 멈춥니다.

2단계 — 재정렬(reranking): 순위의 미세한 떨림

검색으로 끌어온 수십 개 후보를, 이번엔 질문과 한 쌍으로 묶어 "이 문서가 정말 이 질문에 답이 되나"를 다시 채점합니다. 이게 cross-encoder 재정렬입니다. 1차 검색이 '제목만 보고 책을 모은 것'이라면, 재정렬은 '사서가 질문을 손에 들고 각 책을 펼쳐 읽으며 다시 줄 세우는 것'입니다. 재정렬은 검색 품질을 크게 끌어올려서, NDCG 기준 +5~15(난도 높은 질의에선 ~20)의 향상이 보고됩니다.

Anthropic의 Contextual Retrieval(2024) 분석이 이 단계의 위력을 잘 보여줍니다. 청크에 맥락을 덧붙여 검색 실패율을 35% 줄였고(5.7%→3.7%), BM25 하이브리드를 더하면 49%, 여기에 재정렬까지 얹으면 67% 감소했습니다. 그만큼 재정렬은 '누가 인용되느냐'를 좌우하는 결정적 단계입니다.

표류의 관점에서 문제는, 재정렬 점수가 연속적인 실수값이라는 데 있습니다. 1위(0.82점)와 4위(0.79점)의 차이가 0.03밖에 안 될 때, 모델·배치·부동소수점 연산의 미세한 차이만으로 순위가 뒤집힙니다. 그리고 답변에 실제로 인용되는 건 대개 상위 몇 개뿐이라, 이 미세한 순위 떨림이 곧 인용/탈락의 운명을 가릅니다.

3단계 — 생성(generation): 어떤 출처를 '문장으로' 끌어올릴까

마지막으로 LLM이 상위 문서들을 읽고 답변을 씁니다. 여기서 두 가지 표류 요인이 추가됩니다.

첫째, 위치 편향(Lost in the Middle)입니다. Liu 등(2023, arXiv:2307.03172)은 긴 맥락을 받은 모델이 앞과 끝의 정보는 잘 쓰지만 중간에 낀 정보는 흘리는 U자형 성능 곡선을 보인다는 걸 밝혔습니다. 우리 글이 후보 목록의 중간 11번째쯤에 들어가면, 검색에는 성공해도 답변에는 인용되지 않을 수 있습니다. 그리고 그 '위치'는 매 실행마다 조금씩 바뀝니다.

둘째, 생성의 확률적 본질입니다. LLM은 다음 단어를 확률 분포에서 고릅니다. temperature=0이라도 앞서 말한 GPU 연산·배치 처리의 비결정성 때문에 완벽히 고정되지 않습니다. 어떤 실행에선 우리 출처를 인라인 인용으로 콕 박고, 어떤 실행에선 같은 사실을 다른 출처로 귀속시킵니다.

세 단계를 합치면 결론은 분명합니다. citation drift는 파이프라인 어느 한 곳의 결함이 아니라, 세 단계의 작은 흔들림이 곱해져 증폭된 결과입니다.

왜 엔진마다 인용이 이렇게 다른가

표류에는 '같은 엔진의 시간적 흔들림'만 있는 게 아닙니다. 엔진 사이의 구조적 차이도 큽니다. 대규모 인용 분석들을 보면, ChatGPT와 Perplexity가 같은 도메인을 인용하는 비율은 ~11%에 불과하고, 인용의 약 90%가 엔진마다 다릅니다. 즉 한 엔진에서 1등이어도 다른 엔진에선 아예 안 보일 수 있습니다.

엔진인용 성향표류에 주는 함의
ChatGPT위키백과·커뮤니티 선호(한 분석에서 위키백과 ~47.9%)권위 출처에 집중 → 신규 도메인은 진입 장벽 높음
Perplexity실시간 웹 + 인라인 인용, Reddit 비중 큼(~46.7%)최신성에 민감 → 시간 표류가 가장 큼
Gemini구글 색인 기반, E-E-A-T 신호 중시구글 SEO 자산이 그대로 영향
Claude근거 약한 콘텐츠를 보수적으로 걸러냄(Citations API)출처 명확한 글에 유리, 표류 폭은 상대적으로 작음
Grok실시간 웹 + X 스트림인용 정확도 편차 큼 → 표류 변동성 높음

여기서 실무적으로 가장 위험한 함정 하나. 여러 엔진의 결과를 하나로 합산해서 보면 표류의 원인(어느 엔진·어느 단계 문제인지)이 통째로 가려집니다. 평균 노출 점수가 어제 70, 오늘 55로 떨어졌을 때, 그게 Perplexity의 시간 표류 때문인지 ChatGPT의 인덱스 변화 때문인지 합산값만으로는 알 길이 없습니다. 엔진은 반드시 분리해서 봐야 합니다.

한국 시장의 특수 변수 — 네이버

한국 GEO를 다루는 글에서 네이버를 빼면 절반만 보는 겁니다. 네이버는 2026년 들어 검색 지형을 크게 바꿨습니다. 큐:(Cue:)와 클로바X는 2026-04-09 종료됐고, 새 AI탭이 2026-06-25~26 전체 정식 출시되며 대화형·에이전틱 검색으로 전환했습니다. AI 브리핑(요약)은 이미 통합검색 쿼리의 20% 이상에 적용되고 있고, 2026-04 기준 AI 브리핑 인용은 월 약 3.558억 건 규모로 보고됩니다.

네이버 표류의 핵심 데이터가 하나 있습니다. 한 표본 분석(272건)에서 AI 브리핑 인용 출처의 약 58%가 블로그였고, 인용된 출처의 약 49%가 통합검색 Top10 바깥에서 왔습니다. 무슨 뜻일까요? 검색 순위 1페이지에 없어도 AI에는 인용될 수 있고, 반대로 1페이지에 있어도 인용 안 될 수 있다는 겁니다. 순위와 인용이 따로 논다 — 이것이 표류를 키우는 또 다른 축입니다.

네이버 알고리즘은 C-Rank(출처 신뢰·전문성) + D.I.A.+(문서 의도)로 인용을 거릅니다. 그리고 네이버는 외부 크롤러를 차단하기 때문에, 글로벌 AI들은 네이버 본문 대신 나무위키·위키백과·티스토리를 우회 경유해 한국 정보를 가져갑니다. 즉 같은 한국어 질문이라도 네이버 AI탭과 ChatGPT가 보는 '원본'이 아예 다릅니다. 엔진 간 표류가 한국에선 더 극단적인 이유입니다.

가장 비싼 실수 — 단일 측정으로 의사결정하기

여기까지 읽었다면 핵심 결론이 보일 겁니다. 한 번 측정한 값은 신호가 아니라 노이즈에 가깝습니다.

이건 정성적 주장이 아닙니다. 한 연구(arXiv:2603.08924)는 AI 가시성 측정의 불확실성을 정량화하면서, 브랜드 인용이 멱법칙(power-law)으로 출렁인다는 것을 보였습니다. 멱법칙이란 대부분은 작게 움직이지만 가끔 크게 튄다는 뜻으로, '오늘은 평소보다 두 배 인용됐다' 같은 일이 드물지 않게 일어납니다. 그래서 이 연구는 다중 실행 + 부트스트랩 신뢰구간을 권장합니다. 6개 모델을 480회 돌린 또 다른 실험(arXiv:2602.14349)도 같은 메시지를 줍니다 — 한 번 봐서는 모른다.

측정 방법의 차이를 실제 문장으로 대조해 보겠습니다.

❌ 약한 측정 보고
"ChatGPT에 'OO 추천' 물어보니 우리 브랜드가 1위로 인용됐습니다. 
 노출 1등 달성!"
→ 1회 측정. 내일 다시 물으면 3위일 수 있음. 운을 실력으로 착각.

✅ 강한 측정 보고
"동일 질문 세트 20개를 4개 엔진에서 각 10회 반복(총 800회) 측정. 
 브랜드 언급률(SOV) 평균 22%, 95% 신뢰구간 [16%, 29%]. 
 ChatGPT 31%·Perplexity 18%·Gemini 14%·Claude 25%로 엔진 편차 큼. 
 지난주 대비 +3%p이나 신뢰구간이 겹쳐 '유의미한 상승'으로 단정하지 않음."
→ 표류를 구간으로 포착. 엔진 분리. 변화의 유의성까지 판단.

질문 세트 자체도 결과를 좌우합니다. 어떤 질문 20개를 고르느냐에 따라 SOV(Share of Voice, 카테고리 AI 답변 중 브랜드가 언급된 비율)는 통째로 달라집니다. 그래서 질문 세트는 고정하고 공개해야 비교가 의미를 갖습니다.

프롬프트 '검색량'을 파는 도구들도 조심해야 합니다. 사용자가 AI에 실제로 무엇을 묻는지는 외부에서 실측할 수 없고, 대부분 시장의 1% 미만 패널을 모델링한 추정치입니다. Conductor의 표현을 빌리면 "신뢰할 수 없는 검색량 데이터는 없는 것보다 나쁘다"입니다. 표류하는 세계에서 가짜 정밀함은 독입니다.

그럼 무엇을 어떻게 해야 하나 — 표류를 다루는 GEO 전략

표류는 없앨 수 없습니다. 다루는 것이 목표입니다. 두 갈래로 접근합니다 — (A) 측정을 표류에 견디게, (B) 콘텐츠를 표류에 강하게.

A. 측정을 표류에 견디게

B. 콘텐츠를 표류에 강하게

표류의 본질은 '경계선에 있는 문서가 흔들린다'는 것입니다. 그렇다면 답은 경계선에서 벗어나 확실한 상위권으로 올라가는 것입니다. 어떻게? GEO 연구가 답을 줍니다. Aggarwal 등(2023, arXiv:2311.09735, KDD 2024)은 콘텐츠에 통계·출처 인용·직접 인용문을 추가하면 특정 조건에서 생성엔진 가시성이 최대 약 40% 올라간다는 것을 실험으로 보였습니다. 재정렬 점수를 확실히 끌어올려 경계선 위로 올라가는 전략입니다.

실제 문장으로 비교해 보겠습니다.

❌ 약한 문장 (인용되기 어려움)
"우리 제품은 업계 최고 수준의 성능을 자랑하며 
 많은 고객이 만족하고 있습니다."
→ 검증 가능한 사실 0. 출처 0. 모델이 인용할 '근거'가 없음.

✅ 강한 문장 (인용되기 쉬움)
"A제품의 평균 응답 시간은 0.8초로, 동일 카테고리 
 3개 제품 평균(1.4초·자체 벤치마크 2026-06) 대비 43% 빠르다. 
 — '응답이 빠른 OO 추천' 류 질문에 직답이 되는 문장."
→ 수치·기준·시점이 박힌 검증 가능한 사실. 모델이 그대로 인용 가능.

추가로, Anthropic 분석이 보여줬듯 청크에 맥락을 심는 것도 중요합니다. "이 수치는 무엇에 대한 것인지"를 문단 안에서 자족적으로 설명하면, 검색 단계에서 잘리지 않고 정확히 끌려옵니다. 그리고 Lost in the Middle 대응으로, 핵심 직답은 문서의 앞과 끝에 배치합니다(이 글이 첫 문장을 직답으로 시작한 이유입니다). 마지막으로 AI 크롤러(GPTBot·OAI-SearchBot·PerplexityBot·ClaudeBot·anthropic-ai·Google-Extended)가 robots.txt에서 허용돼 있어야 애초에 후보로 진입합니다 — 차단돼 있으면 위 모든 노력이 0이 됩니다.

Citeon은 이 원리를 제품에 담았다

citation drift를 이해하면, Citeon이 왜 지금의 모습으로 설계됐는지가 자연스럽게 보입니다.

표류하는 세계에서 첫걸음은 '지금 어디에 서 있는지'를 노이즈가 아닌 신호로 보는 것입니다. Citeon 무료 AI 가시성 진단(₩0)으로 4엔진에서 내 브랜드가 실제로 어떻게 인용되는지부터 확인해 보세요.

자주 묻는 질문

같은 질문에 인용이 매번 바뀌면, 측정 자체가 무의미한 것 아닌가요?

아닙니다. 무의미한 건 '단일 측정'이지 '측정'이 아닙니다. 주사위 한 번 굴려 1이 나왔다고 주사위가 1만 나온다고 할 수 없듯, 여러 번 굴려 분포를 보면 정확한 기댓값을 얻습니다. 다중 실행 + 신뢰구간으로 측정하면 표류는 '구간'으로 포착되고, 그 구간의 추세 변화는 충분히 신뢰할 수 있는 신호가 됩니다.

temperature를 0으로 고정하면 표류가 사라지지 않나요?

줄어들긴 해도 사라지지 않습니다. temperature=0에서도 GPU 연산 순서·배치 처리 같은 하드웨어 요인으로 출력이 흔들립니다. 한 분석에서 2,350억 파라미터급 모델을 1,000회 돌렸을 때 80가지 출력이 나왔습니다. 게다가 표류의 더 큰 원인은 생성 단계가 아니라 그 앞의 검색·재정렬 단계(인덱스 변화·순위 떨림)에 있어, temperature만으로는 해결되지 않습니다.

네이버 AI탭과 ChatGPT 중 어디에 집중해야 하나요?

고객이 어디서 묻는지에 따라 다릅니다. 다만 둘은 보는 '원본'이 다릅니다 — 네이버는 외부 크롤러를 차단해 자사 블로그·C-Rank 기반으로 인용하고, 글로벌 AI는 나무위키·위키백과·티스토리를 우회 경유합니다. 한국 B2C라면 네이버 비중이, 글로벌·B2B·기술 영역이라면 ChatGPT·Perplexity 비중이 큽니다. 엔진을 분리해 둘 다 측정한 뒤 자원을 배분하는 게 정석입니다.

인용을 늘리려면 콘텐츠에서 뭘 가장 먼저 바꿔야 하나요?

'검증 가능한 사실'을 심는 것입니다. GEO 연구(KDD 2024)에서 통계·출처 인용·직접 인용문을 추가하자 생성엔진 가시성이 특정 조건 최대 약 40% 올랐습니다. "업계 최고" 같은 주관적 표현을 "평균 0.8초, 경쟁 평균 대비 43% 빠름(자체 벤치마크 2026-06)"처럼 수치·기준·시점이 박힌 문장으로 바꾸세요. 핵심 직답은 문단의 앞·끝에 배치하면 Lost in the Middle 효과도 피할 수 있습니다.

인용이 갑자기 0이 됐습니다. 우리가 뭘 잘못한 건가요?

꼭 그렇지 않습니다. 우리 글이 후보 풀의 경계선(예: 20등 근처)에 있었다면, 경쟁 문서 하나가 새로 색인되거나 재정렬 점수가 0.01 바뀐 것만으로도 인용에서 탈락할 수 있습니다. 먼저 다중 실행으로 '정말 0인지(표류인지)'를 확인하고, robots.txt에서 AI 크롤러가 차단되지 않았는지 점검한 뒤, 콘텐츠를 경계선 위로 끌어올리는 처방으로 대응하세요.

참고자료

이서연
이서연 · GEO 전략 리드

AI 검색(AEO·GEO) 전략과 구글·네이버 공식 가이드 해석을 담당합니다. 측정에서 매출까지 잇는 풀퍼널 관점으로 글을 씁니다.

내 사이트의 AI 검색 점수가 궁금하다면

30초 무료 진단으로 SEO·AEO·GEO 점수와 처방을 받아보세요.

무료 진단 시작
← 인사이트 목록으로