Citeon
한국어 LLM 인용 데이터 리서치

한국어 질의의 query fan-out 구조 해부

박도현
박도현 · AEO 리서처
한국어 질의의 query fan-out 구조 해부

한국어 질문 하나를 AI에 던지면, 엔진은 그 질문을 그대로 검색하지 않는다. 질문을 여러 개의 하위 질의(sub-query)로 쪼개 동시에 검색한 뒤, 흩어진 결과를 다시 모아 답을 합성한다. 이 '한 질문 → 여러 검색'의 부채꼴 분해 과정을 query fan-out이라 부른다. 그리고 한국어는 조사·띄어쓰기·외래어 표기가 흔들리는 언어라서, 이 분해 단계에서 영어보다 훨씬 많은 변이가 생긴다. 당신의 콘텐츠가 AI 답변에 인용되느냐 마느냐는, 사실 이 fan-out으로 갈라진 수많은 하위 질의 중 몇 개를 당신 문서가 받아내느냐의 문제다.

이 글은 query fan-out이 '왜' 일어나는지를 RAG(retrieval→reranking→generation) 메커니즘으로 분해하고, 한국어 특유의 형태소 구조가 이 부채꼴을 어떻게 더 넓게 펼치는지, 그래서 인용되려면 콘텐츠를 어떻게 써야 하는지까지 데이터와 논문에 기대어 짚는다. 근거 없는 단정은 피한다 — 확실한 수치는 출처와 함께, 불확실한 것은 정성적으로.

query fan-out이란 무엇인가 — 한 질문이 부채처럼 펼쳐진다

전통적인 키워드 검색은 단순했다. 사용자가 "제주도 3박4일 가족여행 코스"라고 치면, 그 문자열에 가까운 문서를 찾아 10개를 줄 세웠다. 질문 하나, 검색 하나, 결과 목록 하나.

AI 검색은 이 과정을 근본적으로 바꿨다. 같은 질문을 받으면 엔진은 내부적으로 이렇게 분해한다.

하나의 질문이 예닐곱 개의 독립적인 검색으로 갈라진다. 각각은 따로 검색되고, 따로 후보 문서를 끌어오고, 마지막에 LLM이 이 모든 조각을 읽어 하나의 답으로 꿰맨다. 이것이 fan-out(부채꼴 펼침)이다.

비유하자면, 옛 검색이 "도서관에서 이 제목이 적힌 책을 찾아 주세요"라면, query fan-out은 "이 주제로 보고서를 쓸 건데, 필요한 자료를 항목별로 나눠서 각 서가에서 동시에 가져와 주세요"라고 여러 사서에게 동시에 부탁하는 것과 같다. 사서들이 각자 다른 서가를 뒤지고, 마지막에 한 사람이 모은 자료로 보고서를 쓴다. 당신의 책이 인용되려면 '제목'이 맞는 게 아니라, 갈라진 항목 중 하나의 서가에 정확히 꽂혀 있어야 한다.

왜 엔진은 질문을 쪼개는가 — RAG 메커니즘에서 답이 나온다

이 분해가 '왜' 필요한지는 RAG의 작동 원리를 보면 명확해진다. RAG는 2020년 Lewis 등이 제안한 구조로(arXiv:2005.11401), 모델이 학습으로 외운 지식(파라메트릭 메모리)에 더해, 검색으로 가져온 외부 문서(비파라메트릭 메모리)를 함께 읽어 답을 만든다. 핵심은 답을 생성하기 전에 먼저 검색한다는 것이다. 검색 단계에서 좋은 문서를 못 끌어오면, 아무리 똑똑한 LLM이라도 그 사실을 답에 넣을 수 없다.

그런데 복잡한 질문 하나를 그대로 검색하면 문제가 생긴다. "제주도 3박4일 가족여행 코스"라는 긴 문자열에 통째로 잘 맞는 문서는 드물다. 어떤 블로그는 숙소만, 어떤 글은 맛집만, 어떤 글은 렌터카만 깊게 다룬다. 질문을 통째로 던지면 이 좋은 부분 자료들이 '전체 매칭 점수'에서 밀려 후보에 못 든다.

그래서 엔진은 질문을 의도 단위로 쪼개 각각을 검색한다. 이렇게 하면 숙소 전문 글, 맛집 전문 글, 동선 전문 글이 각자의 하위 질의에서 1등으로 뽑힐 기회를 얻는다. fan-out은 RAG의 검색 품질을 끌어올리기 위한 필연적 장치다.

검색 단계의 실제 작동 — 의미 검색과 하이브리드

각 하위 질의가 후보 문서를 끌어오는 방식도 진화했다. 2020년 Karpukhin 등의 Dense Passage Retrieval(arXiv:2004.04906)은 질문과 문서를 각각 벡터(임베딩)로 바꿔 '의미가 가까운' 문서를 찾는 방식이 전통적 키워드 매칭(BM25)을 능가함을 보였다. "강아지 사료"로 검색해도 "반려견 먹이"를 다룬 글을 찾아낸다 — 글자는 달라도 의미가 가깝기 때문이다.

하지만 의미 검색만으로는 부족하다. 고유명사·모델명·정확한 수치처럼 '글자 그대로' 매칭돼야 하는 것은 키워드 검색이 더 강하다. 그래서 현대 엔진은 둘을 합친 하이브리드 검색을 쓴다.

비유하자면, 하이브리드 검색은 '도서관의 키워드 색인(BM25)'과 '주제를 이해하는 사서(임베딩)'를 동시에 쓰는 것이다. 색인은 정확한 단어를 빠르게 찾고, 사서는 단어가 달라도 뜻이 통하는 책을 안다. 둘을 합치면 어느 한쪽이 놓친 책을 다른 쪽이 잡는다.

공개 벤치마크를 종합하면 이 차이는 숫자로 드러난다.

검색 방식recall@10 (상위 10개 안에 정답을 담는 비율)
BM25 단독(키워드)약 65%
의미 검색 단독(임베딩)약 78%
하이브리드(RRF로 결합)약 91%

Anthropic이 2024년 공개한 Contextual Retrieval 실험도 같은 방향을 가리킨다. 청크(문서 조각)에 맥락을 덧붙이자 검색 실패율이 5.7%에서 3.7%로 35% 줄었고, 여기에 BM25를 더한 하이브리드로 49%, 재정렬(reranking)까지 얹자 67%까지 실패율이 줄었다. 검색은 한 가지 기술이 아니라 여러 단계의 누적이라는 뜻이다.

재정렬(reranking) — 후보를 질문과 함께 다시 읽는다

fan-out으로 각 하위 질의가 후보 20~수십 개를 끌어오면, 그다음 단계가 reranking이다. cross-encoder라 불리는 모델이 '질문과 후보 문서를 한 쌍으로 같이 읽고' 진짜 관련성을 다시 채점한다. 1차 검색이 빠르지만 거친 그물이라면, reranking은 그물에 걸린 것을 손으로 골라내는 정밀 작업이다. 공개 실험에서 reranking은 NDCG(순위 품질 지표)를 5~15포인트, 난도 높은 경우 약 20포인트까지 끌어올린다.

여기서 중요한 실무 함의가 나온다. 당신의 문서는 두 번 평가받는다. 1차 검색에서 후보로 진입해야 하고(키워드+의미 둘 다 잡혀야 유리), 2차 재정렬에서 '질문에 직접 답하는 글'로 다시 뽑혀야 한다. 키워드만 욱여넣은 글은 1차는 통과해도 2차에서 걸러진다.

한국어가 fan-out을 더 넓게 펼치는 이유

여기까지가 언어 공통의 메커니즘이다. 이제 한국어의 차례다. 한국어는 영어와 형태가 근본적으로 달라서, query fan-out 단계에서 변이가 폭증한다.

1. 조사(은/는/이/가/을/를)가 토큰을 흔든다

한국어는 교착어다. 명사 뒤에 조사가 달라붙는다. "제주도"가 "제주도는", "제주도에서", "제주도까지", "제주도로"로 변형된다. 키워드 매칭 입장에서 이들은 서로 다른 문자열이다. 영어 "Jeju"는 어디서나 "Jeju"지만, 한국어 명사는 문맥마다 꼬리가 바뀐다.

그래서 엔진이 fan-out으로 하위 질의를 만들 때, 한국어는 '어간만 남긴 형태', '조사 붙은 형태', '띄어 쓴 형태'가 모두 후보로 갈라질 수 있다. 의미 검색(임베딩)은 이 변이를 상당히 흡수하지만, 키워드 매칭 경로에서는 여전히 손실이 난다. 즉 한국어에서는 하이브리드 검색의 'BM25 절반'이 영어보다 더 자주 헛발질한다.

2. 띄어쓰기가 자유롭다

"인공지능" vs "인공 지능", "머신러닝" vs "머신 러닝", "가족여행" vs "가족 여행". 한국어는 띄어쓰기 규범이 있지만 실제 웹 문서는 제각각이다. 토크나이저가 이를 다르게 쪼개면, 같은 개념인데도 다른 하위 질의로 갈라지거나, 매칭에서 점수가 떨어진다.

3. 외래어 표기가 표준이 없다

가장 골치 아픈 변이다. 같은 외래 개념이 "챗GPT / 챗지피티 / ChatGPT / 쳇GPT"로, "리트리벌 / 리트리버 / retrieval"로, "리랭킹 / 재정렬 / re-ranking"으로 흩어진다. 사람은 같은 것으로 읽지만, 키워드 인덱스에는 전부 다른 토큰이다. fan-out이 "챗지피티 인용 측정"으로 갈라졌는데 당신 글에는 "ChatGPT"만 있다면, 의미 검색이 구원해 주기 전까지는 매칭 손실이 발생한다.

4. 존댓말·문어체·구어체가 같은 의도를 다르게 쓴다

"제주도 어디 가요?" / "제주도 가볼 만한 곳" / "제주 추천 명소" — 셋 다 같은 의도다. 한국어는 종결어미와 격식 수준이 다양해 의도-표현 매핑이 영어보다 1:N으로 넓다. fan-out은 이 변이형들을 각각 별도 하위 질의로 펼칠 수 있다.

결론적으로 한국어 콘텐츠는 영어보다 더 넓게 갈라진 부채를 받아내야 한다. 하나의 표기, 하나의 어투로만 쓰인 글은 갈라진 하위 질의 중 일부만 잡는다.

그래서 어떻게 써야 인용되나 — ❌약한 예 / ✅강한 예

fan-out이 펼친 하위 질의를 최대한 많이 받아내고, 1차 검색·2차 재정렬·최종 생성 단계를 모두 통과하는 문장은 어떻게 다른가. 실제 문장으로 대조한다.

표기 변이를 흡수하는가

약한 예: "본 솔루션은 LLM 기반 검색 노출을 최적화합니다."
강한 예: "Citeon은 ChatGPT(챗지피티)·Gemini(제미나이)·Perplexity(퍼플렉시티)·Claude(클로드) 같은 생성형 AI 검색 답변에서 브랜드가 인용되는지를 측정합니다."

강한 예는 영문·한글 표기를 자연스럽게 병기해, 외래어 표기로 갈라진 여러 하위 질의를 한 문장이 동시에 받아낸다. 핵심 개념은 한 번씩 한글 표기를 끼워 주는 것이 좋다.

질문에 직접 답하는가 (재정렬 통과)

약한 예: "AEO는 점점 중요해지고 있으며 많은 기업이 관심을 갖고 있습니다."
강한 예: "query fan-out이란, AI가 질문 하나를 여러 하위 질의로 쪼개 병렬 검색한 뒤 답을 합성하는 과정을 말한다."

cross-encoder 재정렬기는 '질문과 문서를 함께 읽는다'. 정의형 질문에 정의로 시작하는 문장은 재정렬 점수가 높다. 분위기만 잡는 문장은 1차 검색은 통과해도 2차에서 밀린다.

하위 질의를 소제목으로 미리 나눠 두는가

약한 예: 3,000자짜리 한 덩어리 문단에 숙소·맛집·동선·날씨를 모두 섞어 서술.
강한 예: <h3>제주 가족 숙소 위치</h3>, <h3>아이와 가기 좋은 실내 관광지</h3>처럼 fan-out이 갈라낼 의도를 미리 소제목으로 분할.

RAG는 문서를 청크 단위로 잘라 검색한다. 의도별로 소제목이 나뉜 글은 각 청크가 각 하위 질의에 깔끔히 대응돼, 한 글이 여러 하위 질의에서 동시에 뽑힌다. 뒤섞인 한 덩어리는 어느 하위 질의에도 '딱 맞지 않는' 어중간한 청크가 된다.

핵심을 앞과 끝에 두는가 (Lost in the Middle)

2023년 Liu 등의 "Lost in the Middle" 연구(arXiv:2307.03172)는 LLM이 긴 맥락의 중간에 있는 정보를 잘 놓친다는 U자형 성능 곡선을 보였다. 양 끝(처음·마지막)의 정보는 잘 활용하고, 가운데는 흘린다.

이건 최종 생성 단계에 직결된다. fan-out으로 모은 여러 청크를 LLM이 한꺼번에 읽을 때, 청크 안에서도 핵심 답이 중간에 묻혀 있으면 답에 반영될 확률이 떨어진다.

약한 예: 배경 설명 5문장 → (중간에) 핵심 수치 → 다시 일반론 5문장.
강한 예: 첫 문장에 직답(핵심 수치/결론) → 근거 전개 → 마지막에 핵심 재요약.

이 글이 매 섹션을 직답으로 시작하는 것도 같은 이유다.

통계·출처·인용을 넣는가 (GEO)

2023년 Aggarwal 등의 GEO 연구(arXiv:2311.09735, KDD 2024)는 생성형 엔진에서의 가시성을 끌어올리는 요소를 실험했다. 통계 수치 추가, 출처 인용, 직접 인용문 삽입이 특정 조건에서 생성엔진 가시성을 최대 약 40%까지 높였다. 막연한 주장보다 '숫자·근거·인용'을 갖춘 문장이 합성 단계에서 채택될 확률이 높다는 뜻이다.

약한 예: "하이브리드 검색이 훨씬 좋습니다."
강한 예: "하이브리드 검색의 recall@10은 약 91%로, 의미 검색 단독(~78%)·BM25 단독(~65%)을 모두 앞선다(공개 벤치마크 종합)."

한국 시장의 특수 변수 — 네이버와 나무위키 우회

한국어 fan-out은 검색 생태계가 둘로 갈린다는 또 하나의 변수를 안고 있다. 네이버는 외부 크롤러를 차단한다. 그 결과 글로벌 AI(ChatGPT·Gemini 등)는 한국어 사실을 채울 때 네이버 블로그 대신 나무위키·위키백과·티스토리를 우회 경로로 쓰는 경향이 관찰된다.

한 대규모 인용 분석에서는 ChatGPT가 위키백과를 약 47.9% 인용하고, Perplexity는 Reddit을 약 46.7% 인용하는 등 엔진마다 선호 출처가 뚜렷이 달랐다(Profound/Discovered Labs 등). 인용의 약 90%가 엔진마다 다르고, ChatGPT와 Perplexity의 도메인 중복은 약 11%에 그쳤다. 즉 같은 한국어 질문도 엔진마다 다른 부채로 갈라지고, 다른 출처에서 답을 길어 올린다.

네이버 자체도 빠르게 움직이고 있다. 큐:(Cue:)·클로바X는 2026년 4월 9일 종료되고, AI탭이 2026년 6월 25~26일 전체 정식 출시되며 대화형·에이전틱 검색으로 전환된다. AI 브리핑(요약)은 이미 통합검색 쿼리의 20% 이상에 적용되고, 2026년 4월 기준 AI 브리핑 인용은 월 약 3.558억 건에 달한다. 한 표본 분석(272건)에서는 인용 출처의 약 58%가 블로그였고, 인용된 글의 약 49%가 통합검색 Top10 밖에서 나왔다. 네이버는 C-Rank(출처 신뢰·전문성)와 D.I.A.+(문서 의도)로 채점하며, 직접 경험·일관된 주제·진정성·읽기 쉬운 구조·최신성이라는 콘텐츠 5원칙을 강조한다.

여기서 한국어 콘텐츠 운영의 분기점이 생긴다. 글로벌 AI에 인용되려면 robots.txt로 AI 크롤러(GPTBot·OAI-SearchBot·PerplexityBot·ClaudeBot·anthropic-ai·Google-Extended)를 허용해 후보 풀에 진입해야 하고, 위키성 출처에 정확한 사실이 박혀 있어야 우회 경로로 잡힌다. 네이버 답변에 잡히려면 C-Rank가 인정하는 신뢰·전문성과 5원칙을 갖춘 블로그 자산이 필요하다. 같은 한국어 질문을 두 생태계가 다르게 fan-out하므로, 양쪽을 따로 공략해야 한다.

측정이 흔들린다는 사실을 먼저 인정하라

여기서 david의 원칙을 하나 분명히 해 둔다. AI 가시성 측정은 결정적이지 않다. temperature=0으로 고정해도 LLM 결과는 GPU 연산·배치 처리 특성 때문에 흔들린다. 한 실험에서는 2,350억 파라미터 모델을 1,000회 돌렸을 때 80가지 출력이 나왔고, 또 다른 연구는 인용이 멱법칙으로 출렁여 다중 실행과 부트스트랩 신뢰구간으로 불확실성을 정량화할 것을 권했다. 단일 측정은 노이즈다.

fan-out 관점에서 이는 당연하다. 같은 질문이 매번 조금씩 다른 부채로 갈라지면, 갈라진 하위 질의가 끌어오는 후보도, 최종 합성도 매번 미세하게 다르다. 그러니 "우리 브랜드가 어제 ChatGPT 답변에 나왔다"는 한 번의 관찰로 흥분하거나 좌절할 일이 아니다. 여러 번 측정해 추세로 봐야 한다.

덧붙여, 시중에 떠도는 'AI 프롬프트 검색량' 수치는 실측이 불가능하다. 패널(시장 1% 미만) 기반 모델링 추정치일 뿐이다. Conductor는 "신뢰할 수 없는 검색량 데이터는 없는 것보다 나쁘다"고 못 박는다. fan-out된 하위 질의는 사용자가 직접 입력한 질문이 아니라 엔진이 내부 생성한 것이라, 외부에서 그 볼륨을 정확히 셀 방법이 없다.

Citeon은 이 원리를 제품에 담았다

query fan-out의 메커니즘을 받아들이면, 'AI 마케팅'에서 무엇을 측정하고 무엇을 고쳐야 하는지가 또렷해진다. Citeon은 정확히 이 지점을 제품으로 만들었다.

그리고 시작은 무료 진단(₩0)이다. URL 하나만 넣으면 당신 사이트가 한국어 fan-out을 얼마나 받아내는지, 어디가 비어 있는지를 리포트로 받는다.

→ Citeon 무료 AI 가시성 진단 받기 (citeon.cloud)

자주 묻는 질문(FAQ)

query fan-out과 일반 키워드 SEO는 무엇이 다른가요?

키워드 SEO는 하나의 검색어에 대해 하나의 결과 목록에서 순위를 다투는 게임이었습니다. query fan-out 환경에서는 엔진이 질문 하나를 여러 하위 질의로 쪼개 병렬 검색하고 답을 합성하므로, 단일 키워드 순위보다 '여러 하위 의도에 각각 답하는 구조'가 중요합니다. 소제목으로 의도를 나누고, 각 섹션을 직답으로 시작하는 글이 유리합니다.

한국어라서 영어 콘텐츠보다 불리한가요?

불리하다기보다 변이가 더 많습니다. 조사·띄어쓰기·외래어 표기·존댓말 때문에 같은 의도가 여러 표현으로 갈라집니다. 의미 검색(임베딩)이 이 변이를 상당 부분 흡수하지만, 키워드 매칭 경로에서는 손실이 납니다. 핵심 개념을 한글·영문 병기로 한 번씩 노출하고, 자연스러운 동의어를 함께 쓰면 갈라진 하위 질의를 더 많이 받아낼 수 있습니다.

네이버와 ChatGPT 양쪽에 다 인용되려면 같은 글이면 되나요?

한 글로 양쪽을 노릴 수 있지만, 공략 포인트가 다릅니다. 글로벌 AI는 robots.txt로 AI 크롤러를 허용해 후보에 진입해야 하고, 네이버가 막은 영역은 나무위키·위키백과 같은 우회 출처에 정확한 사실이 있어야 잡히는 경향이 있습니다. 네이버 AI 브리핑은 C-Rank가 인정하는 신뢰·전문성과 콘텐츠 5원칙(직접 경험·일관 주제·진정성·읽기 쉬운 구조·최신성)을 봅니다. 두 생태계를 별도로 점검하는 것이 안전합니다.

AI 답변에 한 번 나왔다가 다음 날 안 나옵니다. 왜죠?

정상입니다. temperature=0에서도 LLM 출력은 흔들립니다. 한 실험에서 2,350억 파라미터 모델을 1,000회 돌렸을 때 80가지 출력이 나왔고, 인용은 멱법칙으로 출렁인다는 연구도 있습니다. 단일 관찰은 노이즈에 가깝습니다. 여러 번 측정한 주간 추세로 보아야 진짜 변화를 판단할 수 있습니다.

'AI 프롬프트 검색량' 데이터를 사면 도움이 되나요?

주의가 필요합니다. fan-out된 하위 질의는 엔진이 내부 생성한 것이라 사용자 입력처럼 외부에서 정확히 집계할 수 없습니다. 시중 수치는 대개 시장 1% 미만 패널 기반 모델링 추정치입니다. Conductor는 "신뢰할 수 없는 검색량 데이터는 없는 것보다 나쁘다"고 지적합니다. 절대 수치보다 실제 인용 측정과 그 추세를 보는 편이 낫습니다.

참고자료

박도현
박도현 · AEO 리서처

생성형 검색·LLM 인용에 관한 논문과 데이터를 읽고 실무 언어로 옮깁니다. 근거 없는 '카더라'를 싫어합니다.

내 사이트의 AI 검색 점수가 궁금하다면

30초 무료 진단으로 SEO·AEO·GEO 점수와 처방을 받아보세요.

무료 진단 시작
← 인사이트 목록으로