Citeon
한국어 LLM 인용 데이터 리서치

Claude가 한국 브랜드를 보수적으로 인용하는 이유

박도현
박도현 · AEO 리서처
Claude가 한국 브랜드를 보수적으로 인용하는 이유

직답부터 하자. Claude가 한국 브랜드를 보수적으로 인용하는 이유는 Claude가 '한국'이나 특정 브랜드를 차별해서가 아니라, ① 답변이 출처에서 추적 가능해야 한다는 faithfulness 제약을 다른 엔진보다 강하게 걸고, ② 그 제약을 통과시킬 만한 한국어 1차 근거가 Claude가 실제로 읽을 수 있는 자리에 충분히 쌓여 있지 않기 때문이다. 즉 문제는 모델의 '태도'가 아니라 retrieval(검색)·reranking(재정렬)·generation(생성)으로 이어지는 RAG 파이프라인의 각 단계에서 한국 브랜드 콘텐츠가 탈락하는 구조적 이유에 있다. 이 글은 그 탈락 지점을 단계별로 분해한다.

먼저: '보수적으로 인용한다'는 게 정확히 무슨 뜻인가

AI 검색엔진은 질문을 받으면 곧장 글을 쓰지 않는다. 내부적으로 세 단계를 거친다. 사람이 도서관에서 답을 찾는 과정에 비유하면 정확하다.

'보수적으로 인용한다'는 말은 이 마지막 단계에서 Claude가 근거가 약하다고 판단되는 문서를 인용 후보에서 적극적으로 떨어뜨린다는 뜻이다. RAG의 원전인 Lewis 등의 2020년 연구(arXiv:2005.11401)는 언어모델이 가진 내부 지식(파라메트릭 메모리)에 외부 문서(비파라메트릭 메모리)를 결합해 답의 사실성을 높이는 구조를 제안했다. Claude의 보수성은 이 비파라메트릭 쪽, 즉 '외부 문서가 충분히 신뢰할 만한가'에 대한 문턱이 다른 엔진보다 높게 설정돼 있다는 것으로 이해하면 된다.

핵심 원리: faithfulness — "출처에서 추적되지 않는 문장은 쓰지 않는다"

RAG 시스템의 답변 품질을 평가하는 대표 지표 중 하나가 faithfulness(충실도)다. RAGAS 프레임워크에서 faithfulness는 '답변의 각 주장이 제공된 출처에서 실제로 추적되는 정도'를 뜻한다. 실무 현장에서는 이 값이 0.9 이상이면 안정적, 0.7 미만이면 환각(없는 사실 생성) 위험으로 보는 경우가 많다(팀마다 기준은 다르다).

Claude 계열은 이 'faithfulness 우선' 성향이 특히 강한 모델로 알려져 있다. Anthropic은 답변 문장마다 근거 문단을 명시적으로 매핑하는 Citations API를 별도 기능으로 제공하는데, 이는 설계 철학 자체가 '추적 가능한 인용'에 무게를 둔다는 방증이다. 비유하자면 Claude는 시험 답안에 각주 없이는 한 문장도 못 쓰게 하는 깐깐한 채점관이다. 각주를 달 수 있는 튼튼한 1차 자료가 손에 없으면, 그 주장 자체를 안 쓰거나 일반론으로 흐린다.

여기서 한국 브랜드의 첫 번째 탈락이 일어난다. 브랜드에 대한 1차 근거(공식 사이트의 명확한 사실 진술, 권위 있는 매체의 검증된 보도)가 약하면, Claude는 '추적 불가'로 판정하고 인용을 회피한다. 같은 상황에서 ChatGPT는 위키백과·커뮤니티를, Perplexity는 실시간 웹 결과를 상대적으로 관대하게 끌어다 쓰는 경향이 보고된다. 엔진 성향의 차이가 한국 브랜드에서 유독 크게 벌어지는 이유를, 이제 단계별로 본다.

탈락 지점 1 — Retrieval: Claude가 한국어 1차 출처에 도달하지 못한다

아무리 좋은 사서라도 서가에 없는 책은 추천하지 못한다. AI 엔진의 후보 선정도 똑같다. 크롤러가 읽지 못한 페이지는 retrieval 후보에 아예 들어가지 못한다. robots.txt에서 해당 봇을 허용해야 후보 진입의 출발선에 선다.

엔진크롤러 User-Agent
Anthropic(Claude)ClaudeBot, anthropic-ai
OpenAI(ChatGPT)GPTBot, OAI-SearchBot
PerplexityPerplexityBot
GoogleGoogle-Extended

한국 브랜드 정보가 가장 많이 쌓이는 곳은 어디인가. 네이버 블로그, 카페, 지식iN이다. 그런데 네이버는 외부 크롤러를 차단한다. 그 결과 글로벌 AI들은 한국 브랜드 정보를 네이버에서 직접 읽지 못하고, 공개적으로 크롤링 가능한 나무위키·위키백과·티스토리 같은 우회 경로로 한국 지식을 수집한다. 한국 브랜드 입장에서 이것은 치명적이다. 자사가 가장 공들여 쓴 네이버 블로그 본문이 Claude의 서가에는 처음부터 꽂혀 있지 않은 셈이기 때문이다.

그래서 같은 한국 브랜드라도, 나무위키 문서가 잘 정리돼 있거나 위키백과 표제어가 있는 브랜드는 Claude가 인용할 거리를 갖지만, 네이버 생태계 안에서만 유명한 브랜드는 Claude의 retrieval 단계에서 아예 후보로 떠오르지 못한다. '보수적'으로 보이는 첫 번째 원인은 모델이 아니라 데이터 가용성이다.

의미 검색과 하이브리드 — 후보를 끌어오는 방식의 한계

retrieval은 보통 두 방식을 섞는다. 키워드가 글자 그대로 겹치는지 보는 BM25(어휘 검색)와, 문장의 뜻이 가까운지 보는 임베딩(의미 검색)이다. Karpukhin 등의 2020년 DPR 연구(arXiv:2004.04906)는 의미 기반 검색이 전통적 BM25를 능가할 수 있음을 보였다. 도서관에 비유하면 BM25는 '제목에 그 단어가 든 책'을 찾는 색인이고, 의미 검색은 '그 주제를 아는 사서'가 비슷한 내용의 책을 골라주는 것이다.

둘을 합치면 더 좋다. 공개 벤치마크들을 종합하면 recall@10 기준으로 의미 단독은 약 78%, BM25 단독은 약 65%인데, 둘을 RRF로 합친 하이브리드는 약 91%까지 올라간다. 문제는 이 메커니즘이 한국 브랜드에 불리하게 작동할 수 있다는 점이다. 임베딩 모델이 한국어 브랜드명·신조어·업종 용어의 의미 공간을 영어만큼 촘촘히 학습하지 못했다면, 의미 검색이 엉뚱한 문서를 끌어오고 정작 관련 높은 한국어 페이지를 놓친다. 후보군이 부실하면 그 뒤 단계가 아무리 정교해도 좋은 인용은 나오지 않는다. 쓰레기가 들어가면 쓰레기가 나온다는 원칙은 RAG에서도 그대로다.

탈락 지점 2 — Reranking: 질문과 나란히 다시 읽힐 때 한국 콘텐츠가 밀린다

retrieval이 후보 20개를 카트에 담았다면, reranking은 그 20개를 질문과 한 쌍으로 묶어 다시 정밀하게 읽고 순위를 매기는 단계다. 보통 cross-encoder라는 모델이 '질문 + 문서'를 통째로 읽어 관련도 점수를 다시 계산한다. 단독 검색 점수보다 훨씬 비싸지만 정확하다. 공개 자료들은 reranking 적용 시 NDCG가 5~15포인트, 난도 높은 셋에서는 20포인트 가까이 오른다고 보고한다.

Anthropic이 2024년 공개한 Contextual Retrieval 결과는 이 단계의 위력을 정량으로 보여준다. 각 청크(문서 조각)에 그 청크가 속한 맥락을 한 줄 덧붙이는 것만으로 검색 실패율이 5.7%에서 3.7%로 35% 감소했고, 여기에 BM25 하이브리드를 더하면 49%, reranking까지 얹으면 67% 감소했다. Anthropic은 reranking 후 상위 20개(top-20)를 생성 단계에 넘길 것을 권장했다.

여기서 한국 브랜드의 두 번째 탈락이 생긴다. reranker는 '이 문서 조각만 떼어 읽어도 질문에 답이 되는가'를 본다. 그런데 한국어 블로그 글은 흔히 인사말·서론·광고 멘트가 길고, 핵심 사실이 본문 한참 뒤에 묻혀 있다. 조각으로 잘렸을 때 '이게 무엇에 대한 글인지' 맥락이 빠진 청크는 reranker가 낮게 매긴다. 같은 사실을 담아도, 맥락이 자족적인 문서가 이긴다.

구분예시 문장
❌ 약한 예 (reranker가 버림)"안녕하세요 여러분! 오늘도 찾아와 주셔서 감사해요. 날씨가 참 좋네요. 자, 그럼 본론으로 들어가서… 저희 제품 정말 좋답니다 ^^"
✅ 강한 예 (reranker가 올림)"OOO은 2024년 출시된 B2B 재고관리 SaaS로, 월 9만 9천원부터 시작하며 평균 재고 회전율을 30% 개선한다. 주요 고객은 중소 제조업체다."

강한 예는 그 한 문장만 떼어내도 '무엇인지·얼마인지·누구를 위한 것인지'가 자족적으로 들어 있다. Anthropic의 Contextual Retrieval이 증명한 그 원리 — 청크에 맥락을 심으면 검색 정확도가 오른다 — 를 콘텐츠 작성 단계에서 미리 실현한 문장이다.

탈락 지점 3 — Generation: 길게 줘도 중간은 안 읽힌다(Lost in the Middle)

reranking을 통과해 상위 문서가 생성 단계에 넘어가도 안심할 수 없다. Liu 등의 2023년 연구 'Lost in the Middle'(arXiv:2307.03172)은 긴 맥락을 받은 언어모델이 맨 앞과 맨 끝의 정보는 잘 활용하지만 중간에 놓인 정보는 성능이 뚝 떨어지는 U자형 곡선을 보인다는 사실을 밝혔다. 사람이 긴 회의록을 받으면 첫머리와 결론만 기억하고 가운데는 흐릿한 것과 똑같다.

이것이 한국 브랜드 인용에 주는 함의는 분명하다. 설령 Claude가 우리 브랜드 문서를 컨텍스트에 넣었더라도, 그 문서가 후보 더미의 중간 순번에 있고 핵심 사실이 본문 한가운데 있다면 생성 단계에서 사실상 무시될 수 있다. faithfulness를 중시하는 Claude는 '확실히 읽힌 앞·뒤의 강한 근거'만 인용하고, 어정쩡하게 중간에 있는 한국 브랜드 정보는 보수적으로 건너뛴다. 핵심 사실은 문서의 앞이나 끝, 그리고 인용 후보 순위의 위쪽에 있어야 살아남는다.

탈락 지점 4 — 콘텐츠 자체의 신호 부족: GEO가 말하는 것

같은 페이지라도 생성엔진에 더 잘 인용되도록 만드는 콘텐츠 신호가 있다. Aggarwal 등의 2023년 GEO 연구(arXiv:2311.09735, KDD 2024)는 통계 수치 추가, 출처 인용, 전문가 직접 인용문(quote)을 넣으면 특정 조건에서 생성엔진 내 가시성이 최대 약 40%까지 오를 수 있음을 실험으로 보였다.

왜 효과가 있을까. faithfulness 채점관(특히 Claude)의 입장에서 생각하면 자명하다. "수치·출처·인용문"은 곧 "이 문장은 추적 가능한 근거가 붙어 있다"는 신호다. 채점관이 각주를 달기 쉬운 문서가 인용되는 것이다. 한국 브랜드 콘텐츠가 감성적 수식어와 자기 자랑으로만 채워져 있으면, 추적할 근거가 없으니 Claude는 보수적으로 외면한다.

구분예시 문장
❌ 약한 예 (근거 신호 0)"저희 솔루션은 업계 최고 수준의 성능과 압도적인 만족도를 자랑합니다."
✅ 강한 예 (수치·출처·인용)"2024년 자체 도입 고객 120곳 분석에서 평균 응대 시간이 14분에서 6분으로 줄었다. 도입사 물류팀장은 '재고 오류가 분기당 절반으로 감소했다'고 말했다."

강한 예는 검증 가능한 표본 수, 비교 가능한 전후 수치, 출처가 분명한 직접 인용문을 갖췄다. 같은 내용을 Claude가 인용할 때 ✅ 쪽은 각주를 달 수 있지만 ❌ 쪽은 달 수 없다. GEO 연구가 측정한 가시성 상승의 정체가 바로 이 '인용 가능성'의 차이다.

그래서 Claude의 보수성은 '버그'가 아니라 '필터'다

지금까지를 한 장의 표로 정리한다. Claude가 한국 브랜드를 보수적으로 인용하는 이유는 단일 원인이 아니라 파이프라인 전 구간에 걸쳐 있다.

단계한국 브랜드가 탈락하는 이유대응 방향
Retrieval네이버 차단으로 1차 출처가 서가에 없음 / robots.txt에 ClaudeBot 미허용크롤 가능한 공개 자산(자사 도메인·위키 계열) 확보, 봇 허용
Reranking청크가 자족적 맥락이 없어 관련도 점수 낮음문단마다 무엇/얼마/누구를 자족적으로
Generation핵심이 본문 중간에 묻혀 Lost in the Middle핵심 사실을 앞/끝에 배치
콘텐츠 신호추적 가능한 근거(수치·출처·인용) 부족 → faithfulness 탈락통계·출처·전문가 인용문 삽입

중요한 통찰은 이것이다. Claude의 보수성은 신뢰를 사는 메커니즘이다. 근거 약한 콘텐츠를 걸러내기 때문에, 그 필터를 통과한 브랜드는 오히려 더 강한 신뢰의 인용을 얻는다. 문턱이 높다는 건 한 번 넘으면 경쟁이 적다는 뜻이기도 하다. 한국 브랜드에게 Claude는 가장 까다롭지만 가장 정직한 채점관이다.

측정할 때 반드시 알아야 할 함정: 한 번 본 인용은 신호가 아니다

"Claude에 우리 브랜드를 물었더니 인용이 안 되더라" — 이 한 번의 관찰로 결론 내리면 안 된다. LLM 출력은 비결정적이다. temperature를 0으로 두어도 GPU 연산 순서와 배치 처리 때문에 결과가 흔들린다. 한 분석에서는 동일 프롬프트를 대규모 모델에 1,000회 던졌을 때 80가지에 가까운 서로 다른 출력이 나왔다. AI 가시성의 불확실성을 정량화한 연구들은 인용 빈도가 멱법칙(소수 출처에 쏠리고 길게 꼬리를 무는 분포)으로 출렁이므로, 다중 실행 + 부트스트랩 신뢰구간으로 봐야 한다고 권고한다. 단일 측정은 신호가 아니라 노이즈다.

또 하나, 인용 출처는 엔진마다 거의 겹치지 않는다. 대규모 인용 분석에서 ChatGPT와 Perplexity의 도메인 중복은 약 11%에 불과했고, 인용의 약 90%가 엔진마다 달랐다. ChatGPT는 위키백과 비중(약 47.9%)이 높고 Perplexity는 Reddit 비중(약 46.7%)이 높았다. 즉 'Claude에서 안 보인다'는 'ChatGPT에서도 안 보인다'를 의미하지 않는다. 엔진을 뭉뚱그려 합산하면 각 엔진의 메커니즘이 가려진다. 엔진별로 따로 측정해야 한다.

Citeon은 이 원리를 제품에 담았다

지금까지의 메커니즘은 한 가지 실무 결론으로 모인다. Claude의 보수성은 추측이 아니라 측정과 진단으로만 다룰 수 있다. Citeon은 정확히 그 지점을 제품으로 만들었다.

가장 보수적인 채점관을 통과한 브랜드가 가장 단단한 인용을 얻는다. 우리 브랜드가 Claude의 필터 어디에서 걸리는지부터 확인하자. Citeon 무료 진단(₩0)으로 4엔진 인용 현황과 한국어 처방 리포트를 받아볼 수 있다.

자주 묻는 질문

Claude가 한국 브랜드를 일부러 차별하나요?

아닙니다. Claude는 '한국'이나 특정 브랜드를 식별해 배제하지 않습니다. 보수적으로 보이는 현상은 ① 답변이 출처에서 추적 가능해야 한다는 faithfulness 제약이 강하고, ② 그 제약을 통과할 한국어 1차 근거가 Claude가 읽을 수 있는 위치(네이버 밖의 크롤 가능한 자산)에 충분히 쌓이지 않은 데이터 구조 때문입니다. 태도가 아니라 파이프라인의 문제입니다.

네이버 블로그를 열심히 쓰면 Claude에 인용되나요?

직접적으로는 어렵습니다. 네이버는 외부 크롤러를 차단하므로 글로벌 AI는 네이버 본문을 직접 읽지 못합니다. 다만 그 정보가 나무위키·위키백과·티스토리 등 크롤 가능한 경로에 정리되거나, 자사 공개 도메인에 추적 가능한 근거(수치·출처)와 함께 실리면 Claude의 후보군에 진입할 수 있습니다. 네이버는 네이버대로 중요하지만, Claude를 노린다면 크롤 가능한 공개 자산이 따로 필요합니다.

ChatGPT에는 인용되는데 Claude에는 안 됩니다. 왜죠?

엔진마다 인용 출처가 거의 겹치지 않기 때문입니다. 한 대규모 분석에서 ChatGPT와 Perplexity의 도메인 중복은 약 11%에 그쳤습니다. ChatGPT는 위키백과·커뮤니티를 비교적 관대하게 인용하는 반면, Claude는 근거가 약한 콘텐츠를 보수적으로 걸러냅니다. 같은 브랜드라도 ChatGPT를 통과시킨 근거가 Claude의 faithfulness 문턱은 못 넘을 수 있습니다. 엔진별로 따로 진단해야 하는 이유입니다.

한 번 물어보고 인용 여부를 판단해도 되나요?

안 됩니다. LLM 출력은 temperature=0에서도 비결정적이라 같은 질문에도 결과가 흔들립니다. 동일 프롬프트 1,000회에 수십 가지 출력이 나온 분석도 있습니다. 다중 실행과 추이 관찰로 봐야 신호와 노이즈를 구분할 수 있습니다. Citeon의 주간 모니터가 이 함정을 피하도록 설계된 이유입니다.

당장 무엇부터 고쳐야 하나요?

우선순위는 이렇습니다. ① 자사 핵심 페이지의 robots.txt에서 ClaudeBot·anthropic-ai를 허용해 후보 진입의 출발선에 서고, ② 각 문단을 '무엇/얼마/누구'가 자족적으로 담기게 다시 쓰고, ③ 핵심 사실을 본문 앞·끝에 배치하고, ④ 감성 수식어 대신 통계·출처·전문가 인용문 같은 추적 가능한 근거를 넣는 것입니다. 어느 단계에서 막혔는지는 진단으로 먼저 확인하는 편이 빠릅니다.

참고자료

박도현
박도현 · AEO 리서처

생성형 검색·LLM 인용에 관한 논문과 데이터를 읽고 실무 언어로 옮깁니다. 근거 없는 '카더라'를 싫어합니다.

내 사이트의 AI 검색 점수가 궁금하다면

30초 무료 진단으로 SEO·AEO·GEO 점수와 처방을 받아보세요.

무료 진단 시작
← 인사이트 목록으로