Claude에 인용되려면, 모델이 '검증 가능하다고 판단한 문장'을 써야 한다. Claude는 다른 생성형 엔진보다 근거가 약한 주장을 보수적으로 걸러내는 성향이 강하고, Citations API를 통해 답변의 각 문장을 출처 원문의 특정 구절에 묶는다. 즉 Claude에게 인용은 '좋아 보이는 글'을 고르는 일이 아니라 '이 문장이 이 출처의 이 부분에서 추적 가능한가'를 따지는 일이다. 이 글은 그 판정이 내부적으로 어떻게 일어나는지를 RAG 메커니즘으로 분해하고, 인용 확률을 끌어올리는 콘텐츠 신뢰 신호를 문장 단위 대조로 보여준다.
왜 Claude를 따로 다뤄야 하나
AI 검색 인용은 엔진마다 다르게 일어난다. 대규모 인용 분석을 보면 ChatGPT와 Perplexity가 같은 질문에 인용하는 도메인의 중복은 약 11%에 불과했고, 전체 인용의 약 90%가 엔진마다 달랐다. ChatGPT는 위키백과 의존도가 높고(인용의 약 47.9%가 위키백과 계열), Perplexity는 Reddit 같은 커뮤니티 비중이 컸다(약 46.7%). 한마디로 '어떤 엔진이냐'가 '무엇을 인용하느냐'를 절반 이상 결정한다.
Claude는 이 스펙트럼에서 보수적인 쪽에 있다. 근거가 약하거나 출처와의 연결이 모호한 콘텐츠를 답변에 끌어오기를 꺼린다. 그리고 이 성향은 단순한 '취향'이 아니라 Anthropic이 Claude에 붙여 둔 Citations API라는 구조적 장치에서 나온다. 이 기능은 모델이 답변의 문장마다 '이 문장은 제공된 문서의 몇 번째 청크, 어느 구절에서 나왔다'를 명시적으로 묶도록 설계됐다. 인용이 사후 장식이 아니라 생성 과정의 일부인 셈이다.
비유하면 이렇다. 대부분의 엔진이 '그럴듯한 답을 쓰고 나서 출처를 붙이는 학생'이라면, Claude는 '각주 없이는 문장을 못 쓰게 만든 논문 심사 환경의 학생'에 가깝다. 그러니 Claude에 인용되려면, 모델이 각주를 달기 쉬운 글을 써야 한다.
먼저: AI 검색은 어떻게 '인용할 글'을 고르는가 (RAG 3단계)
Claude든 다른 엔진이든, 실시간 검색 기반 답변의 뼈대는 RAG(Retrieval-Augmented Generation)다. 2020년 Lewis 등의 원전 연구(arXiv:2005.11401)가 제안한 구조로, 모델이 외운 지식(파라메트릭 메모리)에만 의존하지 않고 외부 문서(비파라메트릭 메모리)를 그때그때 끌어와 결합한다. 이 과정은 세 단계로 나뉜다.
| 단계 | 하는 일 | 일상 비유 |
|---|---|---|
| Retrieval (검색) | 질문과 의미가 가까운 문서 청크를 수십~수백 개 후보로 끌어옴 | 도서관에서 주제와 관련된 책 한 무더기를 책상에 쌓는 일 |
| Reranking (재정렬) | 후보를 질문과 다시 한 줄씩 대조해 정말 답이 될 만한 것만 위로 | 쌓아둔 책을 사서가 펼쳐 보며 '이건 진짜 답', '이건 제목만 비슷'을 가려냄 |
| Generation (생성) | 상위 청크만 읽고 답을 쓰며, 출처를 인용 | 고른 책 몇 권만 인용해 리포트를 작성 |
인용은 이 마지막 단계에서 결정되지만, 마지막 단계까지 살아남으려면 앞의 두 관문을 통과해야 한다. 검색에서 후보로 안 잡히면 재정렬 대상조차 안 되고, 재정렬에서 밀리면 생성 단계의 모델 눈에 닿지 않는다. Claude의 보수성은 주로 마지막 생성 단계에서 작동하지만, 우리가 손댈 수 있는 신호는 세 단계 전부에 흩어져 있다.
1단계 — 검색: 의미로 잡히되 키워드로도 잡혀야 한다
초기 RAG의 검색은 임베딩(의미 벡터) 기반이다. 2020년 Karpukhin 등의 Dense Passage Retrieval 연구(arXiv:2004.04906)는 이 의미 검색이 전통적 키워드 검색(BM25)을 능가한다는 걸 보였다. 단어가 안 겹쳐도 뜻이 통하면 잡아낸다는 뜻이다. '강아지 사료 추천'으로 물어도 '반려견 먹이 고르는 법' 문서가 후보로 올라온다.
하지만 의미 검색만으로는 부족하다. 공개 벤치마크들을 종합하면 recall@10(상위 10개 안에 정답을 포함하는 비율)이 의미 검색 단독은 약 78%, 키워드(BM25) 단독은 약 65%, 그리고 둘을 합친 하이브리드(RRF 융합)는 약 91%로 뛴다. Anthropic의 Contextual Retrieval 연구(2024)도 같은 결론이다. 청크에 맥락을 덧붙이는 것만으로 검색 실패율이 5.7%에서 3.7%로 35% 줄었고, 여기에 BM25 하이브리드를 더하면 실패율이 49% 감소, 다시 재정렬까지 얹으면 67% 감소했다.
하이브리드 검색을 비유하면 도서관의 키워드 색인(정확한 단어 매칭)과 주제를 꿰고 있는 사서(의미 이해)를 동시에 부리는 일이다. 사서만 있으면 '비슷한 주제'를 잘 찾지만 정확한 제품명·고유명사를 놓치고, 색인만 있으면 단어는 맞아도 맥락을 못 읽는다. 그래서 콘텐츠는 두 쪽 모두를 만족시켜야 한다.
- ❌ 약한 예: "저희 솔루션은 업계를 선도하는 혁신적 기술로 고객 만족을 실현합니다." → 의미도 흐릿하고, 매칭될 고유 키워드(제품명·수치·기능명)도 없다. 어느 관문도 통과 못 한다.
- ✅ 강한 예: "Citeon의 사이트 진단 엔진은 입력한 URL의 SEO·AEO·GEO를 0~100점으로 채점하고, 쇼핑몰·블로그·로컬·B2B 유형을 자동 인지해 한국어 처방을 출력한다." → 고유명사(Citeon, AEO, GEO), 구체 기능(0~100 채점, 유형 인지), 명확한 의미가 모두 잡힌다.
2단계 — 재정렬: 질문과 한 줄씩 맞춰 본다
재정렬은 cross-encoder라는 모델이 맡는다. 검색이 '질문 벡터'와 '문서 벡터'를 따로 만들어 거리를 재는 것과 달리, cross-encoder는 질문과 후보 문서를 한 덩어리로 같이 읽어 관련성을 점수화한다. 그래서 느리지만 정확하다. 이 단계만 추가해도 검색 품질 지표(NDCG)가 보통 5~15포인트, 어려운 질문에서는 20포인트 가까이 오른다.
실무적으로 중요한 건, 재정렬기가 '질문에 직접 답하는 한 문단'을 좋아한다는 점이다. 질문이 "Claude가 인용을 거르는 기준은?"인데 후보 문단이 회사 연혁으로 시작하면, cross-encoder는 그 문단을 낮게 매긴다. 질문-답변이 한 청크 안에서 완결되어야 위로 올라온다.
- ❌ 약한 예: (소제목 "신뢰성") "신뢰는 우리 회사의 핵심 가치입니다. 2019년 창업 이래…" → '신뢰성 기준이 뭐냐'는 질문에 답하지 않는다.
- ✅ 강한 예: (소제목 "Claude가 출처를 거르는 기준") "Claude는 주장이 출처 원문 구절로 직접 추적되지 않으면 인용하지 않는다. Citations API가 문장마다 출처 청크를 묶기 때문이다." → 질문과 그대로 맞물린다.
3단계 — 생성: 여기서 Claude의 보수성이 작동한다
상위 청크가 모델에 전달되면 답을 쓴다. 이때 두 가지가 인용을 좌우한다.
첫째, 청크 안의 위치. 2023년 Liu 등의 'Lost in the Middle' 연구(arXiv:2307.03172)는 긴 맥락에서 모델이 앞과 끝의 정보는 잘 쓰고 가운데 정보는 흘린다는 U자형 성능 곡선을 보였다. 핵심 주장을 글 한가운데 묻어두면, 검색·재정렬을 통과해도 생성 단계에서 모델 눈 밖으로 새어 나간다. 그래서 직답은 문단 맨 앞에, 핵심 수치·결론은 앞이나 끝에 둔다.
둘째, 추적 가능성. 여기가 Claude의 차별점이다. Claude의 Citations API는 답변 문장을 출처의 특정 구절에 묶는다. 그러니 Claude는 '출처 문장으로 그대로 받아쓸 수 있는 형태'의 주장을 선호한다. RAGAS 같은 평가 프레임워크가 쓰는 faithfulness(충실도) 지표 — 답변의 각 주장이 출처에서 추적되는 정도 — 와 정확히 같은 논리다. 실무에서 faithfulness는 0.9 이상이면 안정, 0.7 미만이면 위험 신호로 본다(팀마다 기준은 다르다). Claude에 인용되는 글은 본질적으로 'faithfulness 점수를 높이기 쉬운 글'이다.
그래서, Claude를 위한 콘텐츠 신뢰 신호 5가지
이제 메커니즘에서 실천으로 내려가자. 아래는 '왜 효과가 있는지'가 위 3단계로 설명되는 것만 골랐다.
신호 1 — 주장마다 출처를 붙인다 (검증 가능성)
2023년 Aggarwal 등의 GEO 연구(arXiv:2311.09735, KDD 2024)는 콘텐츠에 통계·인용 출처·직접 인용문을 추가하면 생성형 엔진에서의 가시성이 특정 조건에서 최대 약 40% 상승한다는 걸 실험으로 보였다. 이건 모든 엔진에 통하지만, 출처 연결을 구조적으로 요구하는 Claude에는 특히 직접적이다. 모델 입장에서 '출처가 붙은 주장'은 그대로 인용 문장으로 옮기기 쉽고, faithfulness를 깨지 않는다.
- ❌ 약한 예: "하이브리드 검색이 훨씬 정확하다." → 추적할 근거가 없다. Claude는 이런 무근거 단정을 받아쓰기 꺼린다.
- ✅ 강한 예: "공개 벤치마크 종합 기준 recall@10은 의미 검색 단독 약 78%, 하이브리드(RRF) 약 91%다." → 수치와 비교 대상이 있어 그대로 인용 가능하다.
신호 2 — 직답을 문단 맨 앞에 둔다 (위치)
'Lost in the Middle' 원리상, 핵심은 앞·끝에 둬야 생성 단계에서 살아남는다. 모든 H2/H3 섹션을 한 문장 직답으로 시작하라. 그 뒤에 설명·비유·근거를 붙인다. 이렇게 하면 재정렬기도 '질문에 답하는 청크'로 인식하고, 생성기도 첫 문장을 놓치지 않는다.
- ❌ 약한 예: "이 주제를 이해하려면 먼저 배경을 살펴봐야 합니다. 2020년경부터…" (결론은 5번째 문단)
- ✅ 강한 예: "Claude는 출처로 추적되지 않는 주장을 인용하지 않는다. 이유는 다음과 같다." (직답 먼저, 근거 나중)
신호 3 — 청크가 스스로 맥락을 갖게 한다 (검색·재정렬)
Anthropic의 Contextual Retrieval이 검색 실패율을 35% 줄인 핵심은 각 청크에 '이게 무엇에 대한 내용인지' 맥락 한 줄을 덧붙인 것이다. 글쓰기로 옮기면, 대명사·생략에 의존하지 말고 각 문단이 독립적으로 읽혀도 무슨 얘기인지 알게 쓰라는 뜻이다. 검색은 글 전체가 아니라 잘린 청크 단위로 일어나기 때문이다.
- ❌ 약한 예: "그것은 이 경우에 49%까지 줄어든다." → 청크로 잘리면 '그것=무엇'을 모른다.
- ✅ 강한 예: "청크에 맥락을 덧붙이고 BM25 하이브리드를 더하면 검색 실패율이 49% 감소한다(Anthropic, 2024)." → 잘려도 자족적이다.
신호 4 — 크롤러를 막지 않는다 (후보 진입의 전제)
아무리 잘 써도 모델이 못 읽으면 0이다. Claude의 크롤러는 ClaudeBot과 anthropic-ai다. robots.txt에서 이들을 허용해야 검색 후보로 들어갈 자격이 생긴다. (참고로 OpenAI는 GPTBot·OAI-SearchBot, Perplexity는 PerplexityBot, 구글 AI는 Google-Extended다.) 이건 콘텐츠 품질 이전의 위생 점검인데, 의외로 많은 사이트가 'AI 크롤러 전체 차단' 설정으로 스스로를 후보에서 지운다.
# robots.txt — Claude 크롤러 허용
User-agent: ClaudeBot
Allow: /
User-agent: anthropic-ai
Allow: /
신호 5 — 권위와 전문성을 보강한다 (보수적 필터 통과)
Claude가 근거 약한 콘텐츠를 거른다는 건, 거꾸로 저자·기관의 전문성 신호가 통과 확률을 높인다는 뜻이다. 실명 저자와 자격, 1차 출처 링크, 실제 데이터, 발행·갱신일 명시 — 이런 E-E-A-T류 신호는 모델이 '이 출처는 신뢰할 만하다'고 판단할 재료가 된다. 단, 정직해야 한다. 존재하지 않는 통계나 가짜 인용을 지어 넣으면 단기적으로는 통과해도, 사용자가 클릭해 검증하는 순간 신뢰가 무너진다. 신뢰 신호는 '있어 보이게 꾸미는 것'이 아니라 '실제로 검증 가능하게 만드는 것'이다.
측정의 함정 — '인용됐는지'를 한 번 보고 믿지 마라
david로서 가장 강조하고 싶은 부분이다. AI 인용 측정은 본질적으로 비결정적이다. temperature=0으로 고정해도 LLM 출력은 GPU 연산 순서와 배치 처리 때문에 흔들린다. 한 실험에서 2,350억 파라미터급 모델을 같은 입력으로 1,000회 돌리니 80가지 서로 다른 출력이 나왔다. AI 가시성의 불확실성을 정량화한 연구는 인용이 멱법칙(power law)처럼 출렁인다는 걸 보이며 다중 실행 + 부트스트랩 신뢰구간을 권한다.
결론: 단일 측정은 노이즈다. "어제 Claude가 우리를 인용했다"는 한 번의 관측으로 콘텐츠 전략을 바꾸면 노이즈를 신호로 오인하는 것이다. 인용은 여러 번, 여러 질문 변형으로 측정해 추이로 봐야 한다. 또한 프롬프트 '검색량' 같은 데이터는 실측이 불가능하고 작은 패널(시장 1% 미만) 모델링 추정치에 불과하니 과신하지 말 것. Conductor의 표현처럼 "신뢰할 수 없는 검색량 데이터는 없는 것보다 나쁘다."
SOV(Share of Voice) — 한 카테고리의 AI 답변 중 우리 브랜드가 언급된 비율 — 로 보되, 질문 세트 선정이 결과를 좌우한다는 점, 엔진을 합산하면 엔진별 메커니즘 차이가 가려진다는 점을 늘 기억해야 한다. 그래서 Claude·ChatGPT·Gemini·Perplexity는 따로 측정하는 게 옳다.
Citeon은 이 원리를 제품에 담았다
위에서 풀어낸 메커니즘은 추상론이 아니라 측정·진단 가능한 대상이다. Citeon은 그 지점을 제품으로 만들었다.
- 4엔진 인용 측정(SOV) — ChatGPT·Gemini·Perplexity·Claude 각각에서 우리 브랜드가 인용·언급되는 비율을 따로 측정한다. Claude의 보수적 필터가 우리 콘텐츠를 통과시키는지를 다른 엔진과 분리해 볼 수 있다(엔진 합산이 메커니즘을 가린다는 위 원칙 그대로).
- 사이트 진단 엔진 — 입력한 URL의 SEO·AEO·GEO를 0~100점으로 채점하고 한국어 처방을 출력한다. 크롤러 허용 여부, 직답 구조, 출처·수치 보강 같은 위 신뢰 신호를 점검 항목으로 잡아준다.
- 경쟁사 역추적 — Claude가 경쟁사를 인용한다면 그 콘텐츠가 어떤 신호를 갖췄는지 역설계해 격차를 보여준다.
- 주간 모니터 추이 — 단일 측정의 노이즈 함정을 피하려고, 인용을 한 번이 아니라 주 단위 추이로 추적한다.
지금 우리 사이트가 Claude에 인용될 신뢰 신호를 갖췄는지 궁금하다면, Citeon 무료 진단(₩0)으로 URL 한 줄만 넣어 확인해 보라. SEO·AEO·GEO 점수와 한국어 처방 리포트를 받아볼 수 있다.
자주 묻는 질문
Claude는 정말 다른 엔진보다 인용을 더 까다롭게 거르나요?
그렇게 보는 게 합리적입니다. Claude는 근거가 약한 콘텐츠를 보수적으로 걸러내는 성향이 있고, 답변 문장을 출처 구절에 묶는 Citations API를 갖췄습니다. 즉 '출처로 추적 가능한 주장'을 선호합니다. 반면 ChatGPT는 위키백과·커뮤니티 의존도가 높고, Perplexity는 실시간 인라인 인용 중심입니다. 대규모 분석에서 엔진 간 인용 도메인 중복이 약 11%에 그친 것도 이런 메커니즘 차이 때문입니다.
출처와 수치를 넣으면 정말 인용이 늘어나나요?
GEO 연구(Aggarwal 등, 2023)는 통계·출처 인용·직접 인용문을 더하면 생성형 엔진 가시성이 특정 조건에서 최대 약 40% 상승한다고 보고했습니다. 다만 '정직한 출처'여야 합니다. 지어낸 통계는 사용자가 검증하는 순간 역효과를 냅니다. 검증 가능성이 핵심이지, 숫자를 많이 박는 게 핵심이 아닙니다.
크롤러만 허용하면 인용되나요?
아닙니다. 크롤러 허용(ClaudeBot·anthropic-ai)은 '후보로 들어갈 자격'일 뿐 필요조건이지 충분조건이 아닙니다. 그다음 검색→재정렬→생성 세 관문을 통과해야 합니다. 직답 구조, 자족적 청크, 출처 보강이 함께 갖춰져야 실제 인용으로 이어집니다.
한 번 인용된 걸 보고 전략이 통했다고 판단해도 되나요?
위험합니다. LLM 출력은 temperature=0에서도 흔들립니다(한 실험에서 같은 입력 1,000회에 80가지 출력). 단일 관측은 노이즈일 수 있습니다. 여러 질문 변형으로 여러 번 측정해 추이로 보고, 가능하면 신뢰구간으로 다뤄야 합니다.
핵심 결론을 글 어디에 둬야 하나요?
문단·섹션의 맨 앞에 두세요. 'Lost in the Middle' 연구는 모델이 긴 맥락의 가운데 정보를 흘리고 앞·끝 정보를 잘 쓴다는 U자형 곡선을 보였습니다. 직답을 앞에 두면 재정렬 단계에서 '질문에 답하는 청크'로 인식되고, 생성 단계에서도 누락되지 않습니다.
