Citeon
트렌드·담론

AI 에이전트 쇼핑 시대의 브랜드 전략

이서연
이서연 · GEO 전략 리드
AI 에이전트 쇼핑 시대의 브랜드 전략

AI 에이전트 쇼핑 시대에 브랜드가 해야 할 일은 '사람을 설득하는 것'에서 '기계에게 인용될 자격을 쌓는 것'으로 옮겨갑니다. 고객이 직접 검색창에 키워드를 넣고 열 개의 탭을 비교하던 시대가 저물고, 대신 AI 에이전트가 사용자의 의도를 받아 후보를 모으고, 비교하고, 추천하고, 때로는 결제까지 대신하는 흐름이 시작됐기 때문입니다. 이 글은 그 전환의 한복판에서 "왜 어떤 브랜드는 에이전트의 추천 목록에 오르고 어떤 브랜드는 영영 보이지 않는가"를 RAG(검색→재정렬→생성) 메커니즘으로 끝까지 파고든 다음, 풀퍼널·GEO 관점에서 실제로 무엇을 바꿔야 하는지 정리합니다.

에이전트 쇼핑이란 무엇인가 — '검색하는 사람'에서 '대리하는 기계'로

전통적인 온라인 쇼핑은 사람이 모든 단계를 직접 밟았습니다. 검색하고, 결과를 훑고, 리뷰를 읽고, 가격을 비교하고, 장바구니에 담았죠. AI 에이전트 쇼핑은 이 노동을 기계에 위임합니다. 사용자는 "3만 원 이하 무선 이어폰 중 통화 품질 좋은 거 추천해줘"라고 한 문장만 던지고, 에이전트가 검색→후보 수집→비교→추천(또는 구매)을 대신합니다.

비유하자면, 예전에는 손님이 직접 시장 골목을 돌며 가게마다 들어가 물건을 살폈다면, 이제는 대신 장을 봐주는 집사를 고용한 셈입니다. 집사는 손님이 일일이 보지 못한 수십 개 가게를 빠르게 훑고, 그중 '추천할 만한 몇 곳'만 손님 앞에 가져옵니다. 여기서 브랜드의 운명이 갈립니다. 집사의 손에 들려 손님 앞 식탁에 오르느냐, 아니면 집사가 들르지도 않은 가게로 남느냐.

중요한 통찰은 이것입니다. 에이전트는 '광고를 보는 소비자'가 아니라 '근거를 읽는 기계'라는 점입니다. 감성적인 슬로건, 화려한 배너, 인플루언서의 미소에 흔들리지 않습니다. 에이전트가 반응하는 것은 구조화된 사실, 검증 가능한 출처, 명확한 비교 가능한 속성입니다. 그래서 에이전트 쇼핑 시대의 브랜드 전략은 '설득의 미학'에서 '인용 가능성의 공학'으로 무게중심이 옮겨갑니다.

에이전트는 어떻게 후보를 고르는가 — RAG 3단계로 본 추천의 해부학

에이전트가 "이 브랜드를 추천합니다"라고 말하기까지의 내부 과정은 대부분 RAG(Retrieval-Augmented Generation)라는 구조 위에서 돌아갑니다. RAG는 2020년 Lewis 등이 제안한 개념으로(arXiv:2005.11401), 모델이 자기 머릿속 지식(파라메트릭 메모리)만으로 답하지 않고 외부 문서를 실시간으로 찾아와(비파라메트릭 메모리) 결합해 답을 만드는 방식입니다. 에이전트 쇼핑에서 '외부 문서'는 곧 제품 페이지, 리뷰, 비교 글, 사양표입니다.

이 과정을 세 단계로 쪼개 보면, 브랜드가 어느 길목에서 탈락하는지가 선명하게 드러납니다.

1단계 — 검색(Retrieval): 후보군에 들어가야 시작이다

에이전트는 먼저 사용자의 질문을 받아 관련 있는 문서를 대량으로 끌어옵니다. 이때 두 가지 검색 방식이 함께 쓰입니다.

현실의 강한 시스템은 둘을 합칩니다. 이를 하이브리드 검색이라 부르는데, 비유하면 '키워드 색인을 든 사서'와 '주제를 아는 사서'가 함께 책을 찾아주는 것입니다. 공개 벤치마크들을 종합하면 recall@10(상위 10개 안에 정답을 얼마나 담아내는가) 기준으로 의미 검색 단독이 약 78%, 키워드(BM25) 단독이 약 65%인 반면, 둘을 RRF 방식으로 결합한 하이브리드는 약 91%까지 올라갑니다. 한쪽 사서만 쓰면 놓치던 책을, 두 사서가 함께 찾으니 더 많이 건집니다.

브랜드 관점의 교훈: 1단계에서 후보군에 들지 못하면 그 뒤 단계는 존재하지 않습니다. 키워드 검색에 걸리려면 사람들이 실제로 쓰는 표현이 본문에 있어야 하고, 의미 검색에 걸리려면 제품이 무엇이고 어떤 맥락에서 쓰이는지가 분명히 서술돼 있어야 합니다.

2단계 — 재정렬(Reranking): 끌어온 후보를 질문과 함께 다시 읽는다

검색은 빠르지만 거칩니다. 일단 그물로 수십~수백 개를 건져 올린 다음, 그중 진짜 좋은 것을 골라내는 정밀 작업이 필요합니다. 이 단계가 재정렬입니다. cross-encoder라 불리는 모델이 질문과 후보 문서를 '함께' 읽어가며 한 건씩 점수를 다시 매깁니다.

1단계의 검색이 '제목만 보고 빠르게 솎아내는 사서'라면, 재정렬은 '후보 책을 펼쳐 손님의 질문과 대조하며 정독하는 사서'입니다. 느리지만 정확합니다. 연구·실무 보고들을 종합하면 재정렬은 NDCG(순위 품질 지표)를 대략 5~15포인트, 어려운 질의에서는 20포인트 가까이 끌어올립니다.

Anthropic이 2024년 공개한 Contextual Retrieval 실험은 이 단계들의 누적 효과를 인상적으로 보여줍니다. 청크(문서 조각)에 맥락을 덧붙여 검색 실패율을 35% 낮추고(5.7%→3.7%), 여기에 BM25 하이브리드를 더하면 49%, 다시 재정렬을 얹으면 실패율 67% 감소까지 떨어졌습니다. 그리고 후보를 top-20 정도로 넉넉히 통과시키라고 권합니다. 핵심은, 좋은 콘텐츠는 이 모든 단계를 통과하며 '점점 위로' 올라간다는 점입니다.

3단계 — 생성(Generation): 살아남은 근거만 답에 인용된다

마지막으로 모델은 상위로 추려진 소수의 문서만 읽고 최종 추천을 만듭니다. 사용자에게 보이는 "A 브랜드를 추천합니다, 이유는…"이라는 한 문장은 이 마지막 관문을 통과한 극소수 문서의 산물입니다.

여기서 빠지기 쉬운 함정이 있습니다. 상위 후보에 들었다고 안심하면 안 됩니다. 2023년 Liu 등의 'Lost in the Middle' 연구(arXiv:2307.03172)는 모델이 긴 맥락을 읽을 때 중간에 놓인 정보를 흘려버리는 U자형 경향을 보고했습니다. 맨 앞과 맨 끝의 정보는 잘 활용하지만 가운데 파묻힌 정보는 답에 반영되지 않을 확률이 높다는 것이죠. 책 더미 한가운데 끼어 있으면 사서가 펼쳐 보고도 그냥 지나칠 수 있다는 뜻입니다. 그래서 핵심 결론과 핵심 사실은 문서의 앞쪽과 끝쪽에 명확히 배치돼야 합니다.

RAG 단계비유여기서 탈락하면브랜드가 할 일
검색그물로 후보 건지기아예 후보에 못 듦실제 쓰는 표현 + 명확한 주제 서술
재정렬후보를 정독해 재배치상위로 못 올라감질문에 정밀히 답하는 구조
생성소수만 읽고 답 작성읽혔는데도 인용 안 됨핵심을 앞·끝에 배치, 인용 가능한 형태

에이전트에게 '인용될 자격'은 무엇으로 만들어지는가

그렇다면 같은 후보들 중에서 에이전트는 무엇을 보고 한쪽을 추천할까요. 2023년 Aggarwal 등의 GEO 연구(arXiv:2311.09735, KDD 2024)는 이 질문에 구체적인 답의 실마리를 줍니다. 이 연구는 콘텐츠에 통계 수치, 출처 인용, 전문가의 직접 인용문을 추가했을 때 생성 엔진에서의 가시성이 특정 조건에서 최대 약 40%까지 상승할 수 있음을 보였습니다. 키워드를 무작정 욱여넣는 전통적 SEO 기법이 아니라, '기계가 신뢰하고 인용하기 좋은 형태'로 콘텐츠를 다듬는 것이 효과적이라는 뜻입니다.

이를 에이전트 쇼핑의 언어로 옮기면 다음과 같습니다. 약한 브랜드 콘텐츠와 강한 브랜드 콘텐츠의 차이는 문장 수준에서 드러납니다.

제품 설명: 형용사 vs 사실

왜 후자가 이기는가. 에이전트는 "3만 원 이하, 통화 품질"이라는 사용자 조건과 직접 대조 가능한 속성을 찾습니다. '최고의 음질'은 어떤 조건과도 매칭되지 않는 빈 형용사지만, '3중 마이크 노이즈 캔슬링'은 '통화 품질'이라는 의도와 정확히 맞물립니다.

근거: 주장 vs 출처 동반

Claude 계열 엔진은 근거가 약한 콘텐츠를 보수적으로 걸러내는 성향이 보고됩니다(Citations API를 통해 출처 추적을 강조). 측정 조건이 명시된 주장은 '추적 가능한 사실'로 취급되지만, 근거 없는 최상급 표현은 통과 문턱에서 떨어지기 쉽습니다.

이 '추적 가능성'을 정량화하려는 시도가 RAG 평가 지표인 RAGAS의 faithfulness(충실성)입니다. 답변의 주장이 실제 출처에서 얼마나 추적되는지를 0~1로 보는데, 실무에서는 흔히 0.9 이상을 안정, 0.7 미만을 위험 신호로 봅니다(팀마다 기준은 다릅니다). 브랜드 콘텐츠를 만들 때도 같은 질문을 스스로 던져야 합니다. "이 문장의 주장은 같은 페이지 안에서 근거로 추적되는가?"

엔진마다 다른 '집사의 취향' — 한 곳을 잡으면 끝나지 않는다

에이전트 쇼핑 시대에 흔한 착각은 "ChatGPT에서만 잘 보이면 된다"는 것입니다. 그러나 엔진마다 신뢰하는 출처가 크게 다릅니다. 대규모 인용 분석에 따르면 ChatGPT와 Perplexity가 인용하는 도메인의 중복은 약 11%에 불과하고, 인용의 약 90%가 엔진마다 서로 다릅니다. ChatGPT는 위키백과 비중이 약 47.9%로 높고, Perplexity는 Reddit 비중이 약 46.7%로 두드러진다는 분석도 있습니다(Profound·Discovered Labs 등).

이는 '집사'마다 신뢰하는 정보원이 다르다는 뜻입니다. 한 집사는 백과사전을 펴 보고, 다른 집사는 동네 커뮤니티 후기를 챙깁니다.

엔진성향(보고된 경향)브랜드 시사점
ChatGPT위키백과·커뮤니티 비중 높음백과사전적 사실 정합성, 위키 등재 가치
Gemini구글 색인·E-E-A-T 중시구글 검색 기반 신뢰 신호 축적
Claude근거 약한 콘텐츠 보수적 필터출처·인용 가능한 사실 강화
Perplexity실시간·인라인 인용, Reddit 비중최신성 + 실사용 후기 노출
Grok실시간 웹 + X 스트림, 인용 정확도 편차실시간 대화/소셜 신호

그래서 에이전트 쇼핑 전략은 본질적으로 멀티 엔진 전략입니다. 한 엔진에 최적화한 콘텐츠가 다른 엔진에서는 통하지 않을 수 있고, 그 격차를 '감'으로 메울 수는 없습니다. 측정이 필요한 이유가 여기 있습니다.

국내 변수 — 네이버라는 별도의 운동장

한국 시장의 브랜드라면 글로벌 엔진만 봐서는 절반만 본 것입니다. 네이버는 큐:(Cue:)와 클로바X를 2026년 4월 9일 종료하는 한편, AI탭을 2026년 6월 25~26일 전체 정식 출시하며 대화형·에이전틱 방향으로 재편하고 있습니다. 통합검색 위에 얹히는 AI 브리핑(요약)은 이미 쿼리의 20% 이상에 적용되고, AI 브리핑 인용은 2026년 4월 기준 월 약 3.558억 건에 달합니다.

주목할 통계가 하나 있습니다. 한 표본 분석(272건)에서 AI 브리핑이 인용한 출처의 약 58%가 블로그였고, 인용의 약 49%가 통합검색 Top10 바깥의 문서에서 나왔습니다. 즉 전통 검색 순위 10위 안에 못 들어도 AI에는 인용될 수 있다는 뜻으로, 순위 게임과 인용 게임이 별개임을 보여줍니다.

네이버의 알고리즘은 출처의 신뢰·전문성을 보는 C-Rank와 문서의 의도를 보는 D.I.A.+를 함께 씁니다. 네이버가 권장하는 콘텐츠 5원칙은 직접 경험 · 일관된 주제 · 진정성 · 읽기 쉬운 구조 · 최신성입니다. 흥미로운 구조적 특징도 있습니다. 네이버는 외부 크롤러를 차단하기 때문에, 글로벌 AI들은 네이버 본문 대신 나무위키·위키백과·티스토리 같은 우회 경로로 한국 정보를 수집하는 경향이 있습니다. 한국 브랜드라면 네이버 생태계와 글로벌 우회 경로를 둘 다 염두에 둬야 한다는 의미입니다.

가장 먼저 점검할 한 줄 — robots.txt

전략을 논하기 전에, 기본기가 빠지면 모든 게 무의미합니다. AI 크롤러가 사이트에 들어오지 못하면 후보군 진입 자체가 불가능합니다. 에이전트가 장을 보러 왔는데 가게 문이 잠겨 있는 격입니다.

# robots.txt — 주요 AI 크롤러 허용 예시
User-agent: GPTBot
Allow: /
User-agent: OAI-SearchBot
Allow: /
User-agent: PerplexityBot
Allow: /
User-agent: ClaudeBot
Allow: /
User-agent: anthropic-ai
Allow: /
User-agent: Google-Extended
Allow: /

GPTBot·OAI-SearchBot(OpenAI), PerplexityBot, ClaudeBot·anthropic-ai(Anthropic), Google-Extended(구글)를 robots.txt에서 허용해야 콘텐츠가 인덱싱 후보에 들어갑니다. 보안·저작권 정책상 일부를 막을 수는 있지만, 그 선택이 '인용 후보에서 빠지는 비용'을 동반한다는 점을 분명히 인지해야 합니다.

측정의 함정 — 한 번 봐서는 아무것도 알 수 없다

에이전트 쇼핑 전략을 세웠다면, 그것이 작동하는지 어떻게 알 수 있을까요. 여기서 가장 많은 브랜드가 헛발을 짚습니다. "ChatGPT에 우리 브랜드 물어봤더니 잘 나오던데?"라는 단 한 번의 확인은 측정이 아니라 노이즈입니다.

이유는 LLM의 근본적 비결정성에 있습니다. temperature=0으로 설정해도 GPU 연산 순서와 배치 처리 때문에 같은 질문에 결과가 흔들립니다. 한 분석에서는 2,350억 파라미터급 모델에 같은 입력을 1,000번 넣었을 때 80가지 출력이 나왔고, 6개 모델로 480회 실험한 연구도 보고됐습니다(arXiv:2602.14349). 또 다른 연구(arXiv:2603.08924)는 AI 인용 빈도가 멱법칙(power-law)을 따라 크게 출렁이며, 단일 측정 대신 다중 실행 + 부트스트랩 신뢰구간으로 불확실성을 정량화할 것을 권합니다.

또 하나 경계할 것은 'AI 검색량' 같은 수치입니다. 프롬프트 볼륨은 실측이 불가능하며, 시장의 1% 미만 패널을 모델링한 추정치에 불과합니다. Conductor는 "신뢰할 수 없는 검색량 데이터는 없는 것보다 나쁘다"고 못 박습니다(https://www.conductor.com/academy/debunking-ai-prompt-volume/). 그럴듯한 숫자에 전략을 거는 것보다, 직접 측정 가능한 '인용 여부'에 집중하는 편이 정직합니다.

SOV — 에이전트 쇼핑 시대의 점유율 지표

그래서 등장한 개념이 SOV(Share of Voice)입니다. 특정 카테고리의 AI 답변들 중에서 우리 브랜드가 언급되는 비율을 뜻합니다. "무선 이어폰 추천"류 질문 100개에 에이전트가 답할 때, 그중 몇 번 우리가 호명되는가. 이것이 에이전트 쇼핑 시대의 '진열대 점유율'입니다.

다만 SOV에는 함정이 있습니다. 질문 세트 선정이 결과를 좌우합니다. 우리에게 유리한 질문만 모으면 SOV는 부풀려집니다. 또 여러 엔진의 결과를 하나로 합산하면, 엔진마다 다른 메커니즘이 평균 속에 가려집니다. 그래서 측정은 엔진별로 분리해서 봐야 합니다. 일부 한국 업체는 SMR(Share of Model Response) 같은 변형 지표를 쓰기도 합니다.

마지막으로, 가시성은 그 자체가 목적이 아닙니다. Overdrive류의 'CFO식 측정' 관점에서 보면, AI 가시성은 결국 매출·리드라는 결과를 설명하는 2차 지표입니다. 에이전트의 추천 목록에 올랐다는 사실이 실제 유입과 전환으로 이어졌는지까지 추적해야 비로소 전략의 완성입니다. 참고로 일부 분석에서는 AI 검색을 통한 유입의 전환율이 일반 검색보다 몇 배 높게 나타나기도 합니다(구체 수치는 사례마다 다릅니다). 에이전트는 이미 의도가 무르익은 사용자를 데려오기 때문일 수 있습니다.

그래서 브랜드는 무엇을 바꿔야 하는가 — 풀퍼널 체크리스트

지금까지의 메커니즘을 실행 가능한 전략으로 압축하면 다음과 같습니다.

Citeon은 이 원리를 제품에 담았다

위에서 본 모든 원리는 결국 두 가지 질문으로 수렴합니다. "지금 우리 브랜드는 에이전트의 추천 목록에 오르고 있는가?" 그리고 "무엇을 고치면 더 자주 인용되는가?" Citeon은 정확히 이 두 질문에 답하기 위해 만들어졌습니다.

에이전트 쇼핑 시대의 브랜드 전략은 추측으로 세울 수 없습니다. 먼저 지금 어디에 서 있는지를 정직하게 측정하는 데서 시작합니다. Citeon 무료 AI 가시성 진단(₩0)으로 우리 브랜드가 4대 엔진에서 어떻게 인용되고 있는지부터 확인해 보세요.

자주 묻는 질문(FAQ)

AI 에이전트 쇼핑이 정말 검색을 대체하나요?

완전한 대체라기보다 검색 위에 한 겹이 얹히는 형태로 보는 편이 정확합니다. 사용자는 여전히 검색을 하지만, 점점 더 많은 탐색·비교·추천이 에이전트에 위임됩니다. 핵심은, 그 에이전트가 후보를 고르는 방식(RAG: 검색→재정렬→생성)이 전통적 순위 게임과 다르다는 점입니다. 실제로 한 네이버 표본 분석에서는 AI 인용의 약 49%가 통합검색 Top10 바깥에서 나왔습니다.

광고를 많이 하면 에이전트가 우리 브랜드를 추천하나요?

에이전트는 배너나 슬로건이 아니라 구조화된 사실과 출처를 읽습니다. 감성적 광고 문구보다, 비교 가능한 속성·수치·측정 조건·출처가 인용 가능성을 높입니다. GEO 연구(Aggarwal 등, 2023)는 통계·출처·직접 인용문을 더했을 때 생성 엔진 가시성이 특정 조건 최대 약 40% 상승할 수 있음을 보였습니다.

한 엔진(예: ChatGPT)에서만 잘 나오면 충분한가요?

아닙니다. 엔진마다 신뢰하는 출처가 크게 다릅니다. ChatGPT와 Perplexity의 인용 도메인 중복은 약 11%에 불과하고, 인용의 약 90%가 엔진마다 다릅니다. 게다가 국내라면 네이버 AI탭·AI 브리핑이라는 별도 운동장도 있습니다. 멀티 엔진 전략이 필수입니다.

우리 브랜드의 AI 가시성을 한 번 확인하면 되나요?

단 한 번의 확인은 측정이 아니라 노이즈입니다. LLM은 temperature=0에서도 결과가 흔들립니다(한 분석에서 같은 입력 1,000회에 80가지 출력). 인용 빈도는 멱법칙으로 출렁이므로, 여러 번 반복 질의해 추이와 신뢰구간으로 봐야 합니다. Citeon은 이를 주간 모니터 추이로 추적합니다.

robots.txt만 열어두면 인용되나요?

robots.txt 허용은 '필요조건'이지 '충분조건'이 아닙니다. AI 크롤러(GPTBot·PerplexityBot·ClaudeBot·Google-Extended 등)를 허용해야 후보군에 진입할 수 있지만, 거기서부터는 검색·재정렬·생성 각 단계를 통과할 만큼 콘텐츠가 명확하고 인용 가능해야 실제로 추천에 오릅니다.

참고자료

이서연
이서연 · GEO 전략 리드

AI 검색(AEO·GEO) 전략과 구글·네이버 공식 가이드 해석을 담당합니다. 측정에서 매출까지 잇는 풀퍼널 관점으로 글을 씁니다.

내 사이트의 AI 검색 점수가 궁금하다면

30초 무료 진단으로 SEO·AEO·GEO 점수와 처방을 받아보세요.

무료 진단 시작
← 인사이트 목록으로