Citeon
콘텐츠 전략

AI는 이미지·영상도 읽는다 — 멀티모달 콘텐츠로 인용률 높이는 법

김태오
김태오 · 그로스·퍼포먼스 리드
AI는 이미지·영상도 읽는다 — 멀티모달 콘텐츠로 인용률 높이는 법

결론부터: AI가 이미지·영상을 '본다'고 해서 그 자체로 인용되는 게 아니다. AI 검색이 이미지·영상을 인용하는 실제 경로는 '그 시각 콘텐츠가 텍스트(캡션·alt·자막·구조화 데이터)로 변환돼 검색기(retriever)에 잡히느냐'다. 즉 멀티모달 인용의 승부처는 '더 예쁜 이미지'가 아니라 '기계가 읽을 수 있는 이미지'다. 저는 그로스·퍼포먼스 관점에서 이걸 숫자로 봅니다. 예쁜 화보 100장보다, 검색기에 정확히 걸리는 캡션 한 줄이 인용률과 유입에 더 크게 기여하는 경우가 흔합니다. 이 글은 그 원리를 RAG 메커니즘으로 해부하고, 오늘 바로 따라 할 수 있는 단계별 체크리스트까지 드립니다.

먼저 오해부터 풀자 — 'AI가 본다'와 'AI가 인용한다'는 다르다

요즘 멀티모달 모델은 실제로 이미지·영상을 이해합니다. 사진을 넣으면 무엇이 찍혔는지 설명하고, 영상 프레임을 읽고 요약도 합니다. 그래서 '이제 이미지도 알아서 읽어주니 대충 올려도 되겠지'라고 생각하기 쉽습니다. 그런데 여기엔 결정적인 구멍이 하나 있습니다. AI가 답변을 만들 때 세상의 모든 이미지를 실시간으로 눈으로 훑어보는 게 아니라는 점입니다.

AI 검색은 대부분 RAG(retrieval→reranking→generation) 구조로 돕니다. Lewis 등이 2020년에 정식화한 이 구조(arXiv:2005.11401)의 핵심은, 모델이 답을 쓰기 전에 외부 문서를 '검색해서 가져온다'는 것입니다. 모델이 학습으로 외운 지식(파라메트릭 메모리)과, 그때그때 검색해 온 문서(비파라메트릭 메모리)를 합쳐 답을 만듭니다. 문제는 이 '검색해서 가져오는' 검색기가 대부분 텍스트를 기준으로 문서를 찾는다는 데 있습니다.

비유하자면 이렇습니다. AI는 시력이 좋은 사서입니다. 눈앞에 책을 펼쳐주면 그림도 읽습니다. 하지만 그 사서가 서고에서 책을 꺼내오는 기준은 눈이 아니라, 책등에 붙은 라벨(색인 카드)입니다. 라벨이 비어 있는 화보집은 아무리 안이 훌륭해도 서고에서 뽑혀 나오질 못합니다. 멀티모달 콘텐츠도 똑같습니다. 이미지·영상이 검색기에 '텍스트 라벨'로 등록돼 있어야, 답변을 만들 재료로 뽑혀 나옵니다.

이미지·영상이 인용되는 실제 경로 — 5개의 관문

내 이미지 한 장, 영상 하나가 AI 답변에 인용되기까지는 사실 여러 관문을 통과해야 합니다. 어디서 탈락하는지 알아야 처방이 나옵니다.

관문하는 일여기서 탈락하면
① 크롤 허용AI 크롤러가 페이지·미디어에 접근robots.txt 차단 시 후보 진입 자체 불가
② 텍스트화이미지→alt·캡션, 영상→자막·트랜스크립트텍스트 없으면 검색기가 색인할 근거 없음
③ 검색(retrieval)질문과 의미·키워드가 맞는 청크 회수맥락 없는 캡션은 회수 실패
④ 재정렬(reranking)회수된 후보를 질문과 다시 대조해 정렬상위 컷 밖으로 밀리면 생성에 안 쓰임
⑤ 생성·인용답변 문장 작성 + 출처 표기근거가 약하면 인용 없이 버려짐

핵심은 ②번입니다. 아무리 좋은 이미지·영상도 텍스트라는 통로를 거쳐야 ③~⑤로 넘어갑니다. 그래서 멀티모달 최적화는 역설적으로 '텍스트 최적화'에서 시작합니다. 요리사가 냉장고에서 꺼낼 수 없는 재료는 접시에 오르지 못하는 것과 같습니다. 이미지·영상을 냉장고 안에 '이름표를 붙여' 넣어두는 작업, 그게 alt·캡션·자막·구조화 데이터입니다.

왜 '캡션 한 줄'에 맥락이 필요한가 — Contextual Retrieval의 교훈

검색기가 이미지를 잘 회수하려면 캡션이 '독립적으로 말이 되는 문장'이어야 합니다. 이건 텍스트 청킹 연구에서 이미 검증된 원리입니다. Anthropic의 Contextual Retrieval(2024) 실험에서, 각 청크 앞에 그 청크가 무슨 맥락인지 설명을 덧붙이자 검색 실패율이 35% 감소(5.7%→3.7%)했고, BM25 키워드 검색을 하이브리드로 얹으니 49%, 여기에 reranking까지 더하니 67% 감소했습니다. 그리고 상위 20개(top-20) 후보를 넘기는 걸 권장했습니다.

이 원리는 이미지 캡션에 그대로 적용됩니다. '제품 사진'이라는 맥락 없는 캡션은 검색기에게 아무 신호도 못 줍니다. 반면 '무엇을·어디서·어떤 조건에서'가 담긴 캡션은 질문과 매칭될 확률이 확 올라갑니다.

차이가 보이시나요? 강한 쪽은 그 자체로 검색 질문("분당 욕실 리모델링 비용", "작은 욕실 건식 세면대")과 바로 맞물립니다. 검색기는 이미지의 픽셀이 아니라 이 문장을 보고 회수 여부를 결정합니다.

영상은 '자막'이 곧 검색 인덱스다

영상은 이미지보다 한층 더 '텍스트 의존적'입니다. 10분짜리 제품 리뷰 영상을 AI가 통째로 눈으로 보며 답변마다 대조하는 건 비용상 비현실적입니다. 실제로는 자막(트랜스크립트)이 텍스트 문서로 색인되고, 그 텍스트가 검색·인용의 대상이 됩니다. 즉 영상의 인용 가능성은 자막의 품질과 거의 동의어입니다.

여기서 그로스 관점의 계산이 들어갑니다. 자막이 없는 영상은 '검색 색인 위에서는 존재하지 않는 콘텐츠'입니다. 제작비 300만 원을 들인 영상이라도, 자막이 없으면 AI 인용 파이프라인에서의 기여도는 0에 수렴할 수 있습니다. 반대로 이미 만든 영상에 정확한 한국어 자막과 타임스탬프별 챕터, 그리고 요약 텍스트를 페이지에 붙이는 건 몇 시간이면 됩니다. ROI가 명백한 작업입니다.

영상 자산검색 인덱스에서의 실체인용 가능성
자막·설명 없는 영상거의 빈 문서낮음
자동 자막만오타·화자혼동 섞인 텍스트중간(불안정)
교정 자막+챕터+요약 텍스트구조화된 문서높음

한 가지 더. 자막은 어디에 배치하느냐도 중요합니다. Liu 등의 'Lost in the Middle'(2023, arXiv:2307.03172) 연구는 긴 맥락에서 중간에 묻힌 정보가 손실되는 U자형 현상을 보였습니다. 앞과 끝의 정보가 더 잘 활용됩니다. 그래서 영상 페이지에서도 핵심 결론·수치는 트랜스크립트 맨 앞의 요약 문단과 맨 끝의 정리에 배치하는 게 유리합니다. 긴 자막 한가운데에만 있는 핵심은 묻히기 쉽습니다.

구조화 데이터 — 기계에게 '이건 무엇이다'라고 직접 말해주기

alt·자막이 사람이 읽는 설명이라면, 구조화 데이터(schema.org의 ImageObject·VideoObject 등)는 기계에게 직접 건네는 명세서입니다. "이 영상의 제목은 X, 업로드 날짜는 Y, 다루는 내용은 Z, 썸네일은 여기"를 태그로 명시하면, 검색 시스템이 추측할 필요 없이 그대로 받아 색인합니다.

이건 GEO 연구의 결과와도 통합니다. Aggarwal 등의 GEO 논문(2023, arXiv:2311.09735, KDD 2024)은 통계·출처 인용·직접 인용문을 콘텐츠에 더하면 생성엔진 가시성이 특정 조건에서 최대 약 40%까지 올라간다고 보고했습니다. 이미지·영상 페이지도 마찬가지입니다. "이 차트는 무엇을 보여주는가"를 캡션에 수치와 함께 적고, 출처를 명시하면, 검색기와 생성기 모두에게 '근거로 쓸 만한 재료'로 인식됩니다.

<!-- ❌ 약한 예: 이미지만 덩그러니 -->
<img src="chart.png">

<!-- ✅ 강한 예: 설명 + 구조화 데이터 -->
<figure>
  <img src="chart.png"
    alt="2024~2026 국내 리모델링 평균 공사비 추이: 욕실 380만→480만 원">
  <figcaption>출처: 자사 시공 1,200건 집계, 2026년 상반기 기준</figcaption>
</figure>
<script type="application/ld+json">
{ "@type":"ImageObject",
  "caption":"국내 욕실 리모델링 평균 공사비 추이",
  "contentUrl":"https://example.com/chart.png" }
</script>

크롤러가 못 들어오면 이 모든 게 무의미하다

앞의 모든 작업은 ①번 관문, 즉 AI 크롤러가 페이지와 미디어에 접근할 수 있을 때만 의미가 있습니다. robots.txt에서 이미지 디렉터리나 미디어 CDN을 막아두면, alt를 아무리 잘 써도 검색기가 볼 수 없습니다. 다음 크롤러들이 미디어를 포함해 접근 허용돼 있는지 점검해야 합니다.

특히 한국에서는 함정이 하나 더 있습니다. 네이버는 외부 크롤러를 차단하는 정책이라, 글로벌 AI들은 네이버 블로그 대신 나무위키·위키백과·티스토리 같은 우회 경로에서 근거를 가져오는 경향이 있습니다. 그래서 이미지·영상 자산을 네이버 안에만 쌓아두면 글로벌 AI 인용에서는 잘 안 잡힐 수 있습니다. 자사 도메인(크롤 허용)에도 핵심 시각 자산과 그 설명을 함께 두는 게 안전합니다.

엔진마다 '보는 눈'이 다르다는 것도 계산에 넣자

인용 패턴 분석을 보면 엔진별로 선호하는 출처가 꽤 다릅니다. 한 대규모 분석에서 ChatGPT와 Perplexity의 인용 도메인 중복은 약 11%에 그쳤고, 인용의 약 90%가 엔진마다 달랐습니다. ChatGPT는 위키백과 비중이 높고(약 47.9%), Perplexity는 Reddit 비중이 컸습니다(약 46.7%). 성향도 갈립니다. Claude는 근거가 약한 콘텐츠를 보수적으로 걸러내는 편이고(Citations API 계열), Perplexity는 실시간·인라인 인용을 잘 답니다. Gemini는 구글 색인과 E-E-A-T 신호를 중시합니다.

멀티모달 관점에서 이걸 실무로 옮기면: 이미지·영상 페이지의 근거를 탄탄히 하는 것은 특히 Claude·Gemini 계열에서 컷을 통과하는 데 유리합니다. 캡션에 수치와 출처를 붙이고, 영상 자막에 사실을 정확히 담는 작업이 여기에 직결됩니다. 반대로 엔진 하나만 보고 판단하면 안 됩니다. 인용의 90%가 서로 다르다는 건, 한 엔진에서 안 잡힌다고 실패가 아니라는 뜻이기도 합니다.

측정은 반드시 '여러 번'으로 — 한 번의 관찰은 노이즈다

"오늘 ChatGPT에 물어보니 우리 이미지가 인용 안 됐어요"라는 한 번의 관찰로 판단하면 위험합니다. LLM은 확률적으로 다음 단어를 뽑는 데다, temperature=0에서도 GPU 연산·배치 문제로 결과가 미세하게 흔들립니다. 한 실험에서는 2,350억 파라미터 모델을 1,000회 돌렸더니 80가지 출력이 나왔습니다. AI 가시성의 인용은 멱법칙처럼 출렁이므로, 다중 실행과 부트스트랩 신뢰구간으로 봐야 한다는 연구도 있습니다(arXiv:2603.08924). 단일 측정은 측정값이 아니라 노이즈 한 점입니다.

그래서 멀티모달 최적화의 효과도 '한 번 검색해보고' 판단하지 마세요. 처방 전후로 여러 번, 여러 엔진에서 인용 여부를 재고 추이로 봐야 합니다. 빌려온 벤치마크 숫자는 참고, 내 사이트에서 직접 잰 추이가 판단의 근거입니다.

바로 따라 하는 단계별 실행 체크리스트

오늘 당장 순서대로 할 수 있게 정리했습니다. 위에서 아래로, 앞쪽일수록 ROI가 큽니다.

  1. [크롤 개방] robots.txt 점검(30분). GPTBot·OAI-SearchBot·ClaudeBot·anthropic-ai·PerplexityBot·Google-Extended가 이미지·미디어 경로를 포함해 허용돼 있는지 확인. 미디어 CDN 서브도메인의 robots.txt도 별도로 확인.
  2. [텍스트화 1] 핵심 이미지 alt 재작성. 트래픽·전환 상위 페이지부터. "무엇을·어떤 조건·어떤 수치"가 담긴 한 문장으로. 파일명(IMG_xxxx)·"이미지"·빈 alt 전부 교체.
  3. [텍스트화 2] 이미지 캡션(figcaption)에 근거 추가. 출처·날짜·수치를 함께. 차트·비교표 이미지는 특히 텍스트 요약을 옆에 병기.
  4. [영상] 자막 교정 + 챕터 + 요약 텍스트. 자동 자막의 오타·화자혼동 교정 → 타임스탬프 챕터 → 페이지 상단에 영상 요약 문단(핵심 결론·수치)을 텍스트로. Lost in the Middle 대비해 결론은 앞/끝에.
  5. [구조화] ImageObject·VideoObject 스키마 삽입. 제목·설명·업로드일·썸네일·트랜스크립트 링크 명시.
  6. [국내 우회] 자사 도메인에 시각 자산 미러링. 네이버에만 있는 핵심 이미지·영상은 크롤 허용된 자사 도메인에도 설명과 함께 배치.
  7. [측정] 처방 전후 다중 측정. 4개 엔진에서 관련 질문 세트로 여러 번 인용 여부 측정 → 추이 기록. 단일 측정으로 판단 금지.
  8. [반복] 상위 페이지→하위 페이지로 확산. 효과 확인된 패턴을 나머지 콘텐츠에 롤아웃.

①~③만 해도 대부분의 사이트에서 '검색기에 안 잡히던 이미지'가 잡히기 시작합니다. 화려한 신규 제작보다, 이미 가진 자산에 텍스트 라벨을 다는 게 먼저입니다.

Citeon은 이 원리를 제품에 담았다

멀티모달 최적화의 어려움은 '내 이미지·영상이 지금 실제로 인용되고 있는지'를 눈으로 확인하기 어렵다는 데 있습니다. Citeon은 여기서 출발합니다. ChatGPT·Gemini·Perplexity·Claude 4개 엔진에서 브랜드가 실제로 인용되는 비율(SOV, Share of Voice)을 측정하고, 단발이 아니라 주간 모니터링 추이로 보여줍니다. 앞서 말한 '단일 측정=노이즈' 문제를 추이로 넘어서기 위해서입니다.

또한 사이트 진단 엔진이 페이지를 훑어 크롤 허용·텍스트화·구조 같은 관문의 약점을 한국어 처방으로 짚어줍니다. 이미지·영상 자산이 검색기에 잡힐 상태인지, 어디가 비어 있는지를 확인하는 출발점이 됩니다. 경쟁사 역추적으로는 같은 카테고리에서 어떤 콘텐츠가 인용을 가져가는지도 볼 수 있습니다.

먼저 내 사이트가 지금 어디서 탈락하는지부터 아는 게 순서입니다. Citeon 무료 진단(₩0)으로 현재 상태를 받아보세요. 처방은 그다음입니다.

자주 묻는 질문

AI가 이미지를 직접 본다는데, 그래도 alt·캡션이 필요한가요?

네. 멀티모달 모델이 이미지를 이해하는 것과, 검색기가 그 이미지를 '답변 재료로 회수'하는 것은 다른 단계입니다. 대부분의 AI 검색은 RAG 구조에서 텍스트를 기준으로 문서를 검색합니다. alt·캡션·자막이라는 텍스트 통로가 없으면, 아무리 이해 능력이 좋아도 애초에 그 이미지가 후보로 뽑히질 않습니다.

영상에 자막을 붙이면 정말 인용에 도움이 되나요?

자막은 영상의 내용을 검색 가능한 텍스트 문서로 만들어줍니다. 자막이 없으면 영상은 검색 인덱스 위에서 사실상 빈 문서에 가깝습니다. 다만 효과는 사이트·엔진·질문에 따라 다르므로, 붙인 뒤 여러 번·여러 엔진에서 인용 추이를 재보고 판단하시길 권합니다.

네이버 블로그에 이미지가 많은데 글로벌 AI에는 왜 잘 안 잡히나요?

네이버는 외부 크롤러를 차단하는 정책이라, 글로벌 AI들은 네이버 대신 나무위키·위키백과·티스토리 등 우회 경로에서 근거를 가져오는 경향이 있습니다. 그래서 핵심 시각 자산은 크롤이 허용된 자사 도메인에도 설명과 함께 두는 것이 안전합니다.

alt 텍스트에 키워드를 잔뜩 넣으면 더 잘 잡히나요?

아닙니다. 키워드 나열은 오히려 근거가 약한 콘텐츠로 걸러질 수 있습니다. 검색기가 잘 회수하는 캡션은 '독립적으로 말이 되는 한 문장'입니다. 무엇을·어떤 조건에서·어떤 수치인지 자연스럽게 담는 편이, 질문과의 매칭 확률을 높입니다.

효과를 어떻게 확인하나요?

한 번의 검색으로는 안 됩니다. LLM은 같은 질문에도 결과가 흔들리기 때문입니다. 처방 전후로 여러 엔진에서 관련 질문 세트를 여러 번 돌려 인용 여부를 기록하고, 추이로 판단하세요. Citeon은 이를 4개 엔진 주간 모니터링으로 자동화합니다.

참고자료

김태오
김태오 · 그로스·퍼포먼스 리드

AI 검색 유입을 전환·매출로 잇는 광고·어트리뷰션을 다룹니다. 숫자로 말하는 걸 좋아합니다.

내 사이트의 AI 검색 점수가 궁금하다면

30초 무료 진단으로 SEO·AEO·GEO 점수와 처방을 받아보세요.

무료 진단 시작
← 인사이트 목록으로