이미지·영상의 AI 검색 최적화는 '그림을 예쁘게 만드는 일'이 아니라, AI가 그 그림을 읽을 수 있도록 텍스트 비계(alt·캡션·파일명·주변 문장·전사·구조화 데이터)를 정교하게 둘러주는 일입니다. ChatGPT·Perplexity·구글 AI 같은 생성형 검색은 사진을 망막으로 감상하지 않습니다. 그들은 사진 둘레에 적힌 글자를 읽고, 그 글자를 근거로 답변에 인용합니다. 그래서 멀티모달 최적화의 90%는 역설적으로 '텍스트 작업'입니다. 이 글에서는 왜 그런지 RAG 메커니즘으로 풀고, 오늘 바로 따라 할 수 있는 체크리스트를 약한 예/강한 예 대조로 정리하겠습니다.
왜 AI는 이미지를 '보는' 게 아니라 '읽는'가
생성형 검색엔진의 답변은 세 단계를 거칩니다. 검색(retrieval) → 재정렬(reranking) → 생성(generation). 이 구조의 원형은 2020년 RAG 논문(Lewis 등)에서 제안됐습니다. 모델 안에 굳어 있는 지식(파라메트릭 메모리)만으로는 최신성·정확성이 부족하니, 외부 문서를 그때그때 꺼내 와(비파라메트릭 메모리) 답변의 근거로 삼는 방식이죠.
여기서 핵심은 '꺼내 오는 대상이 무엇이냐'입니다. 검색 단계에서 엔진이 다루는 1차 재료는 거의 전부 텍스트 임베딩입니다. 2020년 DPR(Dense Passage Retrieval) 연구는 단어 일치(BM25)보다 의미를 담은 임베딩 검색이 더 정확하다는 것을 보였는데, 이 임베딩은 '문장'을 벡터로 바꾼 것이지 '픽셀'을 바꾼 것이 아닙니다. 즉, 당신의 멋진 인포그래픽이 답변에 등장하려면, 그 인포그래픽을 설명하는 문장이 먼저 검색 인덱스에 들어가 있어야 합니다.
비유하자면, AI 검색엔진은 점자 도서관의 사서입니다. 서가에 아무리 화려한 화보집이 꽂혀 있어도, 사서가 더듬어 읽을 수 있는 건 표지에 붙은 점자 라벨(alt·캡션·파일명)뿐입니다. 라벨이 비어 있으면 그 책은 사서에게 '존재하지 않는 책'입니다.
물론 최신 멀티모달 모델은 이미지 자체를 어느 정도 이해합니다. 하지만 '검색 후보로 올라가는' 단계, 즉 인덱싱과 1차 retrieval은 여전히 텍스트가 지배합니다. 이미지를 직접 이해하는 능력은 주로 '이미 답변에 끌려온 페이지를 마지막에 정리할 때' 보조적으로 쓰입니다. 그래서 실무 우선순위는 명확합니다. 먼저 텍스트로 발견되게 하고, 그다음 이미지로 신뢰를 더한다.
멀티모달 콘텐츠가 AI 답변에 인용되는 실제 경로
이미지·영상이 답변에 닿는 길은 하나가 아닙니다. 각 경로마다 '무엇을 최적화해야 하는지'가 다릅니다.
| 인용 경로 | AI가 읽는 실제 재료 | 당신이 손봐야 할 곳 |
|---|---|---|
| 본문 속 이미지 | alt 텍스트, 캡션, 바로 앞뒤 문단 | 설명형 alt + 두괄식 캡션 |
| 이미지 검색 → 답변 인용 | 파일명, 주변 제목(h2/h3), 구조화 데이터 | 키워드형 파일명 + ImageObject 스키마 |
| 영상(유튜브 등) | 전사(transcript)·자막, 챕터, 설명란 | 정확한 자막 + 타임스탬프 챕터 |
| 표·차트 이미지 | 이미지가 아닌 '본문에 다시 쓴 수치' | 그림 옆에 텍스트로 데이터 재서술 |
네 번째 행을 특히 강조하고 싶습니다. 매출 추이 그래프를 이미지 하나로만 올리면, AI에게 그것은 읽을 수 없는 검은 상자입니다. 같은 수치를 본문 문장이나 작은 표로 한 번 더 적어 두면, 그 문장이 검색 인덱스에 들어가 답변에 인용됩니다. '그림은 사람에게, 숫자는 텍스트로 AI에게' — 이 이중 제공이 멀티모달 최적화의 첫 번째 원칙입니다.
이미지 최적화 체크리스트 — alt·파일명·캡션·주변 텍스트
1) alt 텍스트: 장식이 아니라 직답 한 문장
alt는 원래 시각장애인용 스크린리더와 이미지 로딩 실패 대비용이지만, AI 검색에는 '이미지의 의미를 텍스트로 박아 두는 유일한 공식 슬롯'입니다. 키워드 나열이 아니라, 그 이미지가 무엇을 보여주는지 한 문장으로 직답해야 합니다.
<!-- ❌ 약한 예: 비었거나, 파일명 그대로거나, 키워드 나열 -->
<img src="a.jpg" alt="">
<img src="IMG_2931.jpg" alt="IMG_2931">
<img alt="마케팅 AEO GEO SEO 대행 AI 검색 최적화">
<!-- ✅ 강한 예: 무엇을·어떤 맥락인지 한 문장 직답 -->
<img src="aeo-ctr-2026.jpg"
alt="2026년 AI 검색 유입의 전환율이 일반 검색 대비 수 배 높게 나타난 분기별 비교 막대그래프">
강한 예의 alt는 그 자체로 하나의 '문장 청크'가 되어, 누군가 'AI 검색 전환율 비교' 같은 질문을 했을 때 의미 임베딩으로 매칭될 수 있습니다.
2) 파일명: AI가 읽는 첫 단어
이미지 URL의 파일명은 의외로 강한 신호입니다. screenshot_final_v3.png는 아무 의미도 없지만, aeo-rag-pipeline-diagram.png는 그 자체로 주제를 선언합니다.
- ❌
%E1%84%89%E1%84%89.jpg(한글 깨짐),1.png,final-FINAL.jpg - ✅
hybrid-search-recall-benchmark.png— 영문 소문자, 하이픈, 핵심 키워드
3) 캡션: 그림 밑 한 줄도 두괄식으로
캡션(figcaption)은 사람이 가장 먼저 읽는 곳이자, AI가 이미지와 본문을 잇는 다리입니다. 여기서도 '결론 먼저'가 통합니다.
<!-- ❌ 약한 예: 그림 번호만 -->
<figcaption>그림 3.</figcaption>
<!-- ✅ 강한 예: 캡션이 직답 문장 -->
<figcaption>그림 3. 하이브리드 검색(RRF)의 recall@10은
공개 벤치마크 종합 약 91%로, 의미 검색 단독(약 78%)·BM25
단독(약 65%)을 모두 앞선다.</figcaption>
이 강한 캡션 하나가 왜 중요한지는 검색 메커니즘으로 설명됩니다. 의미 검색만 쓰면 동의어·맥락은 잘 잡지만 '91%' 같은 정확한 토큰을 놓칠 수 있고, 키워드 검색(BM25)만 쓰면 정확한 단어는 잡지만 의미가 다른 표현을 놓칩니다. 그래서 실전 엔진은 둘을 합친 하이브리드 검색을 씁니다. 도서관에 비유하면, 키워드 색인 카드(BM25)와 '주제를 아는 사서'(의미 검색)를 동시에 부리는 것이죠. 당신의 캡션이 정확한 수치와 자연스러운 설명을 함께 담으면 두 검색 방식 모두에 걸립니다.
4) 주변 텍스트: 이미지는 문단에 '둘러싸여야' 한다
Anthropic이 2024년 공개한 Contextual Retrieval 연구는 매우 시사적입니다. 문서를 조각(청크)으로 자를 때 각 조각에 '이 조각이 전체에서 어떤 맥락인지'를 한두 문장 덧붙였더니, 검색 실패율이 5.7%에서 3.7%로 약 35% 줄었습니다. 여기에 BM25를 더하면 49%, 재정렬(reranking)까지 더하면 67%까지 실패율이 떨어졌고, 상위 후보를 20개(top-20)까지 넉넉히 보는 것이 권장됐습니다.
이미지에도 똑같은 원리가 적용됩니다. 외딴섬처럼 던져진 이미지보다, 바로 앞 문단이 '무엇을 보여줄 그림인지' 예고하고, 바로 뒤 문단이 '그림에서 무엇을 읽어야 하는지' 해설하는 이미지가 훨씬 잘 인용됩니다. 그림이 맥락 문장에 둘러싸이는 것 자체가, Contextual Retrieval이 말한 '맥락 덧붙이기'를 사람 손으로 해 주는 셈입니다.
영상 최적화 — 전사(transcript)가 전부다
영상은 이미지보다 더 극단적입니다. AI는 영상의 픽셀을 프레임 단위로 감상하지 않습니다. AI가 읽는 것은 사실상 자막·전사 텍스트, 챕터 제목, 설명란입니다. 자막 없는 10분짜리 명강의는 AI에게 '10분짜리 침묵'입니다.
- 정확한 전사/자막: 자동 생성 자막을 그대로 두지 말고 핵심 용어·고유명사 오타를 교정하세요. '시테온'이 '시태온'으로 적히면 그 영상은 브랜드 검색에서 사라집니다.
- 타임스탬프 챕터: 설명란에
00:00 도입 / 02:15 RAG 3단계 / 05:40 하이브리드 검색처럼 챕터를 적으면, 각 챕터 제목이 작은 청크가 되어 특정 질문에 매칭됩니다. - 설명란 두괄식 요약: 첫 2~3문장에 '이 영상이 답하는 질문'을 직답으로 적으세요. 긴 글에서 중간 정보가 잘 안 읽히는 'Lost in the Middle'(Liu 등 2023) 현상은 영상 설명란에도 통합니다 — 핵심은 맨 앞과 맨 끝에.
- 본문에 영상 내용 재서술: 영상을 페이지에 임베드했다면, 같은 페이지 본문에 영상의 핵심을 글로 한 번 더 풀어 주세요. 그 글이 인용의 실제 후보가 됩니다.
<!-- ✅ 영상 임베드 + 텍스트 비계 동시 제공 -->
<figure>
<iframe src="..." title="RAG 3단계로 보는 AI 검색 인용 원리"></iframe>
<figcaption>영상 요약: 검색→재정렬→생성 3단계 중
'재정렬'에서 cross-encoder가 질문과 후보를 함께 읽어
NDCG를 끌어올린다(난도 높은 질의에서 더 큰 폭).</figcaption>
</figure>
참고로 재정렬(reranking) 단계는 cross-encoder가 질문과 후보 문서를 '함께' 읽어 다시 순위를 매기는 과정으로, 공개 자료에서 NDCG가 보통 5~15포인트, 어려운 질의에서는 20포인트가량 오른다고 보고됩니다. 즉 1차로 끌려온 후보 중에서 '진짜 질문에 답하는' 것이 위로 올라옵니다. 당신의 전사가 질문의 표현과 잘 맞을수록 이 단계에서 유리합니다.
크롤러가 들어와야 후보가 된다 — robots.txt 점검
아무리 alt를 잘 써도, AI 크롤러가 페이지(와 이미지)에 접근하지 못하면 인용 후보에 아예 오르지 못합니다. 주요 크롤러를 robots.txt에서 막고 있지 않은지 먼저 확인하세요.
| 주체 | 크롤러 / 봇 이름 |
|---|---|
| OpenAI | GPTBot, OAI-SearchBot |
| Anthropic | ClaudeBot, anthropic-ai |
| Perplexity | PerplexityBot |
| Google-Extended |
이미지가 별도 CDN·서브도메인에 있다면 그쪽 robots.txt도 함께 봐야 합니다. 본문은 열려 있는데 이미지 호스트만 막혀 있으면, AI는 '설명은 있는데 그림은 못 보는' 상태가 됩니다.
구조화 데이터로 '이건 이미지/영상입니다' 선언하기
구조화 데이터(Schema.org)는 검색엔진에게 '이 조각이 무엇인지'를 기계어로 명시해 줍니다. 이미지엔 ImageObject, 영상엔 VideoObject를 쓰세요.
<script type="application/ld+json">
{
"@context": "https://schema.org",
"@type": "ImageObject",
"contentUrl": "https://example.com/hybrid-search-recall.png",
"caption": "하이브리드 검색 recall@10 약 91% 비교 그래프",
"description": "의미 검색 78%, BM25 65%, 하이브리드(RRF) 91%",
"creditText": "Citeon"
}
</script>
이런 명시적 선언은 GEO 연구와도 결이 맞습니다. 2023년 GEO 연구(Aggarwal 등, KDD 2024)는 본문에 통계·출처 인용·직접 인용문을 더하면 생성엔진에서의 가시성이 특정 조건에서 최대 약 40%까지 올라간다고 보고했습니다. 캡션과 description에 '78%·65%·91%' 같은 구체 수치와 출처를 박아 두는 것은, 바로 이 '통계 추가' 전략을 멀티모달 메타데이터에 적용하는 것입니다.
엔진마다 인용 취향이 다르다
대규모 인용 분석에 따르면 엔진 간 인용 도메인 중복은 낮습니다 — 한 분석에서 ChatGPT와 Perplexity의 인용 도메인 중복은 약 11%에 그쳤고, 인용의 약 90%가 엔진마다 달랐습니다. ChatGPT는 위키백과 비중이 약 47.9%, Perplexity는 Reddit이 약 46.7%로 나타나기도 했습니다. 이미지·영상 최적화도 이 성향을 의식하면 좋습니다.
- ChatGPT: 위키·커뮤니티 친화 → 잘 정리된 설명형 캡션·정의 문장이 유리.
- Gemini: 구글 색인·E-E-A-T 기반 → 구조화 데이터와 이미지 검색 신호가 중요.
- Claude: 근거가 약한 콘텐츠를 보수적으로 걸러내는 편 → 캡션에 출처·수치 명시가 효과적.
- Perplexity: 실시간·인라인 인용 → 최신성과 명확한 전사가 강점.
중요한 건, 한 엔진에서 잘 인용된다고 다른 엔진도 그러리란 보장이 없다는 점입니다. 그래서 멀티 엔진을 따로 측정해야 합니다(뒤에서 다룹니다).
네이버의 멀티모달 — 한국 시장의 특수성
네이버는 글로벌 엔진과 다른 경기장입니다. 큐:(Cue:)·클로바X는 2026-04-09 종료되고, AI탭이 2026-06-25~26 대화형·에이전틱으로 전체 정식 출시됩니다. AI 브리핑(요약)은 이미 통합검색 쿼리의 20% 이상에 적용되고 있습니다. 한 표본분석(272건)에서는 AI 브리핑 인용 출처의 약 58%가 블로그였고, 인용의 약 49%는 검색결과 Top10 밖에서 나왔습니다.
실무 시사점은 두 가지입니다. 첫째, 네이버는 외부 크롤러를 차단하기 때문에 글로벌 AI는 네이버 콘텐츠를 직접 못 읽고 나무위키·위키백과·티스토리로 우회합니다. 둘째, 네이버 알고리즘(C-Rank·D.I.A.+)과 콘텐츠 5원칙(직접경험·일관주제·진정성·읽기 쉬운 구조·최신성)을 따르려면, 이미지도 직접 찍은 실사진 + 경험을 적은 캡션이 스톡 이미지보다 유리합니다. 같은 사진이라도 '직접 테스트하며 캡처한 화면'이라는 맥락이 붙으면 진정성 신호가 됩니다.
측정의 함정 — 한 번 찍은 숫자는 노이즈다
이미지·영상 최적화의 효과를 '한 번 물어보고' 판단하면 안 됩니다. LLM은 temperature=0에서도 출력이 흔들립니다(GPU 연산·배치 차이 때문). 한 실험에서는 2,350억 파라미터 모델에 같은 질문을 1,000번 던졌을 때 80가지 출력이 나왔습니다. AI 가시성 인용은 멱법칙처럼 출렁이기 때문에, 다중 실행 + 부트스트랩 신뢰구간으로 봐야 합니다. 단일 측정은 측정이 아니라 노이즈입니다.
또한 '프롬프트 검색량' 같은 숫자는 대부분 패널 모델링 추정치입니다(시장 표본 1% 미만). Conductor는 "신뢰할 수 없는 검색량 데이터는 없는 것보다 나쁘다"고 경고합니다. 그러니 멀티모달 작업의 성과는 '이 이미지가 몇 번 노출됐나'를 단정하기보다, '여러 번 측정한 인용율의 추세'로 봐야 합니다.
Citeon은 이 원리를 제품에 담았다
지금까지의 원리 — 텍스트 비계, 크롤러빌리티, 엔진별 성향, 다중 측정 — 은 모두 '실제로 인용되고 있는지'를 봐야 검증됩니다. Citeon은 이를 제품으로 만들었습니다.
- 4엔진 인용 측정(SOV): ChatGPT·Gemini·Perplexity·Claude에서 당신 브랜드가 실제로 인용되는 비율을 따로 측정합니다. 엔진마다 취향이 다르다는 점을 합산으로 가리지 않고 분리해 보여줍니다.
- 사이트 진단엔진: URL을 넣으면 SEO/AEO/GEO 관점에서 점수와 한국어 처방을 냅니다. alt·구조·구조화 데이터처럼 '이미지가 AI에게 읽히는가'를 점검하는 출발점입니다.
- 경쟁사 역추적: 같은 카테고리에서 어떤 콘텐츠·페이지가 인용되는지 역으로 추적해, 당신이 보강할 멀티모달 자산의 힌트를 줍니다.
- 주간 모니터 추이: 단일 측정의 함정을 피해, 인용율을 주 단위 추세로 관찰합니다.
이미지·영상을 아무리 정성껏 최적화해도, '정말 인용되고 있는지'를 모르면 개선의 방향을 잡을 수 없습니다. Citeon 무료진단(₩0)으로 지금 당신의 사이트가 AI에게 어떻게 읽히는지부터 확인해 보세요.
자주 묻는 질문(FAQ)
이미지에 텍스트(차트 수치)를 박아 넣으면 AI가 읽나요?
대체로 못 읽는다고 보는 게 안전합니다. AI 검색의 1차 retrieval은 텍스트 임베딩 기반이라, 그림 안에 그려진 글자는 인덱싱에서 누락되기 쉽습니다. 핵심 수치는 반드시 본문 문장이나 작은 표로 한 번 더 적어 '그림은 사람에게, 숫자는 텍스트로 AI에게' 이중 제공하세요.
alt 텍스트에 키워드를 많이 넣으면 더 잘 인용되나요?
아닙니다. 키워드 나열형 alt는 오히려 의미가 흐려져 매칭이 약해집니다. '그 이미지가 무엇을 보여주는지' 한 문장으로 직답하는 alt가, 의미 검색 임베딩과 더 잘 맞아 인용 후보가 됩니다.
영상은 유튜브에 올리는 게 좋나요, 자체 사이트가 좋나요?
둘 다 텍스트 비계가 핵심입니다. 유튜브는 자막·챕터·설명란을, 자체 사이트는 영상 옆 본문 재서술을 정확히 갖추는 게 우선입니다. 플랫폼보다 '전사가 정확하고 두괄식인가'가 인용을 좌우합니다.
이미지 최적화 효과를 어떻게 확인하나요?
한 번 물어보고 판단하지 마세요. LLM은 같은 질문에도 출력이 흔들립니다. 여러 번 측정한 인용율의 '추세'로 봐야 하며, 엔진별로 따로 측정하는 것이 정확합니다.
네이버에서도 같은 방식이 통하나요?
원리는 같지만 네이버는 외부 크롤러를 차단하고 C-Rank·콘텐츠 5원칙(직접경험·진정성 등)을 강조합니다. 스톡 이미지보다 직접 찍은 실사진과 경험을 담은 캡션이 더 유리합니다.
