이 글을 다 읽으면 얻게 되는 것
25만 2,000회 시행을 거친 대조 연구가 AI 인용을 좌우한다고 결론 내린 네 가지 요인에 대한 페이지 단위 점검과, 그 네 가지가 갖춰진 뒤에 효과를 내는 일곱 가지 2차 요인의 수정 순서입니다. 아울러 "스키마 마크업은 AI 인용에 전혀 효과가 없다"는 널리 퍼진 주장이 그 연구의 실제 결론이 아닌 이유를 출처와 함께 이해하게 됩니다. 잘못된 수정에 스프린트를 낭비하지 않을 수 있습니다.
대상 독자: ChatGPT, Gemini, Perplexity, Claude, Google의 AI 답변에 인용되고 싶은 사이트에서 페이지 단위 SEO 또는 GEO를 담당하는 분.
필요 시간: 페이지당 30~45분(점검과 1차 수정까지).
완료 기준: 점검 대상 페이지가 네 가지 게이트키퍼 검사를 모두 통과하고, 아직 손봐야 할 2차 요인 목록이 손에 정리되어 있는 상태.
시작하기 전에: 이 체크리스트의 근거와 바로잡는 것
SEO/GEO 업계에 도는 글 중에는 SIGIR 연구가 6개 LLM에서 25만 2,000회 시행을 했고 스키마와 JSON-LD는 AI 인용에 "측정 가능한 효과가 0"이었으며 가격, 최신성, 사양, 깊이가 효과를 크게 움직였다고 주장하는 것이 있습니다.
연구는 실재합니다. 시행 횟수도 맞습니다. 그 글에 실린 오즈비도 실제 수치에 가깝습니다. 성립하지 않는 부분은 하나, 그 연구는 스키마 마크업을 검증하지 않았습니다. 스키마가 "효과 0으로 측정된" 것이 아니라, 측정 대상 목록에 스키마가 애초에 없었습니다.
논문은 "What Gets Cited: Competitive GEO in AI Answer Engines"(Vishwakarma, Kumar, Jamidar, Sprinklr, SIGIR '26, 멜버른)입니다. 설계는 6개 LLM(Gemini-2.5-Flash, Claude-3.5-Sonnet, Kimi-K2-Thinking, GPT-5 계열 3종)에 후보 소스를 정확히 두 개 주입하고, 각 쌍이 18개 콘텐츠 요인 중 정확히 하나만 다르게 만들어 어느 쪽이 먼저 인용되는지 기록하는 방식입니다. 18개 요인은 콘텐츠 일치도, 완전성, 신뢰성, 가독성, 경쟁 위치, 최신성에 걸쳐 있습니다. 구조화 데이터 형식은 18개 어디에도 없습니다. 이는 논문 자체의 분류표를 직접 확인해 뒷받침했습니다.
스키마에 대한 진짜 답을 원한다면 출처는 따로 있습니다. Ahrefs가 2026년 5월에 수행한 대조 연구로, JSON-LD를 추가한 1,885개 페이지를 4,000개 대조 페이지와 비교했습니다. 결과는 Google AI Overviews에서 의미 있는 인용 증가가 없었고(-4.6%, 작지만 통계적으로 유의한 감소), Google AI Mode(+2.4%, 유의하지 않음), ChatGPT(+2.2%, 유의하지 않음)였습니다. 별도의 searchVIU 검증에서는 ChatGPT, Claude, Perplexity, Gemini, Google AI Mode가 실시간 검색 시 JSON-LD, 숨겨진 Microdata, 숨겨진 RDFa를 아예 읽지 않는다는 사실이 확인되었습니다.
이 점검에 들어가기 전에 두 사실을 혼동하지 마세요. SIGIR 연구는 페이지에서 무엇을 우선해야 하는지 알려줍니다. Ahrefs 연구는 스키마가 인용량이라는 관점에서는 그 우선순위 중 하나가 아니라는 것을 알려줍니다. 다만 리치 결과와 엔티티 명확성 같은 다른 국면에서는 여전히 의미가 있습니다.
1단계: 게이트키퍼 점검 실행하기
페이지를 다음 네 가지 요인에 비추어 확인합니다. SIGIR 연구에서는 6개 모델 모두에서 이 네 가지가 만장일치로 결정적이었고 효과는 매우 컸습니다(대부분의 모델에서 오즈비 100 초과). 하나라도 실패하면 페이지의 나머지가 아무리 강해도 인용 가능성은 사라집니다.
게이트키퍼 | 확인 내용 | 오즈비 범위(검증한 6개 모델) |
|---|---|---|
주제 일치 | 그 페이지가 대상 쿼리에 직접 답하는가(인접한 다른 주제가 아니라)? | 6개 모델 중 5개에서 사실상 결정적 |
가격 명시 | 구체적인 가격이 페이지에 보이는가("문의하기" 뒤에 가려져 있지 않은가)? | 6.26~10,000 초과 |
최신 타임스탬프 | 현재의 게시일 또는 최종 검토일이 표시되어 있고 정확한가? | 14.4~10,000 초과 |
목록 위치 | 해당 쿼리의 후보 중 두 번째가 아니라 첫 번째로 순위가 잡히는 경향이 있는가? | 1,795~10,000 초과 |
실행 내용: 대상 쿼리 옆에 페이지를 열어 둡니다. 첫 150단어를 읽고 쿼리에 직접 답하는지 자문합니다. 페이지에서 가격을 검색해 보고, 폼이나 전화가 필요하다면 실패입니다. 표시된 날짜가 실제로 마지막으로 업데이트한 시점과 맞는지 확인합니다. 해당 쿼리에서 현재 순위 또는 인용 점유율을 확인합니다.
기대 산출물: 네 행 각각의 통과/실패.
품질 점검: 주제 일치에서 실패했다면 여기서 멈춥니다. 이후 단계 중 어느 것도 잘못된 질문에 답하는 페이지를 구제하지 못합니다.
복구 경로: 가격과 타임스탬프 실패는 당일에 고칠 수 있습니다(2단계). 목록 위치 실패는 콘텐츠 수정으로 해결되지 않습니다. 이 페이지가 인용 경쟁을 할 수 있게 되기 전에 SEO 기초 체력 자체를 다시 세워야 한다는 뜻이며, 페이지 위의 작은 손질로는 대신할 수 없습니다.

2단계: 게이트키퍼 실패를 먼저 고치기
다른 것에 손대기 전에 이것부터 합니다. 이 목록에서 효과가 가장 크고 수고가 가장 적은 항목입니다.
가격이 빠져 있다면: 실제 숫자를 넣습니다. 가격이 달라진다면 "문의하기" 폼 대신 실제 시작 가격이나 명확한 범위를 공개합니다. 이는 연구에서 네 가지 게이트키퍼 중 하나였습니다.
타임스탬프가 오래되었거나 없다면: 게시일 또는 최종 검토일을 갱신합니다. 다만 실제로 내용을 개정한 뒤에만 그렇게 합니다. 실질적 갱신이 없는 날짜 변경은 누군가 확인하면 뒷받침할 수 없는 최신성 신호가 됩니다.
주제 일치가 약하다면: 도입부 150단어를, 관련 주제가 아니라 쿼리의 과업에 직접 답하도록 다시 씁니다. 오래된 구조에 새 도입부를 덧대지 말고 교체합니다.
품질 점검: 자신이 그 쿼리가 된 셈 치고 페이지를 다시 읽습니다. 처음 보는 사람이 첫 문단에서 구체적인 답을 얻을 수 있습니까?
복구 경로: 진짜 가격을 공개할 수 없다면(맞춤 견적, 엔터프라이즈 계약 등) 빈칸으로 두지 말고 대표적인 시작 가격이나 일반적인 범위를 공개합니다. 연구가 실패 상태로 측정한 것은 "가격이 언급되지 않음"이지 "가격이 변동함"이 아닙니다.
3단계: 2차 차별화 요인 다루기
네 가지 게이트키퍼를 통과하면 다음 일곱 요인이 2차 차별화를 만듭니다. 오즈비는 모델에 따라 약 2~243 범위입니다. 이 순서대로 수정합니다.
- 사양 누락. 구매자가 실제로 비교하는 기술 사양(치수, 재질, 용량, 호환성)을 추가합니다. 모델별 오즈비 8.63~243으로 2차 요인 중 가장 큰 효과 중 하나입니다.
- 비교 부재. 최소 한 가지 구체적인 대안과의 직접 비교를 추가합니다. 오즈비 1.61~7.45.
- 모호한 표현. "~일 수도 있다", "~할 가능성이 있다", "아마도"를 페이지가 실제로 뒷받침할 수 있는 단정적 표현으로 바꿉니다.
- 근거 없는 주장. 주장에 증거를 붙입니다. 시험 결과, 인증, 방법론 명시 등입니다.
- 내부 모순. 같은 페이지 안에서 수치와 주장이 어긋나지 않는지 확인합니다. 편집 중에 끼어들기 쉽고 검토할 때 놓치기 쉬운 항목입니다.
- 키워드 누락. 대상 쿼리가 쓰는 구체적인 표현이 동의어만이 아니라 페이지에 실제로 들어 있는지 확인합니다.
- 약한 가치 제안. 경쟁 페이지가 제시하는 내용에 맞서 자사의 구체적인 편익 주장을 벼립니다.
실행 내용: 목록을 위에서부터 순서대로 확인하며 해당하는 것을 고칩니다. 모든 페이지가 일곱 가지 문제를 다 안고 있는 것은 아닙니다.
기대 산출물: 모든 주장이 구체적이거나, 비교되고 있거나, 근거를 갖춘 상태가 된 페이지.
품질 점검: 회의적인 독자가 모호하거나 근거 없는 문장을 하나라도 찾아낼 수 있습니까?
복구 경로: 시간이 부족하면 항목 1과 2(사양과 비교)에서 멈춰도 됩니다. 일곱 개 중 가장 큰 오즈비를 갖고 있습니다.

4단계: 서식만 바꾸는 작업은 건너뛰기
연구는 문단을 글머리 기호로 재구성하는 것, 훑어보기 좋게 소제목을 추가하는 것, 흩어진 정보를 재배치하는 것에서 일관된 효과가 발견되지 않았다고 명시했습니다. 검증된 모델들이 시각적 구조와 무관하게 콘텐츠를 해석했기 때문입니다. 페이지가 여기까지의 검사를 통과했다면 인용 증가를 기대하며 서식 다듬기에 스프린트를 쓰지 마세요. 데이터가 뒷받침하지 않는 인용 효과를 위해서가 아니라 사람 독자를 위해 정리하세요.
5단계: 스키마는 제자리에 두기
스키마 마크업은 기술적으로 유효한 상태로 유지하세요. 실제로 하는 일이 있기 때문입니다. Google과 Bing이 리치 결과를 해석하도록 돕고, 검색 시스템에 페이지와 엔티티가 무엇인지 모호함 없이 전달합니다. 반면, 이용 가능한 최선의 대조 연구에 따르면 AI 인용 오즈를 움직이지는 않습니다. 스키마가 인용 레버라는 논리로 1~3단계보다 스키마 작업을 앞세우지 마세요. 그것을 뒷받침하는 대조 연구는 없고, 근거로 인용되는 유일한 연구는 스키마를 아예 검증하지 않았습니다. Ahrefs 스키마 연구가 실제로 무엇을 측정했는지 자세한 분석은 2026 시맨틱 SEO 가이드에서 확인할 수 있습니다.
결과 검증하기
수정 뒤에 그 페이지에서 1단계 점검을 다시 실행합니다. 네 가지 게이트키퍼가 모두 통과해야 합니다. 3단계에서 고친 2차 요인 중 두세 개를 표본 확인합니다. AI Search Visibility Checker 같은 AI 가시성·인용 추적 도구를 쓸 수 있다면, 다음 페이지로 넘어가기 전에 대상 쿼리에 대한 그 페이지의 현재 인용률을 기준선으로 기록해 둡니다. 그래야 나중에 변경이 무엇을 움직였는지 판단할 수 있습니다.
결과 유지하기
타임스탬프 게이트키퍼는 정해진 달력이 아니라 페이지에 실질적인 업데이트를 할 때마다 다시 확인합니다. 인용 점유율을 잃은 페이지는 2차 요인이 무너졌다고 단정하기 전에 네 가지 게이트키퍼부터 재점검합니다.
자주 묻는 질문
SIGIR 연구는 스키마 마크업이나 JSON-LD를 검증했나요? 아니요. 그 18개 요인 분류는 콘텐츠 일치도, 완전성, 신뢰성, 가독성, 경쟁 위치, 최신성, 목록 위치를 다룹니다. 구조화 데이터 형식은 검증된 범주에도 요인에도 없습니다. 논문의 분류표를 직접 확인해 뒷받침했습니다.
스키마 마크업은 AI 인용에 조금도 도움이 되지 않나요? 이용 가능한 최선의 대조 연구, 즉 Ahrefs가 2026년 5월에 1,885개 페이지를 4,000개 대조군과 비교한 연구에서는 JSON-LD 추가로 인한 의미 있는 인용 증가가 Google AI Overviews, Google AI Mode, ChatGPT 어디에서도 확인되지 않았습니다. 별도 검증에서는 주요 AI 모델 몇 가지가 실시간 검색 시 구조화 데이터를 읽지 않는다는 사실도 밝혀졌습니다. 그렇다고 스키마가 다른 국면에서 무가치하다는 뜻은 아닙니다. 인용량 레버가 아니라는 것뿐입니다.
화제가 된 글의 구체적인 숫자(6.3, 14, 4~8.6)는 어디서 온 것인가요? SIGIR 논문 결과표의 실제 오즈비와 비슷하지만, 그 숫자들은 스키마가 아니라 가격, 최신성, 사양·비교 요인에 속합니다. 논문은 수치를 하나의 평균으로 합치지 않고 모델별로 보고하며, 검증한 6개 LLM 사이에서 범위가 크게 달라집니다.
한 시간밖에 없다면 무엇부터 고쳐야 하나요? 네 가지 게이트키퍼입니다. 주제 일치, 가격, 타임스탬프, 목록 위치. 어느 하나라도 실패하면 페이지의 다른 모든 것과 무관하게 인용 가능성은 사라집니다.
스키마 작업을 완전히 그만두어야 하나요? 아니요. 리치 결과와 엔티티 명확성을 위해 유효한 상태로 유지하세요. 다만 AI 인용량이 실제 목표라면 게이트키퍼 수정보다 새 스키마 작업을 우선하지 마세요.
저자: Bennett Hayes(Auspia의 Applied GEO Analyst, 400건 이상의 구현 리뷰 담당). 실무적인 GEO 실행, 감사, 그리고 대조 연구가 실제로 무엇을 측정했는지에 근거한 구현 노트를 씁니다.




