이번 달 검색 팀 사이에 아주 자신 있는 숫자 하나가 붙은 주장이 돌고 있습니다. 비교 쿼리에서 브랜드 A를 먼저 쓰면 Google의 AI Overview가 약 80% 확률로 브랜드 A를 추천한다는 것입니다. 순서를 뒤집으면 추천도 뒤집힙니다. 더 크고 오래된 브랜드라고 해서 예외가 아닙니다.
매력적인 이야기입니다. AI 답변을 추적하는 사람이라면 누구나 본 적 있는 현상을 설명해 주기 때문입니다. 비교 쿼리의 답변은 검색 결과 목록과 전혀 닮지 않았고, Google 밖에서는 그것이 어떻게 조립됐는지 들여다볼 방법이 없습니다. 그래서 심심한 쪽을 택했습니다. 검증입니다. 2026년 9월 11일, 우리는 실제로 작동 중인 Google AI Overview에 비교 쿼리 102개를 던졌습니다. 브랜드 16쌍, 두 가지 어순, 순서당 2~3회 반복이었고 모든 답변과 인용 출처를 저장했습니다.
결과는 이렇습니다. 어순 때문에 추천이 바뀐 쌍은 16쌍 중 0쌍이었습니다. 쿼리에서 먼저 쓴 브랜드가 답변에서도 먼저 언급된 비율은 49%로, 동전 던지기와 같은 수준입니다. 실제로 답변을 바꾼 것은 쿼리의 표현 방식과 어느 Google 화면이 답하느냐였습니다.
퍼진 주장의 내용
이번 달 돌고 있는 버전은 대략 이렇습니다.
- "브랜드 A vs 브랜드 B" AI Overview는 약 80% 확률로 브랜드 A로 시작하며 브랜드 A를 추천한다.
- "브랜드 B vs 브랜드 A"는 그 거울상이 된다.
- 브랜드 A가 브랜드 B보다 훨씬 크고 오래됐어도 성립한다.
- 제시된 메커니즘은 이렇습니다. AI Overview가 쿼리를 여러 하위 검색으로 확장하는데, 쿼리에서 처음 언급된 브랜드가 그 하위 검색을 고정한다는 것입니다.
마지막 항목이 이 주장을 그럴듯하게 만들고, 동시에 가장 근거가 탄탄한 부분입니다.
메커니즘은 실재한다. 그래서 이 주장은 퍼진다
Google이 2026년 5월에 공개한 생성형 AI 기능 가이드는 쿼리 팬아웃을 인정합니다. AI Overview와 AI Mode는 하나의 쿼리를 여러 관련 하위 쿼리로 확장하고, 인덱스에 병렬로 실행한 뒤 결과를 종합해 하나의 답변으로 합성할 수 있습니다. 하위 쿼리가 무엇이었는지는 Search Console을 포함해 어디에도 보고되지 않습니다. 즉 AI Overview를 보고 있다는 것은 관찰할 수 없는 과정의 출력을 보고 있다는 뜻입니다.
언어 모델의 순서 효과도 실재하며, 동료 심사를 거친 연구가 있습니다. 2026년 8월 PNAS Nexus에 실린 연구는 9개 모델을 이력서 비교와 색상 선택 과제로 검증했고, 위치 효과가 단순한 동점 처리용이 아니라는 것을 보였습니다. 선택지 순서를 바꾸면 모델의 선호 자체가 뒤집혀 더 나쁜 선택지를 고르는 경우도 있었습니다. Columbia Business School의 연구는 반대 방향의 연관 패턴을 찾았습니다. ChatGPT는 5,447개 프롬프트에서 약 63% 확률로 목록의 첫 번째 선택지를 골랐고, 더 단순한 설정의 64,800회 시행에서도 64.29%로 같은 결과가 재현됐습니다.
두 발견을 나란히 읽으면 그 주장은 자연스러운 다음 단계처럼 보입니다. 팬아웃은 존재하고, LLM에는 순서 습관이 있으니, 어순이 브랜드 추천을 결정할 것이다.
문제는 그 마지막 단계입니다. 이 실험들은 모델에게 선택지 목록을 평가해 하나를 고르라고 요구하는 과제입니다. AI Overview의 비교 쿼리는 그 과제가 아닙니다. 서드파티 페이지에 근거를 두는 검색 시스템이 답하는 종합 요청입니다. 그래서 이 주장은 반복할 대상이 아니라 검증할 대상이었습니다.
검증 설계
쿼리 | Google AI Overview 대상 102개, AI Mode 대상 18개 추가 |
브랜드 쌍 | 16쌍(소프트웨어 10쌍, 소비재 6쌍) |
어순 | 양방향, 순서당 2~3회 반복 |
표현 | 전 쌍 |
화면 | Google 검색, 미국, 영어, 데스크톱 |
날짜 | 2026년 9월 11일(단일 일자) |
수집 | SERP API 응답, 요청당 쿼리 1개, AI Overview 텍스트 요소와 전체 참조 목록 저장 |
비용 | API 크레딧 약 0.43달러 |
설계에서 중요한 선택이 두 가지 있었습니다. 첫째, 각 쿼리를 두세 번 실행했습니다. 무작위성이 조금이라도 있는 시스템에서 한 번 뒤집힌 답변은 아무것도 증명하지 못합니다. 둘째, 답변이 무엇을 말했는지뿐 아니라 어떻게 만들어졌는지를 기록했습니다. 어느 브랜드가 먼저 언급되는지, 각 브랜드가 몇 번 언급되는지, 인용 페이지가 어떤 모습인지, 인용 중 몇 개가 각 브랜드의 자사 도메인을 가리키는지입니다.
16쌍은 두 상황을 아우르도록 골랐습니다. 두 브랜드 모두 사람들이 조사하는 개체인 소프트웨어 비교(Notion vs Asana, Slack vs Microsoft Teams, Semrush vs Ahrefs, Figma vs Sketch)와 더 큰 브랜드가 뻔한 소비재 비교(Nike vs Adidas, Coca-Cola vs Pepsi, iPhone vs Samsung Galaxy, Netflix vs Disney+, Toyota vs Honda, iRobot Roomba vs Roborock)입니다.
결과 1: 답변은 어순을 따르지 않았다
측정 가능한 첫 언급을 낸 100회 실행에서 쿼리에 먼저 쓴 브랜드가 먼저 언급된 경우는 49회, 49%였습니다.
쌍 | "A vs B"에서 먼저 언급 | "B vs A"에서 먼저 언급 | 어순으로 바뀌었나 |
|---|---|---|---|
Notion vs Asana | Asana | Asana | 아니오 |
Slack vs Microsoft Teams | Microsoft Teams | Microsoft Teams | 아니오 |
Wix vs Squarespace | Wix | Wix | 아니오 |
Canva vs Adobe Express | Canva | Canva | 아니오 |
Mailchimp vs Klaviyo | Klaviyo | Klaviyo | 아니오 |
Airtable vs Monday.com | Monday.com | Monday.com | 아니오 |
Shopify vs WooCommerce | Shopify | Shopify | 아니오 |
Semrush vs Ahrefs | Semrush | Semrush | 아니오 |
Figma vs Sketch | Figma | Figma | 아니오 |
Zoom vs Google Meet | Google Meet | Google Meet | 아니오 |
Nike vs Adidas | Nike | Nike | 아니오 |
Coca-Cola vs Pepsi | Coca-Cola | Coca-Cola | 아니오 |
iPhone vs Samsung Galaxy | Samsung Galaxy | Samsung Galaxy | 아니오 |
Netflix vs Disney+ | Netflix | Netflix | 아니오 |
Toyota vs Honda | Toyota | Toyota | 아니오 |
iRobot Roomba vs Roborock | Roborock | Roborock | 아니오 |
다수 의견이 뒤집힌 쌍은 하나도 없습니다. 답변이 선호를 가질 때 그것은 두 어순 모두에서 유지됐습니다. AI Overview는 "Notion vs Asana"와 "Asana vs Notion" 모두 Asana로 시작했고, Airtable 비교에서는 양쪽 모두 Monday.com, Zoom 비교에서는 양쪽 모두 Google Meet으로 시작했습니다. Nike는 Adidas를 상대로 두 어순 모두에서 앞섰고, Samsung Galaxy는 iPhone을 상대로 두 어순 모두에서 앞섰습니다.
반복 실행 간 일치는 100회 중 93회였습니다. 일곱 번의 예외 중 여섯 번은 다른 표현으로 돌린 한 쌍에서 나왔는데, 이것이 사실 진짜 이야기입니다. 일곱 번째는 Slack vs Microsoft Teams를 한 번 실행했을 때 Teams가 아니라 Slack으로 시작한 경우였고, 다음 두 번은 Teams로 돌아갔습니다.
이 측정으로 결론이 나지 않는 것이 하나 있습니다. 답변을 앞에서 이끄는 것과 추천받는 것은 다릅니다. 그래서 추천 표현도 세어 봤습니다. 소프트웨어 쌍 60회 전체 실행에서 승리 계열 단어(wins, better choice, recommend, stronger, go-to)를 쓴 문장은 쿼리 선두 브랜드가 40개, 후순위 브랜드가 39개였습니다. 완전한 무승부입니다.

결과 2: 두 답변은 대개 같은 답변이었다
어순이 하위 검색을 고정한다면 같은 쿼리의 두 버전은 서로 다른 페이지를 가져와야 하고 답변도 갈라져야 합니다. 대부분 갈라지지 않았습니다.
소프트웨어 10쌍 중 8쌍에서 "A vs B"와 "B vs A"의 AI Overview는 단어 하나까지 같았습니다. Semrush vs Ahrefs의 첫 문장을 두 어순에서 나란히 봅니다.
Semrush는 올인원 마케팅 플랫폼이고, Ahrefs는 SEO와 백링크 분석에 특화된 도구입니다. (원문은 영어)
같은 문장, 같은 사실 순서, 같은 "Semrush를 고른다면… / Ahrefs를 고른다면…" 마무리로, 쿼리가 어느 브랜드로 시작했든 달라지지 않았습니다. 실제로 문장이 어긋난 쌍은 두 개뿐이었습니다. Slack vs Microsoft Teams와 Shopify vs WooCommerce이고, Shopify의 경우 결론이 아니라 도입 문단의 표현만 달라졌습니다.
뒷받침 수치도 같은 방향을 가리킵니다. 소프트웨어 쌍 실행에서 나온 806개 참조 항목 중 두 브랜드 자사 도메인 인용은 36대 36이었습니다. 두 브랜드 이름을 모두 담은 참조 페이지 제목에서 쿼리 선두 브랜드가 먼저 온 경우는 392회, 후순위 브랜드가 먼저 온 경우는 396회로 49.7%였습니다. 이것도 동전 던지기입니다. 브랜드 총 언급 수는 337대 336, 즉 50.1% 대 49.9%였습니다.
쿼리 맨 앞에 온 브랜드가 검색을 유도하고 있는 시스템이라면 36대 36 인용 비율도, 단어 하나까지 같은 문장도 나오지 않습니다.
실제로 답변을 바꾼 것
두 가지였고, 둘 다 어순보다 쓸모 있습니다.
표현 방식. 세 쌍에 대해 "vs" 쿼리와 which is better, X or Y 쿼리를 두 어순으로 모두 돌렸습니다. AI Overview는 이 둘을 서로 다른 질문으로 취급했고, 그렇게 취급하는 방식이 두 어순에서 동일했습니다.
Shopify와 WooCommerce에서 Shopify vs WooCommerce는 제품 설명으로 시작했습니다. Shopify는 올인원 호스팅 스토어 빌더이고, 답변은 차이점을 훑었습니다. Which is better, Shopify or WooCommerce는 순위를 매기기를 거부하며 시작했습니다. 어느 쪽도 객관적으로 낫지 않고 필요에 달렸다는 것입니다. 같은 네 번의 실행, 같은 쌍, 같은 날, 정반대의 첫인상이었고 이를 이끈 것은 위치가 아니라 표현이었습니다.
Semrush와 Ahrefs에서는 which is better 답변에 명시적인 판정 문장이 있었고, 그 모두가 Ahrefs를 인정했습니다. 5회 중 5회였고, 쿼리가 Semrush or Ahrefs든 Ahrefs or Semrush든 같았습니다. 비교 코퍼스가 Ahrefs를 더 강한 백링크 도구로 취급한다는 사실 앞에서 어순은 무관했습니다.
화면. 같은 쿼리 중 18개를 대화형 화면인 Google AI Mode로도 실행했습니다. 그 동작은 AI Overview와 다르며, 순서 민감도처럼 보이지만 실제로는 아닙니다. Semrush vs Ahrefs에서 AI Mode는 쿼리 어순에 따라 Both Semrush and Ahrefs are… 또는 Both Ahrefs and Semrush are…로 시작해 어순을 그대로 비췄습니다. 그리고 어떤 변형에 도달했는지 보십시오. Both X and Y이며 순위 함의가 전혀 없는 구문입니다. 문장을 이끄는 이름은 프롬프트의 문체적 반향일 뿐입니다.
그 반향 아래에서 AI Mode의 내용은 AI Overview보다 훨씬 불안정했습니다. 같은 어순 안에서 실행 간 텍스트 유사도는 0.30~0.36에 불과했고, 어순을 넘나들면 0.38이었습니다. AI Overview가 대부분의 쌍에서 동일한 텍스트를 낸 것과 대조적입니다. 세 쌍 중 두 쌍에서 AI Mode의 답변은 어순을 넘어 단어 하나까지 같았고, Shopify의 경우 AI Mode는 두 번 모두 WooCommerce로, AI Overview는 두 번 모두 Shopify로 시작을 고정했습니다. 화면마다 굳어진 표현 습관이 있고, 그 습관은 서로 같지 않습니다.

어순 이야기가 완전한 허구는 아닌 이유
어순에 따라 움직인 측정이 하나 있었고, 그것은 대부분의 사람이 실제로 지켜보는 지표입니다. 전통적인 검색 결과 목록입니다.
소프트웨어 10쌍 중 5쌍에서 상위 3개 전통적 유기 결과가 "A vs B"와 "B vs A"에서 달랐습니다. AI Overview가 두 어순에서 동일했던 쌍도 포함됩니다. Reddit은 대부분의 소프트웨어 비교에서 상위권에 올랐고, 어떤 스레드가 나타나는지는 표현에 따라 바뀌었습니다. 즉 비교 쿼리에 대한 Google 검색에는 실제 순서 민감도가 있습니다. 그것은 AI 답변 아래층에 있고 추천 자체에 있지는 않습니다. 이 구분이 이 검증을 돌린 이유 전체이며, 우리가 예상했던 발견도 아닙니다.
이 구분은 리포팅에도 중요합니다. 순위 추적기에서 브랜드 쿼리와 비브랜드 비교 쿼리 사이에 순위가 흔들린다면 그것은 실재하는 효과입니다. 다만 그 주장이 설명하는 효과가 아니고, 그것을 최적화해도 AI Overview가 당신에 대해 말하는 내용은 바뀌지 않습니다.
데이터가 가리키는 진짜 지렛대
우리 실행에서 가장 선명한 신호는 쿼리 구성과 무관했습니다. 각 답변이 만들어낸 비교 코퍼스 자체였습니다.
Airtable vs Monday.com에서 인용 출처에는 Monday.com 자사 페이지가 18개, Airtable 자사 페이지는 0개였습니다. 두 어순 모두 같습니다. Mailchimp vs Klaviyo에서는 Mailchimp 6개, Klaviyo 0개였습니다. Shopify vs WooCommerce에서는 WooCommerce 3개, Shopify 0개였습니다. 반면 어느 브랜드의 자사 도메인도 전혀 나오지 않은 쌍도 많았고, 그런 경우 답변은 서드파티 비교 글, 리뷰 사이트, 포럼 스레드에서 조립됐습니다.
이 패턴은 검색이 실제로 작동하는 방식과 맞습니다. 모델은 당신이 어느 이름을 먼저 입력했는지 관심이 없습니다. 어떤 페이지가 존재하고 각 브랜드를 어떻게 설명하는지에 관심이 있습니다. 브랜드가 비교 콘텐츠를 직접 갖고 있으면 그 페이지들이 끌려 들어옵니다. 갖고 있지 않으면 누가 물어봐도 답변에서 빠집니다.
직접 어순 반전 테스트를 돌리는 방법
15분이면 되고 API도 필요 없습니다.
- 우리 브랜드와 실제 경쟁사가 이름을 올리는 비교 쿼리 다섯 개를 고른다.
- 각각을 두 어순으로, 어순마다 두 번씩 실행한다. 쌍당 네 개의 답변, 총 열 쌍의 답변이 된다.
- 읽기 전에 답변을 저장한다. 전문과 인용 출처를 캡처하거나 복사한다.
- 두 가지를 따로 비교한다. 어느 브랜드가 먼저 언급됐는지, 그리고 답변이 각 브랜드에 대해 무엇을 말했는지. 우리가 흥미로운 신호를 찾은 곳은 어순이 안정적이고 내용이 그렇지 않았던 지점입니다.
- 문장뿐 아니라 인용 목록을 본다. 경쟁사 자사 도메인이 반복해서 나타나고 우리 도메인이 나타나지 않는다면 실제 병목을 찾은 것입니다.
AI Overview Citation Checker는 어떤 쿼리에 대해 AI Overview가 어떤 페이지를 인용하는지 보여줍니다. 우리 도메인이 인용 풀에 들어 있는지 가장 빠르게 확인하는 방법입니다.
결론을 내리기 전에 최소 두 번, 다른 날에 실행하십시오. 우리 자체 실행 간 일치율은 100%가 아니라 93%였고, 한 번 뒤집힌 실행은 그대로 자신감 있는 블로그 글이 되는 종류의 잡음입니다.
이 결과를 어떻게 쓸 것인가
어순을 기준으로 비교 페이지를 재구성하지 마십시오. AI Overview의 추천을 바꾼다는 증거가 없고, 설령 Google이 나중에 가중치를 둔다 해도 수정은 단어 하나 바꾸는 일이며 당신의 실제 위치에 대해 알려주는 것은 없습니다.
표현 방식은 실제 변수로 다루십시오. X vs Y와 which is better, X or Y는 서로 다른 쿼리이고 다른 답변을 냅니다. 구매자가 비교를 질문 형태로 한다면 스펙 대조표가 아니라 그 질문에 답하는 콘텐츠가 필요합니다.
관심 있는 비교의 인용에 우리 브랜드 자체 페이지가 나오는지 확인하십시오. 우리가 본 18대 0 차이는 이 데이터셋에서 가장 실행 가능한 숫자이고, 프롬프트 문구가 아니라 퍼블리싱에 관한 이야기입니다.
이미 첫 언급 지표가 있다면 유지하되, 답변이 무엇을 말하는지에 대한 기술로 다루고 당길 수 있는 지렛대로 다루지 마십시오. 우리 데이터에서 그것은 쿼리가 아니라 코퍼스를 따른 동전 던지기였습니다.
한계
이것은 한 지역과 언어, 데스크톱에서, 브라우저 세션이 아니라 SERP API로 수집한 하루치 데이터이며 브랜드 16쌍을 다룹니다. 검색 결과는 개인화, 시간, 기기에 따라 달라지고 하루치로는 미래의 변화를 배제할 수 없습니다.
우리가 측정한 것은 어느 브랜드가 먼저 언급되는지, 얼마나 자주 언급되는지, 어떤 출처가 인용되는지입니다. 어느 것도 독자에게 답변이 얼마나 설득력 있는지를 직접 재는 값이 아니며, 우리 브랜드를 먼저 언급한 답변도 다른 쪽이 이긴다는 인상을 남길 수 있습니다.
AI Mode 표본은 세 쌍 18개 쿼리로, 화면이 다르게 동작하는 것을 보기에는 충분하고 수치화하기에는 부족합니다. 그 절은 비율이 아니라 방향으로 읽으십시오.
마지막으로 원래 이야기의 메커니즘 주장은 외부에서 검증할 수 없는 상태로 남습니다. Google은 팬아웃이 일어난다고 인정하면서 하위 쿼리를 공개하지 않으므로, 당신의 쿼리가 어떤 하위 쿼리를 만들었는지 보여줄 수 있는 사람은 없습니다. 우리 검증은 어순을 뒤집어도 출력이 바뀌지 않았다는 것을 보일 수 있습니다. 왜 그런지는 보일 수 없습니다.
FAQ
Google 쿼리의 어순이 AI Overview에 영향을 주나요? 우리 검증에서는 아니었습니다. 브랜드 16쌍을 두 어순으로 다룬 AI Overview 쿼리 102개에서 쿼리 선두 브랜드가 먼저 언급된 비율은 49%였고, 쿼리를 뒤집었을 때 답변 방향이 바뀐 쌍은 없었습니다. 소프트웨어 10쌍 중 8쌍은 두 어순에서 단어 하나까지 같은 답변을 냈습니다.
어순이 AI 추천에 영향을 준다는 보고는 왜 나오나요? 목록에서 하나를 고르라고 요구받은 언어 모델에서 순서 효과가 문서화되어 있고, 공개된 연구에서는 첫 번째 선택지가 약 63% 확률로 선택됩니다. 또 Google의 쿼리 팬아웃은 검색 과정을 보이지 않게 만듭니다. 두 사실 모두 실제입니다. 그러나 어느 것도 AI Overview의 비교 쿼리에서 이름 순서를 바꾸면 브랜드가 바뀐다는 뜻은 아닙니다.
AI Overview의 비교 쿼리에서 실제로 바뀌는 것은 무엇인가요? 표현 방식과 화면입니다. Shopify vs WooCommerce는 두 어순 모두에서 제품 중심 답변을 냈고, which is better, Shopify or WooCommerce는 두 어순 모두에서 "어느 쪽도 객관적으로 낫지 않다"는 답변을 냈습니다. 같은 쿼리를 AI Mode로 돌리면 또 다른 프레이밍으로 돌아왔고 실행 간 변동도 훨씬 컸습니다.
AI Overview의 첫 언급을 위해 최적화할 가치가 있나요? 지켜보되 최적화하지는 마십시오. 우리 데이터에서 첫 언급은 쿼리에서 통제한 무엇이 아니라 출처 코퍼스를 따랐습니다. 통제 가능한 변수는 우리 비교 페이지가 인용 풀에 들어 있는지 여부입니다. 우리가 검증한 한 쌍은 경쟁사 자사 인용 18개와 다른 브랜드 0개를 기록했습니다.
관련 읽을거리
저자: Ethan Marlowe, Auspia에서 500개 이상의 프롬프트를 아우르는 GEO 측정 리드. AI 가시성 측정, 프롬프트 세트 설계, 두 번째 검토를 견디는 테스트 설계를 씁니다.




