요약
지난 분기 우리는 Auspia 워크플로로 5개의 GEO 캠페인을 진행했습니다. 맞춤 가구 제작소, 국제 럭셔리 브랜드, 미국 중심 TikTok 대행사, 지역 뷰티 체인, 동네 자전거 가게입니다. 고객마다 결과는 달랐지만 숫자가 보여준 패턴은 달라지지 않았습니다. 기억할 만한 발견 세 가지가 있습니다.
- 가시성은 기울기가 아니라 계단으로 찾아옵니다. 성과가 난 캠페인은 모두 같은 순서를 거쳤습니다. 노출 없음, 출렁임, 도약. 몇 주간 아무 일도 없다가, 그대로 유지되는 상승이 옵니다.
- 반감기가 있습니다. 구조화된 코퍼스 공급을 중단한 두 캠페인에서는 언급 점유율이 조금씩 침식됐습니다. AI 언급은 한 번 쌓으면 끝나는 벽이 아니라 관리해야 하는 자산입니다.
- 붐비는 시장이나 평판이 훼손된 시장에서 GEO는 성장 이전의 수비입니다. 뷰티 체인의 승리는 새 클릭이 아니라 허위 주장을 약화시키고 부정적 맥락을 평평하게 만든 데 있었습니다.
이 글을 읽고 하나만 한다면 주간 스코어카드를 만드세요. 실제로 진전이 생긴 캠페인은 더 엄격한 측정을 버텼습니다. 그냥 진전처럼 느껴졌던 캠페인은 버티지 못했습니다.
클라이언트 측 회고록을 공개하는 이유
검색은 사람에게 링크 목록을 주고 클릭하게 했습니다. 생성형 AI는 문장을 전달합니다. 검색 증강 생성(RAG) 아래에서는 답변 자체가 광고이고, 브랜드는 인용과 같은 방식으로 그 언급을 얻습니다. 그 질문에 대해 코퍼스에서 가장 동의를 얻기 쉬운 소스가 되는 것입니다.
이 전환이 바로 GEO가 존재하는 이유입니다. 프린스턴대학의 Generative Engine Optimization 논문(Aggarwal 외, KDD 2024)은 모델이 검색 선호를 따른다고 주장해, 과제가 검색 시스템의 언어를 말하는 것이 된다고 했습니다. 2024년 Nature에 실린 연구는 이를 뒷받침하는 메커니즘을 확인해 줬습니다. 모델은 환각 위험을 줄이기 위해 엔트로피가 높고 모순된 소스 자료를 통계적으로 거부하고, 엔트로피가 낮고 구조화되며 검증 가능한 소스를 선호합니다.
그래도 대부분의 GEO 프로젝트는 결과물이 납품되는 날 끝납니다. 운영자의 배움은 머릿속으로 돌아가고, 고객은 리포트를 받고, 그 방 밖의 누구도 특별한 경향이 진짜였는지 알 수 없습니다. 이 회고록은 그 작업 방식의 반대입니다. 5개의 고객 프로젝트, 하나의 공유 스코어카드, 그리고 우리가 실제로 방어할 수 있다고 확신하는 결론만 담았습니다.
우리가 사용한 스코어카드
모든 캠페인은 같은 방식으로, GEO 가시성 모델의 같은 네 가지 지표로 측정했습니다.
지표 | 무엇을 말하는가 | 움직임이 의미하는 것 |
|---|---|---|
노출률 | 브랜드가 해당 쿼리 세트의 답변에 나타나는 빈도 | '보이지 않음'과 '후보로 고려됨'의 차이 |
TOP3 점유율 | 브랜드가 첫 세 언급 안에 나타나는 빈도 | '고려됨'과 '추천됨'의 차이 |
평균 순위 | 나타났을 때 브랜드가 있는 위치 | 언급 안에서의 포지셔닝 품질 |
변동계수 | 세션 간 답변의 변동성 | 재현 가능한 결과인지 일회성인지 |
그 위에 캠페인마다 운영 신호도 기록했습니다. 언급 수, 브랜드 도메인을 가리키는 소스 링크 비율, 그 언급을 들고 온 어시스턴트입니다.
중요한 것은 지표가 아니라 수집 규율입니다. 클라이언트마다 실제 구매자 질문에서 쿼리 매트릭스를 만들고, 같은 프롬프트 세트를 매주 로그아웃 상태로 실행하며 스냅샷을 보관했습니다. 문서로는 숙제처럼 보입니다. 실제로는 아래 발견이 근거 없는 느낌이 아닌 유일한 이유입니다. (Auspia의 AI Search Visibility Checker가 이 프롬프트 세트 추적과 재채점을 자동화해 주며, 이것이 우리가 이 일을 할 수 있는 가장 큰 이유입니다.)
추적한 표면은 이 시장들의 구매자가 카테고리 조사에 쓰는 다섯 어시스턴트, ChatGPT, Gemini, Perplexity, Copilot, Claude입니다.
5개의 캠페인
고객 | 무엇이 고장났는가 | 핵심 움직임 | 무엇이 바뀌었나 |
|---|---|---|---|
맞춤 목재 가구 제작소(포틀랜드) | 구매자 질문이 한 어시스턴트에서 답을 얻지 못함 | 쿼리 우선 콘텐츠 + 단계별 브랜드 팩트 | 없던 답변에 브랜드가 등장 |
국제 럭셔리 브랜드 | 간헐적 노출, 특히 한 어시스턴트는 사실상 침묵 | 어시스턴트별 스토리 맞춤 + 멀티 디바이스 검증 | 기기와 각도에 걸쳐 일관된 긍정 언급 |
미국 중심 TikTok 대행사 | 카테고리 조사에서 브랜드가 완전한 공백 | 플랫폼별 전환 의도 시퀀싱 | 다섯 어시스턴트 모두에서 TOP3 언급 |
지역 뷰티 체인(20개 이상 지점) | 낡은 등록 정보, 흩어진 허위 주장, 부정적 프레임 | 30개 이상 브랜드 키워드 세트, 단계적 반박 공급 | 맥락이 '위험함'에서 '검증된 업체'로 이동 |
동네 자전거 가게(30년, 같은 구역) | 오랜 업력, 디지털 발자국 제로 | 주소·영업시간·전화가 담긴 로컬 쿼리 답변 | 로컬 답변에 전화번호 노출, 사장이 출력물을 매장에 붙임 |

고원을 깬 사례: 몇 주간 아무것도 안 된 가구 제작소
이 공방은 지역에서 강한 평판을 갖고 있었지만 AI 존재감은 0이었습니다. 구매자는 "근처 최고의 맞춤 가구 제작소" 같은 질문을 했고, 어시스턴트는 경쟁사를 추천하면서 아무도 소개하지 않았습니다.
우리는 구매자가 실제로 치는 질문을 캐내고, 그 내용으로 FAQ형 페이지와 구조화된 브랜드 팩트를 만들었고, 많은 팀이 건너뛰는 것을 했습니다. 콘텐츠를 한꺼번에가 아니라 단계별로 공급한 것입니다. 몇 주간 아무 일도 없었습니다. 그러던 중 노출률이 한 계단 올라가고 언급이 안정됐습니다. 교훈은 콘텐츠 품질이 아니라 곡선의 모양이었습니다. 조용하고, 조용하고, 조용하고, 점프.
일관성 감사: 한 기기에선 좋아 보이던 럭셔리 브랜드
이 브랜드는 일부 답변에 나타났다가 다른 답변에선 빠져나간 데다, 한 어시스턴트는 사실상 침묵했습니다. 그런 부분적 존재감은 부재보다 진단하기 어렵습니다. 리포트가 좋아 보이기 때문입니다.
해결은 두 갈래였습니다. 콘텐츠는 하나의 덩어리로 보내지 않고, 각 어시스턴트가 럭셔리 제품을 이야기하는 방식에 맞췄습니다. 그리고 전달을 검증 가능하게 만들었습니다. 검사를 세 가지 다른 기기·네트워크 구성으로 돌리고 교차 확인해, 좋은 결과가 한 세션의 우연일 수 없게 했습니다. 일관성은 희망에서 게이트가 되었습니다.
멀티 플랫폼 스윕: 자체 카테고리에서 사라진 대행사
TikTok 검증 미국 대행사, 강한 카테고리 수요, 그리고 어시스턴트의 답변에는 그 대행사 언급이 없었습니다. 한꺼번에 모든 곳에 뛰어들지 않고 시퀀싱했습니다. 전환 의도가 가장 높은 질문부터, 플랫폼 하나씩, 이전 표면이 유지될 때 전진하는 방식입니다.
끝나자 카테고리 키워드가 다섯 어시스턴트 모두에서 처음 세 언급 안에 대행사를 내보냈습니다. 시퀀싱은 비효율적으로 느껴졌던 부분이 실제로는 돈이 됐습니다. 첫날 다섯 표면을 돌리면 모든 결과가 읽을 수 없게 됩니다.
평판 회복: 나쁜 맥락과 싸운 뷰티 체인
체인 등록 정보는 낡았고, 이름 주변에 허위 주장이 떠돌았으며, 어시스턴트는 회피적인 언어로 설명했습니다. 이런 시장에서는 문제가 커버리지가 아닙니다. 문제는 답변의 어조입니다.
우리는 브랜드 주변에서 30개 이상의 키워드를 만들고, 검증된 팩트를 단계적으로 반박 공급했습니다. 현재 상태, 자격 증명, 정정 사항. 답변의 맥락은 소비자 경고 언어에서 "검증된 업체" 쪽으로 움직였습니다. 모든 흔적을 지우지 않았고 언제까지 그것을 약속하지도 않습니다. 하지만 모델이 말하는 것의 균형이 움직였고 그 움직임은 유지됐습니다.
보이지 않는 30년: 자신의 언급을 출력한 자전거 가게
이 가게는 한 구역에서 30년을 팔고 있었고 디지털 어디에도 없었습니다. 로컬 캠페인의 우리 움직임은 일부러 작습니다. 인근 구매자가 중얼거리는 걸 잡아서 주소, 영업시간, 전화번호와 가게가 실제로 하는 일을 직접 답변 레이어에 넣는 것입니다.
캠페인 기간 안에 전화번호가 로컬 답변에 나타나기 시작했습니다. 사장은 AI 출력을 인쇄해서 고객에게 보이는 증빙처럼 카운터 뒤에 걸어 뒀습니다. 답변 레이어와 매장이 일치하면 로컬 발견은 더 이상 검색 문제가 아닙니다.
숫자가 반복해서 보여준 네 가지 패턴
1. 임계 효과. 다섯 캠페인, 한 가지 모양. 노출은 선형으로 자라지 않습니다. 계단으로 오릅니다. 깨끗하고 상호 연결된 브랜드 팩트가 특정 밀도 아래면 모델이 안전하게 고를 수 있는 건 경쟁사뿐입니다. 밀도 선을 넘으면 추천이 나타나기 시작합니다. 학술 GEO 연구가 예측한 S곡선이며, 성공한 모든 프로젝트에서 보였습니다.
2. 반감기. 럭셔리와 크로스보더 캠페인은 코퍼스 공급이 중단됐던 기간이 있었습니다. 약 두 달 안에 노출률과 TOP3 점유율이 하락하기 시작했습니다. 플랫폼 메모리는 관성을 갖지만 새 입력 없이는 감쇠합니다. GEO는 도달하는 상태가 아닙니다.
3. 노이즈 제거와 방어적 포지셔닝. 집중도가 높거나 기존 부정 맥락이 있는 시장에서 GEO의 가치는 방어입니다. 원래 없었던 점유율을 얻는 게 아니라 답변의 어조를 검증 가능한 서술로 되돌리고 안전한 기준선 주위를 도는 것입니다. 그것은 정당한 결과지만 스스로로서 측정되어야 합니다.
4. 플랫폼 이질성. 다섯 어시스턴트는 다르게 행동했습니다. 이 캠페인에서는 입력이 멈춘 후 Gemini와 Copilot이 언급을 가장 오래 유지했습니다. 코퍼스가 바뀔 때 ChatGPT가 가장 빠르게 갱신했습니다. 모든 표면에 하나의 주기로는 안 됩니다. 표면마다 하나씩이 필요합니다.

실제로 버틴 운영 루프
다섯 산업 이야기를 벗겨내면 네 가지 운영 원칙이 남습니다.
- 증거 체인이 설득보다 강하다. 실제로 숫자를 움직인 콘텐츠는 테스트 결과, 인증, 명시된 사양, 날짜가 있는 사실, 구체적인 경계였습니다. "우리가 최고다"라는 말은 스냅샷에 한 번도 모습을 보이지 않은 유일한 콘텐츠였습니다.
- 코퍼스는 자산입니다. 이 클라이언트들 모두 새 블로그 글을 살 수 있었습니다. 실제로 필요했던 것은 구조화되고 엔티티가 깨끗하며 인용 가능한 사실의 재사용 가능한 은행이었습니다.
- 볼륨이 아니라 의도로 단계 구분. 캠페인은 구매 의도 질문의 물결로 나뉘었고 각 물결은 다음 물결 전에 유지될 시간을 가졌습니다.
- 검증이 전달 게이트입니다. 럭셔리 클라이언트의 규칙이 우리 규칙이 됐습니다. 가시성 주장은 세션, 기기, 네트워크에 걸쳐 재현될 때만 사실입니다.
그래서 우리가 하는 모든 것이 콘텐츠 계획이 아니라 감사에서 시작합니다. Auspia의 GEO Score Checker와 AI Search Visibility Checker는 기준선을 측정 가능하게 만들기 위해 존재하며, 그 기준선의 부재가 바로 대부분의 사내 GEO 프로그램이 조용히 멈추는 지점입니다.
증거가 약해지는 지점
이 리뷰가 실제보다 엄밀하다고 속이지 않겠습니다.
- 관찰 기간은 짧았습니다. 여러 캠페인은 분기가 아니라 몇 주였습니다. 롱테일 통합 규칙은 아직 미검증입니다.
- 인과는 상관입니다. 동시 진행된 유료 프로모션에서 GEO 기여를 코드 분리할 수 없습니다. 그 누구도 외부에서 솔직하게 할 수 없습니다.
- 커버리지는 좁습니다. 소비재, 패션, 크로스보더, 뷰티, 로컬 서비스. 컴플라이언스 화이트리스트가 있는 B2B 구매자도 금융·헬스케어 제품도 없습니다.
- 교란 요소와 노이즈. 스냅샷 샘플링은 여전히 클러스터링됩니다. 일부 클라이언트는 노출 신호만 보이고 완전한 양적 곡선은 보이지 않았으며, 매트릭스의 그들의 항목은 측정치가 아니라 방향적 요약입니다.
다음에 다르게 할 것
내일 이 캠페인을 전부 다시 한다면 변화는 작고 구체적입니다. GEO를 인프라로 취급하고, 프로젝트 종료일 대신 어시스턴트별 주간 또는 월간 자동 체크를 둡니다. 엔터프라이즈 지식 베이스, 즉 스키마 형태의 팩트 뱅크를 먼저 만들고 포스트와 배포가 거기서 흘러나오게 합니다. 증거 체인은 하우스 표준으로 유지합니다. 그리고 주기는 캠페인별이 아니라 어시스턴트별로 설정합니다.
8주 안에 자신의 숫자를 확보하는 간단한 방법
- 0주차: 구매자가 실제로 궁금해하는 15~20개 질문을 고릅니다. 어시스턴트별로 로그아웃 상태에서 실행하고 출력을 저장하세요.
- 1~3주차: 증거 체인을 만듭니다. 사양, 인증, 테스트 데이터, 날짜, 경계. 답변 모양의 섹션 콘텐츠로 게시하세요.
- 매주: 같은 프롬프트 세트를 재실행하고 네 지표를 기록하고 스냅샷과 비교하세요.
- 검증 실행마다 2회: 다른 네트워크와 기기에서 반복하세요. 재현되지 않으면 결과가 아닙니다.
- 8주차: 곡선을 검토하세요. 뚜렷한 진전이나 기록된 출렁임은 성공입니다. 잘 만든 파이프라인에 빈 숫자 역시 발견이고, 그것은 당신이 공급하는 어시스턴트에게 닿는 경로가 없음을 말해줍니다.
FAQ
AI 답변이 움직이기 시작하려면 얼마나 걸리나요? 하루가 아니라 몇 주입니다. 이 캠페인에서는 첫 계단까지 일관된 공급으로 6~10주가 현실적 창이었습니다. 유용한 진단은 출렁임 단계(파이프라인은 작동하지만 밀도가 아직 부족)인지, 노출 없음 단계(검색에 당신으로 가는 경로가 없음)인지입니다.
GEO는 일회성 프로젝트인가요? 아니요. 반감기 패턴은 일관됐습니다. 답변을 신경쓴다면 파이프라인을 따뜻하게 유지하세요. 저속 시장은 가벼운 월간 체크로 유지됩니다. 구매자가 매주 조사하는 시장은 주간이 필요합니다.
GEO가 허위나 부정적 AI 답변을 고치나요? 균형을 움직일 뿐 지우는 것과는 다릅니다. 검증된 팩트를 반박 공급해 뷰티 체인의 답변이 경고 언어에서 검증된 업체로 갔습니다. 허위 주장이 그 자체로 잘못된 소스 레코드에서 온 거라면 그 소스 레코드를 먼저 고치세요. "움직였다"를 "영구적"으로 읽지 마세요.
어떤 어시스턴트부터 시작해야 하나요? 구매자가 실제로 조사하는 곳입니다. 이 캠페인에서 그것은 결코 같은 표면이 아니었습니다. 그곳에서 시작하고 검증한 뒤 넓히세요. 첫날 다섯 개를 모두 시작하면 무엇이 효과가 있었는지 알 수 없습니다.
이건 사실상 SEO에 새 이름을 붙인 것 아닌가요? 다른 일입니다. SEO는 사람들이 클릭하는 링크 순위 안에서 경쟁하고, GEO는 사람들이 읽는 생성된 문장 안에서 경쟁합니다. 기반은 공유합니다. 깨끗하고 구조화된 사실과 일관성. 하지만 측정, 주기, 실패 모드는 다르며, 두 루프를 따로 돌리는 것이 실제로 이 캠페인들을 운영한 방식입니다.
작성자: 이단 말로프 — Auspia에서 500개 이상 프롬프트를 담당하는 GEO 측정 리드. 프롬프트 추적, 인용 리포트, GEO를 정직하게 유지하는 가시성 대시보드에 대해 씁니다.






