AI가 우리 홈페이지를 못 읽는 걸까요, 읽을 게 없는 걸까요? — 사이트 133곳 실측
MEPiX 미픽스 진단 이력에 쌓인 사이트 133곳을 세어봤어요. 항목별 점검이 끝난 93곳 기준으로, 첫 문단에 답을 먼저 쓰는 구조는 97.8%가 갖췄는데 주장의 출처를 밝힌 글이 있는 곳은 16.1%뿐이었습니다. AI 로봇을 막아둔 곳은 11.8%. 구조는 됐고, 비어 있는 건 근거였어요.

이 글의 목차
한 문장으로 답하면요
구조는 거의 다 갖춰져 있었어요. 비어 있는 건 '근거'였습니다.
MEPiX 미픽스 진단 이력에 쌓인 사이트 133곳을 모아서 세어봤어요(사이트 주인이 직접 신청한 곳과 저희가 시험 삼아 넣어 본 곳이 섞여 있어요). 첫 문단에 답을 먼저 쓰는 구조는 97.8%가 이미 갖추고 있었는데, 주장의 출처를 밝힌 글이 있는 곳은 16.1%뿐이었습니다.
많은 분들이 걱정하시는 "혹시 AI가 우리를 못 읽게 막혀 있나?"는 11.8%였어요. 열에 아홉은 문이 열려 있었습니다. 진짜 비어 있는 쪽은 AI가 가져갈 근거였어요.
어떻게 셌나요?
- 표본: 미픽스 진단 이력 중 분석이 끝난 주소 133곳 (2026년 6월 17일 ~ 8월 26일)
- 문 점검(기계가 읽음): 로봇 안내 파일(
robots.txt)에서GPTBot·OAI-SearchBot·ChatGPT-User·ClaudeBot·anthropic-ai·PerplexityBot·Google-Extended·Applebot-Extended8종의 차단 여부를 확인했어요. llms.txt 파일과 구조화 데이터도 기계가 읽었습니다. - 글 점검(AI가 읽음): '첫 문단에 답이 있는지·출처를 밝혔는지·숫자를 썼는지' 세 가지는 AI가 본문을 읽고 판단한 값이에요. 사람이 볼 때와 다르게 매겨진 경우가 있을 수 있어요.
- 항목마다 점검한 곳의 수가 달라요. 그 점검이 붙기 전(6월 22일 이전)에 진단된 곳은 값이 아예 없어서 분모에서 뺐습니다 — 문·글 점검은 93곳이 분모예요. 구조화 데이터는 112곳인데, 빠진 21곳 중 6곳은 기능이 붙은 뒤인데도 홈 화면 원본을 읽지 못해 값이 비었어요. 읽기 어려운 사이트가 빠진 만큼 50.0%는 실제보다 조금 높게 나왔을 수 있습니다.
- 같은 주소를 여러 번 진단한 경우 첫 진단 결과로 셌어요. (마지막 진단 기준으로 세면 막힌 곳이 10곳이 돼요. 그사이 설정을 푼 곳이 있다는 뜻이에요.)
- 개별 사이트 이름은 공개하지 않아요. 전부 합쳐 비율로만 봅니다.
미리 밝혀 둘 한계가 세 가지 있어요.
- 무작위 표본이 아니에요. 사이트 주인이 직접 신청한 곳도 있고, 저희가 서비스를 만들면서 시험 삼아 진단해 본 곳도 섞여 있어요. 그러니 아래 숫자는 한국 웹 전체의 평균이 아니라 미픽스 진단 이력에 쌓인 사이트들의 상태로 읽어 주세요.
- 대부분 국내 사이트지만 해외 사이트도 일부 섞여 있어요. 그리고 저희가 직접 운영하거나 관계된 도메인 몇 곳도 표본에 들어 있습니다(미픽스 홈페이지 포함). 그중 1곳은 아래 '로봇을 막은 11곳'에도 들어 있어요.
- 구조화 데이터는 홈 화면 한 장만 봤어요. 하위 페이지에만 있으면 못 잡힐 수 있습니다.
한눈에 보는 결과
| 점검 항목 | 점검한 곳 | 갖춘 곳 | 뜻 |
|---|---|---|---|
| 첫 문단에 답이 있음 | 93곳 | 97.8% | AI가 발췌하기 좋은 구조 |
| 숫자·데이터를 씀 | 93곳 | 52.7% | "많이 저렴" 대신 "30% 저렴" |
| 구조화 데이터 있음 | 112곳 | 50.0% | 회사·상품 정보를 기계가 읽는 형식으로 표시 (한 종류라도 있으면 갖춘 것으로 봤어요) |
| llms.txt 파일 있음 | 93곳 | 25.8% | AI에게 우리 사이트를 안내하는 파일 |
| 출처를 밝힘 | 93곳 | 16.1% | 주장의 근거를 남긴 글 |
| AI 로봇을 막고 있음 | 93곳 | 11.8% | 차단 설정 (낮을수록 좋아요) |
미픽스 진단 이력 · 주소 133곳 중 항목별 점검 완료분 기준 · 2026년 6월 17일 ~ 8월 26일 · 집계일 8월 27일.
llms.txt가 있던 24곳 중 9곳은 내용이 "모두 허용" 몇 줄뿐인 자동 생성 파일이었어요(같은 제작 업체 템플릿으로 보여요). 사이트를 실제로 소개하는 llms.txt는 14곳이었어요. 남은 1곳은 그사이 주소가 응답하지 않아 확인하지 못했습니다.
사이트 자체 점수(검색·AI 친화도)는 중앙값 79점, 평균 78.1점이었어요. 기본기는 나쁘지 않다는 뜻이에요.
발견 ① 문을 막은 곳은 열에 한 곳 남짓이었어요
"AI가 우리 사이트를 못 읽는 것 같다"는 걱정을 자주 듣는데, 실제로 막혀 있던 곳은 문을 점검한 93곳 중 11곳(11.8%)이었어요.
그리고 그 11곳은 대부분 막을 로봇을 골라서 막은 상태였습니다. 업종을 보면 어느 쪽에 몰려 있는지 보여요.
| 업종 | 막은 곳 |
|---|---|
| SaaS·IT 솔루션 | 14곳 중 4곳 (29%) |
| 콘텐츠·미디어 | 18곳 중 5곳 (28%) |
| B2B·전문 서비스 | 11곳 중 1곳 (9%) |
| 지역 서비스 | 43곳 중 1곳 (2%) |
| 이커머스·쇼핑몰 | 4곳 중 0곳 (0%) |
| 브랜드·제조 | 3곳 중 0곳 (0%) |
막은 11곳에는 네이버 블로그·네이버 지도처럼 개별 사업자가 아닌 플랫폼도 포함돼 있어요. 이 경우 설정은 플랫폼 운영사가 정합니다.
글을 많이 쌓아둔 콘텐츠·미디어와 이런 설정을 잘 아는 SaaS·IT가 약 30%로 높고, 동네 병원·미용실·학원 같은 지역 서비스는 43곳 중 단 1곳(2%)이었어요.
사장님 사이트는 이미 열려 있을 확률이 높아요. 그래도 1분이면 확인되니 한 번 보세요 — 주소창에 우리회사주소.com/robots.txt를 치고, Disallow: /라는 줄이 보이면 홈페이지 만든 업체에 문의하시면 됩니다.
발견 ② 막은 곳의 절반 이상은 "학습은 거절, 답변은 허용"이었어요
이게 이번 집계에서 가장 흥미로운 부분이에요. 막은 11곳을 로봇 종류별로 뜯어보면 이렇습니다.
| 로봇 | 역할 | 막은 곳 |
|---|---|---|
GPTBot | 챗GPT 학습용 | 11곳 |
ClaudeBot | 클로드 학습용 | 11곳 |
Applebot-Extended | 애플 학습용 | 10곳 |
Google-Extended | 제미나이 학습·근거수집용 | 8곳 |
PerplexityBot | 퍼플렉시티 답변용 | 5곳 |
OAI-SearchBot | 챗GPT 답변용 | 4곳 |
ChatGPT-User | 챗GPT 답변용(실시간 열람) | 4곳 |
anthropic-ai | 클로드 학습용(옛 이름) | 3곳 |
이번에 점검한 로봇은 위 8종이에요. 클로드 답변용(Claude-SearchBot)은 점검 목록에 없어서 이번 집계에서는 확인하지 않았습니다.
GPTBot·ClaudeBot은 11곳이 모두 막았는데, 답변용 로봇을 막은 곳은 4~5곳이었어요. 학습용을 막을 때 답변용까지 함께 막지는 않은 곳이 더 많았다는 뜻이에요.
정리하면 저희가 점검한 답변 전용 로봇(OAI-SearchBot·ChatGPT-User·PerplexityBot) 기준으로, 막은 11곳 중 6곳은 학습용만 막고 답변용은 열어둔 상태이고 나머지 5곳이 답변용까지 함께 막았어요.
다만 Google-Extended는 제미나이의 학습과 근거 수집을 함께 관리하는 이름표라서, 이걸 막은 곳은 제미나이 쪽 답변 경로도 일부 닫혀 있어요(6곳 중 5곳이 여기 해당해요).
다만 솔직하게 덧붙일 게 있어요. 그 6곳 중 5곳은 막은 로봇 목록이 완전히 똑같았습니다. 직접 고민해서 고른 게 아니라 홈페이지 제작·호스팅 쪽에서 기본으로 넣어준 설정일 가능성이 커요. 그래도 결과적으로는 "AI 답변에는 나올 수 있는" 쪽에 서 있습니다.
이 구분 자체는 서치어드바이저에 등록했는데 AI는 왜 우리 사이트를 모를까요?에서 카카오 브런치 사례로 설명드렸던 그 선택이에요.
반대로 답변용까지 막은 5곳은 AI 답변에 나올 길을 함께 닫은 상태예요. 오픈AI도 공식 봇 안내 문서에서 OAI-SearchBot을 막으면 챗GPT 검색 답변에는 나오지 않는다고 밝히고 있어요(링크로는 남을 수 있고요. 2026년 8월 27일 확인). 학습만 거절하고 싶으셨던 거라면 설정을 다시 볼 필요가 있어요.
발견 ③ 진짜 비어 있는 건 '근거'였어요
문이 열려 있어도 안에 가져갈 게 없으면 AI는 우리를 인용하지 않아요. 그래서 '고쳐야 할 곳이 얼마나 되나' 방향으로 다시 세어봤습니다.
- 문이 막혀 있는 곳 — 11.8% (걱정하시던 것)
- 숫자·데이터가 없는 곳 — 47.3%
- llms.txt가 없는 곳 — 74.2%
- 근거(출처)를 남기지 않은 곳 — 83.9% (진짜 문제)
걱정하던 문제는 열에 한 곳, 진짜 비어 있는 건 열에 여덟 곳이었어요.
AI 답변은 대체로 근거가 분명한 문서를 인용한다고 알려져 있어요. "저희가 최고입니다"라고만 적힌 페이지와, "○○ 통계에 따르면…"처럼 근거의 출처를 밝힌 페이지 중 어느 쪽을 가져갈지는 분명하죠. 그런데 글을 점검한 93곳 중 15곳만 후자였어요.
다만 정확히 짚고 갈게요. "출처를 밝히면 AI에 더 많이 인용된다"는 인과를 이번 집계로 확인한 건 아니에요. 이번에 센 것은 "AI가 가져갈 근거가 준비돼 있는가"까지입니다.
업종별로도 갈렸어요
| 업종 | 전체 | 평균 점수 | 구조화 데이터 | llms.txt | 출처 밝힘 |
|---|---|---|---|---|---|
| 지역 서비스 | 59곳 | 78 | 48% (50곳) | 33% (43곳) | 16% (43곳) |
| SaaS·IT 솔루션 | 24곳 | 76 | 28% (18곳) | 14% (14곳) | 21% (14곳) |
| 콘텐츠·미디어 | 22곳 | 79 | 67% (21곳) | 11% (18곳) | 17% (18곳) |
| B2B·전문 서비스 | 18곳 | 81 | 63% (16곳) | 18% (11곳) | 18% (11곳) |
| 이커머스·쇼핑몰 | 7곳 | 72 | — | — | — |
| 브랜드·제조 | 3곳 | 84 | — | — | — |
「전체」는 133곳의 업종 분포(합계 133곳)이고, 비율은 그중 항목별 점검이 끝난 곳만으로 계산했어요. 괄호 안이 그 분모입니다. 이커머스·쇼핑몰(점검 4곳)과 브랜드·제조(점검 3곳)는 표본이 작아 비율(—)은 내지 않았어요.
점검 표본이 10곳을 넘는 업종만 놓고 보면, SaaS·IT가 구조화 데이터 28%로 가장 낮아요. 기술을 아는 업종인데도 그렇습니다. 제품 소개에 집중하느라 "우리가 뭐 하는 회사인지"를 기계가 읽는 형식으로 남기는 걸 놓친 것 같아요.
반대로 지역 서비스는 llms.txt가 33%로, 점검 표본이 10곳을 넘는 업종 중 가장 높아요. 다만 자동 생성 템플릿이 섞여 있어 그대로 읽으면 안 됩니다 — 지역 서비스의 llms.txt 14곳 중 5곳이 그 템플릿이었고, 나머지 9곳은 사이트를 실제로 소개하는 파일이었어요.
그래서 뭘 해야 할까요?
이번 숫자가 가리키는 순서는 분명해요. 문 확인은 1분이면 끝나고, 나머지에 시간을 쓰세요.
- 문 확인 (1분, 대부분 이상 없음) —
우리회사주소.com/robots.txt를 열어보세요. 아무것도 안 나오면 정상이에요.Disallow: /가 보일 때만 조치하면 됩니다. 열에 아홉(88.2%)은 여기서 끝나요. - 근거를 남기세요 (갖춘 곳이 16.1%뿐 — 가장 많이 비어 있던 항목) — 주장에 숫자와 출처를 붙이세요. "많은 분들이 찾으세요" 대신 "지난달 이 시술로 방문하신 분이 120명이었어요". 우리가 직접 겪은 것, 직접 센 것이 가장 강한 근거예요.
- 구체적인 사실을 글로 적으세요 (갖춘 곳 52.7%) — 가격·소요 시간·조건·지역. AI는 이런 걸 가져갑니다. 이미지 안에만 있으면 못 읽어요.
- 기계가 읽는 형식으로 정리하세요 (갖춘 곳 50.0%) — 영업시간·주소·가격을 구조화 데이터로 표시하는 것. 자세한 방법은 스키마 마크업이 AI 인용에 도움이 될까?에 있어요.
- 학습·답변을 구분해 설정하세요 — AI 학습이 싫으시면 학습용 로봇만 막으세요. 답변용까지 막으면 AI 답변에 나올 길이 함께 닫힙니다.
더 촘촘한 점검표가 필요하시면 AEO 체크리스트 35단계를 참고해 주세요.
우리 사이트는 어디쯤일까요?
MEPiX 미픽스 무료 진단에 홈페이지 주소만 넣으면 AI 로봇 차단 여부, llms.txt·사이트맵 유무, 페이지 구조를 확인할 수 있어요. 구조화 데이터와 글의 근거 점검은 VIP 리포트에서 보실 수 있습니다.
집계 기준: 미픽스 진단 이력 중 분석이 완료된 주소 133곳 · 2026년 6월 17일~8월 26일(한국 시각) · 집계일 2026년 8월 27일 · 같은 주소는 첫 진단 결과로 계산. 항목별 분모는 그 점검이 실제로 돌아간 곳(문·글 93곳, 구조화 데이터 112곳)이에요. 개별 사이트 정보는 공개하지 않고 비율로만 집계했습니다. 무작위 표본이 아니라 미픽스 진단 이력에 쌓인 사이트이므로 한국 웹 전체 평균과 다를 수 있어요. 집계에서 빼길 원하시면 [email protected]으로 알려 주세요. 같은 기준으로 계속 측정해 변화를 추적할 예정입니다.
자주 묻는 질문
- Q. AI 로봇을 막고 있는 사이트는 얼마나 되나요?
- MEPiX 미픽스 진단 이력 133곳 중 로봇 안내 파일을 점검한 93곳을 기준으로 11.8%인 11곳이었어요(2026년 6월 17일~8월 26일). 나머지 82곳은 열려 있었습니다. 특히 동네 병원·미용실·학원 같은 지역 서비스는 점검한 43곳 중 단 1곳(2%)만 막혀 있었어요. 그러니 '혹시 우리가 막혀 있나' 하는 걱정은 열에 아홉은 문제가 아닙니다.
- Q. AI 학습은 막고 AI 답변에는 나오게 할 수 있나요?
- 가능하고, 실제로 그렇게 하는 곳이 있어요. MEPiX 미픽스가 진단한 사이트 중 AI 로봇을 막은 11곳이 있는데, 그중 6곳이 학습용 로봇(GPTBot·ClaudeBot 등)만 막고 저희가 점검한 답변용 로봇(OAI-SearchBot·PerplexityBot·ChatGPT-User)은 열어두었습니다. 챗GPT와 클로드는 학습용과 답변용 로봇을 따로 쓰기 때문에 각각 설정할 수 있어요. 반대로 답변용까지 막으면 AI 답변에 나올 길도 함께 닫힙니다.
- Q. AI 노출에서 가장 부족한 부분은 무엇인가요?
- 근거예요. 글 내용을 점검한 93곳 중 주장의 출처를 밝힌 글이 있는 곳은 16.1%(15곳)뿐이었어요. 로봇이 막혀 있던 곳은 11.8%인데, 근거를 남기지 않은 곳은 83.9%였습니다. 반면 첫 문단에 답을 먼저 쓰는 구조는 97.8%가 이미 갖추고 있었어요. 구조보다 내용의 근거가 훨씬 부족한 상태입니다.
- Q. 우리 홈페이지가 AI 로봇을 막고 있는지 어떻게 확인하나요?
- 주소창에 '우리회사주소.com/robots.txt'를 쳐보세요. 아무것도 안 나오거나 페이지가 없다고 하면 정상이에요. 'Disallow: /'라는 줄이 보일 때만 홈페이지를 만든 업체에 문의하시면 됩니다. MEPiX 미픽스 무료 진단을 쓰면 AI 로봇이 막혀 있는지 한 번에 확인할 수 있어요.
- Q. 이 조사의 표본과 한계는 어떻게 되나요?
- MEPiX 미픽스 진단 이력 중 분석이 완료된 주소 133곳이고, 2026년 6월 17일부터 8월 26일까지 쌓인 데이터예요. 항목마다 점검이 실제로 돌아간 곳만 분모로 썼습니다(문·글 점검 93곳, 구조화 데이터 112곳). 개별 사이트 이름은 공개하지 않고 비율로만 집계했어요. 다만 무작위 표본이 아니에요. 사이트 주인이 직접 신청한 곳과 저희가 시험 삼아 진단한 곳이 섞여 있고 해외 사이트도 일부 포함돼 있어서, 한국 웹 전체 평균이 아니라 미픽스 진단 이력에 쌓인 사이트들의 상태로 보시는 게 정확해요.
무료 AI 검색 진단
우리 브랜드는 AI 답변에 나올까요?
MEPiX 미픽스는 챗GPT·제미나이·클로드·퍼플렉시티·네이버 5곳에 실제로 물어봐서, 우리 브랜드가 AI 답변에 나오는지 무료로 보여드려요.
지금까지 170개+ 브랜드가 미픽스로 AI 노출을 확인했어요.
