# ============================================================ # OPUSCLAM.COM · robots.txt # 최종 수정 2026-09-18 # 09-09 AI 봇 전면 차단 # 09-17 「사람이 부를 때」 셋 개방 · Crawl-delay 제거 # 09-18 ★ AI 검색 「색인용」 셋 개방 (OAI-SearchBot · Claude-SearchBot # · PerplexityBot) — 학습용은 그대로 차단 # # 데이터 이용 조건: https://opusclam.com/legal/data-protection.html # 이 파일의 제한을 무시한 접근은 허용된 접근권한을 넘은 것으로 봅니다. # 문의: cser@wixon.co.kr · (주)윅슨어소시에이츠 # # Terms for automated access: # https://opusclam.com/legal/data-protection.html # Access exceeding the limits declared here is unauthorised. # No licence is granted for text and data mining, AI training, # or retrieval-augmented generation. Contact: cser@wixon.co.kr # ============================================================ # ── 일반 검색엔진 ──────────────────────────────────────────── # 색인은 환영합니다. 다만 관리·계정·내부 경로는 제외합니다. User-agent: * Disallow: /admin/ Disallow: /account/ Disallow: /api/ Disallow: /legal/*? Allow: / # ★★ 2026-09-17 · Crawl-delay 를 뺐습니다 # ──────────────────────────────────────────────────────── # ★ 왜 — 구글은 이 값을 아예 보지 않습니다(Search Console 의 # 수집 속도 설정을 씁니다). 그런데 네이버 Yeti 와 빙은 # 지킵니다. 5초로 묶어 두면 네이버가 하루에 훑을 수 있는 # 양이 크게 줄어듭니다. # # ★ 실제로 이렇게 되어 있었습니다 (oc_bot_day 기록) # 09-05 Yeti 6,190 회 ← 서치어드바이저 등록 뒤 첫 수집 # 09-06 Yeti 780 회 # 09-07~ Yeti 2~28 회 ← 그대로 잦아듦 # Yeti 는 표본 추출 대상이 아니라 한 건까지 세는데도 # 하루 몇 건입니다. 색인을 늘리려는 판에 스스로 묶어 둔 셈입니다. # # ★ 서버가 힘들어지면 이 줄을 되살리기보다 Vercel 속도 제한을 # 쓰십시오. 그쪽은 봇마다 따로 걸 수 있고, 예의를 안 지키는 # 봇에게도 듣습니다. (이미 perplexity-rate-limit 규칙이 있습니다) # ── 기계학습·데이터 수집 목적 크롤러 ───────────────────────── # 전면 차단합니다. 데이터 이용 조건 4장 제11~13호에 따른 # 명시적 유보이며, 학술 목적을 포함하여 예외를 두지 않습니다. # # ★★ 2026-09-18 · 여기서 세 개를 아래로 옮겼습니다. # OAI-SearchBot · Claude-SearchBot · PerplexityBot 은 모델을 # 훈련시키는 봇이 아니라 AI 검색에 실으려고 색인하는 봇입니다. # 갈래가 달라 「AI 검색 색인」 섹션으로 옮겨 열었습니다. # ▶ 학습용(GPTBot · ClaudeBot · Claude-Web · anthropic-ai · CCBot # · Google-Extended · Applebot-Extended · Meta-* · Bytespider # · Amazonbot · cohere-* 등)은 그대로 차단입니다. # 모델 훈련에 우리 DB 가 들어가도 우리 주소는 남지 않습니다. # 얻는 것이 없으므로 열지 않습니다. User-agent: GPTBot Disallow: / User-agent: ClaudeBot Disallow: / User-agent: Claude-Web Disallow: / User-agent: anthropic-ai Disallow: / User-agent: Google-Extended Disallow: / User-agent: CCBot Disallow: / User-agent: Applebot-Extended Disallow: / User-agent: Meta-ExternalAgent Disallow: / User-agent: Meta-ExternalFetcher Disallow: / User-agent: FacebookBot Disallow: / User-agent: Bytespider Disallow: / User-agent: TikTokSpider Disallow: / User-agent: Amazonbot Disallow: / User-agent: cohere-ai Disallow: / User-agent: cohere-training-data-crawler Disallow: / User-agent: Diffbot Disallow: / User-agent: omgili Disallow: / User-agent: omgilibot Disallow: / User-agent: Timpibot Disallow: / User-agent: ImagesiftBot Disallow: / User-agent: AI2Bot Disallow: / User-agent: Ai2Bot-Dolma Disallow: / User-agent: DuckAssistBot Disallow: / User-agent: MistralAI-User Disallow: / User-agent: YouBot Disallow: / # ── 사람이 물어서 찾아오는 AI (한 쪽씩만 가져갑니다) ─────── # ★ 2026-09-17 · 열었습니다. # 위 「기계학습·데이터 수집」과 다른 갈래입니다. 이들은 미리 훑지 # 않고, 사람이 무언가를 물었을 때 그 답에 쓰려고 그때 한 쪽만 # 가져갑니다. 그리고 답에 우리 주소를 걸어 줍니다. # # ★ 왜 열었나 — 막기 전 기록으로 하루 13~55건이었습니다. # 폭주한 것은 색인용 PerplexityBot 이었고 이들이 아니었습니다. # ★★ 2026-09-18 정정 — 예전 주석의 「하루 140~212건」은 틀린 # 값이었습니다. oc_bot_day 는 slot 칸에 `*`(그날 총합)과 # 내역(db·home·spot·community)을 함께 담습니다. 전부 # 더하면 두 배가 됩니다. 셀 때는 반드시 slot='*' 만 봅니다. # 실제 하루치는 09-05 55 · 09-06 24 · 09-08 13 이었습니다. # ★★ 그리고 이 셋만 열어서는 거의 오지 않습니다 — 이들은 사람이 # 물었을 때 오는 페처이고, 그 전에 색인용 봇이 우리를 훑어 # 두어야 AI 가 우리를 답 후보로 찾습니다. 실제로 08월말~09초 # oai-searchbot 이 하루 12~81건 색인하는 동안 chatgpt-user 가 # 13~55건 따라왔고, 색인이 멈추자 페치도 함께 0이 됐습니다. # 그래서 09-18 에 색인용을 함께 열었습니다(아래 섹션). # ★ 학습용(GPTBot·ClaudeBot·CCBot·Google-Extended 등)은 # 위에서 그대로 막혀 있습니다. 데이터는 지킵니다. # ★ 이름에 -User 가 붙은 것만입니다. -Bot 은 색인용이라 다릅니다. # ChatGPT-User ≠ GPTBot · OAI-SearchBot # Claude-User ≠ ClaudeBot · Claude-SearchBot # Perplexity-User ≠ PerplexityBot # # ★★ 이름을 적은 묶음은 위 「User-agent: *」 를 아예 보지 않습니다. # 그래서 관리·계정 경로를 여기에 다시 적습니다. 빠뜨리면 # 이 봇들에게만 /admin/ 이 열립니다. User-agent: ChatGPT-User Disallow: /admin/ Disallow: /account/ Disallow: /api/ Allow: / User-agent: Claude-User Disallow: /admin/ Disallow: /account/ Disallow: /api/ Allow: / User-agent: Perplexity-User Disallow: /admin/ Disallow: /account/ Disallow: /api/ Allow: / # ── AI 검색 색인용 (2026-09-18 개방) ─────────────────────── # ★ 위 「기계학습」과 갈래가 다릅니다. 이들은 모델을 훈련시키지 않고 # AI 검색 결과에 실으려고 훑습니다. 답에 우리 주소가 걸립니다. # # ★ 왜 열었나 (2026-09-18 · 파트너 판단) # ① 오퍼스클램은 런칭 한 달째입니다. 지금은 노출이 비용보다 # 먼저입니다. # ② 구글이 12만 건을 「발견했지만 부르지 않는」 상태인데, 그 까닭은 # 결국 외부에서 우리를 인용하지 않기 때문입니다. AI 검색 # 색인은 그 신호를 만드는 몇 안 되는 수단입니다. # ③ 클래식 인물·단체는 질문형 검색이 많아 AI 답변에 오르는 # 것이 일반 검색보다 유입 효율이 좋습니다. # ④ middleware.js 가 봇을 `/api/seo` 로 보냅니다. 사람용 화면 # (스크립트 24개)이 아니라 가벼운 서버 화면을 받으므로, # 09-07 퍼플렉시티 폭주로 네이버·구글이 느려졌던 일은 # 되풀이되지 않습니다. # # ★★ 열면서 각오한 것 — 정직하게 적어 둡니다 # ① 첫 훑기 때는 몰립니다. 09-04 Claude-SearchBot 하루 4,693건, # 09-07 PerplexityBot 하루 11,150건이었습니다. 첫 주에 하루 # 수천 건은 올 수 있습니다. # ② AI 가 우리 내용을 요약해 답해 버리면 사람이 사이트에 안 올 # 수도 있습니다. 업계가 아직 답을 못 찾은 문제입니다. # ③ robots.txt 는 법적 보호가 아닙니다. DB 를 지키는 것은 # 약관의 DB제작자 권리와 저작권법 제93조입니다. # # ★ 힘들어지면 — 이 줄을 `Disallow: /` 로 되돌리기 전에 Vercel # Firewall 의 속도 제한을 쓰십시오. 봇마다 따로 걸 수 있고 # 예의를 안 지키는 봇에게도 듣습니다. 되돌리는 것은 한 줄이라 # 언제든 할 수 있습니다. # # ★★ 이름을 적은 묶음은 위 「User-agent: *」 를 아예 보지 않습니다. # 그래서 관리·계정 경로를 여기에도 다시 적습니다. 빠뜨리면 # 이 봇들에게만 /admin/ 이 열립니다. User-agent: OAI-SearchBot Disallow: /admin/ Disallow: /account/ Disallow: /api/ Allow: / User-agent: Claude-SearchBot Disallow: /admin/ Disallow: /account/ Disallow: /api/ Allow: / User-agent: PerplexityBot Disallow: /admin/ Disallow: /account/ Disallow: /api/ Allow: / # ── 자료 대량 수집·아카이브 ────────────────────────────────── User-agent: SemrushBot Disallow: / User-agent: AhrefsBot Disallow: / User-agent: MJ12bot Disallow: / User-agent: DotBot Disallow: / User-agent: DataForSeoBot Disallow: / User-agent: BLEXBot Disallow: / User-agent: PetalBot Disallow: / User-agent: SeekportBot Disallow: / User-agent: Scrapy Disallow: / User-agent: python-requests Disallow: / User-agent: node-fetch Disallow: / User-agent: Go-http-client Disallow: / User-agent: curl Disallow: / User-agent: Wget Disallow: / # ── 사이트맵 ───────────────────────────────────────────────── # ★ 2026-09-17 확인 — 200 · application/xml · 하위 24개 모두 정상. # 인물 3파일에 107,505개 주소가 들어 있고 lastmod 도 붙어 있습니다. # ★★ 2026-09-18 · 다국어는 사이트맵에도 없고 봇에게도 주지 # 않습니다. 09-17 사이트맵에서 185개를 뺐고(LANGS=[]), 09-18 # middleware.js 에서 봇 판정을 다국어 판정보다 앞으로 올려 # `/en/…` 으로 온 봇도 한국어 정식 화면을 받게 했습니다. # 까닭 — 번역된 것은 메뉴·단추뿐이고 본문은 DB 값이라 한국어입니다. # 서치 콘솔 실시간 테스트로 확인했습니다(canonical 이 한국어 주소). # ★ 서치 콘솔에 09-18 세 파일을 다시 제출했습니다. sitemap-pages 는 # 228 → 43 으로 즉시 반영됐습니다. Sitemap: https://opusclam.com/sitemap.xml