# ============================================================
# OPUSCLAM.COM · robots.txt
# 최종 수정 2026-09-18
# 09-09 AI 봇 전면 차단
# 09-17 「사람이 부를 때」 셋 개방 · Crawl-delay 제거
# 09-18 ★ AI 검색 「색인용」 셋 개방 (OAI-SearchBot · Claude-SearchBot
# · PerplexityBot) — 학습용은 그대로 차단
#
# 데이터 이용 조건: https://opusclam.com/legal/data-protection.html
# 이 파일의 제한을 무시한 접근은 허용된 접근권한을 넘은 것으로 봅니다.
# 문의: cser@wixon.co.kr · (주)윅슨어소시에이츠
#
# Terms for automated access:
# https://opusclam.com/legal/data-protection.html
# Access exceeding the limits declared here is unauthorised.
# No licence is granted for text and data mining, AI training,
# or retrieval-augmented generation. Contact: cser@wixon.co.kr
# ============================================================
# ── 일반 검색엔진 ────────────────────────────────────────────
# 색인은 환영합니다. 다만 관리·계정·내부 경로는 제외합니다.
User-agent: *
Disallow: /admin/
Disallow: /account/
Disallow: /api/
Disallow: /legal/*?
Allow: /
# ★★ 2026-09-17 · Crawl-delay 를 뺐습니다
# ────────────────────────────────────────────────────────
# ★ 왜 — 구글은 이 값을 아예 보지 않습니다(Search Console 의
# 수집 속도 설정을 씁니다). 그런데 네이버 Yeti 와 빙은
# 지킵니다. 5초로 묶어 두면 네이버가 하루에 훑을 수 있는
# 양이 크게 줄어듭니다.
#
# ★ 실제로 이렇게 되어 있었습니다 (oc_bot_day 기록)
# 09-05 Yeti 6,190 회 ← 서치어드바이저 등록 뒤 첫 수집
# 09-06 Yeti 780 회
# 09-07~ Yeti 2~28 회 ← 그대로 잦아듦
# Yeti 는 표본 추출 대상이 아니라 한 건까지 세는데도
# 하루 몇 건입니다. 색인을 늘리려는 판에 스스로 묶어 둔 셈입니다.
#
# ★ 서버가 힘들어지면 이 줄을 되살리기보다 Vercel 속도 제한을
# 쓰십시오. 그쪽은 봇마다 따로 걸 수 있고, 예의를 안 지키는
# 봇에게도 듣습니다. (이미 perplexity-rate-limit 규칙이 있습니다)
# ── 기계학습·데이터 수집 목적 크롤러 ─────────────────────────
# 전면 차단합니다. 데이터 이용 조건 4장 제11~13호에 따른
# 명시적 유보이며, 학술 목적을 포함하여 예외를 두지 않습니다.
#
# ★★ 2026-09-18 · 여기서 세 개를 아래로 옮겼습니다.
# OAI-SearchBot · Claude-SearchBot · PerplexityBot 은 모델을
# 훈련시키는 봇이 아니라 AI 검색에 실으려고 색인하는 봇입니다.
# 갈래가 달라 「AI 검색 색인」 섹션으로 옮겨 열었습니다.
# ▶ 학습용(GPTBot · ClaudeBot · Claude-Web · anthropic-ai · CCBot
# · Google-Extended · Applebot-Extended · Meta-* · Bytespider
# · Amazonbot · cohere-* 등)은 그대로 차단입니다.
# 모델 훈련에 우리 DB 가 들어가도 우리 주소는 남지 않습니다.
# 얻는 것이 없으므로 열지 않습니다.
User-agent: GPTBot
Disallow: /
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-Web
Disallow: /
User-agent: anthropic-ai
Disallow: /
User-agent: Google-Extended
Disallow: /
User-agent: CCBot
Disallow: /
User-agent: Applebot-Extended
Disallow: /
User-agent: Meta-ExternalAgent
Disallow: /
User-agent: Meta-ExternalFetcher
Disallow: /
User-agent: FacebookBot
Disallow: /
User-agent: Bytespider
Disallow: /
User-agent: TikTokSpider
Disallow: /
User-agent: Amazonbot
Disallow: /
User-agent: cohere-ai
Disallow: /
User-agent: cohere-training-data-crawler
Disallow: /
User-agent: Diffbot
Disallow: /
User-agent: omgili
Disallow: /
User-agent: omgilibot
Disallow: /
User-agent: Timpibot
Disallow: /
User-agent: ImagesiftBot
Disallow: /
User-agent: AI2Bot
Disallow: /
User-agent: Ai2Bot-Dolma
Disallow: /
User-agent: DuckAssistBot
Disallow: /
User-agent: MistralAI-User
Disallow: /
User-agent: YouBot
Disallow: /
# ── 사람이 물어서 찾아오는 AI (한 쪽씩만 가져갑니다) ───────
# ★ 2026-09-17 · 열었습니다.
# 위 「기계학습·데이터 수집」과 다른 갈래입니다. 이들은 미리 훑지
# 않고, 사람이 무언가를 물었을 때 그 답에 쓰려고 그때 한 쪽만
# 가져갑니다. 그리고 답에 우리 주소를 걸어 줍니다.
#
# ★ 왜 열었나 — 막기 전 기록으로 하루 13~55건이었습니다.
# 폭주한 것은 색인용 PerplexityBot 이었고 이들이 아니었습니다.
# ★★ 2026-09-18 정정 — 예전 주석의 「하루 140~212건」은 틀린
# 값이었습니다. oc_bot_day 는 slot 칸에 `*`(그날 총합)과
# 내역(db·home·spot·community)을 함께 담습니다. 전부
# 더하면 두 배가 됩니다. 셀 때는 반드시 slot='*' 만 봅니다.
# 실제 하루치는 09-05 55 · 09-06 24 · 09-08 13 이었습니다.
# ★★ 그리고 이 셋만 열어서는 거의 오지 않습니다 — 이들은 사람이
# 물었을 때 오는 페처이고, 그 전에 색인용 봇이 우리를 훑어
# 두어야 AI 가 우리를 답 후보로 찾습니다. 실제로 08월말~09초
# oai-searchbot 이 하루 12~81건 색인하는 동안 chatgpt-user 가
# 13~55건 따라왔고, 색인이 멈추자 페치도 함께 0이 됐습니다.
# 그래서 09-18 에 색인용을 함께 열었습니다(아래 섹션).
# ★ 학습용(GPTBot·ClaudeBot·CCBot·Google-Extended 등)은
# 위에서 그대로 막혀 있습니다. 데이터는 지킵니다.
# ★ 이름에 -User 가 붙은 것만입니다. -Bot 은 색인용이라 다릅니다.
# ChatGPT-User ≠ GPTBot · OAI-SearchBot
# Claude-User ≠ ClaudeBot · Claude-SearchBot
# Perplexity-User ≠ PerplexityBot
#
# ★★ 이름을 적은 묶음은 위 「User-agent: *」 를 아예 보지 않습니다.
# 그래서 관리·계정 경로를 여기에 다시 적습니다. 빠뜨리면
# 이 봇들에게만 /admin/ 이 열립니다.
User-agent: ChatGPT-User
Disallow: /admin/
Disallow: /account/
Disallow: /api/
Allow: /
User-agent: Claude-User
Disallow: /admin/
Disallow: /account/
Disallow: /api/
Allow: /
User-agent: Perplexity-User
Disallow: /admin/
Disallow: /account/
Disallow: /api/
Allow: /
# ── AI 검색 색인용 (2026-09-18 개방) ───────────────────────
# ★ 위 「기계학습」과 갈래가 다릅니다. 이들은 모델을 훈련시키지 않고
# AI 검색 결과에 실으려고 훑습니다. 답에 우리 주소가 걸립니다.
#
# ★ 왜 열었나 (2026-09-18 · 파트너 판단)
# ① 오퍼스클램은 런칭 한 달째입니다. 지금은 노출이 비용보다
# 먼저입니다.
# ② 구글이 12만 건을 「발견했지만 부르지 않는」 상태인데, 그 까닭은
# 결국 외부에서 우리를 인용하지 않기 때문입니다. AI 검색
# 색인은 그 신호를 만드는 몇 안 되는 수단입니다.
# ③ 클래식 인물·단체는 질문형 검색이 많아 AI 답변에 오르는
# 것이 일반 검색보다 유입 효율이 좋습니다.
# ④ middleware.js 가 봇을 `/api/seo` 로 보냅니다. 사람용 화면
# (스크립트 24개)이 아니라 가벼운 서버 화면을 받으므로,
# 09-07 퍼플렉시티 폭주로 네이버·구글이 느려졌던 일은
# 되풀이되지 않습니다.
#
# ★★ 열면서 각오한 것 — 정직하게 적어 둡니다
# ① 첫 훑기 때는 몰립니다. 09-04 Claude-SearchBot 하루 4,693건,
# 09-07 PerplexityBot 하루 11,150건이었습니다. 첫 주에 하루
# 수천 건은 올 수 있습니다.
# ② AI 가 우리 내용을 요약해 답해 버리면 사람이 사이트에 안 올
# 수도 있습니다. 업계가 아직 답을 못 찾은 문제입니다.
# ③ robots.txt 는 법적 보호가 아닙니다. DB 를 지키는 것은
# 약관의 DB제작자 권리와 저작권법 제93조입니다.
#
# ★ 힘들어지면 — 이 줄을 `Disallow: /` 로 되돌리기 전에 Vercel
# Firewall 의 속도 제한을 쓰십시오. 봇마다 따로 걸 수 있고
# 예의를 안 지키는 봇에게도 듣습니다. 되돌리는 것은 한 줄이라
# 언제든 할 수 있습니다.
#
# ★★ 이름을 적은 묶음은 위 「User-agent: *」 를 아예 보지 않습니다.
# 그래서 관리·계정 경로를 여기에도 다시 적습니다. 빠뜨리면
# 이 봇들에게만 /admin/ 이 열립니다.
User-agent: OAI-SearchBot
Disallow: /admin/
Disallow: /account/
Disallow: /api/
Allow: /
User-agent: Claude-SearchBot
Disallow: /admin/
Disallow: /account/
Disallow: /api/
Allow: /
User-agent: PerplexityBot
Disallow: /admin/
Disallow: /account/
Disallow: /api/
Allow: /
# ── 자료 대량 수집·아카이브 ──────────────────────────────────
User-agent: SemrushBot
Disallow: /
User-agent: AhrefsBot
Disallow: /
User-agent: MJ12bot
Disallow: /
User-agent: DotBot
Disallow: /
User-agent: DataForSeoBot
Disallow: /
User-agent: BLEXBot
Disallow: /
User-agent: PetalBot
Disallow: /
User-agent: SeekportBot
Disallow: /
User-agent: Scrapy
Disallow: /
User-agent: python-requests
Disallow: /
User-agent: node-fetch
Disallow: /
User-agent: Go-http-client
Disallow: /
User-agent: curl
Disallow: /
User-agent: Wget
Disallow: /
# ── 사이트맵 ─────────────────────────────────────────────────
# ★ 2026-09-17 확인 — 200 · application/xml · 하위 24개 모두 정상.
# 인물 3파일에 107,505개 주소가 들어 있고 lastmod 도 붙어 있습니다.
# ★★ 2026-09-18 · 다국어는 사이트맵에도 없고 봇에게도 주지
# 않습니다. 09-17 사이트맵에서 185개를 뺐고(LANGS=[]), 09-18
# middleware.js 에서 봇 판정을 다국어 판정보다 앞으로 올려
# `/en/…` 으로 온 봇도 한국어 정식 화면을 받게 했습니다.
# 까닭 — 번역된 것은 메뉴·단추뿐이고 본문은 DB 값이라 한국어입니다.
# 서치 콘솔 실시간 테스트로 확인했습니다(canonical 이 한국어 주소).
# ★ 서치 콘솔에 09-18 세 파일을 다시 제출했습니다. sitemap-pages 는
# 228 → 43 으로 즉시 반영됐습니다.
Sitemap: https://opusclam.com/sitemap.xml