
Common Crawl
United States"웹 데이터 접근의 민주화"
소개
Common Crawl은 웹 크롤링 데이터를 공개적으로 저장하는 501(c)(3) 비영리 단체입니다. 컴퓨터 과학자 Gil Elbaz가 2008년에 설립한 이래로, 이 기관은 체계적으로 인터넷을 크롤링하여 방대한 양의 원시 HTML, 메타데이터 및 추출된 텍스트를 무료로 제공해 왔습니다. 이 데이터는 Amazon Web Services의 공개 S3 버킷에 호스팅되며, 사용자는 자체 컴퓨팅 및 스토리지 비용만 부담하면 됩니다. Common Crawl의 코퍼스는 연구원, 언론인, 스타트업 및 주요 AI 연구소에서 사용하는 가장 큰 공개 웹 데이터셋입니다. 2020년대에는 GPT-3, GPT-4, LLaMA를 포함한 대규모 언어 모델의 주요 학습 소스가 되었습니다. 2025년 11월 The Markup과 Wired의 조사에서 AI 기업들이 데이터를 어떻게 사용하는지 분석하여 동의 및 저작권에 대한 논쟁을 불러일으켰습니다.
미션
Common Crawl의 임무는 인터넷을 크롤링하여 얻은 콘텐츠를 누구나 무료로 이용할 수 있도록 제공함으로써 웹 데이터 접근을 민주화하는 것입니다. 목표는 웹 규모 데이터 분석의 장벽을 낮추고, 혁신을 촉진하며, 웹의 개방적인 역사 기록을 보존하는 것입니다.
역사
Gil Elbaz는 개방형 웹 데이터가 건강한 인터넷에 필수적이라는 신념으로 2007년에 첫 크롤러 구축을 시작했습니다. 약 20억 개의 페이지를 포함한 첫 번째 공개 크롤링 데이터셋은 2008년에 출시되었습니다. 초기 인프라는 기증된 서버와 보조금에 의존했습니다. 2012년, Common Crawl은 Amazon Web Services와 파트너십을 맺고 데이터를 공개 S3 버킷에 호스팅하여 무료로 확장 가능한 액세스를 제공했습니다. News Crawl 데이터셋은 2015년에 출시되어 지속적으로 업데이트되는 뉴스 기사 피드를 제공했습니다. 2017년까지 코퍼스는 35억 개의 페이지로 성장하여 당시 공개적으로 이용 가능한 가장 큰 웹 데이터셋이 되었습니다. 2020년대 초 AI 붐으로 수요가 폭발적으로 증가했으며, Common Crawl은 대규모 언어 모델의 사실상의 학습 코퍼스가 되었습니다. 2025년 조사에서 제기된 저작권 및 동의 관련 우려에 대응하여, 이 기관은 옵트아웃 시스템 개발 및 더 나은 출처 추적 계획을 발표했습니다.
주요 인물
Gil Elbaz
Founder and Chairman of the Board · 2008–present
Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.
Rich Skrenta
상임이사 · 2024–present
Former CEO of Blekko; creator of the Elk Cloner virus.
Peter Norvig
Former Board Member · 2010–2020
Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.
주요 이정표
2007
Gil Elbaz begins building the first web crawler.
2008
Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).
2012
Partnership with Amazon Web Services; data made available via public S3 buckets.
2015
Launch of the News Crawl dataset.
2017
Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.
2020
Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.
2022
Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).
2023
Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.
2025
The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.
부서
조직 정보
- 설립
- +2008
- 본사
- San Francisco, California, United States
- 국가
- United States
- Executive Director
- Rich Skrenta
- 유형
- Non-profit
- 유형
- Non-profit
- 설립
- +2008
- 국가
- 미국
- 창립자
- Gil Elbaz
- Annual Budget
- $1–2 million
- 임직원
- 5–10
- Data Size
- Petabytes
재무
- 매출
- $0.0 billion
- 예산
- $1–2 million
- 임직원
- 5–10
공식 웹사이트
commoncrawl.org/
커뮤니티 참여
명의 팬이 이야기 중