Last updated
    Common Crawl
    Non-profit

    Common Crawl

    United States flagUnited States

    "웹 데이터 접근의 민주화"

    Founded +2008 San Francisco, California, United States Executive Director: Rich Skrenta
    커뮤니티

    소개

    Common Crawl은 웹 크롤링 데이터를 공개적으로 저장하는 501(c)(3) 비영리 단체입니다. 컴퓨터 과학자 Gil Elbaz가 2008년에 설립한 이래로, 이 기관은 체계적으로 인터넷을 크롤링하여 방대한 양의 원시 HTML, 메타데이터 및 추출된 텍스트를 무료로 제공해 왔습니다. 이 데이터는 Amazon Web Services의 공개 S3 버킷에 호스팅되며, 사용자는 자체 컴퓨팅 및 스토리지 비용만 부담하면 됩니다. Common Crawl의 코퍼스는 연구원, 언론인, 스타트업 및 주요 AI 연구소에서 사용하는 가장 큰 공개 웹 데이터셋입니다. 2020년대에는 GPT-3, GPT-4, LLaMA를 포함한 대규모 언어 모델의 주요 학습 소스가 되었습니다. 2025년 11월 The Markup과 Wired의 조사에서 AI 기업들이 데이터를 어떻게 사용하는지 분석하여 동의 및 저작권에 대한 논쟁을 불러일으켰습니다.

    미션

    Common Crawl의 임무는 인터넷을 크롤링하여 얻은 콘텐츠를 누구나 무료로 이용할 수 있도록 제공함으로써 웹 데이터 접근을 민주화하는 것입니다. 목표는 웹 규모 데이터 분석의 장벽을 낮추고, 혁신을 촉진하며, 웹의 개방적인 역사 기록을 보존하는 것입니다.

    역사

    Gil Elbaz는 개방형 웹 데이터가 건강한 인터넷에 필수적이라는 신념으로 2007년에 첫 크롤러 구축을 시작했습니다. 약 20억 개의 페이지를 포함한 첫 번째 공개 크롤링 데이터셋은 2008년에 출시되었습니다. 초기 인프라는 기증된 서버와 보조금에 의존했습니다. 2012년, Common Crawl은 Amazon Web Services와 파트너십을 맺고 데이터를 공개 S3 버킷에 호스팅하여 무료로 확장 가능한 액세스를 제공했습니다. News Crawl 데이터셋은 2015년에 출시되어 지속적으로 업데이트되는 뉴스 기사 피드를 제공했습니다. 2017년까지 코퍼스는 35억 개의 페이지로 성장하여 당시 공개적으로 이용 가능한 가장 큰 웹 데이터셋이 되었습니다. 2020년대 초 AI 붐으로 수요가 폭발적으로 증가했으며, Common Crawl은 대규모 언어 모델의 사실상의 학습 코퍼스가 되었습니다. 2025년 조사에서 제기된 저작권 및 동의 관련 우려에 대응하여, 이 기관은 옵트아웃 시스템 개발 및 더 나은 출처 추적 계획을 발표했습니다.

    주요 인물

    Gil Elbaz

    Founder and Chairman of the Board · 2008–present

    Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.

    Rich Skrenta

    상임이사 · 2024–present

    Former CEO of Blekko; creator of the Elk Cloner virus.

    Peter Norvig

    Former Board Member · 2010–2020

    Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.

    주요 이정표

    2007

    Gil Elbaz begins building the first web crawler.

    2008

    Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).

    2012

    Partnership with Amazon Web Services; data made available via public S3 buckets.

    2015

    Launch of the News Crawl dataset.

    2017

    Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.

    2020

    Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.

    2022

    Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).

    2023

    Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.

    2025

    The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.

    부서

    Crawling & Infrastructure EngineeringData Processing & QualityCommunity & OutreachAdministration & Finance

    조직 정보

    설립
    +2008
    본사
    San Francisco, California, United States
    국가
    United States
    Executive Director
    Rich Skrenta
    유형
    Non-profit
    유형
    Non-profit
    설립
    +2008
    국가
    미국
    창립자
    Gil Elbaz
    Annual Budget
    $1–2 million
    임직원
    5–10
    Data Size
    Petabytes

    재무

    매출
    $0.0 billion
    예산
    $1–2 million
    임직원
    5–10

    공식 웹사이트

    commoncrawl.org/

    커뮤니티 참여

    명의 팬이 이야기 중