Last updated
    Common Crawl
    Non-profit

    Common Crawl

    United States flagUnited States

    "Zugang zu Webdaten demokratisieren"

    Founded +2008 San Francisco, California, United States Executive Director: Rich Skrenta
    Community

    Über

    Common Crawl ist eine gemeinnützige 501(c)(3)-Organisation, die ein offenes Repository von Web-Crawl-Daten unterhält. Seit seiner Gründung im Jahr 2008 durch den Informatiker Gil Elbaz hat die Organisation systematisch das Internet durchsucht und Petabytes an rohen HTML-, Metadaten- und extrahierten Texten kostenlos zur Verfügung gestellt. Die Daten werden in öffentlichen S3-Buckets von Amazon Web Services gehostet; Nutzer zahlen nur für ihre eigenen Rechen- und Speicherkosten. Der Korpus von Common Crawl ist der größte frei zugängliche Webdatensatz, der von Forschern, Journalisten, Start-ups und großen KI-Laboren genutzt wird. In den 2020er Jahren wurde er zur primären Trainingsquelle für große Sprachmodelle, darunter GPT-3, GPT-4 und LLaMA. Eine Untersuchung von The Markup und Wired im November 2025 untersuchte, wie KI-Unternehmen die Daten nutzen, und löste Debatten über Zustimmung und Urheberrecht aus.

    Mission

    Die Mission von Common Crawl ist es, den Zugang zu Webdaten zu demokratisieren, indem das Internet durchsucht und die daraus resultierenden Inhalte kostenlos für jedermann zur Verfügung gestellt werden. Ziel ist es, die Hürden für die webweite Datenanalyse zu senken, Innovationen zu fördern und eine offene historische Aufzeichnung des Webs zu bewahren.

    Geschichte

    Gil Elbaz begann 2007 mit dem Bau des ersten Crawlers, angetrieben von der Überzeugung, dass offene Webdaten für ein gesundes Internet unerlässlich sind. Der erste öffentliche Crawl-Datensatz mit etwa 2 Milliarden Seiten wurde 2008 veröffentlicht. Die frühe Infrastruktur stützte sich auf gespendete Server und Zuschüsse. Im Jahr 2012 ging Common Crawl eine Partnerschaft mit Amazon Web Services ein, um die Daten in öffentlichen S3-Buckets zu hosten, wodurch der Zugriff kostenlos und skalierbar wurde. Der News Crawl-Datensatz wurde 2015 gestartet und liefert einen kontinuierlich aktualisierten Feed von Nachrichtenartikeln. Bis 2017 war der Korpus auf 3,5 Milliarden Seiten angewachsen, der damals größte öffentlich verfügbare Webdatensatz. Der KI-Boom der frühen 2020er Jahre erhöhte die Nachfrage dramatisch; Common Crawl wurde zum De-facto-Trainingskorpus für große Sprachmodelle. Als Reaktion auf Urheberrechts- und Zustimmungsbedenken, die durch eine Untersuchung im Jahr 2025 aufgeworfen wurden, kündigte die Organisation Pläne zur Entwicklung eines Opt-out-Systems und zur besseren Herkunftsnachverfolgung an.

    Bemerkenswerte Personen

    Gil Elbaz

    Founder and Chairman of the Board · 2008–present

    Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.

    Rich Skrenta

    Geschäftsführender Direktor · 2024–present

    Former CEO of Blekko; creator of the Elk Cloner virus.

    Peter Norvig

    Former Board Member · 2010–2020

    Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.

    Meilensteine

    2007

    Gil Elbaz begins building the first web crawler.

    2008

    Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).

    2012

    Partnership with Amazon Web Services; data made available via public S3 buckets.

    2015

    Launch of the News Crawl dataset.

    2017

    Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.

    2020

    Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.

    2022

    Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).

    2023

    Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.

    2025

    The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.

    Abteilungen

    Crawling & Infrastructure EngineeringData Processing & QualityCommunity & OutreachAdministration & Finance

    Organisationsinfo

    Gegründet
    +2008
    Hauptsitz
    San Francisco, California, United States
    Land
    United States
    Executive Director
    Rich Skrenta
    Typ
    Non-profit
    Typ
    Non-profit
    Gegründet
    +2008
    Land
    Vereinigte Staaten
    Gründer
    Gil Elbaz
    Annual Budget
    $1–2 million
    Mitarbeiter
    5–10
    Data Size
    Petabytes

    Finanzen

    Einnahmen
    $0.0 billion
    Budget
    $1–2 million
    Mitarbeiter
    5–10

    Offizielle Webseite

    commoncrawl.org/

    Der Community beitreten

    Fans diskutieren