
Common Crawl
United States"Zugang zu Webdaten demokratisieren"
Über
Common Crawl ist eine gemeinnützige 501(c)(3)-Organisation, die ein offenes Repository von Web-Crawl-Daten unterhält. Seit seiner Gründung im Jahr 2008 durch den Informatiker Gil Elbaz hat die Organisation systematisch das Internet durchsucht und Petabytes an rohen HTML-, Metadaten- und extrahierten Texten kostenlos zur Verfügung gestellt. Die Daten werden in öffentlichen S3-Buckets von Amazon Web Services gehostet; Nutzer zahlen nur für ihre eigenen Rechen- und Speicherkosten. Der Korpus von Common Crawl ist der größte frei zugängliche Webdatensatz, der von Forschern, Journalisten, Start-ups und großen KI-Laboren genutzt wird. In den 2020er Jahren wurde er zur primären Trainingsquelle für große Sprachmodelle, darunter GPT-3, GPT-4 und LLaMA. Eine Untersuchung von The Markup und Wired im November 2025 untersuchte, wie KI-Unternehmen die Daten nutzen, und löste Debatten über Zustimmung und Urheberrecht aus.
Mission
Die Mission von Common Crawl ist es, den Zugang zu Webdaten zu demokratisieren, indem das Internet durchsucht und die daraus resultierenden Inhalte kostenlos für jedermann zur Verfügung gestellt werden. Ziel ist es, die Hürden für die webweite Datenanalyse zu senken, Innovationen zu fördern und eine offene historische Aufzeichnung des Webs zu bewahren.
Geschichte
Gil Elbaz begann 2007 mit dem Bau des ersten Crawlers, angetrieben von der Überzeugung, dass offene Webdaten für ein gesundes Internet unerlässlich sind. Der erste öffentliche Crawl-Datensatz mit etwa 2 Milliarden Seiten wurde 2008 veröffentlicht. Die frühe Infrastruktur stützte sich auf gespendete Server und Zuschüsse. Im Jahr 2012 ging Common Crawl eine Partnerschaft mit Amazon Web Services ein, um die Daten in öffentlichen S3-Buckets zu hosten, wodurch der Zugriff kostenlos und skalierbar wurde. Der News Crawl-Datensatz wurde 2015 gestartet und liefert einen kontinuierlich aktualisierten Feed von Nachrichtenartikeln. Bis 2017 war der Korpus auf 3,5 Milliarden Seiten angewachsen, der damals größte öffentlich verfügbare Webdatensatz. Der KI-Boom der frühen 2020er Jahre erhöhte die Nachfrage dramatisch; Common Crawl wurde zum De-facto-Trainingskorpus für große Sprachmodelle. Als Reaktion auf Urheberrechts- und Zustimmungsbedenken, die durch eine Untersuchung im Jahr 2025 aufgeworfen wurden, kündigte die Organisation Pläne zur Entwicklung eines Opt-out-Systems und zur besseren Herkunftsnachverfolgung an.
Bemerkenswerte Personen
Gil Elbaz
Founder and Chairman of the Board · 2008–present
Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.
Rich Skrenta
Geschäftsführender Direktor · 2024–present
Former CEO of Blekko; creator of the Elk Cloner virus.
Peter Norvig
Former Board Member · 2010–2020
Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.
Meilensteine
2007
Gil Elbaz begins building the first web crawler.
2008
Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).
2012
Partnership with Amazon Web Services; data made available via public S3 buckets.
2015
Launch of the News Crawl dataset.
2017
Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.
2020
Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.
2022
Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).
2023
Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.
2025
The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.
Abteilungen
Organisationsinfo
- Gegründet
- +2008
- Hauptsitz
- San Francisco, California, United States
- Land
- United States
- Executive Director
- Rich Skrenta
- Typ
- Non-profit
- Typ
- Non-profit
- Gegründet
- +2008
- Land
- Vereinigte Staaten
- Gründer
- Gil Elbaz
- Annual Budget
- $1–2 million
- Mitarbeiter
- 5–10
- Data Size
- Petabytes
Finanzen
- Einnahmen
- $0.0 billion
- Budget
- $1–2 million
- Mitarbeiter
- 5–10
Offizielle Webseite
commoncrawl.org/
Der Community beitreten
Fans diskutieren