
llama.cpp
Georgi Gerganov, Diego Devesa
Übersicht
Am 10. März 2023 pushte Georgi Gerganov den ersten Commit von llama.cpp auf GitHub. Die Bibliothek, geschrieben in C und C++, hatte ein Ziel: Meta's LLaMA-Modelle auf einem Laptop-CPU ohne GPU auszuführen. Innerhalb von Wochen hatte sie Tausende von Sternen und eine wachsende Gemeinschaft von Entwicklern, die ihre Fähigkeiten weiter vorantrieben.
Die Kerninnovation ist die Quantisierung. Durch die Komprimierung der Modellgewichte von 32-Bit-Gleitkommazahlen auf 4-Bit- oder 8-Bit-Ganzzahlen im GGUF-Format reduziert llama.cpp den Speicherbedarf um 75 Prozent oder mehr. Ein Modell mit 7 Milliarden Parametern, das auf einer GPU 28 GB VRAM benötigen würde, kann in weniger als 6 GB Systemspeicher ausgeführt werden. Das GGUF-Format bündelt auch den Tokenizer, das Vokabular und die Chat-Vorlage in einer einzigen Datei, was die Modellverteilung trivial macht.
llama.cpp unterstützt eine ungewöhnlich breite Palette von Hardware: x86-CPUs mit AVX2, Apple Silicon über Metal, NVIDIA-GPUs mit CUDA, AMD-GPUs mit hipBLAS, Intel-GPUs mit SYCL und sogar Vulkan. Das Projekt enthält Befehlszeilenwerkzeuge für Generierung, Benchmarking und Modellkonvertierung sowie einen leichten HTTP-Server. Ab 2025 hat es über 900 Mitwirkende und 69.000 GitHub-Sterne. Tools wie Ollama und LM Studio bauen direkt auf llama.cpp auf und machen lokale LLM-Inferenz für nicht-technische Benutzer zugänglich. Die Bibliothek ist zum De-facto-Standard für die Ausführung großer Sprachmodelle auf Consumer-Hardware geworden und ermöglicht private, kosteneffektive KI-Experimente ohne Cloud-Abhängigkeiten.
Schlagwörter
Buchinfo
- Autor
- Georgi Gerganov, Diego Devesa
- Veröffentlicht
- 2023-03-10
- Autor
- Georgi Gerganov, Diego Devesa
- Initial Release
- March 10, 2023
- License
- MIT License
- Repository
- github.com/ggml-org/llama.cpp
- Written in
- C, C++
Der Community beitreten
Fans diskutieren