
llama.cpp
Georgi Gerganov, Diego Devesa
개요
2023년 3월 10일, Georgi Gerganov가 llama.cpp의 첫 번째 커밋을 GitHub에 푸시했습니다. C와 C++로 작성된 이 라이브러리는 한 가지 목표를 가지고 있었습니다: GPU 없이 노트북 CPU에서 Meta의 LLaMA 모델을 실행하는 것이었습니다. 몇 주 만에 수천 개의 별표와 함께 커뮤니티 개발자들이 그 기능을 더욱 확장해 나갔습니다.
핵심 혁신은 양자화입니다. GGUF 형식을 사용하여 모델 가중치를 32비트 부동 소수점에서 4비트 또는 8비트 정수로 압축함으로써, llama.cpp는 메모리 요구 사항을 75% 이상 줄입니다. GPU에서 28GB의 VRAM이 필요한 70억 개의 파라미터 모델이 6GB 미만의 시스템 RAM에서 실행될 수 있습니다. GGUF 형식은 또한 토크나이저, 어휘 및 채팅 템플릿을 단일 파일로 묶어 모델 배포를 간단하게 만듭니다.
llama.cpp는 비정상적으로 광범위한 하드웨어를 지원합니다: AVX2를 사용하는 x86 CPU, Metal을 통한 Apple Silicon, CUDA를 사용하는 NVIDIA GPU, hipBLAS를 사용하는 AMD GPU, SYCL을 사용하는 Intel GPU, 심지어 Vulkan까지 지원합니다. 이 프로젝트는 생성, 벤치마킹 및 모델 변환을 위한 명령줄 도구와 경량 HTTP 서버를 제공합니다. 2025년 기준으로 900명 이상의 기여자와 69,000개의 GitHub 별표를 보유하고 있습니다. Ollama 및 LM Studio와 같은 도구는 llama.cpp를 기반으로 구축되어 비기술적 사용자도 로컬 LLM 추론에 접근할 수 있게 합니다. 이 라이브러리는 소비자 하드웨어에서 대규모 언어 모델을 실행하는 사실상의 표준이 되었으며, 클라우드 의존성 없이 개인적이고 비용 효율적인 AI 실험을 가능하게 합니다.
키워드
도서 정보
- 저자
- Georgi Gerganov, Diego Devesa
- 출간
- 2023-03-10
- 저자
- Georgi Gerganov, Diego Devesa
- Initial Release
- March 10, 2023
- License
- MIT License
- Repository
- github.com/ggml-org/llama.cpp
- Written in
- C, C++
커뮤니티 참여
명의 팬이 이야기 중