Last updated
    llama.cpp
    도서

    llama.cpp

    Georgi Gerganov, Diego Devesa

    2023
    커뮤니티

    개요

    2023년 3월 10일, Georgi Gerganov가 llama.cpp의 첫 번째 커밋을 GitHub에 푸시했습니다. C와 C++로 작성된 이 라이브러리는 한 가지 목표를 가지고 있었습니다: GPU 없이 노트북 CPU에서 Meta의 LLaMA 모델을 실행하는 것이었습니다. 몇 주 만에 수천 개의 별표와 함께 커뮤니티 개발자들이 그 기능을 더욱 확장해 나갔습니다.

    핵심 혁신은 양자화입니다. GGUF 형식을 사용하여 모델 가중치를 32비트 부동 소수점에서 4비트 또는 8비트 정수로 압축함으로써, llama.cpp는 메모리 요구 사항을 75% 이상 줄입니다. GPU에서 28GB의 VRAM이 필요한 70억 개의 파라미터 모델이 6GB 미만의 시스템 RAM에서 실행될 수 있습니다. GGUF 형식은 또한 토크나이저, 어휘 및 채팅 템플릿을 단일 파일로 묶어 모델 배포를 간단하게 만듭니다.

    llama.cpp는 비정상적으로 광범위한 하드웨어를 지원합니다: AVX2를 사용하는 x86 CPU, Metal을 통한 Apple Silicon, CUDA를 사용하는 NVIDIA GPU, hipBLAS를 사용하는 AMD GPU, SYCL을 사용하는 Intel GPU, 심지어 Vulkan까지 지원합니다. 이 프로젝트는 생성, 벤치마킹 및 모델 변환을 위한 명령줄 도구와 경량 HTTP 서버를 제공합니다. 2025년 기준으로 900명 이상의 기여자와 69,000개의 GitHub 별표를 보유하고 있습니다. Ollama 및 LM Studio와 같은 도구는 llama.cpp를 기반으로 구축되어 비기술적 사용자도 로컬 LLM 추론에 접근할 수 있게 합니다. 이 라이브러리는 소비자 하드웨어에서 대규모 언어 모델을 실행하는 사실상의 표준이 되었으며, 클라우드 의존성 없이 개인적이고 비용 효율적인 AI 실험을 가능하게 합니다.

    키워드

    llama.cppGGUF양자화로컬 LLM추론오픈소스Georgi GerganovCPU 추론머신러닝

    도서 정보

    저자
    Georgi Gerganov, Diego Devesa
    출간
    2023-03-10
    저자
    Georgi Gerganov, Diego Devesa
    Initial Release
    March 10, 2023
    License
    MIT License
    Repository
    github.com/ggml-org/llama.cpp
    Written in
    C, C++

    링크

    커뮤니티 참여

    명의 팬이 이야기 중