Что это
llama.cpp — открытая библиотека на C/C++ для инференса больших языковых моделей на обычном железе, без внешних зависимостей. Поддерживает архитектуры LLaMA, Mistral, Qwen, Gemma, Phi и другие, включая мультимодальные модели с обработкой изображений. Работает на CPU и GPU через CUDA, Metal, Vulkan, SYCL, ROCm, с квантизацией весов от 1.5 до 8 бит для экономии памяти.
В комплекте идут утилиты llama-cli (терминальный чат) и llama-server — HTTP-сервер с OpenAI-совместимым API и встроенным веб-интерфейсом. Для участника клуба это способ поднять собственную LLM на ноутбуке или сервере без подписок и утечки данных наружу: можно подключить n8n через OpenAI-совместимый эндпоинт, тестировать промпты локально при вайб-кодинге или строить приватные сценарии генерации контента без отправки данных третьим сервисам.
Проект активно развивается сообществом ggml-org, часто первым получает поддержку свежих моделей и форматов квантизации GGUF, что делает его удобной базой для экспериментов с локальным инференсом.
Возможности
- Инференс LLM на CPU и GPU (CUDA, Metal, Vulkan, SYCL, ROCm) без обязательного облака
- Поддержка архитектур LLaMA, Mistral, Qwen, Gemma, Phi, ChatGLM и других
- Квантизация моделей от 1.5 до 8 бит для запуска на слабом железе
- llama-server: HTTP-сервер с OpenAI-совместимым API для интеграции с внешними инструментами
- Встроенный веб-интерфейс для чата с моделью прямо из браузера
- Поддержка мультимодальных моделей с обработкой изображений и PDF
- Оптимизация под Apple Silicon (ARM NEON, Metal) и x86 (AVX, AVX512)
- Инструменты для бенчмарков, оценки перплексии и конвертации моделей в формат GGUF
Цена: открытый код под лицензией MIT, полностью бесплатен, платных тарифов нет