Что такое формат файла GGUF?
Файл .gguf - это GGML Universal Format File, бинарный контейнер, используемый llama.cpp для хранения больших языковых моделей. Георгий Герганов и сообщество ggml представили его в августе 2023 года как преемника старых форматов GGML, GGMF и GGJT. Один файл .gguf содержит веса модели, токенизатор и все гиперпараметры в виде типизированных метаданных «ключ-значение», поэтому для загрузки и запуска модели не требуются отдельные конфигурационные файлы.
Формат разработан как самодостаточный, расширяемый и поддерживающий отображение в память (memory-mappable). Поскольку метаданные хранятся в виде пар «ключ-значение» с пространствами имен, а не в виде фиксированного списка, новые поля можно добавлять без нарушения работы старых программ чтения. Веса обычно квантуются (от 2 до 8 бит, включая K-кванты, такие как Q4_K_M), что позволяет запускать объемные модели на потребительских CPU и GPU. Каждый файл начинается с четырехбайтовой магической строки GGUF, за которой следует номер версии; текущая версия - 3.
Безопасность и защита
РИСК: LOWGGUF is a data container for model weights and metadata, not an executable, so opening one does not run code by itself. The main practical risks are large file sizes and downloading models from untrusted sources; a malformed file could in theory exploit a bug in the loader, so use up-to-date inference tools and reputable model repositories.
Детали формата
в двух словах- Genome Graphical User Format - Rarely, .gguf has been used ad hoc by hobby projects for GUI layout data, unrelated to the machine-learning format described here.
Программы, открывающие файлы GGUF
.gguf models through a desktop GUI, with per-model quantization choices. .gguf file via a Modelfile and serve it for chat or API use with one command. .gguf model with llama-cli or llama-server, the reference implementation of the format. .gguf model to the local model folder and chat with it offline. .gguf model for text generation and roleplay with a self-contained executable. .gguf models with Apple Silicon acceleration through a desktop GUI. .gguf model via a Modelfile using Metal acceleration on Apple hardware. .gguf models with CUDA, ROCm or CPU backends via llama-cli and llama-server. .gguf models through the llama.cpp loader in a browser-based interface. .gguf file's metadata, tensor list and quantization in the browser without downloading it. Технические подробности
глубокая спецификация| Encoding | Binary |
| Byte order | Little-endian by default; big-endian supported since version 3 |
| Container | Single-file container holding header, metadata key-value block, tensor info block and raw tensor data |
| Compression | None as a container; weights are stored using GGUF quantization schemes (Q2 through Q8, K-quants such as Q4_K_M, IQ variants, plus F16/BF16/F32) |
| Typical size | Roughly 0.5 GB to over 100 GB depending on parameter count and quantization level |
| Structure | Header (magic, version, tensor count, metadata count) then namespaced key-value metadata, then per-tensor info (name, dimensions, type, offset), then aligned raw tensor data. Default alignment is 32 bytes and must be a multiple of 8. |
| Integrity | No built-in checksum; the metadata block is self-describing and validated at load time |
| Platforms | Windows, macOS, Linux |
| Notes | A GGUF file is self-contained: it bundles the model weights, tokenizer and all hyperparameters as typed metadata, so no separate config files are needed. Metadata keys use lower_snake_case with period-separated namespaces and keys can be up to 65,535 bytes. Over 40 quantization types are supported. Large models can be sharded across multiple .gguf files with llama-gguf-split. |
| Выпущен | August 2023 |
| Последняя версия | Version 3 |
| Открыть стандартное | Да · без роялти |
| Спецификация | github.com |
Конвертации GGUF
Вопросы и ответы сообщества
спрошено пользователямиВопросов пока нет - станьте первым, кто спросит о файлах GGUF.
Часто задаваемые вопросы
Как открыть файл GGUF?
llama.cpp. Эти инструменты читают файл .gguf и позволяют общаться с моделью. Двойной клик по файлу сам по себе ничего не даст.Какая программа создает файлы GGUF?
llama.cpp, в основном convert_hf_to_gguf.py, который превращает модель Hugging Face в .gguf, после чего опционально используется llama-quantize для уменьшения размера до нужного квантования, например Q4_K_M.Что означает Q4_K_M в имени файла GGUF?
Можно ли конвертировать файл GGUF обратно в исходную модель?
.safetensors или PyTorch с помощью скриптов сообщества, но так как большинство файлов GGUF квантованы, преобразование идет с потерями и не восстанавливает точные исходные веса.Почему мой файл GGUF такой большой?
.gguf содержит все веса модели в одном файле. Размер файла масштабируется в зависимости от количества параметров и уровня квантования, поэтому большая модель с высокой точностью может легко превышать десятки гигабайт.