Hvorfor konvertere GGUF til SAFETENSORS?
Konvertering af .gguf til .safetensors lader dig indlæse en model tilbage i Hugging Face Transformers eller diffusers, finjustere den eller re-kvantisere den på en anden måde. GGUF er optimeret til llama.cpp-inferens, mens .safetensors er det standardiserede, pickle-frie format til PyTorch/HF-økosystemet. Bemærk, at meget nye GGUF-formatrevisioner ikke altid kan konverteres.
Sådan konverterer du GGUF til SAFETENSORS
gguf_to_safetensors OPEN-SOURCE
Kør python gguf_to_safetensors.py --input model.gguf --output model.safetensors. Den bruger som standard F16; tilføj --bf16 for BF16-output.
GGUF2Safetensors OPEN-SOURCE
Opkonverterer GGUF-vægte til PyTorch-tensorer i hukommelsen og skriver en Hugging Face-mappe med .safetensors shards, der kan bruges direkte med Transformers.
gguf library + safetensors FREE
Indlæs med GGUFReader, kald gguf.quants.dequantize() pr. tensor, og derefter safetensors.torch.save_file(). Fuld kontrol over dtype og sharding.
Om disse formater
En .gguf-fil er en GGML Universal Format-fil, den binære container, der bruges af llama.cpp og relaterede værktøjer til at gemme en stor sprogmodel som en enkelt fil. Den indeholder…
Åbn .GGUF detaljer →En .SAFETENSORS-fil er en datafil, der bruges af specifik software.
Åbn .SAFETENSORS detaljer →Kvalitet & hvad man skal være opmærksom på
- Dekvantisering af en kvantiseret GGUF (Q4/Q5/osv.) er tabsgivende -
.safetensors-filen vil ikke matche den originale model bit-for-bit. - Nyere GGUF-formatversioner kan fejle i konverteringen, fordi værktøjerne halter bagefter ændringer i llama.cpp.
- Output er F16/BF16 (eller F32), så filstørrelsen vokser betydeligt i forhold til den kompakte kvantiserede GGUF.
Ofte stillede spørgsmål
Er GGUF-til-safetensors tabsfri?
Hvorfor fejlede min nyere GGUF i konverteringen?
Kan jeg indlæse resultatet i Hugging Face Transformers?
.safetensors), hvilket er målet for GGUF2Safetensors.