Waarom GGUF naar ONNX converteren?
Mensen willen GGUF als .onnx om een model uit te voeren in ONNX Runtime, DirectML of andere platformonafhankelijke versnellers die geen GGUF lezen. Omdat ONNX een standaard berekeningsgrafiek nodig heeft en GGUF een llama.cpp-specifieke gekwantiseerde container is, moet je eerst een normaal PyTorch-model reconstrueren en dat vervolgens exporteren.
Hoe GGUF naar ONNX te converteren
GGUF dekwantiseren naar safetensors OPEN-SOURCE
Gebruik een converter zoals de ungguf-tool of een gguf-reader-script om de .gguf terug te zetten naar volledige precisie safetensors die Transformers kan laden.
Exporteren naar ONNX met Optimum FREE
Richt Optimum op het gereconstrueerde model: optimum-cli export onnx --model ./model-dir onnx-out/ schrijft het .onnx-bestand.
Handmatig exporteren met PyTorch OPEN-SOURCE
Voor niet-ondersteunde architecturen laad je het model in PyTorch en roep je zelf torch.onnx.export(model, dummy_input, „model.onnx”) aan.
Over deze formaten
Een .gguf-bestand is een GGML Universal Format-bestand, de binaire container die wordt gebruikt door llama.cpp en gerelateerde tools om een groot taalmodel als één enkel bestand op te…
Open .GGUF details →Een .ONNX-bestand is een gegevensbestand dat wordt gebruikt door specifieke software.
Open .ONNX details →Kwaliteit & waar op te letten
- Het dekwantiseren van een gekwantiseerde GGUF kan de precisie die verloren is gegaan tijdens de kwantisering niet herstellen, en complexe kwantiseringstypes (zoals IQ-varianten) kunnen mogelijk niet foutloos worden omgezet.
- De resulterende ONNX is in volledige precisie, dus deze kan meerdere malen groter zijn dan de compacte GGUF waar je mee begon.
- Optimum ondersteunt standaard alleen bepaalde architecturen; niche- of aangepaste modellen hebben mogelijk een handmatige exportconfiguratie nodig of kunnen falen.