Warum GGUF in ONNX konvertieren?
Nutzer möchten GGUF als .onnx nutzen, um ein Modell in ONNX Runtime, DirectML oder anderen plattformübergreifenden Beschleunigern auszuführen, die GGUF nicht lesen können. Da ONNX einen Standard-Berechnungsgraphen benötigt und GGUF ein llama.cpp-spezifischer quantisierter Container ist, rekonstruieren Sie zuerst ein normales PyTorch-Modell und exportieren es dann.
Wie man GGUF in ONNX konvertiert
GGUF zu safetensors dequantisieren OPEN-SOURCE
Verwenden Sie einen Konverter wie das ungguf-Tool oder ein gguf-Reader-Skript, um die .gguf zurück in Full-Precision safetensors zu verwandeln, die Transformers laden kann.
Export nach ONNX mit Optimum FREE
Richten Sie Optimum auf das rekonstruierte Modell: optimum-cli export onnx --model ./model-dir onnx-out/ schreibt die .onnx-Datei.
Manueller Export mit PyTorch OPEN-SOURCE
Laden Sie bei nicht unterstützten Architekturen das Modell in PyTorch und rufen Sie torch.onnx.export(model, dummy_input, „model.onnx“) selbst auf.
Über diese Formate
Eine .gguf-Datei ist eine GGML Universal Format-Datei, der binäre Container, der von llama.cpp und verwandten Tools verwendet wird, um ein großes Sprachmodell als einzelne Datei zu…
.GGUF-Details öffnen →Eine .ONNX-Datei ist eine Datendatei, die von bestimmter Software verwendet wird.
.ONNX-Details öffnen →Qualität & worauf zu achten ist
- Das Dequantisieren einer quantisierten GGUF kann die während der Quantisierung verlorene Präzision nicht wiederherstellen, und komplexe Quantisierungstypen (wie IQ-Varianten) lassen sich möglicherweise nicht sauber zurückkonvertieren.
- Die resultierende ONNX-Datei ist Full-Precision und kann daher um ein Vielfaches größer sein als die kompakte GGUF-Ausgangsdatei.
- Optimum unterstützt standardmäßig nur bestimmte Architekturen; Nischen- oder benutzerdefinierte Modelle benötigen möglicherweise eine manuelle Export-Konfiguration oder schlagen fehl.