Pourquoi convertir GGUF en ONNX ?
Les gens veulent du GGUF en .onnx pour exécuter un modèle dans ONNX Runtime, DirectML ou d'autres accélérateurs multiplateformes qui ne lisent pas le GGUF. Comme ONNX nécessite un graphe de calcul standard et que GGUF est un conteneur quantifié spécifique à llama.cpp, vous devez d'abord reconstruire un modèle PyTorch normal puis l'exporter.
Comment convertir GGUF en ONNX
Déquantifier GGUF en safetensors OPEN-SOURCE
Utilisez un convertisseur tel que l'outil ungguf ou un script de lecture gguf pour transformer le .gguf en safetensors de pleine précision que Transformers peut charger.
Exporter vers ONNX avec Optimum FREE
Pointez Optimum vers le modèle reconstruit : optimum-cli export onnx --model ./model-dir onnx-out/ écrit le fichier .onnx.
Exporter manuellement avec PyTorch OPEN-SOURCE
Pour les architectures non prises en charge, chargez le modèle dans PyTorch et appelez torch.onnx.export(model, dummy_input, « model.onnx ») vous-même.
À propos de ces formats
Un fichier .gguf est un fichier au format universel GGML (GGML Universal Format), le conteneur binaire utilisé par llama.cpp et les outils associés pour stocker un grand modèle de langage…
Ouvrir les détails de .GGUF →Un fichier .ONNX est un fichier de données utilisé par un logiciel spécifique.
Ouvrir les détails de .ONNX →Qualité et points de vigilance
- La déquantification d'un GGUF quantifié ne peut pas récupérer la précision perdue lors de la quantification, et les types de quant complexes (comme les variantes IQ) peuvent ne pas se convertir parfaitement.
- Le ONNX résultant est en pleine précision, il peut donc être plusieurs fois plus volumineux que le GGUF compact de départ.
- Optimum ne prend en charge que certaines architectures par défaut ; les modèles de niche ou personnalisés peuvent nécessiter une configuration d'exportation manuelle ou échouer.