Hvorfor konvertere GGUF til ONNX?
Folk ønsker GGUF som .onnx for at køre en model i ONNX Runtime, DirectML eller andre acceleratorer på tværs af platforme, der ikke læser GGUF. Da ONNX kræver en standard beregningsgraf, og GGUF er en llama.cpp-specifik kvantiseret container, skal du først rekonstruere en normal PyTorch-model og derefter eksportere den.
Sådan konverterer du GGUF til ONNX
Dekvantiser GGUF til safetensors OPEN-SOURCE
Brug en konverter såsom ungguf-værktøjet eller et gguf-læsescript til at omdanne .gguf tilbage til fuld-præcision safetensors, som Transformers kan indlæse.
Eksporter til ONNX med Optimum FREE
Peg Optimum på den rekonstruerede model: optimum-cli export onnx --model ./model-dir onnx-out/ skriver .onnx-filen.
Eksporter manuelt med PyTorch OPEN-SOURCE
For arkitekturer, der ikke understøttes, skal du indlæse modellen i PyTorch og selv kalde torch.onnx.export(model, dummy_input, "model.onnx").
Om disse formater
En .gguf-fil er en GGML Universal Format-fil, den binære container, der bruges af llama.cpp og relaterede værktøjer til at gemme en stor sprogmodel som en enkelt fil. Den indeholder…
Åbn .GGUF detaljer →En .ONNX-fil er en datafil, der bruges af specifik software.
Åbn .ONNX detaljer →Kvalitet & hvad man skal være opmærksom på
- Dekvantisering af en kvantiseret GGUF kan ikke genvinde den præcision, der gik tabt under kvantiseringen, og komplekse kvantiseringstyper (som IQ-varianter) kan muligvis ikke konverteres fejlfrit.
- Den resulterende ONNX er i fuld præcision, så den kan være flere gange større end den kompakte GGUF, du startede med.
- Optimum understøtter kun visse arkitekturer som standard; niche- eller specialbyggede modeller kan kræve en manuel eksportkonfiguration eller fejle.