GGUF ONNX
Conversão de arquivo

Converter GGUF para ONNX

RESPOSTA RÁPIDA
É possível converter GGUF para ONNX?
Sim - GGUF converte para ONNX.

Não existe um exportador direto de GGUF para ONNX. O caminho realista é converter o .gguf de volta para um modelo Hugging Face (safetensors) com uma ferramenta GGUF-to-safetensors, carregá-lo no Transformers e, em seguida, executar optimum-cli export onnx para gerar o .onnx. Espere arquivos grandes, já que a desquantização remove a economia de tamanho do GGUF.

Também para ONNX: H5

Nesta página

Testado em macOS, Windows e Linux
Última verificação em Sep 2026

Mais conversores gratuitos

HEIC, PNG, WEBP, MP3 e mais - todas as ferramentas aqui são gratuitas.

Abrir a caixa de ferramentas

Por que converter GGUF para ONNX?

As pessoas querem GGUF como .onnx para executar um modelo no ONNX Runtime, DirectML ou outros aceleradores multiplataforma que não leem GGUF. Como o ONNX precisa de um grafo de computação padrão e o GGUF é um contêiner quantizado específico do llama.cpp, você primeiro reconstrói um modelo PyTorch normal e depois o exporta.

Como converter GGUF para ONNX

Desquantizar GGUF para safetensors OPEN-SOURCE

Use um conversor como a ferramenta ungguf ou um script de leitura de gguf para transformar o .gguf de volta em safetensors de precisão total que o Transformers possa carregar.

Exportar para ONNX com Optimum FREE

Aponte o Optimum para o modelo reconstruído: optimum-cli export onnx --model ./model-dir onnx-out/ grava o arquivo .onnx.

Exportar manualmente com PyTorch OPEN-SOURCE

Para arquiteturas não suportadas, carregue o modelo no PyTorch e chame torch.onnx.export(model, dummy_input, "model.onnx") você mesmo.

Sobre estes formatos

Qualidade e o que observar

  • Desquantizar um GGUF quantizado não recupera a precisão perdida durante a quantização, e tipos complexos de quantização (como variantes IQ) podem não converter perfeitamente.
  • O ONNX resultante é de precisão total, portanto, pode ser várias vezes maior que o GGUF compacto original.
  • O Optimum suporta apenas certas arquiteturas nativamente; modelos de nicho ou personalizados podem precisar de uma configuração de exportação manual ou falhar.

Perguntas frequentes

Posso exportar GGUF direto para ONNX?
Não. Você deve primeiro converter o GGUF para um modelo PyTorch/safetensors e depois exportá-lo para ONNX.
O modelo ONNX será tão pequeno quanto o GGUF?
Não. A desquantização restaura a precisão total, então o arquivo ONNX é tipicamente muito maior, a menos que você o quantize novamente depois.
A desquantização restaura a precisão original?
Não. A quantização é lossy (com perdas), então os pesos recuperados carregam os mesmos erros do GGUF quantizado.
Quais ferramentas eu preciso?
Um conversor GGUF-para-safetensors, além do Hugging Face Transformers e Optimum (ou PyTorch para exportação manual).