GGUF ONNX
Conversión de archivos

Convertir GGUF a ONNX

RESPUESTA RÁPIDA
¿Es posible convertir GGUF a ONNX?
- GGUF se convierte a ONNX.

No existe un exportador directo de GGUF a ONNX. El camino realista es convertir el .gguf de nuevo a un modelo de Hugging Face (safetensors) con una herramienta de GGUF-a-safetensors, cargarlo en Transformers y luego ejecutar optimum-cli export onnx para producir el .onnx. Ten en cuenta que los archivos serán grandes, ya que la des-cuantización elimina el ahorro de tamaño de GGUF.

También a ONNX: H5

En esta página

Probado en macOS, Windows y Linux
Última verificación Sep 2026

Más convertidores gratuitos

HEIC, PNG, WEBP, MP3 y más - cada herramienta aquí es gratuita.

Abrir la caja de herramientas

¿Por qué convertir GGUF a ONNX?

Los usuarios quieren GGUF como .onnx para ejecutar un modelo en ONNX Runtime, DirectML u otros aceleradores multiplataforma que no leen GGUF. Debido a que ONNX necesita un grafo de computación estándar y GGUF es un contenedor cuantizado específico de llama.cpp, primero debes reconstruir un modelo de PyTorch normal y luego exportarlo.

Cómo convertir GGUF a ONNX

Des-cuantizar GGUF a safetensors OPEN-SOURCE

Usa un convertidor como la herramienta ungguf o un script lector de gguf para transformar el .gguf de nuevo en safetensors de precisión completa que Transformers pueda cargar.

Exportar a ONNX con Optimum FREE

Apunta Optimum al modelo reconstruido: optimum-cli export onnx --model ./model-dir onnx-out/ escribe el archivo .onnx.

Exportar manualmente con PyTorch OPEN-SOURCE

Para arquitecturas no compatibles, carga el modelo en PyTorch y llama a torch.onnx.export(model, dummy_input, "model.onnx") tú mismo.

Acerca de estos formatos

Calidad y qué observar

  • Des-cuantizar un GGUF cuantizado no puede recuperar la precisión perdida durante la cuantización, y los tipos de cuantización complejos (como las variantes IQ) pueden no convertirse correctamente.
  • El ONNX resultante es de precisión completa, por lo que puede ser varias veces más grande que el GGUF compacto original.
  • Optimum solo admite ciertas arquitecturas de forma nativa; los modelos de nicho o personalizados pueden necesitar una configuración de exportación manual o fallar.

Preguntas frecuentes

¿Puedo exportar GGUF directamente a ONNX?
No. Primero debes convertir el GGUF a un modelo de PyTorch/safetensors y luego exportar este último a ONNX.
¿Será el modelo ONNX tan pequeño como el GGUF?
No. La des-cuantización restaura la precisión completa, por lo que el archivo ONNX suele ser mucho más grande a menos que lo vuelvas a cuantizar después.
¿La des-cuantización restaura la precisión original?
No. La cuantización es un proceso con pérdida (lossy), por lo que los pesos recuperados conllevan los mismos errores que el GGUF cuantizado.
¿Qué herramientas necesito?
Un convertidor de GGUF a safetensors más Hugging Face Transformers y Optimum (o PyTorch para una exportación manual).