docker run --runtime nvidia --gpus all \ -p 8000:8000 \ vllm/vllm-openai --model philschmid/llama-3-1-8b-math-orca-qlora-10k-ep1-merged