25 × 7 researched deployment paths

Pick the model.
Stand up the endpoint.

The top 25 open-weight models on OpenRouter, mapped to the GPU clouds that can actually run them. Every cell opens a provider-specific runbook with hardware, runtime, source docs, smoke tests, and an agent-ready prompt.

Snapshot checked 2026-07-28 · OpenRouter trailing-week order · filtered to downloadable Hugging Face weights

Choose any model × provider pair

Green paths are single-GPU. Purple paths share one multi-GPU host. Amber paths require multiple connected nodes. Red paths deliberately withhold commands when the evidence is incomplete.

Single-node Multi-GPU Cluster Planning only Poor fit
Open-weight rank RunPod Vast.ai Lambda AWS Google Cloud Azure Oracle Cloud
01 MiMo-V2.5 310.8B · 1.04858M ctx · 4×141GB One-node multi-GPU 1 node × 4 H200 (564GB HBM) One-node multi-GPU 1 node × 4 H200 (564GB HBM) One-node multi-GPU 1 node × 4 H200 (564GB HBM) One-node multi-GPU 1 node × 4 H200 (564GB HBM) One-node multi-GPU 1 node × 4 H200 (564GB HBM) One-node multi-GPU 1 node × 4 H200 (564GB HBM) One-node multi-GPU 1 node × 4 H200 (564GB HBM)
02 DeepSeek-V4-Flash 284B · 1.04858M ctx · 4×141GB One-node multi-GPU 1 node × 4 H200 (564GB HBM) One-node multi-GPU 1 node × 4 H200 (564GB HBM) One-node multi-GPU 1 node × 4 H200 (564GB HBM) One-node multi-GPU 1 node × 4 H200 (564GB HBM) One-node multi-GPU 1 node × 4 H200 (564GB HBM) One-node multi-GPU 1 node × 4 H200 (564GB HBM) One-node multi-GPU 1 node × 4 H200 (564GB HBM)
03 Hy3 295B · 256K ctx · 8×141GB One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM)
04 GLM-5.2 753B · 1.04858M ctx · 8×141GB One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM)
05 DeepSeek-V4-Pro 1.6T · 1.04858M ctx · 8×141GB One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM)
06 Nemotron 3 Ultra 550B-A55B 550B · 1M ctx · 4×192GB One-node multi-GPU 1 node × 4 B200 (768GB HBM) One-node multi-GPU 1 node × 4 B200 (768GB HBM) One-node multi-GPU 1 node × 4 B200 (768GB HBM) One-node multi-GPU 1 node × 4 B200 (768GB HBM) One-node multi-GPU 1 node × 4 B200 (768GB HBM) One-node multi-GPU 1 node × 4 B200 (768GB HBM) One-node multi-GPU 1 node × 4 B200 (768GB HBM)
07 MiniMax M3 427B · 1.04858M ctx · 8×141GB One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM)
08 Step 3.7 Flash 201B · 256K ctx · 4×192GB One-node multi-GPU 1 node × 4 B200 (768GB HBM) One-node multi-GPU 1 node × 4 B200 (768GB HBM) One-node multi-GPU 1 node × 4 B200 (768GB HBM) One-node multi-GPU 1 node × 4 B200 (768GB HBM) One-node multi-GPU 1 node × 4 B200 (768GB HBM) One-node multi-GPU 1 node × 4 B200 (768GB HBM) One-node multi-GPU 1 node × 4 B200 (768GB HBM)
09 Kimi K3 2.8T · 1.04858M ctx · 8×288GB Cluster · capacity check 2 nodes × 8 B200 (16 GPUs / 3,072GB HBM) Cluster · capacity check 2 nodes × 8 H200 (16 GPUs / 2,256GB HBM) Cluster · capacity check 2 nodes × 8 B200 (16 GPUs / 3,072GB HBM) One-node multi-GPU 1 node × 8 B300 (2,304GB HBM) Cluster · capacity check 2 nodes × 8 H200 (16 GPUs / 2,256GB HBM) Cluster · capacity check 2 nodes × 8 H200 (16 GPUs / 2,256GB HBM) Cluster · capacity check 4 nodes × 8 H100 (32 GPUs / 2,560GB HBM)
10 MiMo-V2.5-Pro 1.02T · 1.04858M ctx · 8×141GB One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM)
11 gpt-oss-120b 117B · 128K ctx · 1×80GB Guided endpoint 1 node × 1 A100/H100 80GB (80GB HBM) Single-node 1 node × 1 A100/H100 80GB (80GB HBM) Single-node 1 node × 1 A100/H100 80GB (80GB HBM) Single-node 1 node × 1 A100/H100 80GB (80GB HBM) Single-node 1 node × 1 A100/H100 80GB (80GB HBM) Single-node 1 node × 1 A100/H100 80GB (80GB HBM) Single-node 1 node × 1 A100/H100 80GB (80GB HBM)
12 DeepSeek-V3.2 685B · 160K ctx · 8×141GB One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM)
13 Gemma 4 31B 30.7B · 256K ctx · 1×80GB Planning only · do not provision 1 node × 1 H100 80GB (80GB HBM) Planning only · do not provision 1 node × 1 H100 80GB (80GB HBM) Planning only · do not provision 1 node × 1 H100 80GB (80GB HBM) Planning only · do not provision 1 node × 1 H100 80GB (80GB HBM) Planning only · do not provision 1 node × 1 H100 80GB (80GB HBM) Planning only · do not provision 1 node × 1 H100 80GB (80GB HBM) Planning only · do not provision 1 node × 1 H100 80GB (80GB HBM)
14 Nemotron 3 Super 120B-A12B 120B · 1.04858M ctx · 4×80GB One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM)
15 Gemma 4 26B-A4B 25.2B · 256K ctx · 1×80GB Planning only · do not provision 1 node × 1 H100 80GB (80GB HBM) Planning only · do not provision 1 node × 1 H100 80GB (80GB HBM) Planning only · do not provision 1 node × 1 H100 80GB (80GB HBM) Planning only · do not provision 1 node × 1 H100 80GB (80GB HBM) Planning only · do not provision 1 node × 1 H100 80GB (80GB HBM) Planning only · do not provision 1 node × 1 H100 80GB (80GB HBM) Planning only · do not provision 1 node × 1 H100 80GB (80GB HBM)
16 Kimi K2.6 1.059T · 256K ctx · 8×141GB One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM)
17 Mistral Nemo 12.2B · 128K ctx · 1×48GB Planning only · do not provision 1 node × 1 L40S/A6000 48GB (48GB HBM) Planning only · do not provision 1 node × 1 L40S/A6000 48GB (48GB HBM) Planning only · do not provision 1 node × 1 L40S/A6000 48GB (48GB HBM) Planning only · do not provision 1 node × 1 L40S/A6000 48GB (48GB HBM) Planning only · do not provision 1 node × 1 L40S/A6000 48GB (48GB HBM) Planning only · do not provision 1 node × 1 L40S/A6000 48GB (48GB HBM) Planning only · do not provision 1 node × 1 L40S/A6000 48GB (48GB HBM)
18 GLM-5 753.9B · 200K ctx · 8×141GB One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM)
19 North Mini Code 1.0 30B · 256K ctx · 2×80GB Planning only · do not provision 1 node × 2 H100 80GB (160GB HBM) Planning only · do not provision 1 node × 2 H100 80GB (160GB HBM) Planning only · do not provision 1 node × 2 H100 80GB (160GB HBM) Planning only · do not provision 1 node × 2 H100 80GB (160GB HBM) Planning only · do not provision 1 node × 2 H100 80GB (160GB HBM) Planning only · do not provision 1 node × 2 H100 80GB (160GB HBM) Planning only · do not provision 1 node × 2 H100 80GB (160GB HBM)
20 Laguna M.1 225B · 256K ctx · 8×141GB One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM)
21 Laguna S 2.1 118B · 1.04858M ctx · 4×80GB One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM)
22 Kimi K2.5 1.059T · 256K ctx · 8×141GB One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM)
23 Laguna XS 2.1 33B · 256K ctx · 1×80GB Guided endpoint 1 node × 1 H100 80GB (80GB HBM) Single-node 1 node × 1 H100 80GB (80GB HBM) Single-node 1 node × 1 H100 80GB (80GB HBM) Single-node 1 node × 1 H100 80GB (80GB HBM) Single-node 1 node × 1 H100 80GB (80GB HBM) Single-node 1 node × 1 H100 80GB (80GB HBM) Single-node 1 node × 1 H100 80GB (80GB HBM)
24 MiniMax M2.7 229B · 200K ctx · 4×80GB One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM) One-node multi-GPU 1 node × 4 H100 80GB (320GB HBM)
25 Kimi K2.7 Code 1.059T · 256K ctx · 8×141GB One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM) One-node multi-GPU 1 node × 8 H200 (1,128GB HBM)

Seven clouds, seven different setup surfaces

Hand this runbook to Claude Code or Codex

Open a terminal in the repository where you want the deployment files, start claude or codex, then paste this prompt. It asks the agent to verify sources and stop before it creates billable infrastructure.

Deployment prompt
Use the infrastructure or model context on this page to create a reproducible open-model deployment. Use this guide as the starting context: https://www.getflops.ai/. Read the linked model card and provider documentation before choosing hardware or runtime settings. Open every linked primary source and flag any mismatch instead of guessing. Create a deployment folder containing README.md, .env.example with no secrets, a pinned start script or infrastructure manifest, and smoke-test.sh. Make the endpoint OpenAI-compatible where the runtime supports it. Run local/static validation, estimate the billable resources, and stop before provisioning paid infrastructure until I approve.
Guardrails included No secrets in files · verify primary docs · approval before spend