# Kyma API model rankings

Markdown version of https://kymaapi.com/rankings, for agents and crawlers. Same data as the HTML page, measured from all Kyma API traffic (including Kyma's own accounts) and refreshed every 5 minutes. The page's six tabs are the sections below.

- Generated: 2026-10-09T21:45:18.356Z
- HTML page: https://kymaapi.com/rankings
- Model catalog: https://kymaapi.com/models.md
- Pricing: https://kymaapi.com/pricing.md

4.4B tokens across 101 models from 3,615 developers. A model is counted when it has at least one request in the window.

## Top models by tokens

Speed is output tokens per second; an empty cell means not measured. Uptime is the share of the last 30 days' observations that came back from the model that was asked for, one definition across Kyma. Request success rate is a different number: the Reliability column under Performance.

| # | Model | Creator | Tokens | Speed | Uptime (30d) |
| --- | --- | --- | --- | --- | --- |
| 1 | `deepseek-v4-flash` | DeepSeek | 1.2B | 33 tok/s | 100% |
| 2 | `qwen-3.6-plus` | Alibaba | 550.5M | 50 tok/s | 100% |
| 3 | `gemma-4-31b` | Google | 395.4M | 14 tok/s | 100% |
| 4 | `deepseek-v4.1-flash` | DeepSeek | 319.6M | 52 tok/s | 100% |
| 5 | `deepseek-v3` | DeepSeek | 183.4M |  | 98% |
| 6 | `gpt-oss-120b` | OpenAI | 131.7M | 56 tok/s | 98% |
| 7 | `minimax-m2.7` | MiniMax | 119.8M | 13 tok/s | 100% |
| 8 | `minimax-m2.5` | MiniMax | 102.7M | 58 tok/s | 98% |
| 9 | `gemini-3-flash` | Google | 97.6M | 103 tok/s | 99% |
| 10 | `qwen-3-coder` | Alibaba | 95.8M | 5 tok/s | 100% |
| 11 | `glm-5.3-flash` | Zhipu AI | 89.6M | 31 tok/s | 100% |
| 12 | `gemini-3.7-flash` | Google | 83.3M | 89 tok/s | 99% |
| 13 | `llama-3.3-70b` | Meta | 74.9M | 10 tok/s | 89% |
| 14 | `qwen3.7-flash` | Alibaba | 61.2M | 90 tok/s | 97% |
| 15 | `gpt-5.6-luna` | OpenAI | 53.6M | 63 tok/s | 98% |
| 16 | `glm-4.7-flash` | Zhipu AI | 53.5M | 9 tok/s | 100% |
| 17 | `kimi-k3` | Moonshot | 45.4M | 52 tok/s | 98% |
| 18 | `qwen-3.8-max` | Alibaba | 45.2M |  | 100% |
| 19 | `gemini-3.5-flash` | Google | 45.0M | 100 tok/s | 98% |
| 20 | `qwen3.8-flash` | Alibaba | 42.1M | 9 tok/s | 92% |
| 21 | `qwen-3-32b` | Alibaba | 38.4M | 13 tok/s | 74% |
| 22 | `glm-5.3` | Zhipu AI | 29.5M |  | 100% |
| 23 | `minimax-m3` | MiniMax | 27.0M | 8 tok/s | 100% |
| 24 | `deepseek-v4-flash-vision-exp` | DeepSeek | 26.8M | 14 tok/s | 97% |
| 25 | `deepseek-r1` | DeepSeek | 23.5M | 17 tok/s | 100% |
| 26 | `glm-4.5-air` | Zhipu AI | 15.5M | 19 tok/s | 100% |
| 27 | `muse-spark-1.2` | Meta | 15.0M |  | 100% |
| 28 | `glm-5.1` | Zhipu AI | 15.0M |  | 100% |
| 29 | `gemini-3.5-flash-lite` | Google | 13.7M | 222 tok/s | 99% |
| 30 | `gpt-5.6-sol` | OpenAI | 13.2M | 37 tok/s | 97% |
| 31 | `kimi-k2.6` | Moonshot | 12.7M |  | 100% |
| 32 | `gpt-5.6-luna-pro` | OpenAI | 12.6M | 22 tok/s | 90% |
| 33 | `glm-5.2` | Zhipu AI | 11.3M | 55 tok/s | 100% |
| 34 | `qwen3.8-27b` | Alibaba | 10.0M | 18 tok/s | 99% |
| 35 | `gemini-3.6-flash` | Google | 8.9M |  | 91% |
| 36 | `grok-4.20-multi-agent` | xAI | 6.2M |  | 100% |
| 37 | `qwen-3.7-max` | Alibaba | 5.8M | 102 tok/s | 100% |
| 38 | `claude-fable-5` | Anthropic | 5.7M |  | 100% |
| 39 | `grok-4.3` | xAI | 4.5M |  | 100% |
| 40 | `qwen-3.7-plus` | Alibaba | 4.0M | 17 tok/s | 100% |
| 41 | `claude-sonnet-5` | Anthropic | 3.7M | 49 tok/s | 91% |
| 42 | `gemini-3.8-flash` | Google | 3.6M | 42 tok/s | 99% |
| 43 | `kimi-k2.7-code` | Moonshot | 3.1M |  | 100% |
| 44 | `gpt-5.6-terra-pro` | OpenAI | 3.0M |  | 100% |
| 45 | `gpt-5.6-sol-pro` | OpenAI | 2.6M |  | 100% |
| 46 | `claude-haiku-4-5` | Anthropic | 1.6M | 172 tok/s | 99% |
| 47 | `step-3.7-flash` | StepFun | 1.3M | 11 tok/s | 100% |
| 48 | `grok-build` | xAI | 1.2M |  | 100% |
| 49 | `claude-opus-5` | Anthropic | 1.2M |  | 100% |
| 50 | `claude-fable-5.1` | Anthropic | 942.2K |  | 100% |
| 51 | `claude-sonnet-4-6` | Anthropic | 932.3K | 39 tok/s | 99% |
| 52 | `gpt-5.6-terra` | OpenAI | 840.3K |  | 86% |
| 53 | `sonar` | Perplexity | 743.5K |  | 100% |
| 54 | `whisper-v3-turbo` | OpenAI | 677.3K |  | 99% |
| 55 | `nemotron-3-ultra-550b` | NVIDIA | 563.8K |  | 100% |
| 56 | `grok-4.5` | xAI | 485.3K |  | 100% |
| 57 | `grok-4.6` | xAI | 344.0K |  | 100% |
| 58 | `kling-3-pro` | Kuaishou | 330.8K |  |  |
| 59 | `muse-spark-1.1` | Meta | 315.3K |  | 100% |
| 60 | `llama-4-maverick` | Meta | 297.8K | 7 tok/s | 100% |
| 61 | `mimo-v2.5` | Xiaomi | 232.2K |  | 100% |
| 62 | `grok-4.20` | xAI | 211.2K |  | 100% |
| 63 | `gemini-3.1-pro` | Google | 210.8K |  | 100% |
| 64 | `grok-4.7` | xAI | 185.0K |  | 100% |
| 65 | `claude-opus-4-7` | Anthropic | 171.2K |  | 100% |
| 66 | `qwen3-embedding-8b` | Alibaba | 150.3K |  | 100% |
| 67 | `gpt-6-astra` | OpenAI | 136.1K |  | 41% |
| 68 | `hy3` | Tencent | 127.9K | 7 tok/s | 100% |
| 69 | `ideogram-v3` | Ideogram | 111.8K |  |  |
| 70 | `flux-kontext-pro` | Black Forest Labs | 104.1K |  |  |
| 71 | `hermes-3-70b` | Nous Research | 88.4K |  | 100% |
| 72 | `muse-glimmer-30b` | Meta | 73.0K | 27 tok/s | 100% |
| 73 | `bge-m3` | BAAI | 72.8K |  | 100% |
| 74 | `multilingual-e5-large` | Microsoft | 65.2K |  |  |
| 75 | `sonar-pro` | Perplexity | 59.5K |  | 100% |
| 76 | `hermes-3-405b` | Nous Research | 56.1K |  | 100% |
| 77 | `jev` | TypeSafe | 55.5K |  | 100% |
| 78 | `embeddinggemma-300m` | Google | 52.9K |  | 100% |
| 79 | `gte-base` | Alibaba | 51.3K |  |  |
| 80 | `bge-large-en` | BAAI | 50.7K |  |  |
| 81 | `bge-base-en` | BAAI | 50.7K |  |  |
| 82 | `qwen3-embedding-0.6b` | Alibaba | 50.6K |  |  |
| 83 | `qwen3-embedding-4b` | Alibaba | 50.6K |  |  |
| 84 | `all-minilm-l6` | Sentence Transformers | 33.1K |  |  |
| 85 | `gpt-4o-mini-transcribe-2025-12-15` | OpenAI | 18.9K |  | 100% |
| 86 | `all-minilm-l12` | Sentence Transformers | 16.3K |  |  |
| 87 | `muse-spark-1.3` | Meta | 14.3K | 91 tok/s |  |
| 88 | `qwen3-reranker-8b` | Alibaba | 11.7K |  |  |
| 89 | `eleven-flash-v2-5` | ElevenLabs | 112 |  |  |
| 90 | `minimax-image-01` | MiniMax | 56 |  | 98% |
| 91 | `minimax-speech-hd` | MiniMax | 56 |  |  |
| 92 | `minimax-speech-turbo` | MiniMax | 56 |  |  |
| 93 | `recraft-v4` | Recraft | 56 |  |  |
| 94 | `eleven-turbo-v2-5` | ElevenLabs | 56 |  |  |
| 95 | `flux-2-pro` | Black Forest Labs | 56 |  |  |
| 96 | `recraft-v4-vector` | Recraft | 56 |  |  |
| 97 | `eleven-multilingual-v2` | ElevenLabs | 56 |  | 100% |
| 98 | `recraft-v4-pro` | Recraft | 56 |  |  |
| 99 | `lyria-3.5` | Google | 0 |  |  |
| 100 | `gemini-3.5-transcribe` | Google | 0 |  | 86% |
| 101 | `gpt-transcribe` | OpenAI | 0 |  | 100% |

## Top apps

| # | App | Tokens | Requests | Developers | Top model |
| --- | --- | --- | --- | --- | --- |
| 1 | Node.js App | 303.2M | 22,020 | 143 | `gpt-oss-120b` |
| 2 | OpenCode | 254.3M | 1,895 | 8 | `deepseek-v4.1-flash` |
| 3 | Other | 181.5M | 15,494 | 50 | `gpt-4o-mini-transcribe-2025-12-15` |
| 4 | OpenAI Python | 115.5M | 2,307 | 31 | `qwen3.7-flash` |
| 5 | Lua/OpenResty | 99.2M | 4,079 | 9 | `minimax-m2.5` |
| 6 | Python App | 85.7M | 79,197 | 54 | `deepseek-v4-flash` |
| 7 | OpenClaw | 71.7M | 3,430 | 24 | `deepseek-v4.1-flash` |
| 8 | Java/Kotlin App | 63.8M | 711 | 7 | `deepseek-v4.1-flash` |
| 9 | Cline | 34.8M | 782 | 7 | `deepseek-v4.1-flash` |
| 10 | Go App | 9.3M | 151 | 10 | `glm-5.3` |
| 11 | Browser | 3.9M | 1,796 | 47 | `qwen3.7-flash` |
| 12 | Codex CLI | 2.5M | 962 | 4 | `gpt-5.6-luna` |
| 13 | Pheme | 1.9M | 36,818 | 12 | `whisper-v3-turbo` |
| 14 | API Direct | 464.9K | 1,573 | 3 | `gpt-5.6-luna` |
| 15 | Kyma Playground | 279.1K | 53 | 19 | `deepseek-v4-flash` |
| 16 | cURL | 257.9K | 469 | 28 | `gpt-4o-mini-transcribe-2025-12-15` |
| 17 | Vercel AI SDK | 225.7K | 16 | 3 | `deepseek-v4.1-flash` |
| 18 | Unknown | 155.0K | 2,896 | 70 |  |
| 19 | OpenAI SDK | 125.2K | 68 | 4 | `qwen3.8-flash` |
| 20 | Copilot | 83.3K | 3 | 2 | `gpt-5.6-luna` |
| 21 | Kilo Code | 69.8K | 1 | 1 | `deepseek-v4.1-flash` |
| 22 | Roo Code | 18.1K | 2 | 1 | `deepseek-v4.1-flash` |
| 23 | Kyma MCP | 14.4K | 24 | 3 | `glm-5.3-flash` |
| 24 | Cherry Studio | 4.7K | 3 | 1 | `qwen3.8-flash` |
| 25 | Claude Code | 1.1K | 24 | 6 | `gpt-5.6-luna` |
| 26 | watch-cli | 0 | 890 | 12 | `whisper-v3-turbo` |

## Performance

Reliability, speed, latency and cost, measured from production requests over the last 7 days. Most reliable first, busiest first among equals.

Reliability: share of requests that completed. Speed: median tokens/second (completion). TTFB: median time to first byte. P95 Latency: 95th percentile total request time. Price/M: input / output per 1M tokens. An empty cell means not measured, or not sold by the token.

| # | Model | Creator | Reliability | Speed | Volume | TTFB | P95 Latency | Cache Hit | Price/M |
| --- | --- | --- | --- | --- | --- | --- | --- | --- | --- |
| 1 | `gpt-oss-120b` | OpenAI | 100.0% | 56 tok/s | 69.6M | 1.7s | 148.0s | 0% | $0.0494 / $0.2406 |
| 2 | `minimax-m2.5` | MiniMax | 100.0% | 59 tok/s | 12.3M | 9.4s | 59.3s | 51% | $0.405 / $1.62 |
| 3 | `kimi-k3` | Moonshot | 100.0% | 52 tok/s | 6.1M | 1.7s | 27.5s | 79% | $3.768 / $18.837 |
| 4 | `gpt-5.6-sol` | OpenAI | 100.0% | 37 tok/s | 1.3M | 4.9s | 8.0s | 51% | $3.151 / $15.753 |
| 5 | `qwen3.7-flash` | Alibaba | 100.0% | 90 tok/s | 911.3K | 34.4s | 56.0s | 10% | $0.0504 / $0.2187 |
| 6 | `gemma-4-31b` | Google | 100.0% | 9 tok/s | 458.2K | 2.3s | 19.9s | 2% | $0.0763 / $0.218 |
| 7 | `gemini-3.8-flash` | Google | 100.0% | 42 tok/s | 330.9K | 8.7s | 18.8s | 12% | $1.013 / $5.063 |
| 8 | `gemini-3.7-flash` | Google | 100.0% | 89 tok/s | 287.8K | 5.4s | 19.2s | 14% | $1.013 / $5.063 |
| 9 | `gemini-3-flash` | Google | 100.0% | 53 tok/s | 45.7K | 1.1s | 10.5s | 0% | $0.675 / $4.05 |
| 10 | `llama-3.3-70b` | Meta | 100.0% | 12 tok/s | 43.6K | 960ms | 11.1s | 0% | $0.135 / $0.432 |
| 11 | `minimax-m3` | MiniMax | 100.0% | 8 tok/s | 38.7K | 2.9s | 18.1s | 12% | $0.405 / $1.62 |
| 12 | `qwen-3-32b` | Alibaba | 100.0% | 13 tok/s | 34.1K | 2.6s | 4.5s | 0% | $0.108 / $0.378 |
| 13 | `glm-4.7-flash` | Zhipu AI | 100.0% | 9 tok/s | 31.3K | 3.4s | 20.0s | 0% | $0.081 / $0.54 |
| 14 | `glm-5.2` | Zhipu AI | 100.0% | 62 tok/s | 10.0K | 1.5s | 5.3s | 32% | $1.101 / $3.76 |
| 15 | `llama-4-maverick` | Meta | 100.0% | 7 tok/s | 9.3K | 1.5s | 14.2s | 0% | $0.27 / $1.08 |
| 16 | `minimax-m2.7` | MiniMax | 100.0% | 13 tok/s | 9.2K | 2.5s | 3.4s | 0% | $0.405 / $1.62 |
| 17 | `deepseek-r1` | DeepSeek | 100.0% | 68 tok/s | 8.8K | 697ms | 1.4s | 0% | $0.7425 / $2.957 |
| 18 | `qwen-3-coder` | Alibaba | 100.0% | 111 tok/s | 6.4K | 588ms | 14.1s | 6% | $0.3586 / $1.629 |
| 19 | `muse-glimmer-30b` | Meta | 100.0% | 27 tok/s | 3.8K | 1.2s | 3.1s | 60% | $0.405 / $1.62 |
| 20 | `kimi-k2.6` | Moonshot | 100.0% | 66 tok/s | 2.7K | 650ms | 6.7s | 8% | $0.7856 / $3.667 |
| 21 | `step-3.7-flash` | StepFun | 100.0% | 11 tok/s | 2.2K | 2.8s | 5.1s | 0% | $0.27 / $1.552 |
| 22 | `hy3` | Tencent | 100.0% | 8 tok/s | 1.4K | 2.9s | 3.5s | 0% | $0.108 / $0.4455 |
| 23 | `sonar` | Perplexity | 100.0% |  | 138 | 1.6s | 2.5s | 0% | $1.35 / $1.35 |
| 24 | `deepseek-v4.1-flash` | DeepSeek | 99.8% | 53 tok/s | 127.2M | 1.7s | 18.7s | 92% | $0.1048 / $0.3141 |
| 25 | `deepseek-v4-flash` | DeepSeek | 99.8% | 32 tok/s | 5.3M | 7.7s | 140.9s | 68% | $0.1264 / $0.2526 |
| 26 | `qwen-3.6-plus` | Alibaba | 99.6% | 51 tok/s | 554.1K | 13.5s | 100.9s | 0% | $0.454 / $2.724 |
| 27 | `qwen3.8-flash` | Alibaba | 97.8% | 9 tok/s | 2.2M | 2.0s | 27.2s | 86% | $0.2045 / $0.641 |
| 28 | `qwen-3.7-plus` | Alibaba | 97.8% | 18 tok/s | 24.7K | 1.9s | 32.1s | 43% | $0.4431 / $1.773 |
| 29 | `gemini-3.5-flash-lite` | Google | 97.6% | 71 tok/s | 187.9K | 980ms | 7.6s | 0% | $0.405 / $3.375 |
| 30 | `glm-4.5-air` | Zhipu AI | 97.6% | 19 tok/s | 32.4K | 2.0s | 7.0s | 1% | $0.1945 / $1.272 |
| 31 | `glm-5.3-flash` | Zhipu AI | 97.3% | 32 tok/s | 35.3M | 3.0s | 38.1s | 68% | $0.1791 / $0.5972 |
| 32 | `deepseek-v4-flash-vision-exp` | DeepSeek | 96.3% | 14 tok/s | 908.2K | 1.7s | 5.4s | 48% | $0.2514 / $0.7542 |
| 33 | `qwen3.8-27b` | Alibaba | 96.2% | 18 tok/s | 18.6K | 1.5s | 12.3s | 2% | $0.3576 / $2.554 |
| 34 | `claude-sonnet-5` | Anthropic | 95.2% | 50 tok/s | 163.3K | 3.5s | 16.7s | 0% | $2.70 / $13.50 |
| 35 | `gpt-5.6-luna-pro` | OpenAI | 91.7% | 22 tok/s | 87.1K | 2.9s | 5.1s | 31% | $0.1548 / $0.9288 |
| 36 | `gpt-5.6-luna` | OpenAI | 83.3% | 62 tok/s | 2.8M | 2.7s | 65.1s | 12% | $0.3127 / $1.877 |
| 37 | `claude-haiku-4-5` | Anthropic | 61.1% | 172 tok/s | 169.0K | 12.8s | 15.8s | 0% | $1.35 / $6.75 |

### Embeddings, audio & realtime

These return one vector, one audio file or a live session rather than a stream of completion tokens, so tokens/second and time-to-first-byte are not defined for them, and they are not all sold by the token. Ranking them against chat models on those columns would compare two different things, so they get their own table and their price in the unit they are actually sold by.

| # | Model | Creator | Reliability | P95 Latency | Price |
| --- | --- | --- | --- | --- | --- |
| 1 | `whisper-v3-turbo` | OpenAI | 91.4% | 558ms | $0.0009 / min |
| 2 | `gpt-4o-mini-transcribe-2025-12-15` | OpenAI | 62.0% | 1.8s | $0.00405 / min |

## Agent Matrix

Real performance data per model, per coding agent. See which model works best in your workflow. Measured over the last 7 days; Reliability is the share of requests that completed, as on Performance.

### Compatibility Matrix

Speed in tok/s, as the tab opens: the 12 busiest models across the first 5 agents. Every agent's own readings follow under Agent Detail.

| Model | Cline | Claude Code | OpenClaw | OpenCode | Codex CLI |
| --- | --- | --- | --- | --- | --- |
| `deepseek-v4.1-flash` | 32 |  | 53 | 52 | 41 |
| `kimi-k3` |  |  | 47 |  |  |
| `deepseek-v4-flash` | 29 |  | 8 |  | 8 |
| `qwen-3-coder` |  |  |  | 21 | 111 |
| `qwen-3.6-plus` | 34 |  | 36 |  | 19 |
| `deepseek-v4-flash-vision-exp` |  |  | 39 |  | 19 |
| `deepseek-v3` | 14 |  | 6 |  |  |
| `claude-sonnet-5` |  |  | 72 |  |  |
| `llama-3.3-70b` |  |  | 5 |  |  |
| `gemma-4-31b` |  |  | 2 |  | 23 |
| `glm-5.3-flash` |  |  |  | 42 | 20 |
| `gpt-5.6-luna` |  | 5 |  |  | 22 |

### Agent Detail

#### Cline

| # | Model | Requests | Speed | TTFB | Avg Latency | Reliability |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | `deepseek-v4.1-flash` | 358 | 32 tok/s | 3.4s | 7.5s | 100.0% |
| 2 | `deepseek-v4-flash` | 320 | 29 tok/s | 2.1s | 6.9s | 100.0% |
| 3 | `qwen-3.6-plus` | 40 | 34 tok/s | 2.8s | 16.0s | 100.0% |
| 4 | `deepseek-v3` | 47 | 14 tok/s | 3.5s | 35.1s | 97.9% |

#### Claude Code

| # | Model | Requests | Speed | TTFB | Avg Latency | Reliability |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | `gpt-5.6-luna` | 24 | 5 tok/s | 1.9s | 2.1s | 100.0% |

#### OpenClaw

| # | Model | Requests | Speed | TTFB | Avg Latency | Reliability |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | `deepseek-v4.1-flash` | 2,032 | 53 tok/s | 748ms | 2.0s | 100.0% |
| 2 | `kimi-k3` | 988 | 47 tok/s | 1.6s | 7.5s | 100.0% |
| 3 | `qwen-3.6-plus` | 92 | 36 tok/s | 2.6s | 8.4s | 100.0% |
| 4 | `deepseek-v4-flash-vision-exp` | 77 | 39 tok/s | 2.0s | 4.9s | 100.0% |
| 5 | `deepseek-v4-flash` | 66 | 8 tok/s | 5.0s | 12.3s | 100.0% |
| 6 | `claude-sonnet-5` | 14 | 72 tok/s | 2.2s | 22.2s | 100.0% |
| 7 | `llama-3.3-70b` | 26 | 5 tok/s | 9.9s | 14.9s | 100.0% |
| 8 | `gemma-4-31b` | 22 | 2 tok/s | 3.0s | 15.6s | 100.0% |
| 9 | `step-3.7-flash` | 10 | 28 tok/s | 2.2s | 5.0s | 100.0% |
| 10 | `minimax-m2.7` | 10 | 19 tok/s | 3.5s | 6.0s | 100.0% |
| 11 | `gpt-oss-120b` | 11 | 20 tok/s | 2.9s | 5.3s | 100.0% |
| 12 | `deepseek-v3` | 11 | 6 tok/s | 6.9s | 9.9s | 81.8% |
| 13 | `minimax-m2.5` | 10 | 24 tok/s | 2.8s | 3.6s | 100.0% |
| 14 | `gpt-6-astra` | 10 | 17 tok/s | 1.3s | 3.7s | 100.0% |

#### OpenCode

| # | Model | Requests | Speed | TTFB | Avg Latency | Reliability |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | `deepseek-v4.1-flash` | 1,723 | 52 tok/s | 2.4s | 7.8s | 100.0% |
| 2 | `qwen-3-coder` | 147 | 21 tok/s | 3.2s | 10.9s | 99.3% |
| 3 | `glm-5.3-flash` | 13 | 42 tok/s | 2.2s | 9.4s | 100.0% |

#### Codex CLI

| # | Model | Requests | Speed | TTFB | Avg Latency | Reliability |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | `deepseek-v4.1-flash` | 37 | 41 tok/s | 2.0s | 7.0s | 100.0% |
| 2 | `gpt-5.6-luna` | 50 | 22 tok/s | 1.6s | 3.9s | 100.0% |
| 3 | `glm-4.7-flash` | 41 | 9 tok/s | 3.6s | 8.4s | 100.0% |
| 4 | `gpt-5.6-luna-pro` | 22 | 22 tok/s | 2.9s | 2.9s | 90.9% |
| 5 | `qwen3.8-27b` | 44 | 18 tok/s | 1.5s | 4.3s | 100.0% |
| 6 | `qwen-3-coder` | 38 | 111 tok/s | 1.5s | 5.6s | 100.0% |
| 7 | `gemma-4-31b` | 38 | 23 tok/s | 2.4s | 2.6s | 100.0% |
| 8 | `minimax-m3` | 35 | 8 tok/s | 2.9s | 4.4s | 100.0% |
| 9 | `deepseek-v4-flash-vision-exp` | 39 | 19 tok/s | 1.7s | 1.8s | 100.0% |
| 10 | `muse-glimmer-30b` | 41 | 28 tok/s | 1.1s | 1.3s | 100.0% |
| 11 | `glm-5.3-flash` | 46 | 20 tok/s | 1.6s | 2.7s | 100.0% |
| 12 | `gpt-oss-120b` | 40 | 15 tok/s | 2.1s | 2.7s | 100.0% |
| 13 | `minimax-m2.5` | 40 | 18 tok/s | 1.8s | 2.2s | 100.0% |
| 14 | `minimax-m2.7` | 40 | 13 tok/s | 2.4s | 2.5s | 100.0% |
| 15 | `glm-4.5-air` | 39 | 19 tok/s | 2.0s | 2.8s | 100.0% |
| 16 | `qwen3.8-flash` | 38 | 11 tok/s | 5.6s | 7.1s | 100.0% |
| 17 | `step-3.7-flash` | 42 | 11 tok/s | 2.8s | 3.0s | 100.0% |
| 18 | `qwen-3.6-plus` | 39 | 19 tok/s | 1.8s | 1.9s | 100.0% |
| 19 | `qwen-3.7-plus` | 39 | 17 tok/s | 1.9s | 2.0s | 100.0% |
| 20 | `qwen3.7-flash` | 38 | 22 tok/s | 1.4s | 1.5s | 100.0% |
| 21 | `qwen-3-32b` | 38 | 13 tok/s | 2.5s | 2.6s | 100.0% |
| 22 | `hy3` | 40 | 8 tok/s | 2.9s | 2.7s | 100.0% |
| 23 | `llama-4-maverick` | 40 |  | 1.4s | 2.1s | 100.0% |
| 24 | `llama-3.3-70b` | 39 |  | 1.6s | 1.9s | 100.0% |
| 25 | `deepseek-v4-flash` | 19 | 8 tok/s | 2.1s | 4.0s | 100.0% |

## Effective cost

What a million tokens costs on this board once the cache hit rate we measured is applied. Cheapest first. Models sold by the token only, since that is what the column means.

Input / Output $/M: the published rate per 1M tokens. Cache hit: share of prompt tokens served from cache, measured here. Effective $/M: (3 x input + output) / 4, less the cache discount that hit rate earns.

| # | Model | Creator | Input $/M | Output $/M | Cache hit | Effective $/M |
| --- | --- | --- | --- | --- | --- | --- |
| 1 | `deepseek-v4.1-flash` | DeepSeek | $0.1048 | $0.3141 | 94% | $0.024078 |
| 2 | `deepseek-v4-flash` | DeepSeek | $0.1264 | $0.2526 | 68% | $0.061994 |
| 3 | `qwen3.8-flash` | Alibaba | $0.2045 | $0.641 | 86% | $0.072023 |
| 4 | `qwen3.7-flash` | Alibaba | $0.0504 | $0.2187 | 10% | $0.084258 |
| 5 | `gpt-oss-120b` | OpenAI | $0.0494 | $0.2406 |  | $0.0972 |
| 6 | `glm-5.3-flash` | Zhipu AI | $0.1791 | $0.5972 | 68% | $0.109785 |
| 7 | `gemma-4-31b` | Google | $0.0763 | $0.218 | 2% | $0.109805 |
| 8 | `qwen-3-32b` | Alibaba | $0.108 | $0.378 |  | $0.1755 |
| 9 | `hy3` | Tencent | $0.108 | $0.4455 |  | $0.192375 |
| 10 | `glm-4.7-flash` | Zhipu AI | $0.081 | $0.54 | 0% | $0.195439 |
| 11 | `llama-3.3-70b` | Meta | $0.135 | $0.432 |  | $0.20925 |
| 12 | `deepseek-v4-flash-vision-exp` | DeepSeek | $0.2514 | $0.7542 | 48% | $0.214664 |
| 13 | `gpt-5.6-luna-pro` | OpenAI | $0.1548 | $0.9288 | 31% | $0.251862 |
| 14 | `muse-glimmer-30b` | Meta | $0.405 | $1.62 | 60% | $0.324878 |
| 15 | `minimax-m2.5` | MiniMax | $0.405 | $1.62 | 51% | $0.3832 |
| 16 | `glm-4.5-air` | Zhipu AI | $0.1945 | $1.272 | 1% | $0.461575 |
| 17 | `llama-4-maverick` | Meta | $0.27 | $1.08 |  | $0.4725 |
| 18 | `qwen-3.7-plus` | Alibaba | $0.4431 | $1.773 | 43% | $0.478817 |
| 19 | `step-3.7-flash` | StepFun | $0.27 | $1.552 |  | $0.5905 |
| 20 | `minimax-m3` | MiniMax | $0.405 | $1.62 | 12% | $0.630187 |
| 21 | `gpt-5.6-luna` | OpenAI | $0.3127 | $1.877 | 12% | $0.630826 |
| 22 | `qwen-3-coder` | Alibaba | $0.3586 | $1.629 |  | $0.6762 |
| 23 | `minimax-m2.7` | MiniMax | $0.405 | $1.62 |  | $0.70875 |
| 24 | `qwen3.8-27b` | Alibaba | $0.3576 | $2.554 | 2% | $0.890412 |
| 25 | `qwen-3.6-plus` | Alibaba | $0.454 | $2.724 |  | $1.0215 |
| 26 | `gemini-3.5-flash-lite` | Google | $0.405 | $3.375 |  | $1.1475 |
| 27 | `deepseek-r1` | DeepSeek | $0.7425 | $2.957 |  | $1.296125 |
| 28 | `sonar` | Perplexity | $1.35 | $1.35 |  | $1.35 |
| 29 | `kimi-k2.6` | Moonshot | $0.7856 | $3.667 |  | $1.50595 |
| 30 | `gemini-3-flash` | Google | $0.675 | $4.05 |  | $1.51875 |
| 31 | `gemini-3.7-flash` | Google | $1.013 | $5.063 | 27% | $1.529531 |
| 32 | `glm-5.2` | Zhipu AI | $1.101 | $3.76 |  | $1.76575 |
| 33 | `gemini-3.8-flash` | Google | $1.013 | $5.063 | 12% | $1.805784 |
| 34 | `claude-haiku-4-5` | Anthropic | $1.35 | $6.75 |  | $2.70 |
| 35 | `gpt-5.6-sol` | OpenAI | $3.151 | $15.753 | 51% | $3.422357 |
| 36 | `claude-sonnet-5` | Anthropic | $2.70 | $13.50 |  | $5.40 |
| 37 | `kimi-k3` | Moonshot | $3.768 | $18.837 |  | $7.53525 |

## Prompt Cache Analytics

Prompt tokens served from cache over the last 7 days, by model, busiest first.

Cache Hit Rate 75.1% · Cached 146.6M · Uncached 48.6M · Output 55.5M

| Model | Cached Input | Uncached Input | Output | Requests | Cache Rate | Total |
| --- | --- | --- | --- | --- | --- | --- |
| `deepseek-v4.1-flash` | 110.2M | 6.9M | 764.4K | 1,848 | 94% | 117.9M |
| `gpt-oss-120b` | 0 | 17.4M | 52.2M | 11,702 | 0% | 69.6M |
| `glm-5.3-flash` | 23.9M | 11.2M | 145.1K | 365 | 68% | 35.3M |
| `minimax-m2.5` | 6.2M | 5.9M | 198.8K | 313 | 51% | 12.3M |
| `deepseek-v4-flash` | 2.9M | 1.4M | 909.9K | 539 | 68% | 5.3M |
| `gpt-5.6-luna` | 293.3K | 2.3M | 218.5K | 205 | 12% | 2.8M |
| `qwen3.8-flash` | 1.9M | 318.9K | 29.3K | 88 | 86% | 2.2M |
| `gpt-5.6-sol` | 665.7K | 645.6K | 24.4K | 139 | 51% | 1.3M |
| `qwen3.7-flash` | 34.0K | 310.8K | 566.4K | 213 | 10% | 911.3K |
| `deepseek-v4-flash-vision-exp` | 433.4K | 472.1K | 2.6K | 78 | 48% | 908.2K |
| `qwen-3.6-plus` | 0 | 297.2K | 211.7K | 184 | 0% | 508.9K |
| `gemma-4-31b` | 8.4K | 431.2K | 13.2K | 71 | 2% | 452.8K |
| `gemini-3.8-flash` | 35.7K | 260.4K | 29.9K | 40 | 12% | 326.0K |
| `claude-haiku-4-5` | 0 | 112.8K | 56.2K | 33 | 0% | 169.0K |
| `gemini-3.5-flash-lite` | 0 | 104.1K | 33.7K | 38 | 0% | 137.8K |
| `gemini-3.7-flash` | 34.7K | 92.8K | 9.6K | 17 | 27% | 137.1K |
| `gemini-3.5-flash` | 0 | 64.8K | 37.8K | 14 | 0% | 102.6K |
| `gpt-5.6-luna-pro` | 24.3K | 54.7K | 8.1K | 22 | 31% | 87.1K |
| `gemini-3-flash` | 0 | 28.0K | 12.8K | 17 | 0% | 40.8K |
| `minimax-m3` | 4.6K | 32.9K | 1.1K | 38 | 12% | 38.7K |
| `llama-3.3-70b` | 0 | 36.4K | 540 | 46 | 0% | 36.9K |
| `qwen-3-32b` | 0 | 32.6K | 1.5K | 40 | 0% | 34.1K |
| `glm-4.5-air` | 163 | 29.4K | 2.8K | 41 | 1% | 32.4K |
| `glm-4.7-flash` | 52 | 29.4K | 1.9K | 47 | 0% | 31.3K |
| `qwen-3.7-max` | 0 | 10.2K | 18.9K | 4 | 0% | 29.1K |
| `qwen-3.7-plus` | 6.9K | 9.3K | 8.4K | 44 | 43% | 24.7K |
| `qwen3.8-27b` | 256 | 12.6K | 5.6K | 49 | 2% | 18.4K |
| `muse-spark-1.3` | 0 | 4.7K | 7.7K | 2 | 0% | 12.4K |
| `llama-4-maverick` | 0 | 7.3K | 2.0K | 48 | 0% | 9.3K |
| `minimax-m2.7` | 0 | 7.3K | 1.8K | 43 | 0% | 9.2K |
| `muse-glimmer-30b` | 1.5K | 974 | 1.4K | 42 | 60% | 3.8K |
| `step-3.7-flash` | 0 | 619 | 1.6K | 44 | 0% | 2.2K |
| `hy3` | 0 | 573 | 817 | 41 | 0% | 1.4K |
| `grok-4.5` | 0 | 676 | 120 | 1 | 0% | 796 |
| `qwen3-embedding-8b` | 0 | 595 | 0 | 5 | 0% | 595 |
| `qwen-3-coder` | 0 | 388 | 89 | 39 | 0% | 477 |
| `mimo-v2.5` | 0 | 8 | 32 | 1 | 0% | 40 |

### What is prompt caching?

Prompt caching reuses previously processed input tokens, reducing latency and cost by up to 90%. Models with high cache rates indicate efficient usage patterns, typically agentic workflows with long system prompts. [Learn more →](https://docs.kymaapi.com/guides/prompt-caching)
