VGT AI Benchmark / Observatory
Model comparison
Latest selected run per model. Benchmark-version mismatches are explicitly flagged instead of silently normalized.
GPT-6 Astra
OpenAI
GPT-6 Sol
OpenAI
Claude Opus 5.5
Anthropic
Gemini 3.8 Flash
Grok 4.7
xAI
| Category | GPT-6 Astra | GPT-6 Sol | Claude Opus 5.5 | Gemini 3.8 Flash | Grok 4.7 |
|---|---|---|---|---|---|
| coding | — | — | — | 100,00 % | — |
| mathematics | — | — | — | 100,00 % | — |
| reasoning | — | — | — | 100,00 % | — |