Ir para o conteúdo principal
Voltar ao Blog

Os tiers de raciocínio do GPT-5.6 Sol custam o mesmo. Só o xhigh é racional.

A OpenAI precifica todos os tiers de esforço do GPT-5.6 Sol a $11.25/M. A qualidade cai 4 pontos do xhigh para o medium com quase nenhum ganho de velocidade.

FindLLM22 de julho de 2026
gpt-5-6-solreasoning tiersmodel pricingopenaideep dive

Preço fixo, qualidade em degraus

Se você está escolhendo um tier de esforço do GPT-5.6 Sol (OpenAI) em julho de 2026, o padrão é GPT-5.6 Sol (xhigh). Toda variante Sol cobra $11.25/M tokens, então pagar a mesma tarifa pelo medium ou high só compra um modelo mais quieto e um índice de qualidade pior. A escada é real nos benchmarks. A precificação não é.

Essa é a história operacional por trás da família Sol da OpenAI. O GPT-5.6 Sol base fica em 58.9 de qualidade. <!-- fact:gpt-5-6-sol|quality=58.9|price=11.25 --> Os knobs de esforço nomeados descem a partir daí: xhigh em 57.7, high em 55.9, medium em 53.6, todos ainda a $11.25/M. <!-- fact:gpt-5-6-sol-xhigh|quality=57.7|price=11.25 --> <!-- fact:gpt-5-6-sol-high|quality=55.9|price=11.25 --> <!-- fact:gpt-5-6-sol-medium|quality=53.6|price=11.25 --> A latência de inferência mal se mexe. Você não está comprando um caminho mais barato ao baixar o esforço. Está comprando um mais fraco pelo preço cheio.

O que os números realmente dizem

Eu alinhei os três SKUs de esforço ao lado do checkpoint Sol pai e olhei qualidade versus velocidade de saída, não rótulos de marketing.

ModelQualityPriceSpeed
GPT-5.6 Sol58.9$11.25/M67 tok/s
GPT-5.6 Sol (xhigh)57.7$11.25/M64 tok/s
GPT-5.6 Sol (high)55.9$11.25/M59 tok/s
GPT-5.6 Sol (medium)53.6$11.25/M60 tok/s
<!-- fact:gpt-5-6-sol|quality=58.9|price=11.25|speed=67 --> <!-- fact:gpt-5-6-sol-xhigh|quality=57.7|price=11.25|speed=64 --> <!-- fact:gpt-5-6-sol-high|quality=55.9|price=11.25|speed=59 --> <!-- fact:gpt-5-6-sol-medium|quality=53.6|price=11.25|speed=60 -->

Quality comparison

Do xhigh ao medium você entrega 4.1 pontos de qualidade e não ganha nada limpo em throughput. O medium até supera o high em velocidade (60 vs 59 tok/s) enquanto fica 2.3 pontos abaixo em qualidade. <!-- fact:gpt-5-6-sol-medium|quality=53.6|speed=60 --> <!-- fact:gpt-5-6-sol-high|quality=55.9|speed=59 --> Isso não é um produto de latência. É um corte de qualidade com um erro de arredondamento em tokens por segundo.

Traduza isso para pipelines. Uma queda de 4 pontos de qualidade em um loop de agente pesado em código significa mais retries de ferramentas, mais falhas de validador, mais revisão humana. Retries são onde $11.25/M deixa de ser uma linha no orçamento e vira um multiplicador. Se as falhas de parse de structured-output sobem, você paga a tarifa Sol de novo no passe de reparo. O medium não deixa jobs em batch mais baratos. Deixa eles mais longos.

Output speed

Como o Sol se compara ao resto do tabuleiro

Contexto importa. O Claude Fable 5 (Anthropic) ainda lidera a tabela mais ampla com 59.9 de qualidade e $20.00/M a 70 tok/s. <!-- fact:claude-fable-5|quality=59.9|price=20.00|speed=70 --> O Sol base é a perseguição paga mais próxima, com 58.9 e mais ou menos metade do preço unitário. <!-- fact:gpt-5-6-sol|quality=58.9|price=11.25 --> O xhigh mantém a maior parte desse gap fechado em 57.7. <!-- fact:gpt-5-6-sol-xhigh|quality=57.7|price=11.25 -->

Desça para o medium e o quadro se inverte. O Grok 4.5 (xAI) posta 53.8 de qualidade a $3.00/M e 73 tok/s. <!-- fact:grok-4-5|quality=53.8|price=3.00|speed=73 --> O Claude Sonnet 5 (Anthropic) fica em 53.4 a $4.00/M e 86 tok/s. <!-- fact:claude-sonnet-5|quality=53.4|price=4.00|speed=86 --> O Medium Sol com 53.6 a $11.25/M está nessa faixa de qualidade cobrando três a quatro vezes a tarifa e rodando mais devagar. <!-- fact:gpt-5-6-sol-medium|quality=53.6|price=11.25|speed=60 --> Para qualquer carga em que 53–54 de qualidade seja “bom o suficiente”, o medium Sol é a loja errada.

O high fica num meio-termo confuso: 55.9 de qualidade, ainda $11.25/M, 59 tok/s. <!-- fact:gpt-5-6-sol-high|quality=55.9|price=11.25|speed=59 --> O Claude Opus 4.8 (Anthropic) tem 55.7 a $10.00/M e 64 tok/s. <!-- fact:claude-opus-4-8|quality=55.7|price=10.00|speed=64 --> O GPT-5.6 Terra (OpenAI) tem 55.0 a $5.63/M com 149 tok/s. <!-- fact:gpt-5-6-terra|quality=55.0|price=5.63|speed=149 --> Se você estava prestes a escolher o Sol high para trabalho “equilibrado”, o Terra é mais rápido e mais barato em qualidade semelhante, e o Opus 4.8 ganha no preço com um score quase igual. O high só vence se você estiver travado no endpoint Sol por razões de roteamento.

Por que os tiers ainda existem

Eu não acho que os SKUs medium e high sejam acidentes. Knobs de esforço são úteis quando o mesmo checkpoint precisa servir chat interativo e traces profundos de agente sem trocar de modelo. Superfícies de produto que expõem “nível de thinking” para o usuário final precisam de mais de uma parada. Harnesses internos de A/B querem um caminho controlado de degradação de qualidade.

O contra-argumento é latência sob carga, não a mediana de tok/s num leaderboard. xhigh a 64 tok/s versus medium a 60 é ruído num bench de stream único. <!-- fact:gpt-5-6-sol-xhigh|speed=64 --> <!-- fact:gpt-5-6-sol-medium|speed=60 --> Num cluster multi-tenant, esforço menor pode significar seções críticas mais curtas e melhor latência de cauda quando traces de raciocínio dominam o wall clock. Se o seu p95 é limitado pelo comprimento do trace e não pela taxa de decode, o medium ainda pode ser a escolha operacional certa mesmo quando o preço de etiqueta casa com o xhigh.

Esse caso é mais estreito do que a matriz de produto implica. Você precisa de economias medidas de comprimento de trace grandes o suficiente para compensar mais falhas downstream. A maioria das stacks de code-review, extração e tool-calling que eu vejo falha do outro jeito: déficits de qualidade custam mais do que os tokens extras num passe de raciocínio mais longo. Preço fixo torna essa troca brutal. Não há desconto por baixar o nível.

Quem deve usar qual tier

xhigh é o padrão para loops de agente, coding multi-step e qualquer pipeline em que um objeto estruturado errado dispara um retry completo. Ao mesmo preço dos irmãos, 57.7 de qualidade é o único número de esforço Sol que fica perto da fronteira sem pular para os $20.00/M do Fable. <!-- fact:gpt-5-6-sol-xhigh|quality=57.7 --> <!-- fact:claude-fable-5|price=20.00 -->

high é difícil de defender numa folha limpa. 55.9 de qualidade a $11.25/M perde em valor para o Terra com 55.0 a $5.63/M e 149 tok/s quando throughput importa, e perde em preço para o Opus 4.8 em qualidade semelhante. <!-- fact:gpt-5-6-sol-high|quality=55.9|price=11.25 --> <!-- fact:gpt-5-6-terra|quality=55.0|price=5.63|speed=149 --> Use só se o seu router já for só Sol e você tiver traces de latência provando que o high bate o xhigh no p95.

medium é uma armadilha para batch sensível a custo. Você ainda paga $11.25/M por 53.6 de qualidade enquanto Grok 4.5 e Sonnet 5 caem na mesma faixa por $3–4/M e mais tokens por segundo. <!-- fact:gpt-5-6-sol-medium|quality=53.6|price=11.25 --> <!-- fact:grok-4-5|quality=53.8|price=3.00 --> <!-- fact:claude-sonnet-5|quality=53.4|price=4.00 --> Medium faz sentido como modo degradado dentro de um produto no formato Sol, não como decisão de compra a partir de um eval em branco.

O Sol base com 58.9 de qualidade e 67 tok/s continua sendo a escolha simples de “me dá o Sol” quando você não precisa de um pin explícito de esforço. <!-- fact:gpt-5-6-sol|quality=58.9|speed=67 --> O xhigh é o substituto pinado quando a API obriga um campo de esforço e você se recusa a deixar qualidade na mesa.

O problema de design de precificação

A OpenAI lançou uma escada de esforço de três degraus e esqueceu a parte em que os degraus mais baixos ganham preços mais baixos. A Anthropic e outros já brincaram de jogos parecidos com budgets de thinking, mas a folha do Sol é incomumente direta: $11.25/M idênticos em xhigh, high e medium. <!-- fact:gpt-5-6-sol-xhigh|price=11.25 --> <!-- fact:gpt-5-6-sol-high|price=11.25 --> <!-- fact:gpt-5-6-sol-medium|price=11.25 --> Esse design ensina uma lição para quem lê a fatura. Nunca selecione voluntariamente o degrau mais fraco.

Até aparecerem descontos por esforço, vou continuar tratando medium e high como shims de compatibilidade, não como tiers de valor. Os degraus de qualidade são mensuráveis. Os degraus de velocidade não são. O degrau de preço é zero. Escolha GPT-5.6 Sol (xhigh) quando estiver no Sol, ou saia da família quando 53–56 de qualidade for suficiente e modelos da classe $5/M passarem no corte.

Para escolhas casadas com a carga em todo o campo, use o LLM Selector ou navegue pelos cards atuais em Explore.

Fique por dentro

Análises revisadas de LLMs quando uma nova edição estiver pronta. Sem spam.