
Thiago SouzaNos últimos meses, a corrida dos Large Language Models (LLMs) entrou em uma nova fase. Se antes o...
Nos últimos meses, a corrida dos Large Language Models (LLMs) entrou em uma nova fase. Se antes o foco quase exclusivo era o tamanho dos parâmetros e scores em benchmarks sintéticos de conhecimento geral, hoje a discussão técnica migrou fortemente para a capacidade real de processar contextos extensos (long-context understanding) e executar tarefas agentic complexas.
Comercialmente, quase todos os grandes provedores anunciam janelas de contexto gigantescas — variando de 128k a 1M ou até 2M de tokens. No entanto, desenvolvedores e arquitetos de software que constroem sistemas de RAG em larga escala, análise profunda de repositórios de código ou processamento de relatórios extensos conhecem o desafio: suportar um milhão de tokens no papel não significa conseguir recuperar e correlacionar informações dispersas com precisão.
Para entender o comportamento desses modelos sob estresse real, a plataforma independente Context Arena vem gerando benchmarks rigorosos.
Neste artigo, vamos analisar os dados empíricos gerados pelo Context Arena no benchmark GDM-MRCRv2 Full (8-Needle), comparando os desempenhos de GPT-5.6 Sol, Claude Opus 5, Gemini 3.7 Flash, GPT-5.6 Terra e Claude Sonnet 5. Também avaliaremos o custo por milhão de tokens disponível no OpenRouter para entender o impacto prático dessa dinâmica na arquitetura de sistemas.
O objetivo aqui não é influenciar sua escolha nem declarar um "vencedor supremo", mas compartilhar o que os dados observacionais nos mostram sobre o estado da arte atual.
Para avaliar a fidelidade de recuperação em contextos longos, a indústria historicamente utilizou o teste Needle in a Haystack (NIAH), onde uma única informação isolada ("a agulha") é inserida em um ponto aleatório de um texto gigantesco ("o palheiro").
Embora útil para testes preliminares, o NIAH simples tornou-se insuficiente: modelos modernos conseguem passar nesse teste com facilidade, mas ainda falham quando precisam conectar múltiplos fatos dependentes entre si espalhados pelo documento.
É aí que entra o benchmark utilizado pelo Context Arena: o GDM-MRCRv2 Full (8-Needle) (Google DeepMind Multi-Round Co-reference Resolution v2).
Documento Extenso (Haystack)
│
├── [Agulha 1: Entidade A com Atributo X]
├── [Agulha 2: Entidade B referenciando Entidade A]
├── [Agulha 3: Evento Y envolvendo Entidade B]
├── ...
└── [Agulha 8: Conclusão / Condição Final]
│
▼
Pergunta de Raciocínio Multi-Hop:
"Qual foi o impacto final na Entidade A considerando todos os eventos intermediários?"
Legenda de cores dos gráficos do Context Arena:
- 🟢 Verde: Família Gemini (Google)
- 🟣 Roxo: Família GPT (OpenAI)
- 🟠 Laranja: Família Claude (Anthropic)
Vamos agora examinar os dados empíricos observados em cada categoria de comparação.
Na categoria dos modelos de grande porte (flagships), avaliamos a disputa direta entre o GPT-5.6 Sol (OpenAI, barra roxa) e o Claude Opus 5 (Anthropic, barra laranja).
| Context Length Bin | 🟣 GPT-5.6 Sol | 🟠 Claude Opus 5 | Diferença / Destaque |
|---|---|---|---|
| 8k | 100.0% | 98.7% | Ambos praticamente perfeitos |
| 16k | 100.0% | 99.9% | Empate técnico no topo |
| 32k | 98.0% | 99.3% | Opus 5 com ligeira vantagem (+1.3%) |
| 64k | 98.8% | 99.9% | Opus 5 mantém estabilidade notável (+1.1%) |
| 128k | 92.4% | 91.3% | Ponto de inflexão: início da degradação em ambos |
| 256k | 83.5% | 65.6% | GPT-5.6 Sol abre vantagem de +17.9% |
| 512k | 61.9% | 42.5% | GPT-5.6 Sol sustenta +19.4% de margem |
| 1M | (Sem dados) | (Sem dados) | Nenhum dos modelos pontua nesta faixa |
Até 64k tokens, ambos os modelos entregam performance quase impecável, mantendo taxas de acerto acima de 98%. O Claude Opus 5 apresenta uma leve vantagem em 32k e 64k (99.3% e 99.9%).
A divergência crítica ocorre a partir de 128k tokens:
Isso indica que, entre os dois flagships avaliados nessa bateria, a arquitetura do GPT-5.6 Sol preservou melhor a capacidade de resolução de co-referências multi-hop em escalas acima de 200k tokens.
Modelos intermediários (workhorses) são o núcleo operacional da maioria das empresas devido ao equilíbrio entre custo por token e velocidade de inferência. Aqui comparamos o Gemini 3.7 Flash (Google, barra verde), o GPT-5.6 Terra (OpenAI, barra roxa) e o Claude Sonnet 5 (Anthropic, barra laranja).
| Context Length Bin | 🟢 Gemini 3.7 Flash | 🟣 GPT-5.6 Terra | 🟠 Claude Sonnet 5 |
|---|---|---|---|
| 8k | 100.0% | 98.8% | 96.4% |
| 16k | 100.0% | 100.0% | 94.9% |
| 32k | 98.6% | 94.3% | 87.9% |
| 64k | 93.1% | 89.7% | 68.0% |
| 128k | 88.6% | 80.2% | 52.9% |
| 256k | 89.0% | 67.9% | 52.2% |
| 512k | 77.7% | 49.8% | 32.0% |
| 1M | 63.5% | (Sem dados) | (Sem dados) |
Nesta categoria, o comportamento das curvas de retenção é nítido:
O aspecto mais intrigante dos dados do Context Arena surge quando comparamos o Gemini 3.7 Flash (barra verde) diretamente com os dois modelos topo de linha de maior porte: GPT-5.6 Sol (barra roxa) e Claude Opus 5 (barra laranja).
| Context Length Bin | 🟢 Gemini 3.7 Flash | 🟣 GPT-5.6 Sol | 🟠 Claude Opus 5 |
|---|---|---|---|
| 8k | 100.0% | 100.0% | 98.7% |
| 16k | 100.0% | 100.0% | 99.9% |
| 32k | 98.6% | 98.0% | 99.3% |
| 64k | 93.1% | 98.8% | 99.9% |
| 128k | 88.6% | 92.4% | 91.3% |
| 256k | 89.0% | 83.5% | 65.6% |
| 512k | 77.7% | 61.9% | 42.5% |
| 1M | 63.5% | (Sem dados) | (Sem dados) |
Se consultarmos o anúncio oficial do Google, Introducing Gemini 3.7 Flash, a proposta de valor do modelo é clara:
"our most intelligent workhorse model yet for coding and agents"
O Gemini 3.7 Flash não foi concebido como um super-flagship de parâmetros massivos para disputar em custo e tamanho com modelos como GPT-5.6 Sol ou Claude Opus 5. Pelo contrário: ele foi desenvolvido como o modelo workhorse de alta velocidade e baixo custo do Google, posicionado diretamente para competir com a camada intermediária (Sonnet, Terra e Mini).
Ainda assim, nas métricas do Context Arena:
Isso demonstra empiricamente que o desempenho em contextos ultra-longos com raciocínio multi-hop não é uma simples consequência de ter um modelo maior ou mais caro, mas reflete avanços arquiteturais no mecanismo de atenção e compressão contextual do Google.
Para entender como esses números se traduzem na prática de arquitetura e custos, analisamos os valores de referência do OpenRouter:
| Modelo | Categoria / Posicionamento | Entrada (por 1M tokens) | Saída (por 1M tokens) | Retenção em 512k (8-Needle) |
|---|---|---|---|---|
| Gemini 3.7 Flash | Workhorse / Agente Rápido | $1.50 | $7.50 | 77.7% |
| GPT-5.6 Terra | Workhorse Intermediário | $1.00 | $6.00 | 49.8% |
| Claude Sonnet 5 | Workhorse Avançado | $2.00 | $10.00 | 32.0% |
| GPT-5.6 Sol | Flagship | $5.00 | $30.00 | 61.9% |
| Claude Opus 5 | Flagship | $5.00 | $25.00 | 42.5% |
A análise das métricas do Context Arena reforça um aprendizado fundamental para a engenharia de IA: benchmarks específicos revelam nuances operacionais que tabelas gerais de score costumam mascarar.
GDM-MRCRv2 Full (8-Needle) evidencia que a capacidade de conectar informações dispersas em contextos gigantescos varia drasticamente entre as famílias de modelos conforme o volume de tokens escala.Como desenvolvedores e arquitetos de soluções, o caminho ideal é sempre testar com cargas reais representativas do seu caso de uso, equilibrando acurácia, latência e orçamento.