Radar de IA: Radar Semanal w36: GPT-6 Astra lança (ARC-AGI-3 99,9%); Fable 5.1 lidera SWE-bench Pro; Qwen3.8-Max chega open-weights
Semana 36/2026 chegou com três lançamentos de peso e uma virada de leaderboard. O GPT-6 Astra da OpenAI marcou 99,9% no ARC-AGI-3 — mas chegou com preço 2,5× maior que o Sol. O Claude Fable 5.1 liderou o SWE-bench Pro com 81,2% e cortou o custo de cache read em 75%. O Alibaba jogou o Qwen3.8-Max-0902 em open-weights com MIT license. E a Anthropic fechou um deal de US$ 35 bilhões em infraestrutura com a Lambda. A corrida não desacelera — mas os sinais para PMEs ficam mais claros: capacidade sobe, custo desce, e o open-source encurta a distância.
Resumo em 60 segundos
- GPT-6 Astra (03/set): OpenAI lança modelo com 99,9% no ARC-AGI-3 e 100% no ExploitBench — mas a US$ 10/US$ 50 por milhão de tokens (2,5× mais caro que o Sol).: ARC-AGI-3 mede raciocínio geral difícil. Pontuação praticamente perfeita é inédita — mas o preço reposiciona o Astra como ferramenta enterprise de ponta, não solução de volume.
- Fable 5.1 lidera SWE-bench Pro (81,2%) e Terminal-Bench 2.1 (85,02%, 2º). Cache read caiu 75%: de US$ 1,00/M para US$ 0,25/M.: SWE-bench Pro usa repos ativamente mantidos — sem leakage. O corte de 75% no cache read reduz o custo típico de workloads agentivas em 25–45%. Verificado em fontes primárias (BenchLM.ai, llm-stats.com, VentureBeat).
- Qwen3.8-Max-0902 (04/set): Alibaba lança open-weights com MIT license — 4º no SWE-bench Pro (67,7%), gap de 13 p.p. para o líder.: Modelo da família Qwen3.8 (2,4T parâmetros totais / 95B ativos). MIT license = uso comercial sem royalties. PMEs podem hospedar sem custo de licença.
- Anthropic × Lambda: contrato de US$ 35 bilhões em cloud computing (01/set). Datacenter desenvolvido pela Hut 8 no Texas.: Maior deal de infraestrutura anunciado pela Anthropic. Sinaliza escala de capacidade para os próximos modelos — argumento para contratos de API com preços fixados antes de 2027.
- A lição da semana para PMEs: a corrida migrou para benchmarks agentivos. Capacidade de ponta sobe; open-source encurta a distância. Avalie casos de uso antes de travar em fornecedor.: GPT-6 Astra e Fable 5.1 dominam benchmarks agentivos (terminal, coding, raciocínio). Qwen3.8-Max mostra que open-weights chegam cada vez mais próximos — a 13 p.p. do líder no SWE-bench Pro.
Leaderboard da semana: Fable 5.1 lidera código; GPT-5.6 Sol lidera agentes de terminal
Dois benchmarks de referência foram atualizados nesta semana. No SWE-bench Pro — que mede resolução de issues reais do GitHub em repos ativamente mantidos, sem leakage — o Claude Fable 5.1 assumiu a liderança com 81,2%. No Terminal-Bench 2.1, que testa agentes operando diretamente em terminais, o GPT-5.6 Sol ficou na frente com 85,77%, seguido de perto pelo Fable 5.1 (85,02%).
- SWE-bench Pro (03/set): Claude Fable 5.1 #1 com 81,2%. Sequência: Fable 5.1 (81,2%) → Mythos 5 / Fable 5 (80,3% / 80,0%) → Opus 5 (79,2%) → Qwen3.8 Max (67,7%).
- Terminal-Bench 2.1 (01/set): GPT-5.6 Sol #1 (85,77%), Fable 5.1 #2 (85,02%), Opus 5 #3 (84,64%). Terminal-Bench mede agentes que operam diretamente em terminais — automação de DevOps, scripts, pipelines.
- O que esses números significam para a sua empresa: benchmarks de coding e terminal medem tarefas que hoje já são automatizáveis com IA — revisão de código, geração de scripts, análise de logs. Diferenças de 1–2 p.p. entre os líderes raramente se traduzem em ganho real de produção; o que importa é o caso de uso e a integração.
Claude Fable 5.1: benchmark science mais que dobra — e cache read fica 75% mais barato
O Fable 5.1 não aparece só no topo do SWE-bench Pro. No Terminal-Bench-Science 0.1 — benchmark de pesquisa científica autônoma — ele marcou 52,6%, contra 24,7% do Fable 5 e 29,0% do Opus 5. Mais relevante para o dia a dia de quem usa Claude em produção: o preço de cache read caiu de US$ 1,00/M para US$ 0,25/M — corte de 75%.
- Terminal-Bench-Science 0.1: Fable 5.1 marca 52,6% — mais que dobra o Fable 5 (24,7%) e supera o Opus 5 (29,0%). OSWorld 2.0 (partial pass): 77,9%. GDPval-AA v2 (knowledge work): 1.853.
- Cache read -75%: de US$ 1,00/M para US$ 0,25/M de tokens. Preço sticker mantido: US$ 10/M entrada, US$ 50/M saída — igual ao Fable 5. O corte no cache reduz o custo típico de workloads agentivas em 25% e pode chegar a 45% nas mais intensas em cache.
- E daí para a sua empresa? Se você usa Claude em pipelines com contexto longo e recorrente — chatbots, assistentes com base de conhecimento, agentes com histórico — o corte de 75% no cache read se reflete diretamente na fatura. Vale revisar a arquitetura para maximizar o uso de cache nas próximas semanas.
GPT-6 Astra (OpenAI, 03/set): 99,9% no ARC-AGI-3 — mas com preço 2,5× maior
Em 3 de setembro, a OpenAI anunciou o GPT-6 Astra com resultados inéditos em benchmarks de raciocínio geral: 99,9% no ARC-AGI-3, 97,6% no FrontierMath Tier 4 e 100% no ExploitBench. O modelo também marcou 72,6% no OSWorld 2.0 (Computer Use) em cerca de 40 minutos. O preço: US$ 10/US$ 50 por milhão de tokens — 2,5× mais caro que o GPT-5.6 Sol (US$ 4/US$ 20/M).
- GPT-6 Astra: ARC-AGI-3 = 99,9% · FrontierMath Tier 4 = 97,6% · ExploitBench = 100% · OSWorld 2.0 = 72,6% (Computer Use, ~40 min). Rollout em fases: Daybreak (cibersegurança) → ChatGPT Plus/Pro/Business/Enterprise + API/Azure/Bedrock.
- Preço: US$ 10/M entrada e US$ 50/M saída — 2,5× mais caro que o GPT-5.6 Sol (US$ 4/US$ 20/M). O Astra se posiciona como solução enterprise de ponta, não substituto do Sol para volume.Fonteseesel AI — GPT-6 Astra
- E daí para a sua empresa? ARC-AGI-3 praticamente perfeito significa que o Astra resolve problemas de raciocínio que nenhum modelo resolvia antes. Para PMEs: o caso de uso que justifica esse preço é tarefas de alta complexidade analítica (jurídico, financeiro, científico) onde o custo de erro humano supera o custo do modelo. Para volume e automação rotineira, o Sol ou o Fable 5.1 seguem sendo a escolha econômica.
Qwen3.8-Max-0902 (Alibaba, 04/set): open-weights MIT license — 4º no SWE-bench Pro com 67,7%
Em 4 de setembro, o Alibaba lançou o Qwen3.8-Max-0902, versão open-weights da família Qwen3.8 (2,4 trilhões de parâmetros totais, 95 bilhões ativos), sob licença MIT — uso comercial sem royalties. No SWE-bench Pro desta semana, marcou 67,7%, posicionando-se em 4º lugar, a 13,5 pontos percentuais do líder Fable 5.1.
- Qwen3.8-Max-0902: SWE-bench Pro = 67,7% (4º lugar · gap de 13,5 p.p. para o Fable 5.1). MIT license. Família 2,4T parâmetros totais / 95B ativos.
- E daí para a sua empresa? MIT license elimina o custo de licença para quem quer hospedar localmente ou integrar em produto. A 67,7% no SWE-bench Pro, o Qwen3.8-Max já está dentro da faixa de uso prático para automação de código e análise. PMEs com times técnicos podem avaliar um piloto sem comprometer orçamento com APIs externas.
Infraestrutura e abertura: Anthropic fecha US$ 35B com Lambda; OpenClaw 2.0 chega
Dois movimentos de bastidores que sinalizam onde a indústria está colocando dinheiro. Em 1º de setembro, a Anthropic assinou contrato de US$ 35 bilhões com a Lambda (neocloud apoiada pela NVIDIA), em datacenter desenvolvido pela Hut 8 no Texas. No mesmo dia, o OpenClaw 2.0 chegou com 933 contribuidores e mais de 16.000 pull requests — referência open-source de orquestração de agentes.
- Anthropic × Lambda: US$ 35 bilhões em cloud computing (01/set). Maior deal de infraestrutura da história da Anthropic. Datacenter desenvolvido pela Hut 8 no Texas, apoiado pela NVIDIA.
- OpenClaw 2.0 lança (01/set): plataforma open-source de orquestração de agentes com 933 contribuidores e 16.000+ PRs. Referência para times técnicos que querem montar pipelines agentivos sem lock-in de fornecedor.
- E daí para a sua empresa? Deal de US$ 35B da Anthropic = mais capacidade de inferência chegando nos próximos 12–18 meses — argumento para negociar contratos de API com preços fixos antes de 2027, quando a demanda acumulada pode pressionar as tarifas. O OpenClaw 2.0 é o caminho para PMEs que querem controlar a arquitetura de agentes sem depender de uma única API.
E daí para a sua empresa
A semana 36/2026 resumiu o paradoxo atual da IA: o modelo mais capaz do mercado (GPT-6 Astra, ARC-AGI-3 99,9%) ficou 2,5× mais caro, enquanto o open-source (Qwen3.8-Max) chegou a 13 p.p. do líder de coding sem custo de licença. Para PMEs, o sinal prático é claro: use modelos de fronteira para os problemas onde o erro é caro; use open-weights e modelos intermediários (Fable 5.1, Flash) para o volume. A infraestrutura que sustenta isso — deal de US$ 35B da Anthropic com a Lambda — indica que a capacidade vai crescer. Quem estrutura o processo antes da próxima onda de lançamentos colhe o ganho sem refazer tudo.
Quer saber onde a inteligência artificial pode dar o melhor retorno no seu negócio? Faça o diagnóstico gratuito de IA — em poucos minutos você recebe um retrato das oportunidades para a sua empresa.
Quer aplicar IA no seu negócio com quem já fez em escala?
20+ anos em tecnologia, SaaS com milhões de usuários e um gateway de pagamentos, num ecossistema que somou R$7 bilhões em faturamento no último ano. Vamos conversar sobre o seu caso.
Falar com Gleidson