Radar de IA Edição 46 4 min de leitura

Radar de IA: Radar Semanal w36: GPT-6 Astra lança (ARC-AGI-3 99,9%); Fable 5.1 lidera SWE-bench Pro; Qwen3.8-Max chega open-weights

Semana 36/2026 chegou com três lançamentos de peso e uma virada de leaderboard. O GPT-6 Astra da OpenAI marcou 99,9% no ARC-AGI-3 — mas chegou com preço 2,5× maior que o Sol. O Claude Fable 5.1 liderou o SWE-bench Pro com 81,2% e cortou o custo de cache read em 75%. O Alibaba jogou o Qwen3.8-Max-0902 em open-weights com MIT license. E a Anthropic fechou um deal de US$ 35 bilhões em infraestrutura com a Lambda. A corrida não desacelera — mas os sinais para PMEs ficam mais claros: capacidade sobe, custo desce, e o open-source encurta a distância.

Resumo em 60 segundos

  • GPT-6 Astra (03/set): OpenAI lança modelo com 99,9% no ARC-AGI-3 e 100% no ExploitBench — mas a US$ 10/US$ 50 por milhão de tokens (2,5× mais caro que o Sol).: ARC-AGI-3 mede raciocínio geral difícil. Pontuação praticamente perfeita é inédita — mas o preço reposiciona o Astra como ferramenta enterprise de ponta, não solução de volume.
  • Fable 5.1 lidera SWE-bench Pro (81,2%) e Terminal-Bench 2.1 (85,02%, 2º). Cache read caiu 75%: de US$ 1,00/M para US$ 0,25/M.: SWE-bench Pro usa repos ativamente mantidos — sem leakage. O corte de 75% no cache read reduz o custo típico de workloads agentivas em 25–45%. Verificado em fontes primárias (BenchLM.ai, llm-stats.com, VentureBeat).
  • Qwen3.8-Max-0902 (04/set): Alibaba lança open-weights com MIT license — 4º no SWE-bench Pro (67,7%), gap de 13 p.p. para o líder.: Modelo da família Qwen3.8 (2,4T parâmetros totais / 95B ativos). MIT license = uso comercial sem royalties. PMEs podem hospedar sem custo de licença.
  • Anthropic × Lambda: contrato de US$ 35 bilhões em cloud computing (01/set). Datacenter desenvolvido pela Hut 8 no Texas.: Maior deal de infraestrutura anunciado pela Anthropic. Sinaliza escala de capacidade para os próximos modelos — argumento para contratos de API com preços fixados antes de 2027.
  • A lição da semana para PMEs: a corrida migrou para benchmarks agentivos. Capacidade de ponta sobe; open-source encurta a distância. Avalie casos de uso antes de travar em fornecedor.: GPT-6 Astra e Fable 5.1 dominam benchmarks agentivos (terminal, coding, raciocínio). Qwen3.8-Max mostra que open-weights chegam cada vez mais próximos — a 13 p.p. do líder no SWE-bench Pro.

Leaderboard da semana: Fable 5.1 lidera código; GPT-5.6 Sol lidera agentes de terminal

Dois benchmarks de referência foram atualizados nesta semana. No SWE-bench Pro — que mede resolução de issues reais do GitHub em repos ativamente mantidos, sem leakage — o Claude Fable 5.1 assumiu a liderança com 81,2%. No Terminal-Bench 2.1, que testa agentes operando diretamente em terminais, o GPT-5.6 Sol ficou na frente com 85,77%, seguido de perto pelo Fable 5.1 (85,02%).

Claude Fable 5.1: benchmark science mais que dobra — e cache read fica 75% mais barato

O Fable 5.1 não aparece só no topo do SWE-bench Pro. No Terminal-Bench-Science 0.1 — benchmark de pesquisa científica autônoma — ele marcou 52,6%, contra 24,7% do Fable 5 e 29,0% do Opus 5. Mais relevante para o dia a dia de quem usa Claude em produção: o preço de cache read caiu de US$ 1,00/M para US$ 0,25/M — corte de 75%.

GPT-6 Astra (OpenAI, 03/set): 99,9% no ARC-AGI-3 — mas com preço 2,5× maior

Em 3 de setembro, a OpenAI anunciou o GPT-6 Astra com resultados inéditos em benchmarks de raciocínio geral: 99,9% no ARC-AGI-3, 97,6% no FrontierMath Tier 4 e 100% no ExploitBench. O modelo também marcou 72,6% no OSWorld 2.0 (Computer Use) em cerca de 40 minutos. O preço: US$ 10/US$ 50 por milhão de tokens — 2,5× mais caro que o GPT-5.6 Sol (US$ 4/US$ 20/M).

Qwen3.8-Max-0902 (Alibaba, 04/set): open-weights MIT license — 4º no SWE-bench Pro com 67,7%

Em 4 de setembro, o Alibaba lançou o Qwen3.8-Max-0902, versão open-weights da família Qwen3.8 (2,4 trilhões de parâmetros totais, 95 bilhões ativos), sob licença MIT — uso comercial sem royalties. No SWE-bench Pro desta semana, marcou 67,7%, posicionando-se em 4º lugar, a 13,5 pontos percentuais do líder Fable 5.1.

Infraestrutura e abertura: Anthropic fecha US$ 35B com Lambda; OpenClaw 2.0 chega

Dois movimentos de bastidores que sinalizam onde a indústria está colocando dinheiro. Em 1º de setembro, a Anthropic assinou contrato de US$ 35 bilhões com a Lambda (neocloud apoiada pela NVIDIA), em datacenter desenvolvido pela Hut 8 no Texas. No mesmo dia, o OpenClaw 2.0 chegou com 933 contribuidores e mais de 16.000 pull requests — referência open-source de orquestração de agentes.

E daí para a sua empresa

A semana 36/2026 resumiu o paradoxo atual da IA: o modelo mais capaz do mercado (GPT-6 Astra, ARC-AGI-3 99,9%) ficou 2,5× mais caro, enquanto o open-source (Qwen3.8-Max) chegou a 13 p.p. do líder de coding sem custo de licença. Para PMEs, o sinal prático é claro: use modelos de fronteira para os problemas onde o erro é caro; use open-weights e modelos intermediários (Fable 5.1, Flash) para o volume. A infraestrutura que sustenta isso — deal de US$ 35B da Anthropic com a Lambda — indica que a capacidade vai crescer. Quem estrutura o processo antes da próxima onda de lançamentos colhe o ganho sem refazer tudo.

Quer saber onde a inteligência artificial pode dar o melhor retorno no seu negócio? Faça o diagnóstico gratuito de IA — em poucos minutos você recebe um retrato das oportunidades para a sua empresa.

Leia também

ChatGPT, Gemini ou Claude: qual IA usar na sua empresaO que é um agente de IA — e como ele trabalha na empresaIA para pequenas empresas: por onde começar

Quer aplicar IA no seu negócio com quem já fez em escala?

20+ anos em tecnologia, SaaS com milhões de usuários e um gateway de pagamentos, num ecossistema que somou R$7 bilhões em faturamento no último ano. Vamos conversar sobre o seu caso.

Falar com Gleidson

DO RADAR PARA O SEU NEGÓCIO

Acompanhar a IA é o primeiro passo. Aplicar é o que muda o jogo.

Você viu o que mudou hoje. Agora descubra, em 2 minutos, o que isso significa para a sua empresa: o Diagnóstico de IA gratuito mostra seu nível de maturidade e as 3 oportunidades de maior impacto para o seu negócio.

Fazer meu diagnóstico gratuito

Grátis · leva ~2 minutos · sem compromisso.