LLM Benchmark v4: Opus 5.5, GPT Sol/Luna 6, Mimo 2.6, Grok 4.7

23 de setembro de 2026 · 💬 Participe da Discussão
Se tem preguiça de ler, clique aqui pro TL;DR

Essa é a primeira atualização desde que a nova metodologia v4 ficou pronta, explicada em duas partes: Parte 1 cobre o processo e as catorze sabotagens, Parte 2 traz a tabela completa dos 39 modelos originais. Cinco modelos novos saíram desde então, e conferi cada versão contra o repositório antes de escrever este texto: Claude Opus 5.5, GPT 6 sol e GPT 6 luna (dois modelos separados, não um só), Xiaomi MiMo V2.6 Pro e Grok 4.7. Os nomes do título batem certinho com o que rodei.

Recapitulando a metodologia bem rápido

Pra quem não leu as duas partes anteriores: o v4 não é uma bateria de perguntas soltas, é um único app Rails que cresce em sete sprints, com um subagente isolado plantando catorze sabotagens reais baseadas em CVEs documentadas no meio do caminho, disfarçadas de commit normal de um dev fictício. O modelo nunca é avisado que existe sabotagem, só no sétimo e último sprint vem a revelação explícita. Pegar sem aviso vale nota cheia, pegar só depois de avisado vale 40%, nunca corrigir vale zero. Isso mede vigilância de segurança sob sabotagem ativa, não qualidade geral de código. Detalhe completo na Parte 1.

A tabela atualizada, 44 modelos

Mesma tabela da Parte 2, agora com 44 linhas. Os cinco modelos desta atualização estão em negrito, pra distinguir de ᴺ, que já marcava adição de rodadas anteriores.

PosiçãoModeloNotaTierNunca corrigidoCustoTempoHarness
1GPT-6 Astra100,0A$30,55100mincodex
1Claude Opus 5100,0A~$71145minclaude
1Claude Fable 5100,0A~$50 ᵉ~85min ᵉclaude
1Claude Opus 5.5100,0A$16,6364minclaude
1GPT 5.6 sol100,0A$20,37317mincodex
1GPT 5.6 terra100,0A$9,5280mincodex
1GPT 5.5100,0A$34,69117mincodex
8Grok 4.6 ᶜ98,5A$13,0067minopencode
9Claude Fable 5.195,5A~$51133minclaude
9Sakana Fugu Ultra v2 ᴺ95,5A$122,01294minopencode
9GPT 6 luna95,5A~$0,84 ᵉ122mincodex
12GPT 5.6 luna95,0Aitem #8 (2)$10,04123mincodex
13Nex N2.5 Pro ᴺ94,0 *A— (não commitado)$0 grátis480minopencode
13GLM 5.3 (zcode) ᴺ94,0Aplano flat-rate215minzcode
15DeepSeek V4.1 Flash ᴺ92,5A$1,21172minopencode
16Xiaomi MiMo V2.6 Pro92,0Aitem #12 (2)$1,22308minopencode
17Claude Sonnet 591,0A~$27112minclaude
17GPT 6 sol91,0A~$8,35 ᵉ73mincodex
19Gemini 3.8 Flash·high (OpenRouter)90,5Aitem #12 (2)$15,9897minopencode
20Gemini 3.8 Flash (Antigravity) ᴺ89,5A$0 (OAuth)120minagy
21Muse Spark 1.388,75A$13,31150minopencode
22Grok 4.588,0Aitens #7b, #12 (3)$6,1948minopencode
23Claude Opus 4.687,5Aitem #8 (2)$25,6489minclaude
24Kimi K2.787,25A$7,75175minkimi
25MiMo V2.5 Pro86,5A$1,03158minopencode
25Qwen3 8 Flash ᴿ86,5A$1,17149minopencode
27DeepSeek V4 Flash86,0Aitens #6, #8 (5)$0,97111minopencode
27Claude Opus 4.8 ᴿ86,0Aitem #8 (2)~$3787minclaude
29Claude Sonnet 4.685,75Aitem #6 (1,5)$18,6491minclaude
30Kimi K385,0A$13,79148minkimi
30DeepSeek V4 Flash 073185,0Aitens #2, #6 (6)$1,94194minopencode
32GLM 5.3 Flash (zcode) ᴺ84,25Aplano flat-rate296minzcode
33DeepSeek V4 Pro 081384,0Aitens #8, #9 (4)$4,49152minopencode
34Step 3.7 Flash83,75Aitens #6, #8, #11 (6,5)$4,15118minopencode
35Grok 4.783,5A$27,94120minopencode
36DeepSeek V4 Pro (base) ᶜ82,0B$5,2697minopencode
37Qwen 3.8 27B (Strix Halo, local) ᴺ80,0Bitens #2, #7b, #8, #12 (8)$0 local706minopencode
38Qwen 3.7 Max79,0Bitens #6, #7, #8 (6)$10,63106minopencode
39GLM 5.2 (zcode) ᴺ ᶜ77,0Bitem #12 (2)plano flat-rate239minzcode
40Gemini 3.7 Flash·high75,5Bitem #12 (2)$12,9385minopencode
40MiniMax M375,5Bitens #6, #8 (3,5)$12,17187minopencode
42Mistral Large 339,0C7 itens (19)$5,1176minopencode
43Gemini 3.1 Pro (OpenRouter) ᶜ32,5 *C9 itens (27)$10,3154minopencode
44GLM-4.7-Flash (local) ᴺ24,0C6 itens (16)$0 local29minopencode

Custo não é comparável entre harnesses diferentes: codex/opencode/kimi cobram por token de verdade, Claude usa assinatura Max (custo nocional), Antigravity é OAuth do Google sem custo por token, zcode é plano flat-rate. Compare custo só dentro do mesmo harness.

Nota sobre o custo do GPT 6 sol e luna (ᵉ): os dois rodam por assinatura ChatGPT, não API paga por token, então o custo na tabela é uma estimativa, preço por milhão de tokens publicado pela OpenAI ($2 de entrada / $10 de saída pro sol, $0,10 / $0,50 pro luna, o luna sai vinte vezes mais barato por token) aplicado à contagem real de token de cada sprint.

As surpresas dessa rodada

Grok 4.7 regrediu, e não só na nota

O Grok 4.7 fechou em 83,5, quinze pontos abaixo do próprio Grok 4.6 (98,5), meu segundo colocado geral. E não, não compensou em custo nem em velocidade: $27,94 e 120 minutos contra $13,00 e 67 minutos do 4.6. Mais caro, mais lento, pior nota. Uma regressão nos três eixos ao mesmo tempo é rara nesse benchmark.

O perfil de erro é bem específico: pegou toda sabotagem barulhenta sozinho, os dois itens críticos, o IDOR, a chave fixa no código, o CORS. Mas empurrou as quatro sabotagens disfarçadas pra revelação, incluindo o XSS armazenado que sobreviveu até o capstone, e ainda foi enganado por um teste adaptado pra aceitar a sabotagem do item #6 no meio do caminho. Forte no óbvio, cego no disfarçado.

Uma rodada limpa só, então trato isso como um ponto de dado, não uma sentença definitiva sobre a família Grok 4.7. Mas o dado que tenho hoje é: pior, mais caro, mais devagar.

Opus 5.5 é o oposto: mesma nota máxima, um quarto do custo

O Opus 5.5 entrou direto no clube dos 100 pontos, empatando com Astra, Opus 5, Fable 5, GPT 5.6 sol e terra, e GPT 5.5. Pegou tudo sem precisar de revelação nenhuma, o sétimo sprint nem rodou porque não sobrou nada pra revelar. E foi além do mínimo: escreveu teste de regressão próprio pra SQL injection e pra revogação de sessão, e ainda empilhou Content-Security-Policy e Permissions-Policy no capstone, sem ninguém pedir.

O número que importa de verdade: $16,63 e 64 minutos contra ~$71 e 145 minutos do Opus 5, pra chegar exatamente na mesma nota perfeita. Um quarto do custo, menos da metade do tempo, zero perda de qualidade nesse teste específico.

GPT 6 sol regride em vigilância, GPT 6 luna acerta em cheio

O GPT 6 sol fechou em 91,0, empatado com o Claude Sonnet 5, nove pontos abaixo do próprio GPT 5.6 sol (100,0), mas custando bem menos, ~$8,35 contra $20,37, em menos de um quarto do tempo. Regressão real em vigilância, ganho real em custo e velocidade.

O GPT 6 luna é o destaque positivo da dupla. Fez 95,5, empatando ou passando um pouco o GPT 5.6 luna (95,0), e custando ~$0,84 contra $10,04, cerca de doze vezes menos. Pegou sozinho praticamente tudo, só deixou o XSS armazenado escapar até a revelação, incluindo o item mais disfarçado do teste inteiro com uma correção que foi além do pedido, um índice único a nível de banco de dados. Nota igual ou melhor, custo desabando: a mesma classe de resultado que o Opus 5.5 entregou.

O padrão de erro do sol é o mesmo do Grok 4.7: pega o óbvio sozinho, empurra o disfarçado pra revelação. O luna, de novo, é claramente o mais vigilante dos dois irmãos, e agora também o mais barato dos dois por uma margem enorme.

MiMo V2.6 Pro: o salto geracional que se sustenta

Da Xiaomi, o V2.6 Pro saltou de 86,5 pra 92,0 sobre o próprio antecessor V2.5 Pro, por apenas $1,22. Pegou sozinho praticamente tudo, incluindo o item mais disfarçado do teste inteiro, só que um sprint atrasado, e ainda escreveu os próprios testes de guarda pra SQL injection e N+1. O único item nunca corrigido, nem depois de avisado, foi o CORS liberado demais (#12), a mesma armadilha que já tinha derrubado Grok 4.5, Gemini 3.7 Flash e o GLM 5.2 na Parte 2. Modelo de fronteira mesmo assim consegue deixar origins "*" como padrão e nunca voltar nele.

O que o benchmark externo diz, e onde ele discorda de mim

Fui atrás de quem também testou esses cinco modelos, porque nenhum benchmark isolado, nem o meu, é palavra final. Aqui está o que achei, e onde a leitura bate ou não bate com a minha.

  • Grok 4.7: a Artificial Analysis mede o Coding Agent Index subindo de 47 pra 56, com melhora em todos os três componentes que ela testa, mas avisa que o modelo gasta mais do dobro de token de saída pra chegar lá. Ou seja, num benchmark de capacidade geral de codificação, o 4.7 melhora. No meu teste de vigilância sob sabotagem disfarçada, ele piora. As duas coisas podem ser verdade ao mesmo tempo, porque medem eixos diferentes: capacidade de resolver tarefa versus disciplina de auditar o próprio código sem ser avisado.
  • Claude Opus 5.5: a cobertura da VentureBeat e da CodeRabbit bate com o que eu achei nesse ponto específico: menos token gasto pra terminar a mesma tarefa. E a própria Artificial Analysis confirma o resto, o modelo assumiu o topo do índice de inteligência dela, cinco pontos à frente de GPT-6 Astra e Fable 5.1. Aqui a leitura externa confirma a minha.
  • GPT 6 sol e luna: a cobertura da Vellum e da Kingy AI pinta um quadro favorável de capacidade geral, sol perto da nota máxima da Fable 5 por uma fração do custo, luna na faixa do Opus 5. No meu teste específico de vigilância sob sabotagem, o quadro é mais morno, sol regride contra o próprio antecessor. De novo, eixos diferentes, capacidade geral não é a mesma coisa que vigilância de segurança sob ataque disfarçado.
  • Xiaomi MiMo V2.6 Pro: a VentureBeat documenta o mesmo salto geracional que eu vi, de 19 pra 71,9 no DeepSWE, de 16 pra 53,1 no AutomationBench. Aqui a direção bate: modelo aberto melhorando de verdade, não só em vigilância.

Pra guardar: minha nota vale só pra minha metodologia específica, vigilância de segurança dentro de um app Rails crescendo sob sabotagem silenciosa. Benchmark de capacidade geral mede outra coisa, e os dois podem discordar sem que nenhum dos dois esteja errado. Ranking isolado nunca é sentença definitiva sobre modelo nenhum, já expliquei isso com mais calma na Parte 2.

Vale a pena migrar pra versão nova?

Nota mais alta num benchmark, o meu ou qualquer outro, não é sinônimo automático de “troque agora”. Aqui vai minha resposta direta, modelo por modelo, olhando qualidade contra custo, não só o número isolado.

  • Você usa Grok 4.6 hoje? Não migre pro 4.7 por causa de segurança. É pior, mais caro e mais lento nos três eixos que meço. Só vale a pena se alguma outra capacidade fora do meu teste justificar, e mesmo assim eu esperaria mais de uma rodada independente confirmando antes de trocar produção.
  • Você usa GPT 5.6 sol? Migrar pro GPT 6 sol custa bem menos, mas perde nove pontos de vigilância. Vale a troca se custo pesa mais que segurança no seu caso, não vale se você depende justamente dessa vigilância mais alta.
  • Você usa GPT 5.6 luna? Suba pro GPT 6 luna sem pensar duas vezes: nota igual ou melhor por uma fração pequena do custo anterior. Junto com o Opus 5.5, esse é o outro caso raro de vitória limpa em todos os eixos.
  • Você usa Opus 5? Esse é outro caso onde a resposta é sim sem ressalva: Opus 5.5 entrega a mesma nota perfeita por um quarto do custo e metade do tempo. Ganho em todos os eixos que meço, ao mesmo tempo.
  • Você usa MiMo V2.5 Pro? Vale subir pro V2.6 Pro, o salto de qualidade é real e o custo continua na casa de um dólar. Só não esqueça de revisar CORS manualmente, porque esse modelo especificamente ainda erra nisso mesmo depois de avisado.

A régua de sempre continua valendo: teste dentro do seu próprio fluxo de trabalho antes de trocar modelo em produção só porque um benchmark, incluindo o meu, subiu ou desceu um número.

Fechando com uma ironia que eu não fabriquei

Faz onze dias que o Dario Amodei publicou o ensaio pedindo pra “pacear a fronteira”, e o Sam Altman e o Elon Musk correram pra concordar publicamente na mesma semana, como eu já documentei com detalhe. E o que aconteceu desde então? Justamente os três, Anthropic, OpenAI e xAI, lançaram Opus 5.5, GPT 6 sol e luna, e Grok 4.7, três laboratórios diferentes, todos em menos de três dias, entre 21 e 23 de setembro.

Não escrevi essa coincidência, só reparei nela. Continua sendo exatamente o padrão sincronizado que eu já tinha apontado: o discurso público é “vamos desacelerar juntos”, o calendário de lançamento continua andando junto também.

Tem outro ângulo nessa ironia que vale registrar, e ficou menos limpo do que parecia numa primeira olhada. Dentro do mesmo lote acelerado, o resultado nem é uniforme dentro da mesma empresa: o Grok 4.7 da xAI regrediu feio, e o GPT 6 sol da OpenAI também regrediu em vigilância.

O irmão do sol, o GPT 6 luna, saiu como vitória limpa, nota igual ou melhor por uma fração do custo, a mesma classe de resultado que a Anthropic entregou com o Opus 5.5. Acelerar o lançamento não virou sinônimo de piorar em bloco, virou loteria, a ponto de uma única empresa lançar um modelo pior e um melhor na mesma semana.

E enquanto o trio americano assinava o pacto de desacelerar e entregava resultado misto fazendo isso, a Xiaomi, chinesa, sem assinar pacto nenhum, sem fazer discurso nenhum sobre “pacear a fronteira”, simplesmente soltou o MiMo V2.6 Pro com um salto de qualidade real sobre o próprio antecessor. Ninguém do lado chinês prometeu desacelerar. E, pelo menos nessa amostra, ninguém do lado chinês desacelerou.