Saiu o Claude Opus 5, da Anthropic.
O ponto não é só “mais um modelo novo”. O ponto é olhar onde ele melhorou.
Segundo a thread oficial, ele chega perto da fronteira do Fable 5 por metade do preço. Mas os números que mais importam não são só os de código.
No AutomationBench, que mede terminar um fluxo de trabalho de empresa do começo ao fim, o Opus 4.8 fazia 17%. O Opus 5 faz 26%.
No ARC-AGI-3, de resolver problema inédito, o salto foi de 1,5% para 30,2%.
Isso ainda não significa “agente perfeito”. Mas mostra a direção: modelos menos focados em resposta bonita e mais próximos de executar trabalho real.
E ele não vence tudo. Em alguns benchmarks, Fable 5 e GPT-5.6 Sol seguem na frente. Por isso a leitura certa não é torcida por modelo. É entender onde cada avanço vira capacidade prática.
Qual número mais te surpreendeu: AutomationBench ou ARC-AGI-3?
Fonte: thread oficial claudeai no X.
#InteligenciaArtificial #ClaudeAI #Anthropic #AgentesDeIA #Automacao #IA