Modelos e LLMs

Anthropic lança Claude Opus 5: preço do Opus 4.8 e liderança na Artificial Analysis

Modelo escreve pipeline de visão sozinho em teste Frontier-Bench e fica atrás do Mythos 5 em exploração de falhas

Reprodução · anthropic.com

Anthropic lançou o Claude Opus 5 em 24 de julho de 2026, descrevendo-o como modelo "pensativo e proativo" com inteligência próxima do Claude Fable 5 pela metade do preço. O modelo estreou no topo do ranking da Artificial Analysis — tweet artificialanlys/status/2080777718933995967 —, superando o próprio Fable 5. O preço base iguala o do Opus 4.8, com modo rápido cobrado ao dobro. Simon Willison republicou o anúncio como link post em seu blog às 23h48, mas não testou o modelo — estava caiaqueando no Elkhorn Slough, conforme link para Wikipedia. O post original da Anthropic tem título "Introducing Claude Opus 5".

Proatividade extrema em teste de bancada

No teste Frontier-Bench citado no anúncio, o Opus 5 recebeu um desenho de peça mecânica e a ordem de recriá-la no FreeCAD, tendo sido intencionalmente privado de acesso direto à imagem. O modelo escreveu por conta própria um pipeline de visão computacional para extrair geometria dos pixels brutos e reconstruiu a peça completa. Willison classifica o comportamento como "implacavelmente proativo".

Segurança cibernética: acha, mas não explora

A Anthropic afirma: "As with its predecessor, Opus 4.8, we've intentionally avoided training Opus 5 on cyber tasks". Mesmo assim, o modelo melhorou substancialmente na descoberta de vulnerabilidades por ganho de capacidade geral, aproximando-se do Mythos 5 nessa frente. Na exploração — transformar falhas em ameaças materiais — o Opus 5 permanece "substancialmente atrás" do Mythos 5. A empresa espera que isso evite intervenção do governo americano. Willison comenta: "Esperamos que isso signifique que o governo dos EUA não vai fechá-lo".

Disponibilidade e documentação técnica

O modelo já está acessível via API nas mesmas condições comerciais do Opus 4.8. A Anthropic publicou guia de prompting para Claude Opus 5 cobrindo estrutura de prompts, uso de ferramentas e padrões de raciocínio. Thariq Shihipar, da equipe do Claude Code, assinou "The new rules of context engineering for Claude 5 generation models", detalhando gerenciamento de janela de contexto e delegação a subagentes para a nova geração.

Benchmark visual e teste do autor

Willison testou o benchmark do pelicano citado no anúncio: "The first pelican I got was missing the bicycle wheels; the second attempt was better". O artigo sobre Kimi K3 de 16 de julho, "Kimi K3, and what we can still learn from the pelican benchmark", também cita esse benchmark como referência para a geração 5.

Contexto editorial e patrocínio

O post é patrocinado pelo Cursor — "Delegate engineering tasks to Cursor Cloud Agents—even while your laptop is closed. Try Cursor & get 50% off your first month". Willison oferece briefing mensal por 10 dólares: "Pay me to send you less!". Artigos recentes no blog: ciberataque acidental da OpenAI contra Hugging Face (22 de julho), conversa com Cat e Thariq da equipe do Claude Code (21 de julho), Kimi K3 e pelicano (16 de julho). Tags: generative-ai (2.146), llms (1.898), anthropic (1.865), claude (315), llm-release (294). Arquivo do blog vai de 2002 a 2026.

Fontes

Simon WillisonModelos e LLMs
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.