Alibaba libera Open Code Review: code review com 1/9 dos tokens do Claude
Ferramenta nasceu interna, atendeu dezenas de milhares de devs e agora roda com endpoint de modelo configurável.
Ferramenta nasceu interna, atendeu dezenas de milhares de devs e agora roda com endpoint de modelo configurável.
O Open Code Review é uma CLI de revisão de código que lê diffs do Git, manda os arquivos alterados para um LLM configurável via agente com ferramentas e devolve comentários linha a linha. A Alibaba usou a ferramenta internamente por dois anos — atendeu dezenas de milhares de desenvolvedores e achou milhões de defeitos — antes de abri-la em maio de 2026. Em benchmark contra agentes genéricos como o Claude Code, a ferramenta atinge F1 e precisão superiores consumindo cerca de 1/9 dos tokens e rodando mais rápido, com recall menor por escolha de projeto. Serve para times que querem revisão automática barata e com poucos falsos positivos.
A arquitetura híbrida combina pipelines determinísticos — regras estáticas embutidas para NPE, thread-safety, XSS e injeção de SQL em várias linguagens — com um agente LLM que tem acesso a ferramentas. O agente lê o arquivo inteiro, busca no repositório e inspeciona outros arquivos alterados para montar contexto antes de opinar. O binário roda local em Go; a única dependência externa é o endpoint do modelo, compatível com APIs da OpenAI e da Anthropic. Nada de código sai da máquina se o endpoint for auto-hospedado.
Para adotar, baixa o binário ou usa o instalador npm, aponta a variável de ambiente para o endpoint do modelo — pode ser OPENAI_API_KEY ou ANTHROPIC_API_KEY — e roda ocr review no diretório do repositório. Na primeira execução a ferramenta varre o diff do último commit, chama o agente e imprime comentários estruturados no terminal ou exporta para a interface web que acompanha o projeto. O comando ocr scan pula o diff e audita arquivos ou pastas inteiras, útil para revisar código legado ou PRs sem diff significativo.
O projeto tem 123 dias de vida, 36,5 mil estrelas no GitHub, 231 issues abertas e o último commit caiu em 18 de setembro de 2026 na versão v1.12.6. O volume de estrelas para a idade sugere forte tração inicial, mas o número de issues abertas indica que a base de usuários já encontra bordas — a maioria correções de interface no viewer e ajustes de licença em arquivos Kotlin, Python e CSS. A licença Apache-2.0 permite uso comercial, modificação e distribuição sem copyleft viral.
A licença Apache-2.0 libera uso em produto fechado e redistribuição, só exige preservar avisos de copyright e licença. A ferramenta não serve para quem precisa de recall máximo — o benchmark admite recall menor que agentes genéricos como troca deliberada por precisão. Também não resolve quem não tem orçamento para chamadas de LLM: o custo escala com tokens, ainda que seja 1/9 do gasto equivalente no Claude Code. Times sem acesso a endpoint OpenAI ou Anthropic compatível ficam fora a menos que hospedem modelo próprio.
O benchmark AACR-Bench usou 50 repositórios populares, 200 PRs reais, 10 linguagens e 1.505 issues anotados por mais de 80 engenheiros sêniores. O resultado confirma que a precisão sobe quando o agente para de alucinar e passa a buscar contexto no código — a mesma ideia que moveu a Alibaba a manter o projeto interno por dois anos antes de abrir. Quem quiser testar aponta o endpoint, roda o comando e vê se a relação sinal-ruído compensa o custo da chamada.