☑️ Antiagree [Plugin para Claude Code - Agent Skill - Evals]

Ivan Luna 07 Oct, 2026 05 min de leitura
☑️ Antiagree [Plugin para Claude Code - Agent Skill - Evals]

O Antiagree revisa uma ideia, um plano, uma arquitetura, um benchmark ou uma decisão como faria um revisor externo sem nada em jogo. Ele confere as afirmações com o código e os dados, procura o que já existe, tenta derrubar a proposta com o argumento mais forte que encontrar e fica só com o que sobrevive. Toda revisão termina em uma única decisão: GO, ITERATE, RETHINK ou KILL. Ele não finge dureza: quando o plano é sólido, diz GO. É distribuído ao mesmo tempo como plugin para o Claude Code e como Agent Skill. Só instruções, sem telemetria, MIT.

Ver no GitHub Documentação

Concordar é o padrão:


Modelos de linguagem tendem a concordar com quem está na frente deles. Pergunte “este é um bom plano?” e muitas vezes você recebe um sim caprichado, alguns ajustes menores e uma estimativa que ninguém mediu. A falha oposta é igualmente comum: peça honestidade brutal e você recebe problemas inventados, porque é isso que o papel parece pedir. As duas respostas dizem o que você pediu para ouvir, e não o que é verdade.

A lealdade do Antiagree é com o seu objetivo, não com a sua proposta, com as suas decisões anteriores nem com o que ele disse antes na conversa. Dureza intelectual, não de tom.

Como funciona uma revisão:


  • Consulta o registro. Se ANTIAGREE.md existe, ele lê primeiro: um critério de descarte que foi atingido, ou um prazo que venceu, abre a revisão.
  • Investiga antes de julgar. Verifica as três a cinco afirmações das quais a decisão depende, no código, nos dados, nos benchmarks e no histórico do git. Sem artefatos, avisa que a revisão é só de raciocínio.
  • Verifica se já existe. Para qualquer coisa que você planeje construir, procura projetos semelhantes e pergunta o que é realmente diferente.
  • Encontra o objetivo real. Que resultado se busca, qual variável importa e se a própria pergunta está mal formulada.
  • Ataca e depois tenta derrubar. Suposições, atividade versus impacto, causalidade, a medição, custos ocultos, efeitos de segunda ordem, pessoas e incentivos, custo afundado e caminhos mais simples. Depois, o argumento mais forte contra a proposta, não um espantalho.
  • Reconstrói. O gargalo, os poucos movimentos com alavancagem real e experimentos com limites de GO e KILL.

Toda afirmação que importa recebe um rótulo, no idioma do usuário: FATO (com a fonte), FORTEMENTE SUSTENTADO, HIPÓTESE ou ESPECULAÇÃO. Sem porcentagens inventadas: se ninguém sabe, a resposta é “ainda não sabemos”.

O veredito:


Toda revisão abre com um cartão: o que está sendo revisado, o veredito, o maior risco, o próximo passo mais barato que resolve a dúvida e o único fato que o faria mudar de ideia.

  • GO: sólido; siga em frente. É o padrão quando o diagnóstico tem respaldo e o plano pode ser verificado e revertido com pouco custo.
  • ITERATE: objetivo e abordagem certos, com algo a corrigir que o plano ainda não cobre.
  • RETHINK: objetivo certo, abordagem errada.
  • KILL: abandonar.

Fecha com a verdade incômoda, o que manter, o que mudar, o que não construir e o que ainda não se sabe.

Revisar a sessão e cobrar o que foi decidido:


  • Revisão da sessão. Rode /antiagree sem nada depois e ele audita o que você e o Claude já decidiram na conversa, desde a primeira mensagem. Avisa logo de início que participou dessas decisões e abre com uma tabela de cada número e afirmação que a sessão aceitou: quem introduziu, se foi verificado e o que depende disso.
  • Critérios de descarte. Quando uma revisão propõe experimentos com limites, ele oferece registrá-los em ANTIAGREE.md. A próxima revisão os lê primeiro, então a régua não pode mudar depois que o resultado aparece.
  • Calibrado. Diz o que o plano acerta antes de atacá-lo, reconhece as salvaguardas que ele já tem e muda de posição diante de fatos novos ou argumentos melhores, não diante do descontentamento.

Instalação:


# Claude Code
/plugin marketplace add antiagree/antiagree
/plugin install antiagree@antiagree

# Uso
/antiagree                                # revisa as decisões desta sessão
/antiagree nosso plano de dividir o monolito # revisa qualquer coisa
/antiagree quick bench/RESULTS.md         # cartão de veredito + três principais achados

Outros agentes com Agent Skills (Codex, Cursor, Gemini CLI) instalam copiando skills/antiagree/ para a pasta de skills deles. Ele também é acionado por pedidos simples como “ataque meu plano” ou “no me des la razón”.

Verificado, não suposto:


O repositório traz cinco casos de avaliação para claude plugin eval: um benchmark com falhas plantadas, um plano sólido com “seja brutal” no prompt, um caso em espanhol em que o intervalo de confiança inclui o zero, um critério de descarte que os resultados mais recentes atingiram e uma sessão que chegou a um plano à base de concordar. Quatro deles rodam com e sem o plugin.

Nesses casos, com três execuções cada e o Opus 5.5 como juiz, o Sonnet 5.5 e o Opus 5.5 passaram nas 15 execuções com o Antiagree, contra 0 de 12 e 3 de 12 sem ele. Sem o plugin, os dois ainda encontraram as falhas plantadas, mas inventaram problemas no plano sólido e não deram uma regra de decisão para o benchmark. Os casos foram escritos para este projeto, então os números são um sinal, não uma prova.

Stack técnica:


  • Formato: uma única Agent Skill, um SKILL.md, sem hooks, sem servidores MCP e sem scripts. As ferramentas que ele pré-aprova são somente leitura (Read, Grep, Glob); as buscas na web por projetos semelhantes pedem permissão.
  • Distribuição: um marketplace de plugins do Claude Code e o padrão Agent Skills.
  • Evals: claude plugin eval com ablação com e sem o plugin, avaliadores LLM com critérios de aprovação escritos, um histórico de sessão reproduzido e espaços de trabalho gerados por script.
  • CI: validação estrita do plugin, verificação de manifestos e casos de avaliação e regras do diretório de plugins (tamanhos, nomes de arquivo, redação), sem API key e sem custo.
  • Privacidade: sem código de rede e sem telemetria. Lê arquivos do seu projeto, escreve ANTIAGREE.md só quando você concorda e suas buscas passam pela própria ferramenta WebSearch do Claude.

Conclusão:


O Antiagree nasceu dos meus próprios prompts longos pedindo ao Claude que parasse de concordar comigo, transformados em uma skill que qualquer pessoa pode instalar. O projeto demonstra:

  • Moldar o comportamento de um modelo só com instruções: uma skill que muda como o Claude revisa, sem código rodando na máquina do usuário.
  • Tratar a calibração como funcionalidade: dizer GO diante de um plano sólido é testado com o mesmo rigor que detectar um plano com falhas.
  • Medir um prompt como um produto: evals de ablação com e sem o plugin, avaliadores no repositório e resultados publicados com seus limites.
  • Fazer as decisões durarem: um registro de critérios de descarte que a revisão seguinte faz cumprir.


Compartilhar


Projetos relacionados

Todos os projetos