☑️ Antiagree [Plugin para Claude Code - Agent Skill - Evals]
O Antiagree revisa uma ideia, um plano, uma arquitetura, um benchmark ou uma decisão como faria um revisor externo sem nada em jogo. Ele confere as afirmações com o código e os dados, procura o que já existe, tenta derrubar a proposta com o argumento mais forte que encontrar e fica só com o que sobrevive. Toda revisão termina em uma única decisão: GO, ITERATE, RETHINK ou KILL. Ele não finge dureza: quando o plano é sólido, diz GO. É distribuído ao mesmo tempo como plugin para o Claude Code e como Agent Skill. Só instruções, sem telemetria, MIT.
Ver no GitHub DocumentaçãoConcordar é o padrão:
Modelos de linguagem tendem a concordar com quem está na frente deles. Pergunte “este é um bom plano?” e muitas vezes você recebe um sim caprichado, alguns ajustes menores e uma estimativa que ninguém mediu. A falha oposta é igualmente comum: peça honestidade brutal e você recebe problemas inventados, porque é isso que o papel parece pedir. As duas respostas dizem o que você pediu para ouvir, e não o que é verdade.
A lealdade do Antiagree é com o seu objetivo, não com a sua proposta, com as suas decisões anteriores nem com o que ele disse antes na conversa. Dureza intelectual, não de tom.
Como funciona uma revisão:
- Consulta o registro. Se
ANTIAGREE.mdexiste, ele lê primeiro: um critério de descarte que foi atingido, ou um prazo que venceu, abre a revisão. - Investiga antes de julgar. Verifica as três a cinco afirmações das quais a decisão depende, no código, nos dados, nos benchmarks e no histórico do git. Sem artefatos, avisa que a revisão é só de raciocínio.
- Verifica se já existe. Para qualquer coisa que você planeje construir, procura projetos semelhantes e pergunta o que é realmente diferente.
- Encontra o objetivo real. Que resultado se busca, qual variável importa e se a própria pergunta está mal formulada.
- Ataca e depois tenta derrubar. Suposições, atividade versus impacto, causalidade, a medição, custos ocultos, efeitos de segunda ordem, pessoas e incentivos, custo afundado e caminhos mais simples. Depois, o argumento mais forte contra a proposta, não um espantalho.
- Reconstrói. O gargalo, os poucos movimentos com alavancagem real e experimentos com limites de GO e KILL.
Toda afirmação que importa recebe um rótulo, no idioma do usuário: FATO (com a fonte), FORTEMENTE SUSTENTADO, HIPÓTESE ou ESPECULAÇÃO. Sem porcentagens inventadas: se ninguém sabe, a resposta é “ainda não sabemos”.
O veredito:
Toda revisão abre com um cartão: o que está sendo revisado, o veredito, o maior risco, o próximo passo mais barato que resolve a dúvida e o único fato que o faria mudar de ideia.
- GO: sólido; siga em frente. É o padrão quando o diagnóstico tem respaldo e o plano pode ser verificado e revertido com pouco custo.
- ITERATE: objetivo e abordagem certos, com algo a corrigir que o plano ainda não cobre.
- RETHINK: objetivo certo, abordagem errada.
- KILL: abandonar.
Fecha com a verdade incômoda, o que manter, o que mudar, o que não construir e o que ainda não se sabe.
Revisar a sessão e cobrar o que foi decidido:
- Revisão da sessão. Rode
/antiagreesem nada depois e ele audita o que você e o Claude já decidiram na conversa, desde a primeira mensagem. Avisa logo de início que participou dessas decisões e abre com uma tabela de cada número e afirmação que a sessão aceitou: quem introduziu, se foi verificado e o que depende disso. - Critérios de descarte. Quando uma revisão propõe experimentos com limites, ele oferece registrá-los em
ANTIAGREE.md. A próxima revisão os lê primeiro, então a régua não pode mudar depois que o resultado aparece. - Calibrado. Diz o que o plano acerta antes de atacá-lo, reconhece as salvaguardas que ele já tem e muda de posição diante de fatos novos ou argumentos melhores, não diante do descontentamento.
Instalação:
# Claude Code
/plugin marketplace add antiagree/antiagree
/plugin install antiagree@antiagree
# Uso
/antiagree # revisa as decisões desta sessão
/antiagree nosso plano de dividir o monolito # revisa qualquer coisa
/antiagree quick bench/RESULTS.md # cartão de veredito + três principais achados
Outros agentes com Agent Skills (Codex, Cursor, Gemini CLI) instalam copiando skills/antiagree/ para a pasta de skills deles. Ele também é acionado por pedidos simples como “ataque meu plano” ou “no me des la razón”.
Verificado, não suposto:
O repositório traz cinco casos de avaliação para claude plugin eval: um benchmark com falhas plantadas, um plano sólido com “seja brutal” no prompt, um caso em espanhol em que o intervalo de confiança inclui o zero, um critério de descarte que os resultados mais recentes atingiram e uma sessão que chegou a um plano à base de concordar. Quatro deles rodam com e sem o plugin.
Nesses casos, com três execuções cada e o Opus 5.5 como juiz, o Sonnet 5.5 e o Opus 5.5 passaram nas 15 execuções com o Antiagree, contra 0 de 12 e 3 de 12 sem ele. Sem o plugin, os dois ainda encontraram as falhas plantadas, mas inventaram problemas no plano sólido e não deram uma regra de decisão para o benchmark. Os casos foram escritos para este projeto, então os números são um sinal, não uma prova.
Stack técnica:
- Formato: uma única Agent Skill, um
SKILL.md, sem hooks, sem servidores MCP e sem scripts. As ferramentas que ele pré-aprova são somente leitura (Read, Grep, Glob); as buscas na web por projetos semelhantes pedem permissão. - Distribuição: um marketplace de plugins do Claude Code e o padrão Agent Skills.
- Evals:
claude plugin evalcom ablação com e sem o plugin, avaliadores LLM com critérios de aprovação escritos, um histórico de sessão reproduzido e espaços de trabalho gerados por script. - CI: validação estrita do plugin, verificação de manifestos e casos de avaliação e regras do diretório de plugins (tamanhos, nomes de arquivo, redação), sem API key e sem custo.
- Privacidade: sem código de rede e sem telemetria. Lê arquivos do seu projeto, escreve
ANTIAGREE.mdsó quando você concorda e suas buscas passam pela própria ferramenta WebSearch do Claude.
Conclusão:
O Antiagree nasceu dos meus próprios prompts longos pedindo ao Claude que parasse de concordar comigo, transformados em uma skill que qualquer pessoa pode instalar. O projeto demonstra:
- Moldar o comportamento de um modelo só com instruções: uma skill que muda como o Claude revisa, sem código rodando na máquina do usuário.
- Tratar a calibração como funcionalidade: dizer GO diante de um plano sólido é testado com o mesmo rigor que detectar um plano com falhas.
- Medir um prompt como um produto: evals de ablação com e sem o plugin, avaliadores no repositório e resultados publicados com seus limites.
- Fazer as decisões durarem: um registro de critérios de descarte que a revisão seguinte faz cumprir.
Tags
Compartilhar