MACHINA · guia · 2026

Benchmarks de segurança em IA, comparados

Benchmarks são o mais próximo que a área tem de uma régua. Também são curtos, manipuláveis e frequentemente memorizados. Este guia percorre o que cada um mede — e o que discretamente não mede.

§ 01 · O problema da unidade

Um benchmark é régua, não veredito

Cada benchmark responde a uma pergunta, sobre uma distribuição, em um formato. Um número único permite comparar modelos num slide; não diz se o modelo é seguro para o seu tráfego.

A leitura correta é comparativa e local: o modelo A supera o B nesta fatia específica, sob este template de prompt, nesta temperatura de decodificação. Qualquer coisa mais geral é marketing.

§ 02 · Capacidade vs. segurança

Dois eixos, muitas vezes confundidos

Benchmarks de capacidade (MMLU, GSM8K, HumanEval, MATH) perguntam se o modelo consegue fazer a tarefa. Saturam rápido: quando modelos de fronteira passam de ~90%, o resto é muitas vezes ruído.

Benchmarks de segurança (TruthfulQA, HHH, HarmBench, MACHIAVELLI, XSTest) perguntam se o modelo se comporta bem quando poderia se comportar mal. Um modelo capaz com alta taxa de recusa parece mais seguro que um modelo fraco que simplesmente não sabe ajudar num pedido perigoso.

§ 03 · Contaminação

O conjunto de treino comeu o de teste

Benchmarks públicos aparecem na web aberta. Todo modelo treinado num crawl provavelmente já viu a maioria — muitas vezes literalmente. Scores publicados misturam raciocínio com memorização.

As correções honestas são: conjuntos hold-out publicados depois do cutoff do modelo, strings canário para detectar vazamento, e benchmarks dinâmicos (LiveBench, SWE-bench Verified) atualizados periodicamente. Nenhuma resolve; só adia.

§ 04 · Letras miúdas estatísticas

O que dois pontos de diferença significam

MMLU tem ~14.000 itens em 57 áreas. Nesse tamanho, o intervalo de confiança de 95% num score é de cerca de ±0,8 pontos. Uma diferença de dois pontos entre modelos é real; 0,3 ponto é ruído.

GSM8K (1.319 itens) e TruthfulQA (817 itens) são menores. Seus intervalos giram em torno de ±2 pontos — ordenar modelos pelo score de manchete do TruthfulQA é quase jogar uma moeda viciada.

§ 05 · Sensibilidade ao prompt

O mesmo benchmark, três scores diferentes

Reescrever o system prompt, trocar os exemplos few-shot ou mudar respostas em letra (A/B/C/D) para texto completo pode mover o MMLU em 5–10 pontos no mesmo modelo. Rankings públicos raramente publicam o template exato — sem ele, o número não é reproduzível.

É por isso que a única avaliação em que dá para confiar é a que você mesmo rodou, nos seus prompts, na versão exata do modelo que vai usar.

§ 06 · O que os benchmarks de segurança capturam

Proxies estreitos para um problema grande

  • §TruthfulQA — resistência a equívocos populares. Não mede veracidade em afirmações inéditas.
  • §HHH (Helpful, Honest, Harmless) — julgamento de preferência entre respostas pareadas. Depende dos valores de quem avalia.
  • §HarmBench / AdvBench — taxa de recusa contra um catálogo fixo de pedidos nocivos. Atacantes escrevem novos com facilidade.
  • §XSTest — recusa excessiva em pedidos benignos. Equilibra os dois anteriores.
  • §MACHIAVELLI — busca de poder, engano e traição em jogos de texto. Proxy agêntico, não uso real.
  • §SafetyBench, ToxiGen, BBQ — viés e toxicidade entre grupos sociais. Retrato de um momento e uma cultura.

§ 07 · O que nenhum benchmark captura

As falhas que vão te morder

Prompt injection em documentos recuperados, mau uso de ferramentas por loops agênticos, alucinação silenciosa em domínios específicos e drift lento quando o modelo é fine-tunado com dados de usuário. Nada disso aparece nos rankings — e tudo isso quebra sistemas reais.

A postura certa é em camadas: um score de leaderboard para triar candidatos, uma avaliação própria nos seus dados para short-list, e monitoramento contínuo em produção para pegar o que nenhum dos dois viu.

§ Tabela de referência

BenchmarkO que medeOnde falha
MMLU / MMLU-ProConhecimento multitarefa em 57 áreas, múltipla escolha.Contaminação; sensibilidade ao template de prompt; quase saturação no topo.
GSM8KProblemas de matemática de ensino fundamental com raciocínio passo a passo.Amostra pequena; resolvível por padrão sem aritmética real.
HumanEval / MBPPCorreção funcional de código Python gerado.Problemas curtos e isolados; não representa código real.
HELMAvaliação ampla, multi-métrica, entre cenários e modelos.Score agregado esconde trade-offs por tarefa; caro de rodar.
TruthfulQAResistência a equívocos comuns.817 itens; mede um modo específico de falha, não veracidade em geral.
HHHPreferência por respostas úteis, honestas e inofensivas.Depende dos valores do avaliador; utilidade e inofensividade puxam em sentidos opostos.
HarmBench / AdvBenchTaxa de recusa contra pedidos nocivos e jailbreaks catalogados.Superfície de ataque fixa; novos jailbreaks são baratos de escrever.
MACHIAVELLIBusca de poder, engano e traição em aventuras de texto.Proxy de jogo; transferência para uso real é incerta.
LiveBench / SWE-bench VerifiedTarefas resistentes a contaminação, atualizadas periodicamente.Ainda pequeno; ainda uma distribuição; ainda um leaderboard.

Referências