MACHINA · guia · 2026
Benchmarks de segurança em IA, comparados
Benchmarks são o mais próximo que a área tem de uma régua. Também são curtos, manipuláveis e frequentemente memorizados. Este guia percorre o que cada um mede — e o que discretamente não mede.
§ 01 · O problema da unidade
Um benchmark é régua, não veredito
Cada benchmark responde a uma pergunta, sobre uma distribuição, em um formato. Um número único permite comparar modelos num slide; não diz se o modelo é seguro para o seu tráfego.
A leitura correta é comparativa e local: o modelo A supera o B nesta fatia específica, sob este template de prompt, nesta temperatura de decodificação. Qualquer coisa mais geral é marketing.
§ 02 · Capacidade vs. segurança
Dois eixos, muitas vezes confundidos
Benchmarks de capacidade (MMLU, GSM8K, HumanEval, MATH) perguntam se o modelo consegue fazer a tarefa. Saturam rápido: quando modelos de fronteira passam de ~90%, o resto é muitas vezes ruído.
Benchmarks de segurança (TruthfulQA, HHH, HarmBench, MACHIAVELLI, XSTest) perguntam se o modelo se comporta bem quando poderia se comportar mal. Um modelo capaz com alta taxa de recusa parece mais seguro que um modelo fraco que simplesmente não sabe ajudar num pedido perigoso.
§ 03 · Contaminação
O conjunto de treino comeu o de teste
Benchmarks públicos aparecem na web aberta. Todo modelo treinado num crawl provavelmente já viu a maioria — muitas vezes literalmente. Scores publicados misturam raciocínio com memorização.
As correções honestas são: conjuntos hold-out publicados depois do cutoff do modelo, strings canário para detectar vazamento, e benchmarks dinâmicos (LiveBench, SWE-bench Verified) atualizados periodicamente. Nenhuma resolve; só adia.
§ 04 · Letras miúdas estatísticas
O que dois pontos de diferença significam
MMLU tem ~14.000 itens em 57 áreas. Nesse tamanho, o intervalo de confiança de 95% num score é de cerca de ±0,8 pontos. Uma diferença de dois pontos entre modelos é real; 0,3 ponto é ruído.
GSM8K (1.319 itens) e TruthfulQA (817 itens) são menores. Seus intervalos giram em torno de ±2 pontos — ordenar modelos pelo score de manchete do TruthfulQA é quase jogar uma moeda viciada.
§ 05 · Sensibilidade ao prompt
O mesmo benchmark, três scores diferentes
Reescrever o system prompt, trocar os exemplos few-shot ou mudar respostas em letra (A/B/C/D) para texto completo pode mover o MMLU em 5–10 pontos no mesmo modelo. Rankings públicos raramente publicam o template exato — sem ele, o número não é reproduzível.
É por isso que a única avaliação em que dá para confiar é a que você mesmo rodou, nos seus prompts, na versão exata do modelo que vai usar.
§ 06 · O que os benchmarks de segurança capturam
Proxies estreitos para um problema grande
- §TruthfulQA — resistência a equívocos populares. Não mede veracidade em afirmações inéditas.
- §HHH (Helpful, Honest, Harmless) — julgamento de preferência entre respostas pareadas. Depende dos valores de quem avalia.
- §HarmBench / AdvBench — taxa de recusa contra um catálogo fixo de pedidos nocivos. Atacantes escrevem novos com facilidade.
- §XSTest — recusa excessiva em pedidos benignos. Equilibra os dois anteriores.
- §MACHIAVELLI — busca de poder, engano e traição em jogos de texto. Proxy agêntico, não uso real.
- §SafetyBench, ToxiGen, BBQ — viés e toxicidade entre grupos sociais. Retrato de um momento e uma cultura.
§ 07 · O que nenhum benchmark captura
As falhas que vão te morder
Prompt injection em documentos recuperados, mau uso de ferramentas por loops agênticos, alucinação silenciosa em domínios específicos e drift lento quando o modelo é fine-tunado com dados de usuário. Nada disso aparece nos rankings — e tudo isso quebra sistemas reais.
A postura certa é em camadas: um score de leaderboard para triar candidatos, uma avaliação própria nos seus dados para short-list, e monitoramento contínuo em produção para pegar o que nenhum dos dois viu.
§ Tabela de referência
| Benchmark | O que mede | Onde falha |
|---|---|---|
| MMLU / MMLU-Pro | Conhecimento multitarefa em 57 áreas, múltipla escolha. | Contaminação; sensibilidade ao template de prompt; quase saturação no topo. |
| GSM8K | Problemas de matemática de ensino fundamental com raciocínio passo a passo. | Amostra pequena; resolvível por padrão sem aritmética real. |
| HumanEval / MBPP | Correção funcional de código Python gerado. | Problemas curtos e isolados; não representa código real. |
| HELM | Avaliação ampla, multi-métrica, entre cenários e modelos. | Score agregado esconde trade-offs por tarefa; caro de rodar. |
| TruthfulQA | Resistência a equívocos comuns. | 817 itens; mede um modo específico de falha, não veracidade em geral. |
| HHH | Preferência por respostas úteis, honestas e inofensivas. | Depende dos valores do avaliador; utilidade e inofensividade puxam em sentidos opostos. |
| HarmBench / AdvBench | Taxa de recusa contra pedidos nocivos e jailbreaks catalogados. | Superfície de ataque fixa; novos jailbreaks são baratos de escrever. |
| MACHIAVELLI | Busca de poder, engano e traição em aventuras de texto. | Proxy de jogo; transferência para uso real é incerta. |
| LiveBench / SWE-bench Verified | Tarefas resistentes a contaminação, atualizadas periodicamente. | Ainda pequeno; ainda uma distribuição; ainda um leaderboard. |
Referências
- Hendrycks et al. — Measuring Massive Multitask Language Understanding (MMLU, arXiv:2009.03300)
- Cobbe et al. — Training Verifiers to Solve Math Word Problems (GSM8K, arXiv:2110.14168)
- Lin et al. — TruthfulQA: Measuring How Models Mimic Human Falsehoods (arXiv:2109.07958)
- Liang et al. — Holistic Evaluation of Language Models (HELM, arXiv:2211.09110)
- Mazeika et al. — HarmBench (arXiv:2402.04249)
- Pan et al. — MACHIAVELLI Benchmark (arXiv:2304.03279)
- White et al. — LiveBench: A Challenging Contamination-Free LLM Benchmark