Durante décadas, a pirâmide de evidências foi utilizada para ensinar uma ideia aparentemente simples: alguns desenhos de pesquisa oferecem resultados mais confiáveis do que outros. Relatos de caso aparecem na base, estudos observacionais ocupam os níveis intermediários, ensaios clínicos randomizados ficam próximos ao topo e revisões sistemáticas com metanálise recebem a posição de maior prestígio.
Essa representação teve enorme valor educacional. O problema surge quando a pirâmide deixa de ser entendida como um mapa inicial e passa a funcionar como uma regra automática: “se está no topo, é verdade; se está na base, tem pouco valor”.
Foi justamente essa simplificação que M. Hassan Murad e colaboradores questionaram no artigo “New evidence pyramid”, publicado em 2016 na revista Evidence-Based Medicine, atualmente chamada BMJ Evidence-Based Medicine. Em vez de abandonar completamente a hierarquia, os autores propuseram duas mudanças visuais e conceituais:
- substituir as linhas retas entre os desenhos de estudo por linhas onduladas;
- retirar revisões sistemáticas e metanálises do topo e representá-las como uma lente através da qual os estudos primários são examinados.
A proposta parece apenas uma mudança gráfica, mas carrega uma mensagem metodológica importante: o desenho do estudo é somente o ponto de partida para julgar a certeza de uma evidência, não o veredito final.
Por que a pirâmide tradicional é insuficiente?
A pirâmide clássica organiza os estudos principalmente pela capacidade teórica de controlar vieses. Para questões sobre os efeitos de intervenções, a randomização tende a produzir grupos comparáveis e a reduzir a influência de fatores de confusão. Por isso, ensaios clínicos randomizados geralmente começam em uma posição superior aos estudos observacionais.
Entretanto, saber que um estudo foi randomizado não informa se a randomização foi realizada corretamente, se houve ocultação da alocação, perdas relevantes, análise seletiva dos resultados, baixa adesão, amostra insuficiente ou aplicação inadequada dos testes estatísticos.
Em outras palavras, um ensaio clínico pode possuir um desenho teoricamente forte e uma execução metodologicamente frágil.
O inverso também precisa ser considerado. Algumas relações são tão evidentes, apresentam efeitos tão grandes ou não podem ser investigadas eticamente por meio de randomização que estudos observacionais podem produzir evidências bastante convincentes. Não seria aceitável, por exemplo, randomizar pessoas para fumar ou não fumar durante décadas apenas para determinar os efeitos do tabagismo.
Portanto, a pergunta correta não é somente “qual é o desenho do estudo?”, mas também:
- Como o estudo foi conduzido?
- Qual é o risco de viés?
- A amostra foi suficiente?
- Os resultados são consistentes entre os trabalhos?
- A população estudada representa aquela para a qual pretendemos aplicar a evidência?
- Os desfechos avaliados são realmente importantes?
- Qual é a amplitude do intervalo de confiança?
- Há possibilidade de viés de publicação?
A pirâmide tradicional dificilmente consegue representar toda essa complexidade.
O significado das linhas onduladas
A primeira alteração proposta por Murad e colaboradores foi substituir as divisões rígidas da pirâmide por fronteiras onduladas. Essas “ranhuras” indicam que a certeza da evidência pode subir ou descer, mesmo dentro de um mesmo desenho de pesquisa.
A inspiração vem do sistema GRADE, desenvolvido para avaliar a certeza de um conjunto de evidências. Para perguntas sobre intervenções, evidências provenientes de ensaios randomizados geralmente começam como de alta certeza, enquanto estudos não randomizados normalmente começam em um nível inferior. Essa classificação inicial, porém, pode ser modificada.
A certeza pode ser rebaixada por cinco razões principais:
- risco de viés;
- inconsistência entre os estudos;
- evidência indireta;
- imprecisão;
- viés de publicação ou de disseminação.
Em determinadas circunstâncias, evidências observacionais também podem ganhar credibilidade, por exemplo, diante de um efeito de grande magnitude, gradiente dose–resposta ou quando fatores de confusão plausíveis tenderiam a reduzir — e não aumentar — o efeito encontrado. A abordagem atual do GRADE ainda é mais detalhada do que essa explicação resumida e varia conforme o tipo de pergunta. Para prognóstico e exposições, por exemplo, estudos não randomizados podem representar o desenho mais apropriado. O GRADE Book deixa claro que a certeza deve ser avaliada por desfecho e pelo conjunto da evidência, e não atribuída mecanicamente a um artigo isolado.
As linhas onduladas, portanto, não significam que todos os desenhos são equivalentes. A randomização continua tendo vantagens importantes para estimar efeitos causais de intervenções. O que elas mostram é que as categorias apresentam sobreposição: um ensaio randomizado muito problemático pode fornecer menor certeza que um estudo observacional excepcionalmente consistente e adequado à pergunta.
Revisão sistemática não é automaticamente o melhor nível de evidência
A segunda mudança é ainda mais provocativa: revisões sistemáticas e metanálises deixam o topo da pirâmide.
Para entender essa decisão, é necessário distinguir os dois termos. Uma revisão sistemática utiliza métodos explícitos e previamente definidos para localizar, selecionar, avaliar e sintetizar estudos que respondam a uma pergunta específica. A metanálise é uma técnica estatística utilizada para combinar quantitativamente os resultados desses estudos.
Uma revisão sistemática não precisa, obrigatoriamente, conter uma metanálise. Quando os estudos são excessivamente diferentes ou apresentam resultados incompatíveis, calcular um efeito médio pode ser inadequado ou enganoso. Essa orientação é explicitamente reconhecida pelo Manual Cochrane.
Da mesma forma, reunir muitos estudos em uma metanálise não elimina os problemas presentes nos trabalhos originais. Se a síntese incluir pesquisas com elevado risco de viés, medidas inadequadas, amostras pouco representativas ou intervenções muito diferentes, seu resultado combinado poderá apresentar uma aparência de precisão sem oferecer verdadeira segurança.
Uma metanálise de numerosos estudos frágeis continua sendo uma síntese de estudos frágeis.
Além disso, a própria revisão pode introduzir problemas:
- pergunta mal formulada;
- busca incompleta;
- critérios de inclusão modificados após a análise;
- seleção inadequada dos estudos;
- erros na extração dos dados;
- avaliação superficial do risco de viés;
- combinação de intervenções ou populações incompatíveis;
- escolha oportunista do modelo estatístico;
- ausência de protocolo;
- conflitos de interesse;
- conclusões mais fortes do que os dados permitem.
Por essa razão, Murad e colaboradores propõem que a revisão sistemática seja representada como uma lente. Ela é um instrumento para localizar, avaliar e sintetizar a evidência, mas sua confiabilidade depende tanto da qualidade dos estudos incluídos quanto da qualidade do próprio processo de revisão. O Manual Cochrane reforça que revisões sistemáticas procuram minimizar vieses por meio de perguntas e métodos previamente especificados, protocolos, buscas abrangentes e procedimentos transparentes.
O principal mérito do artigo
O maior mérito da proposta não é criar uma pirâmide mais bonita. É ensinar que nível de evidência e certeza da evidência não são sinônimos.
O nível descreve, de maneira aproximada, onde um desenho se encontra em uma hierarquia. A certeza expressa quanto podemos confiar que a estimativa representa adequadamente o efeito verdadeiro em determinado contexto e para determinado desfecho.
Essa distinção impede alguns erros comuns:
- acreditar que todo ensaio randomizado produz evidência de alta certeza;
- tratar toda metanálise como conclusão definitiva;
- descartar automaticamente estudos observacionais;
- ignorar risco de viés, aplicabilidade e imprecisão;
- confundir significância estatística com relevância prática;
- aplicar resultados a populações diferentes daquelas estudadas.
No treinamento físico e na ciência do esporte, isso é especialmente relevante. Muitos estudos randomizados apresentam amostras pequenas, intervenções curtas, participantes destreinados e desfechos laboratoriais que não representam diretamente desempenho, lesão, saúde ou permanência no treinamento.
Um ensaio pode ser randomizado e, mesmo assim, não responder à pergunta de um treinador que trabalha com atletas experientes. O problema não está necessariamente na validade interna, mas na distância entre a população estudada, a intervenção executada e o contexto de aplicação.
Limitações da nova pirâmide
Apesar de seu valor didático, a proposta também possui limitações.
A primeira é que continua sendo uma pirâmide. Qualquer figura hierárquica reduz um processo multidimensional a uma única direção vertical. Diferentes perguntas exigem diferentes desenhos. Ensaios randomizados são adequados para muitas questões sobre eficácia de intervenções, mas não necessariamente para diagnóstico, prognóstico, prevalência, experiências individuais, implementação, efeitos adversos raros ou exposições de longo prazo.
A segunda limitação é que as linhas onduladas podem sugerir que o GRADE simplesmente promove ou rebaixa estudos individuais. Na realidade, o GRADE avalia principalmente a certeza de um corpo de evidências para cada desfecho relevante. Uma mesma revisão pode apresentar alta certeza para um resultado, como redução da pressão arterial, e baixa certeza para outro, como mortalidade ou eventos adversos.
A terceira é que considerar a revisão sistemática apenas uma ferramenta de consumo pode subestimar sua capacidade de produzir conhecimento novo. Uma síntese pode revelar efeitos adversos raros, padrões de resposta, moderadores, lacunas metodológicas e inconsistências que não são perceptíveis nos estudos isolados. Os próprios autores reconhecem essa limitação.
A quarta é que certeza da evidência não determina sozinha uma decisão. Recomendações também dependem da magnitude dos benefícios e danos, valores e preferências, custos, equidade, aceitabilidade e viabilidade. Uma evidência de alta certeza pode mostrar que uma intervenção produz um efeito muito pequeno, caro ou clinicamente irrelevante.
Por isso, uma decisão baseada em evidências não pode ser reduzida à localização de um artigo em uma figura.
Como escolher melhor uma evidência científica
A pirâmide revisada pode ser transformada em uma sequência prática de avaliação:
1. Defina a pergunta
Antes de procurar o “melhor artigo”, estabeleça população, intervenção ou exposição, comparação e desfechos de interesse.
2. Verifique se o desenho é adequado
Um ensaio randomizado pode ser ideal para eficácia de uma intervenção, mas uma coorte pode ser mais apropriada para prognóstico, efeitos adversos ou exposições prolongadas.
3. Avalie como o estudo foi conduzido
Observe randomização, cegamento quando possível, perdas, aderência, mensuração dos desfechos, análise estatística, transparência e conflitos de interesse.
4. Examine a magnitude e a precisão
Não pergunte apenas se o resultado foi estatisticamente significativo. Observe o tamanho do efeito, o intervalo de confiança e se a diferença possui importância clínica ou prática.
5. Analise a aplicabilidade
Os participantes, a intervenção, o ambiente e os desfechos representam a realidade na qual a evidência será utilizada?
6. Procure o conjunto da literatura
Um estudo isolado raramente encerra uma questão. Verifique consistência, replicação e compatibilidade com outros resultados.
7. Avalie criticamente a revisão sistemática
Confirme se houve protocolo, busca abrangente, critérios transparentes, avaliação do risco de viés, exploração da heterogeneidade e classificação da certeza.
O que devemos levar para a prática?
A pirâmide revisada não afirma que relatos de caso, coortes e ensaios clínicos têm exatamente o mesmo peso. Também não declara o fim das hierarquias. Ela mostra que a posição ocupada pelo desenho é insuficiente para determinar a confiança no resultado.
A mensagem mais importante pode ser resumida da seguinte forma:
O desenho do estudo define o ponto de partida; a qualidade metodológica, a consistência, a precisão, a aplicabilidade e o conjunto da evidência definem até onde podemos confiar na conclusão.
Revisões sistemáticas continuam sendo fundamentais, mas não devem receber autoridade automática. Elas precisam ser avaliadas como qualquer outro produto científico. A lente pode ser transparente e precisa, mas também pode estar distorcida, incompleta ou direcionada para o lugar errado.
A verdadeira leitura baseada em evidências começa quando deixamos de perguntar apenas “em que nível da pirâmide este artigo está?” e passamos a perguntar: “Quanto podemos confiar nesse resultado, para qual desfecho, em qual população e para qual decisão?”
Dr. Andre Lopes – PhD em ciências do Movimento Humano.
Murad MH, Asi N, Alsawas M, Alahdab F. New evidence pyramid. Evidence-Based Medicine. 2016;21(4):125–127. DOI: 10.1136/ebmed-2016-110401. Acessar o artigo completo.



