NVIDIA e Google DeepMind abrem estruturas de 2.800 vírus

NVIDIA e Google DeepMind abrem estruturas de 2.800 vírus

A NVIDIA passou a integrar uma coalizão internacional de pesquisa que acaba de liberar, de forma aberta, estruturas 3D previstas para os complexos proteicos de mais de 2.800 vírus. O conjunto de dados está acessível a qualquer cientista, em qualquer lugar, por meio do AlphaFold Database, e foi produzido com o AlphaFold2, modelo do Google DeepMind, otimizado para rodar em GPUs NVIDIA.

O anúncio foi feito em 24 de setembro de 2026.

Uma coalizão global contra a próxima pandemia

Além de NVIDIA e Google DeepMind, o grupo reúne o Instituto Europeu de Bioinformática (EMBL-EBI), a Coalition for Epidemic Preparedness Innovations (CEPI), a Seoul National University, a Sungkyunkwan University, o Swiss Institute of Bioinformatics e a University of Glasgow.

As previsões foram inferidas com o AlphaFold2, modelo de IA que estima como proteínas se dobram em formas tridimensionais, com otimização do NVIDIA BioNeMo Inference Runtime. Segundo a NVIDIA, esse recurso permitiu escalar a inferência para milhares de proteomas virais, prevendo os complexos, grupos de proteínas que atuam em conjunto, codificados em cada vírus.

Risha Patel, gerente de parcerias em ciências da vida do Google DeepMind, afirmou que a ambição do AlphaFold Database sempre foi democratizar o acesso à biologia fundamental em escala. Disse que essa colaboração deve dar aos cientistas de todo o mundo informações necessárias para se prepararem para futuros surtos.

Da sequência à estrutura em minutos

A maior parte das proteínas não trabalha isolada. Elas se organizam em complexos de múltiplas moléculas para cumprir funções sofisticadas, e são justamente essas estruturas que vacinas e medicamentos precisam atingir para bloquear a ação viral.

Entender a estrutura 3D da proteína spike do vírus da COVID-19, por exemplo, foi fundamental para o desenho das vacinas. Para milhares de outros vírus, esse conhecimento simplesmente não existe, e o novo conjunto de dados começa a preencher a lacuna.

Os métodos tradicionais, baseados na cristalização de proteínas e no disparo de raios X, podem levar anos e custar milhares de dólares por estrutura. O AlphaFold2, otimizado com o BioNeMo para rodar com eficiência em GPUs NVIDIA, prevê uma estrutura em minutos e pode operar em lote, cabendo aos cientistas validar experimentalmente apenas as previsões de maior confiança.

A equipe percorreu sistematicamente famílias virais conhecidas por infectar humanos, de vírus causadores de resfriado comum a ameaças emergentes como o Mpox.

A NVIDIA também liberou o BioNeMo Structure Prediction Pipeline, o fluxo de trabalho acelerado por GPU usado para gerar o conjunto de dados. Pesquisadores podem partir da sequência proteica e chegar à estrutura 3D prevista de seus próprios alvos.

30% inédito para a ciência

Cerca de 30% das interações proteicas adicionadas ao banco são completamente novas para a ciência. Elas exibem formatos de interação nunca documentados no Protein Data Bank, principal repositório de estruturas proteicas determinadas experimentalmente.

Chris Dallago, líder do time de ciência aplicada em biologia digital da NVIDIA, descreve a base como um motor de geração de hipóteses. Para ele, o conjunto permite que biólogos e a comunidade de IA investiguem interações proteicas não apenas como moléculas isoladas, mas como complexos.

As previsões do conjunto aberto são rotuladas por nível de confiança, indicando como os complexos virais podem se parecer e como proteínas individuais interagem dentro de um proteoma viral.

Por que isso importa

Uma análise do Center for Global Development estima em cerca de 50% a chance de o mundo enfrentar até 2050 uma pandemia tão grave quanto a de COVID-19.

Joe Grove, professor de virologia molecular do Medical Research Council-University of Glasgow Centre for Virus Research e colaborador do projeto, observa que a próxima pandemia pode trazer algo totalmente inesperado. Segundo ele, faltaria o conhecimento que existia no caso da COVID, e o objetivo é estocar parte desse conhecimento com antecedência.

Ele lembra que, durante seu doutorado, não havia estruturas para nenhuma das proteínas que investigava. O novo conjunto oferece dados estruturais de alta qualidade capazes de acelerar a ciência básica.

Jo McEntyre, diretora interina do EMBL-EBI, afirma que tornar esses dados abertos é crítico para o diagnóstico viral e para o desenvolvimento de tratamentos e vacinas. Ela diz que o conjunto cobre vírus menos estudados e reduz barreiras para cientistas em regiões de poucos recursos que enfrentam surtos na linha de frente.

A liberação coincide com uma reunião da Assembleia Geral das Nações Unidas convocada pelo Fórum Econômico Mundial sobre prevenção, preparação e resposta a pandemias, realizada nesta semana em Nova York. O material se soma ao AlphaFold Database, que agora reúne mais de 260 milhões de previsões de proteínas e complexos proteicos, cobrindo praticamente todas as proteínas catalogadas pela ciência.

Fontes e links

Matéria publicada originalmente em NVIDIA

Últimas Notícias

Dario Amodei, da Anthropic, janta com Trump na Casa Branca
Agentes da OpenAI tentam 'forçar' site de estatísticas da ONU
Engram: sampler com IA transforma alucinações em música
IA em hospitais soma US$ 942 milhões em custos, diz seguradora