Pesquisa em IA
Melhoria recursiva sai da teoria e entra nos roteiros de laboratórios de IA
A AP informa que laboratórios líderes veem a melhoria recursiva como possibilidade próxima, enquanto Anthropic, OpenAI e xAI descrevem sistemas que ajudam a construir modelos futuros.
A melhoria recursiva está deixando de ser um experimento mental distante e entrando no planejamento de curto prazo dos laboratórios de IA de fronteira. A AP informou que desenvolvedores líderes agora dizem que sistemas de IA se aproximam do ponto em que podem ajudar a melhorar a si mesmos e contribuir para construir modelos sucessores mais avançados. A ideia, conhecida como RSI, ocupa há anos o centro dos debates de segurança porque pode acelerar avanços científicos e, ao mesmo tempo, tornar sistemas mais difíceis de entender, monitorar ou conter.
A evidência recente mais clara vem da divulgação da Anthropic sobre o papel de Claude em sua própria pesquisa e desenvolvimento. A empresa disse que Claude lidera cerca de 26% das tarefas de P&D de modelos sob supervisão humana. Isso não significa que Claude esteja projetando sozinho a próxima geração de IA, mas mostra que modelos já fazem parte da máquina usada para construir modelos futuros. Em um laboratório de fronteira, a automação parcial de código, avaliação, dados e desenho de experimentos pode se acumular rapidamente.
A OpenAI também descreveu progresso rumo à pesquisa automatizada. Segundo a AP, a empresa anunciou um “estagiário de pesquisa” automatizado capaz de realizar tarefas bem definidas sob direção humana, incluindo trabalho que poderia levar dias para um pesquisador qualificado. A companhia trabalha para ter um pesquisador de IA mais autônomo até março de 2028, mas também reconhece que ainda não sabe como chegar com segurança a uma RSI completa e alinhada. Elon Musk já descreveu o desenvolvimento do Grok, da xAI, como um processo com menos intervenção humana, mirando maior autonomia em 2027.
A discussão não é se IA pode ajudar pesquisadores de IA. Isso já ocorre. A pergunta difícil é se o ciclo de feedback pode ficar forte o bastante para que cada sistema ajude a construir um sistema mais capaz, que depois melhora novamente o processo. Defensores veem potencial para acelerar medicina, materiais, modelagem climática e a própria pesquisa de segurança. Um pesquisador automatizado pode testar hipóteses, revisar código, executar experimentos e encontrar erros em escala inalcançável para humanos.
Críticos temem essa mesma aceleração. Se modelos começam a melhorar os sistemas que os treinam ou avaliam, empresas podem perder a capacidade de prever para onde as capacidades caminham. O cenário de risco é aquele em que a velocidade de melhoria cresce mais rápido que a supervisão, deixando menos tempo para testar, entender ou intervir. Mesmo versões mais concretas importam: agentes de pesquisa podem introduzir erros sutis, otimizar métricas erradas ou criar ferramentas difíceis de auditar.
A Microsoft chama sua abordagem de “superinteligência humanista”, enfatizando sistemas limitados e a serviço das pessoas. A OpenAI diz que qualquer decisão sobre RSI rápida deve depender da preservação do controle humano e de escolhas democráticas. A RSI ainda não está completa, mas os primeiros ciclos já estão visíveis o suficiente para deixar de ser cenário distante e virar questão prática de governança.