O Toyota Corolla usado no DrivingBench virou pista de teste para modelos de inteligência artificial, mas a maioria mal passou da primeira curva. Em 11 tentativas, oito avançaram menos de 11% do trajeto, expondo dificuldades para interpretar o percurso e calcular a direção.
O experimento colocou agentes de IA no controle do carro com hardware de visão da Comma e o sistema OpenPilot. Os resultados ajudam a separar a habilidade de conversar e resolver tarefas digitais da capacidade de conduzir um veículo com consistência.
Uma pista curta foi suficiente para expor os erros
O circuito era delimitado por pequenos cones e tinha algumas curvas. Todos os modelos receberam as mesmas instruções: relatar o que estavam vendo e fazendo após cada etapa. As tentativas também exigiam paradas frequentes, pois os comandos eram enviados a servidores por um ponto de acesso Wi-Fi.

Foto: Toyota/Divulgação
A configuração reuniu quatro modelos de inteligência artificial geral, entre eles Claude, GPT e Grok. Cada um poderia tentar completar o percurso até três vezes, mas o balanço divulgado contabilizou 11 tentativas.
Os problemas apareceram logo na leitura do ambiente. Na primeira tentativa, o Grok tratou o espaço entre os cones que marcavam a pista como um portão e seguiu em frente. A execução terminou após apenas dois comandos.
Um dos modelos GPT também contrariou uma orientação explícita: inventou que os cones de um dos lados tinham a mesma cor. Em outras passagens, as IAs não calcularam corretamente o ângulo de direção e esterçaram pouco para acompanhar as curvas.
Um modelo concluiu o trajeto, mas sem precisão
Apenas o GPT-6 Astra completou o circuito, na segunda tentativa. A volta, porém, foi irregular: o sistema fez um caminho tortuoso, contornou em excesso uma curva longa à direita e quase saiu da pista perto da chegada.
O custo informado para essa volta foi de US$ 7,74, quase quatro vezes o valor da tentativa anterior, que havia percorrido metade do trajeto. A conclusão também consumiu muito mais tokens, unidades usadas para processar e gerar respostas.
O número chama atenção porque o teste combinava uma pista curta com comandos enviados remotamente. As pausas para comunicação e o consumo de processamento fizeram parte da experiência, embora os dados disponíveis não permitam atribuir todo o custo a um único fator.
O que o experimento diz sobre carros autônomos
O resultado não representa uma avaliação de todos os sistemas de direção automatizada. O DrivingBench testou modelos de propósito geral, capazes de interpretar instruções e imagens, em uma tarefa de condução. Tecnologias desenvolvidas especificamente para dirigir podem usar métodos e estruturas diferentes.
Ainda assim, o teste evidencia um limite prático: reconhecer uma cena e descrever uma ação não garante que o veículo execute a manobra com precisão. No trânsito, decisões inconsistentes podem ter consequências de segurança, o que torna controle previsível e resposta confiável requisitos indispensáveis.
O arquivo de notícias sobre a Toyota reúne outros assuntos ligados à fabricante do carro usado no experimento. Já o caso do Volkswagen Polo e sua aposta em segurança mostra como a proteção veicular também depende de decisões concretas de engenharia.
Por enquanto, o DrivingBench indica que modelos gerais de IA ainda não demonstram a regularidade necessária para assumir sozinhos a direção de um carro.
