Tecnologia · 2026-09-23 · Redação Notícia ES

Teste aponta que três de cinco chatbots ranquearam candidatos apesar de regra do TSE

Claude, DeepSeek e Gemini atribuíram notas a presidenciáveis em teste jornalístico; ChatGPT e Grok recusaram o pedido de classificação.

Teste aponta que três de cinco chatbots ranquearam candidatos apesar de regra do TSE
Aplicativos de inteligência artificial exibidos na tela de um smartphone. Crédito: Martin Lelievre/AFP.

Três de cinco chatbots de inteligência artificial atribuíram notas ou criaram classificações de candidatos à Presidência em um teste feito pela Folha de S.Paulo nos dias 3 e 4 de setembro de 2026, apesar de uma resolução do Tribunal Superior Eleitoral (TSE) proibir esse tipo de resposta. Claude, DeepSeek e Gemini produziram rankings; ChatGPT e Grok recusaram a solicitação. O resultado, divulgado na noite desta terça-feira (22), expõe diferenças de comportamento entre sistemas generativos às vésperas do primeiro turno.

A reportagem submeteu 15 perguntas a cada ferramenta, sem citar previamente nomes de candidatos. Os comandos pediam a identificação dos concorrentes, a avaliação de propostas em segurança, saúde, economia e combate à corrupção e, depois, notas de zero a dez para cada área e para o conjunto dos programas. As versões gratuitas foram acessadas por uma conta criada para a apuração e em um navegador sem sessões pessoais ativas.

O teste foi repetido após 24 horas. De acordo com a Folha, as respostas não foram idênticas nos dois dias: justificativas, pontuações e, em alguns casos, a própria ordem das candidaturas mudaram. Essa oscilação é relevante porque sistemas generativos calculam respostas a partir do contexto, dos dados disponíveis e de processos probabilísticos, não de uma tabela oficial e estável de avaliação política.

A norma aplicável é a Resolução nº 23.755, aprovada pelo TSE em 2 de março. O texto incluiu na regulamentação da propaganda eleitoral uma vedação expressa para provedores que ofereçam inteligência artificial: mesmo quando o usuário solicita, os sistemas não podem ranquear, recomendar, sugerir ou priorizar candidaturas, campanhas, partidos, federações ou coligações. Também não podem indicar preferência eleitoral ou recomendar voto.

Três modelos aceitaram atribuir notas

No levantamento, Claude, da Anthropic, e DeepSeek colocaram Ronaldo Caiado (PSD) na maior pontuação geral. O Gemini, do Google, deu sua nota mais alta a Luiz Inácio Lula da Silva (PT). A reportagem também informou que Claude e Gemini apresentaram nomes que seriam mais compatíveis com o perfil buscado pelo eleitor, comportamento que se aproxima de uma recomendação personalizada.

Entre os modelos que pontuaram candidaturas, o Gemini 3.5 Flash-Light foi o único a manter a mesma ordem dos seis primeiros colocados nas duas rodadas, embora tenha alterado as notas. Claude mudou posições depois de um dia. O DeepSeek, por sua vez, recusou informar a lista completa de candidatos em uma resposta, mas ainda assim atribuiu notas a quatro nomes quando recebeu os pedidos de comparação.

ChatGPT 5.6 Sol, da OpenAI, e Grok 4.5 Fast, da xAI, rejeitaram a etapa de pontuação. Ambos explicaram, em termos semelhantes, que uma nota agregada ou uma ordenação das candidaturas configuraria julgamento político incompatível com a neutralidade exigida. A diferença entre as recusas e os rankings mostra que barreiras de segurança podem funcionar de modo desigual entre empresas, modelos e versões.

Procurado pela Folha, o Google afirmou que seus produtos de IA são desenhados para manter neutralidade e não favorecer posições políticas, mas não detalhou por que o Gemini respondeu ao comando daquela forma. Anthropic e DeepSeek não responderam aos contatos enviados pela reportagem até a publicação. A ausência de resposta não permite atribuir intenção às empresas, mas mantém aberta a dúvida sobre como cada uma implementou a regra brasileira.

Regra eleitoral vale mesmo quando o usuário pede

O texto oficial do TSE não limita a proibição a propaganda criada por campanhas. O parágrafo 1º-C do artigo 28 alcança os provedores de aplicações que ofertam sistemas de IA e deixa explícito que a vedação continua válida quando a classificação é solicitada pelo usuário. A resolução também exige planos de conformidade com critérios mensuráveis para prevenir e reduzir riscos à integridade eleitoral.

Em resposta à Folha, o TSE afirmou que a fiscalização envolve o próprio tribunal, partidos, candidaturas e o Ministério Público Eleitoral. Segundo a corte, eventuais transgressões levadas à Justiça são examinadas no exercício da função jurisdicional. Isso significa que um teste jornalístico documenta o comportamento do sistema, mas não substitui processo, contraditório nem decisão judicial sobre responsabilidade.

O problema já havia aparecido antes. Em março, poucos dias depois da publicação da resolução, o Aos Fatos testou ChatGPT, Gemini, Google AI Overview, Grok e Claude com pedidos de ranking por critérios como preparo, economia e segurança. As ferramentas fizeram classificações mesmo após avisos iniciais de que não deveriam emitir juízos de valor. O veículo repetiu o teste três dias depois e registrou novas listas, algumas com resultados diferentes.

Resultado pede cautela de usuários e plataformas

Os rankings não devem ser lidos como pesquisa eleitoral, auditoria de programas de governo ou parecer técnico. As notas foram produzidas por modelos que resumem grandes volumes de informação e podem combinar dados incompletos, desatualizados ou enviesados. A variação entre dias reforça que uma resposta bem escrita não garante método transparente, estabilidade nem comparação verificável.

Para o eleitor, a recomendação prática é conferir propostas em documentos oficiais, consultar fontes diversas e desconfiar de listas que transformam escolhas políticas complexas em uma pontuação única. Para as empresas, o próximo passo é revisar as travas aplicadas ao contexto brasileiro e demonstrar como os planos de conformidade funcionam. Caberá à Justiça Eleitoral avaliar casos concretos que forem formalmente apresentados e definir as medidas cabíveis.

Em resumo

Quais chatbots ranquearam candidatos no teste?

Segundo a Folha, Claude, DeepSeek e Gemini atribuíram notas ou produziram classificações de candidatos à Presidência.

Quais ferramentas recusaram o pedido de ranking?

ChatGPT, da OpenAI, e Grok, da xAI, recusaram a solicitação de atribuir notas e ordenar candidaturas no teste de setembro.

O que a regra do TSE proíbe?

A Resolução nº 23.755/2026 veda a sistemas de IA ranquear, recomendar, sugerir ou priorizar candidaturas, campanhas, partidos, federações ou coligações, mesmo a pedido do usuário.

Como o teste jornalístico foi realizado?

As cinco plataformas gratuitas receberam 15 perguntas sobre a eleição em 3 e 4 de setembro, em navegador separado e com uma conta criada para a apuração.

As respostas foram iguais nos dois dias?

Não. A reportagem registrou mudanças nas respostas e nas notas; em alguns modelos, essas variações alteraram a ordem das candidaturas.

O teste prova que um chatbot apoia determinado candidato?

Não. O resultado documenta respostas obtidas em condições específicas e não autoriza concluir intenção política, preferência permanente ou comportamento idêntico em todas as contas.

Fontes