As ferramentas de contratação com IA têm mais probabilidade de estereotipar candidatos a emprego do que humanos, revela novo estudo

Um estudo de Princeton e da Universidade de Chicago colocou ChatGPT, Claude e Gemini numa simulação de contratação. Os modelos rapidamente categorizaram grupos étnicos fictícios em funções profissionais e fizeram-no de forma muito mais agressiva do que os participantes humanos.

AI2Day Newsdesk· 3 min read
Photoreal news-editorial style, 16:9 framing, full-frame edge-to-edge composition
Share

Pontos principais

  • Investigadores de Princeton e da Universidade de Chicago publicaram conclusões em julho de 2025 mostrando que os modelos de linguagem de larga escala (LLMs) estereotipam candidatos a emprego de forma mais severa do que os humanos fazem em simulações de contratação controladas.
  • Numa escala de segregação onde 2.0 significa confinamento completo de grupo a função, os participantes humanos obtiveram 0.84. O modelo de raciocínio o3 da OpenAI obteve 1.83.
  • Dizer aos modelos para serem justos teve pouco efeito, mas oferecer um bónus por contratação diversificada reduziu significativamente o comportamento tendencioso.
  • Os modelos tornaram-se menos tendenciosos quando receberam detalhes pessoais relevantes sobre candidatos, como idade e educação, mas reverteram para estereótipos de grupo quando receberam detalhes irrelevantes como cor de cabelo.
  • Conforme reportado pela MIT Technology Review, as empresas que implementam IA para filtrar currículos enfrentam um problema de equidade grave e amplamente não resolvido.

Antes de um único recrutador humano ler o seu currículo, um sistema de IA pode já ter decidido que não é a pessoa certa. Isto já não é uma preocupação distante. É uma realidade presente em muitos grandes empregadores.

Nova investigação académica mostra o quão mal isto pode correr.

Investigadores de Princeton e da Universidade de Chicago colocaram três grandes modelos de linguagem (LLMs, a tecnologia de IA por trás de chatbots como ChatGPT, Claude e Gemini) numa simulação de contratação. Cada modelo assumiu o papel de consultor de recursos humanos para uma cidade fictícia. Em 40 rondas, o modelo escolheu candidatos de quatro grupos étnicos fictícios para preencher 20 funções que iam desde médicos e advogados até assistentes de cuidados infantis e faxineiros.

Eis o problema: os modelos não sabiam que cada candidato tinha igual probabilidade de sucesso, independentemente do grupo.

Os modelos não agiram dessa forma. Quando uma contratação inicial de um grupo falhou, o modelo rapidamente deixou de considerar esse grupo para funções similares e começou a canalizá-los para empregos de menor estatuto. Um resultado negativo tornou-se uma regra aplicada a uma população inteira.

Os humanos fazem isto também. Mas os modelos fazem-no aproximadamente 65 por cento mais agressivamente do que os participantes humanos do estudo de psicologia original em que a experiência foi baseada.

Devem os candidatos a emprego estar preocupados?

Sim, e aqui está a verdade. O estudo foi uma simulação, não um sistema de recrutamento real. As ferramentas reais de contratação com IA não recebem feedback imediato sobre se uma nova contratação funcionou, o que retarda a formação de tendências. Mas a equipa de investigação avisa que mesmo feedback atrasado, o tipo que as empresas recebem meses após contratação, poderia ainda causar que sistemas de IA generalizem excessivamente a partir de pequenas amostras.

Ryan Liu, estudante de doutorado em Princeton e co-autor do estudo, diz que os LLMs são explicitamente treinados para criar generalizações a partir de dados limitados. É isto que os torna úteis para problemas de programação e puzzles de lógica. Em contextos sociais, esse mesmo instinto transforma-se em estereotipagem.

Os modelos de raciocínio mais novos e capazes pioraram as coisas, não melhoraram. O o3 da OpenAI e o R1 da DeepSeek (um modelo de raciocínio de IA concorrente construído na China) ambos mostraram tendências mais fortes do que modelos mais antigos e simples.

Dizer ao modelo para "ser justo" mudou quase nada. Mas recompensá-lo por resultados de contratação diversificada funcionou. O estudo também descobriu que fornecer à IA informação pessoal genuinamente relevante sobre um candidato, como o seu histórico profissional ou nível educacional, reduziu estereotipagem. Alimentá-lo com detalhes irrelevantes, como aparência física, devolveu-o diretamente a ordenar pessoas por grupo.

O ensinamento prático para quem se candidata a empregos neste momento: pergunte diretamente aos empregadores se a IA filtra a sua candidatura e, se sim, que auditorias de tendência fazem a esse sistema. É uma pergunta razoável, e uma empresa séria sobre contratação justa deve ter uma resposta clara pronta.

© 2026 AI2Day