Инструменты AI для найма чаще стереотипизируют кандидатов, чем люди, показывает новое исследование

Исследование Принстонского университета и Чикагского университета протестировало ChatGPT, Claude и Gemini в симуляции найма. Модели быстро сортировали вымышленные этнические группы по должностям и делали это намного агрессивнее, чем участники-люди.

AI2Day Newsdesk· 3 min read
Photoreal news-editorial style, 16:9 framing, full-frame edge-to-edge composition
Share

Ключевые моменты

  • Исследователи из Принстона и Чикагского университета опубликовали в июле 2025 года результаты, показывающие, что большие языковые модели (LLM) стереотипизируют кандидатов на работу более жестко, чем люди в контролируемых симуляциях найма.
  • По шкале сегрегации, где 2.0 означает полное закрепление группы за должностью, участники-люди набрали 0.84. Модель o3 компании OpenAI набрала 1.83.
  • Просьба к моделям быть справедливыми имела слабый эффект, но предложение бонуса за разнообразный наём значительно снизило предвзятое поведение.
  • Модели становились менее предвзятыми при получении релевантной личной информации о кандидатах, например возраста и образования, но возвращались к групповым стереотипам при получении нерелевантной информации, такой как цвет волос.
  • По сообщениям MIT Technology Review, компании, внедряющие AI для просмотра резюме, сталкиваются с серьёзной и в значительной степени нерешённой проблемой справедливости.

Прежде чем какой-либо рекрутер прочитает ваше резюме, система AI может уже решить, что вы не подходите. Это больше не далёкие опасения. Это реальность для многих крупных работодателей.

Новое академическое исследование показывает, насколько плохо это может пойти.

Исследователи из Принстонского университета и Чикагского университета протестировали три крупные большие языковые модели (LLM, технология AI, лежащая в основе чатботов вроде ChatGPT, Claude и Gemini) в симуляции найма. Каждая модель играла роль консультанта по найму для вымышленного города. За 40 раундов модель выбирала кандидатов из четырёх вымышленных этнических групп для заполнения 20 должностей, от врачей и адвокатов до помощников по уходу за детьми и уборщиков.

Вот в чём закавыка: модели не знали, что каждый кандидат имел равные шансы на успех, независимо от группы.

Модели не вели себя так. Когда ранний нанятый из одной группы не справился, модель быстро прекращала рассматривать эту группу для аналогичных ролей и начинала направлять их на должности с более низким статусом. Один неудачный результат становился правилом, применённым ко всему населению.

Люди делают это тоже. Но модели делали это примерно на 65 процентов агрессивнее, чем участники-люди в оригинальном психологическом исследовании, на основе которого была адаптирована симуляция.

Должны ли соискатели волноваться?

Да, и вот честная картина. Исследование было симуляцией, а не реальной системой найма. Реальные инструменты AI для найма не получают мгновенную обратную связь о том, прошёл ли новый сотрудник испытание, что замедляет формирование предвзятости. Но исследовательская группа предупреждает, что даже отложенная обратная связь, которую компании получают спустя месяцы после найма, может привести к тому, что системы AI будут чрезмерно обобщать данные из небольших выборок.

Райан Лю, докторант Принстонского университета и соавтор исследования, говорит, что LLM явно обучены строить обобщения на основе ограниченных данных. Это то, что делает их полезными для задач кодирования и логических головоломок. В социальных ситуациях этот же инстинкт превращается в стереотипизацию.

Более новые и мощные модели рассуждения усугубили ситуацию, а не улучшили. OpenAI's o3 и DeepSeek's R1 (конкурирующая модель AI для рассуждений, разработанная в Китае) обе показали более сильные предвзятости, чем более старые простые модели.

Просьба к модели «быть справедливой» практически ничего не изменила. Но вознаграждение за разнообразные результаты найма сработало. Исследование также обнаружило, что предоставление AI подлинно релевантной личной информации о кандидате, такой как история работы или уровень образования, снижало стереотипизацию. Предоставление нерелевантных деталей, таких как внешность, тут же заставляло её сортировать людей по группам.

Практический вывод для всех, кто прямо сейчас ищет работу: спросите напрямую у работодателей, проверяет ли AI ваше приложение и, если да, какие проверки на предвзятость они проводят на этой системе. Это разумный вопрос, и серьёзная компания, стремящаяся к справедливому найму, должна быть готова дать прямой ответ.

© 2026 AI2Day