Помощник AI-судьи в Пакистане разобрал на 38 дополнительных дел в месяц на одного судью. Вот что на самом деле сработало.

Реальный эксперимент дал 1559 пакистанским судьям специальный инструмент AI для работы с правовыми вопросами. Производительность выросла на 6,3%. Секретный ингредиент — это не программное обеспечение.

AI2Day Newsdesk5 min read
Photoreal news-editorial overhead shot of a darkened government data center aisle with cool blue server rack indicator lights stretching to vanishing point, fai
Share

Ключевые моменты

  • Эксперимент с участием 1559 пакистанских судей показал, что специальный инструмент AI для работы с судебными делами повысил количество рассмотренных дел на 6,3% в течение девяти месяцев в 2024 году.
  • Суды Пакистана имеют задолженность в 2,26 миллиона дел и располагают менее чем двумя судьями на 100 000 человек, в то время как в ЕС — 22 судьи.
  • Обученные судьи разбирали примерно на 38,5 дел в месяц больше, экономя примерно $38,50 судебных расходов на каждый потраченный $1 на работу инструмента.
  • Судьи, прошедшие шесть сеансов обучения, входили в инструмент в среднем 56 раз и отправляли 212 запросов, в то время как те, кто получил только общее обучение по технологиям, входили всего 10 раз.
  • Примерно один из пяти запросов содержал просьбу судей к AI принять решение или написать судебное заключение с минимальным участием человека, что вызывает постоянные опасения по поводу качества.

Суды Пакистана захлёбываются. Более 2,26 миллиона дел ждут своей очереди, а в стране меньше двух судей на каждые 100 000 человек. В Европейском союзе 22 судьи на 100 000 человек, в Бразилии — 8. Что-то должно было измениться.

Поэтому экономист Султан Махмуд из Московской школы экономики вместе с сотрудниками, включая Эллиота Эша из ETH Zurich, создал инструмент JudgeGPT и провел то, что может быть первым крупномасштабным независимым тестом AI в работающей судебной системе. Их результаты, впервые опубликованные IEEE Spectrum AI, появляются в неловкий момент: судьи в нескольких странах уже были застигнуты за тайным использованием коммерческих AI-чатботов способами, которые суды никогда не одобряли.

Что такое JudgeGPT и как он работает?

JudgeGPT — это специальный AI-ассистент, созданный именно для пакистанских судов. Команда наложила GPT-4 от OpenAI, большую языковую модель (систему AI, обученную на огромном объеме текстов для генерирования и анализа языка), которая также питает многие коммерческие чатботы, поверх базы данных, содержащей 128 292 пакистанских судебных заключения и 943 статута.

Ключевым исправлением точности была техника под названием retrieval-augmented generation, или RAG. Думайте об этом как о предоставлении AI частной библиотеки для проверки перед ответом. Вместо того чтобы гадать по прецедентам, инструмент ищет в базе данных, извлекает релевантные документы и показывает источники в сносках. Эш объясняет это просто: «Оказывается, способ исправить галлюцинации — это не просто более интеллектуальные модели. Нужно присоединить модели к инструменту, который может выполнять поиск и проверять источники». Галлюцинации в терминологии AI означают, что модель уверенно выдумывает несуществующие факты.

Коммерческие чатботы, протестированные ранее, плохо справлялись с пакистанскими правовыми запросами и регулярно выдумывали ссылки на судебные дела. JudgeGPT был создан, чтобы этого избежать.

Он действительно сделал судей лучше или просто быстрее?

Быстрее, измеримо. Лучше, вероятно, но с оговорками.

К тому времени, когда 487 судей завершили программу обучения, медианный район зафиксировал рост на 6,3% в количестве рассмотренных дел. Частота апелляций немного снизилась, что говорит о том, что скорость не очевидно приводила к ущербу для точности. Каждый обученный судья рассматривал примерно на 38,5 дел в месяц больше, чем в базовом периоде.

Показатель Результат
Судьи в эксперименте 1559
Дел в очереди 2 260 000
Рост производительности 6,3%
Дополнительных дел на одного обученного судью в месяц 38,5
Экономия средств на каждый потраченный $1 $38,50
Входов в систему на судью после обучения 56
Запросов на судью после обучения 212

Для оценки качества команда использовала GPT-5-mini от OpenAI (более легкую и быструю версию последней модели GPT) для сравнения пар судебных заключений одного судьи до и после обучения. AI выбрал судебное заключение после обучения в 59% случаев. Два опытных пакистанских адвоката согласились с этим выбором в 70,6% случаев и друг с другом в 73% случаев, что предполагает, что оценка качества AI является разумной, но неидеальной мерой.

Дэвид Автор, профессор экономики в MIT, назвал результат достоверным. «Рост производительности на 6,3% не впечатляющий», сказал он, «но он достоверен и вероятно улучшится по мере более широкого использования инструмента».

Какова честная проблема здесь?

Обучение имело большее значение, чем само программное обеспечение. Судьи, которые прошли шесть 90-минутных сеансов, охватывающих, как работает AI, его ограничения и риск предвзятости и галлюцинаций, постоянно использовали инструмент в течение всех девяти месяцев. Те, кто получил только общее обучение по технологиям, входили несколько раз. Те, кто вообще не получил обучения, пробовали его примерно месяц и прекращали.

Более серьезная проблема — делегирование полномочий. Примерно один из пяти запросов спрашивал JudgeGPT, какое должно быть правильное решение, или просил написать судебное заключение с минимальным участием судьи. Это переходит ту черту, которую большинство правовых систем четко проводят. Обучение уменьшило эту долю, но не устранило ее полностью.

Джон Зелезников, профессор права и технологий в университете Ла Трош в Австралии, хорошо формулирует этот разрыв: «Что не совсем ясно, так это то, улучшилось ли то, что вы называете качеством правосудия».

Но для судьи, который разговаривал с исследователями анонимно, повседневная реальность проще. Он вел более 1000 активных дел в течение более десяти лет. «Для исследований это просто один запрос», сказал он, «тогда как раньше мне приходилось часами искать прецеденты и законы».

Вывод: Если на вашем рабочем месте тестируют инструмент AI, настаивайте на структурированном обучении, а не просто на логине и пароле. Это исследование показывает, что доступ без образования дает месяц любопытства и затем отказа. Шесть сеансов изменили все.

© 2026 AI2Day