Помічник судді на AI в Пакистані розглянув 38 додаткових справ на місяць на одного судді. Ось що насправді спрацювало.

Реальний експеримент дав 1559 пакистанським суддям спеціалізований інструмент AI для судових справ. Продуктивність зросла на 6,3%. Секретний інгредієнт був не в програмному забезпеченні.

AI2Day Newsdesk5 min read
Photoreal news-editorial overhead shot of a darkened government data center aisle with cool blue server rack indicator lights stretching to vanishing point, fai
Share

Ключові моменти

  • Експеримент охопив 1559 пакистанських суддів і виявив, що спеціалізований інструмент AI для судових справ підвищив кількість розглянутих справ на 6,3% протягом дев'яти місяців у 2024 році.
  • Суди Пакистану мають накопичення 2,26 мільйона справ і мають менше двох суддів на 100 000 осіб населення, порівняно з 22 в Європейському Союзі.
  • Навчені судді розглянули приблизно 38,5 більше справ на місяць, заощадивши приблизно 38,50 доларів на судових витратах за кожний витрачений долар на роботу інструменту.
  • Судді, які пройшли шість тренінгових сесій, входили в інструмент в середньому 56 разів і відправили 212 запитів, порівняно з 10 входами для тих, хто отримав лише загальну підготовку.
  • Приблизно кожен п'ятий запит включав прохання суддів до AI прийняти рішення або написати судову думку з мінімальною участю людини, що викликає постійні проблеми з якістю.

Суди Пакистану перевантажені. Більше 2,26 мільйона справ очікують на розгляд, а країна має менше двох суддів на кожні 100 000 осіб населення. Європейський Союз управляє 22 суддями на 100 000; Бразилія — 8. Щось мало змінитися.

Тому економіст Султан Махмуд з Нової економічної школи в Москві разом з colaborators, включаючи Еліотта Еша з ETH Zurich, створив інструмент під назвою JudgeGPT і провів те, що може бути першим масштабним незалежним тестом штучного інтелекту в діючій судовій системі. Їхні висновки, вперше повідомлені IEEE Spectrum AI, з'являються в незручний момент: судді в кількох країнах вже були спіймані на тому, що тихо використовували комерційні AI-чат-боти способами, які суди ніколи не схвалювали.

Що таке JudgeGPT і як він працює?

JudgeGPT — це спеціалізований AI-помічник, створений спеціально для суддів Пакистану. Команда інтегрувала GPT-4 OpenAI, велику мовну модель (система AI, навчена на величезних обсягах тексту для генерування та аналізу мови), яка також використовується багатьма комерційними чат-ботами, поверх бази даних 128 292 пакистанських судових рішень та 943 статутів.

Ключовим рішенням для точності була техніка, звана retrieval-augmented generation, або RAG. Представте це як надання AI приватної бібліотеки для перевірки перед відповіддю. Замість вгадування судової практики інструмент проводить пошук у базі даних, витягує релевантні документи та показує джерела у виносках. Еш формулює це просто: «Виявляється, що спосіб усунення галюцинацій — це не просто інтелектуальніші моделі. Це приєднання моделей до інструменту, який може проводити пошук і перевіряти джерела». Галюцинації в термінах AI означають, що модель впевнено вигадує факти, які не існують.

Комерційні чат-боти, протестовані раніше, погано впорались з пакистанськими юридичними запитами, регулярно вигадуючи посилання на справи. JudgeGPT був створений, щоб цьому запобігти.

Чи він насправді зробив суддів кращими або просто швидшими?

Швидшими, вимірюваними. Кращими, ймовірно, але з застереженнями.

На момент, коли 487 суддів завершили програму навчання, медіанна кількість розглянутих справ у районі збільшилась на 6,3%. Темпи апеляцій дещо знизилися, що свідчить про те, що швидкість явно не завдала шкоди точності. Кожен навчений суддя розглянув приблизно 38,5 більше справ на місяць, ніж базовий показник.

Метрика Результат
Судді в експерименті 1,559
Справи в накопленні 2,260,000
Збільшення продуктивності 6,3%
Додаткові справи на одного навченого судді на місяць 38,5
Економія витрат на кожен долар витрачений $38,50
Входи на судді після навчання 56
Запити на судді після навчання 212

Для оцінки якості команда використала GPT-5-mini OpenAI (легшу, швидшу версію останньої моделі GPT) для порівняння пар рішень одного судді до та після навчання. AI обрав рішення після навчання у 59% випадків. Два досвідчені пакистанські адвокати погодилися з цими виборами у 70,6% випадків і один з одним у 73% випадків, що свідчить про те, що оцінка якості AI є розумним, але неідеальним показником.

Девід Автор, професор економіки в MIT, назвав результат вірогідним. «Підвищення продуктивності на 6,3% не є надзвичайним», — сказав він, — «але це вірогідно та, ймовірно, покращиться в міру ширшого використання інструменту».

Які честні побоювання тут?

Навчання мало більше значення, ніж саме програмне забезпечення. Судді, які пройшли шість 90-хвилинних сесій, присвячених тому, як працює AI, його обмеженням та ризикам упередженості та галюцинацій, послідовно використовували інструмент протягом усіх дев'яти місяців. Ті, хто отримав лише загальну підготовку з технологій, входили кілька разів. Ті, хто не отримав нічого, спробували його протягом приблизно місяця і припинили.

Більшим побоюванням є делегування. Приблизно кожен п'ятий запит запитував JudgeGPT, яким мало бути правильне рішення, або просив написати юридичну думку з мінімальною участю судді. Це перетинає лінію, яку більшість правових систем проводять чітко. Навчання зменшило цю частку, але не усунуло її.

Джон Железніков, професор права та технологій в La Trobe University в Австралії, формулює розрив добре: «Не зовсім ясно, чи те, що ви називаєте якістю правосуддя, краще».

Для судді, який анонімно розмовляв з дослідниками, повсякденна реальність простіша. Він має більше 1000 активних справ понад десять років. «Для дослідження це просто один запит», — сказав він, — «тоді як раніше мені довелося годинами шукати прецеденти та закони».

Висновок: Якщо ваша робоча група пілотує інструмент AI, наполягайте на структурованому навчанні, а не просто на логіні та паролі. Це дослідження показує, що доступ без освіти виробляє місяць допитливості та потім відмову. Шість сесій змінили все.

© 2026 AI2Day