Помічник судді на AI в Пакистані розглянув 38 додаткових справ на місяць на одного судді. Ось що насправді спрацювало.
Реальний експеримент дав 1559 пакистанським суддям спеціалізований інструмент AI для судових справ. Продуктивність зросла на 6,3%. Секретний інгредієнт був не в програмному забезпеченні.

Ключові моменти
- Експеримент охопив 1559 пакистанських суддів і виявив, що спеціалізований інструмент AI для судових справ підвищив кількість розглянутих справ на 6,3% протягом дев'яти місяців у 2024 році.
- Суди Пакистану мають накопичення 2,26 мільйона справ і мають менше двох суддів на 100 000 осіб населення, порівняно з 22 в Європейському Союзі.
- Навчені судді розглянули приблизно 38,5 більше справ на місяць, заощадивши приблизно 38,50 доларів на судових витратах за кожний витрачений долар на роботу інструменту.
- Судді, які пройшли шість тренінгових сесій, входили в інструмент в середньому 56 разів і відправили 212 запитів, порівняно з 10 входами для тих, хто отримав лише загальну підготовку.
- Приблизно кожен п'ятий запит включав прохання суддів до AI прийняти рішення або написати судову думку з мінімальною участю людини, що викликає постійні проблеми з якістю.
Суди Пакистану перевантажені. Більше 2,26 мільйона справ очікують на розгляд, а країна має менше двох суддів на кожні 100 000 осіб населення. Європейський Союз управляє 22 суддями на 100 000; Бразилія — 8. Щось мало змінитися.
Тому економіст Султан Махмуд з Нової економічної школи в Москві разом з colaborators, включаючи Еліотта Еша з ETH Zurich, створив інструмент під назвою JudgeGPT і провів те, що може бути першим масштабним незалежним тестом штучного інтелекту в діючій судовій системі. Їхні висновки, вперше повідомлені IEEE Spectrum AI, з'являються в незручний момент: судді в кількох країнах вже були спіймані на тому, що тихо використовували комерційні AI-чат-боти способами, які суди ніколи не схвалювали.
Що таке JudgeGPT і як він працює?
JudgeGPT — це спеціалізований AI-помічник, створений спеціально для суддів Пакистану. Команда інтегрувала GPT-4 OpenAI, велику мовну модель (система AI, навчена на величезних обсягах тексту для генерування та аналізу мови), яка також використовується багатьма комерційними чат-ботами, поверх бази даних 128 292 пакистанських судових рішень та 943 статутів.
Ключовим рішенням для точності була техніка, звана retrieval-augmented generation, або RAG. Представте це як надання AI приватної бібліотеки для перевірки перед відповіддю. Замість вгадування судової практики інструмент проводить пошук у базі даних, витягує релевантні документи та показує джерела у виносках. Еш формулює це просто: «Виявляється, що спосіб усунення галюцинацій — це не просто інтелектуальніші моделі. Це приєднання моделей до інструменту, який може проводити пошук і перевіряти джерела». Галюцинації в термінах AI означають, що модель впевнено вигадує факти, які не існують.
Комерційні чат-боти, протестовані раніше, погано впорались з пакистанськими юридичними запитами, регулярно вигадуючи посилання на справи. JudgeGPT був створений, щоб цьому запобігти.
Чи він насправді зробив суддів кращими або просто швидшими?
Швидшими, вимірюваними. Кращими, ймовірно, але з застереженнями.
На момент, коли 487 суддів завершили програму навчання, медіанна кількість розглянутих справ у районі збільшилась на 6,3%. Темпи апеляцій дещо знизилися, що свідчить про те, що швидкість явно не завдала шкоди точності. Кожен навчений суддя розглянув приблизно 38,5 більше справ на місяць, ніж базовий показник.
| Метрика | Результат |
|---|---|
| Судді в експерименті | 1,559 |
| Справи в накопленні | 2,260,000 |
| Збільшення продуктивності | 6,3% |
| Додаткові справи на одного навченого судді на місяць | 38,5 |
| Економія витрат на кожен долар витрачений | $38,50 |
| Входи на судді після навчання | 56 |
| Запити на судді після навчання | 212 |
Для оцінки якості команда використала GPT-5-mini OpenAI (легшу, швидшу версію останньої моделі GPT) для порівняння пар рішень одного судді до та після навчання. AI обрав рішення після навчання у 59% випадків. Два досвідчені пакистанські адвокати погодилися з цими виборами у 70,6% випадків і один з одним у 73% випадків, що свідчить про те, що оцінка якості AI є розумним, але неідеальним показником.
Девід Автор, професор економіки в MIT, назвав результат вірогідним. «Підвищення продуктивності на 6,3% не є надзвичайним», — сказав він, — «але це вірогідно та, ймовірно, покращиться в міру ширшого використання інструменту».
Які честні побоювання тут?
Навчання мало більше значення, ніж саме програмне забезпечення. Судді, які пройшли шість 90-хвилинних сесій, присвячених тому, як працює AI, його обмеженням та ризикам упередженості та галюцинацій, послідовно використовували інструмент протягом усіх дев'яти місяців. Ті, хто отримав лише загальну підготовку з технологій, входили кілька разів. Ті, хто не отримав нічого, спробували його протягом приблизно місяця і припинили.
Більшим побоюванням є делегування. Приблизно кожен п'ятий запит запитував JudgeGPT, яким мало бути правильне рішення, або просив написати юридичну думку з мінімальною участю судді. Це перетинає лінію, яку більшість правових систем проводять чітко. Навчання зменшило цю частку, але не усунуло її.
Джон Железніков, професор права та технологій в La Trobe University в Австралії, формулює розрив добре: «Не зовсім ясно, чи те, що ви називаєте якістю правосуддя, краще».
Для судді, який анонімно розмовляв з дослідниками, повсякденна реальність простіша. Він має більше 1000 активних справ понад десять років. «Для дослідження це просто один запит», — сказав він, — «тоді як раніше мені довелося годинами шукати прецеденти та закони».
Висновок: Якщо ваша робоча група пілотує інструмент AI, наполягайте на структурованому навчанні, а не просто на логіні та паролі. Це дослідження показує, що доступ без освіти виробляє місяць допитливості та потім відмову. Шість сесій змінили все.



