AI & Robotics Journal

IA e robotica, apurado e traduzido.

Juízes assistidos por IA no Paquistão encerraram 6,3% mais processos, aponta estudo

Um ensaio randomizado com 1.559 juízes paquistaneses constatou que foi o treinamento direcionado — e não o simples acesso a um assistente baseado em GPT-4 — que impulsionou os ganhos de resolução.

Publicado a aijudiciarypakistanfield-experiment

Uma ilustração abstrata de um martelo de tribunal se dissolvendo em linhas geométricas de texto, sugerindo um documento sendo processado, e não um tribunal ou pessoa reais.
Uma ilustração abstrata de um martelo de tribunal se dissolvendo em linhas geométricas de texto, sugerindo um documento sendo processado, e não um tribunal ou pessoa reais.

O que aconteceu

Uma equipe de economistas construiu o JudgeGPT, um chatbot baseado em GPT-4 que consulta 128.292 decisões judiciais paquistanesas e 943 leis, para ajudar juízes de primeira instância em pesquisa jurídica e redação. Em seguida, randomizaram 1.559 juízes de primeira instância em 118 tribunais — cerca de metade dos juízes de primeira instância do país e cerca de 80% de seus tribunais distritais — em três grupos: JudgeGPT com treinamento direcionado, JudgeGPT com um seminário genérico de tecnologia, e um grupo de controle sem IA.

O treinamento direcionado consistiu em seis sessões de 90 minutos, desenvolvidas em conjunto com a Academia Judicial Federal do Paquistão. Os juízes que o receberam fizeram login e usaram o JudgeGPT cerca de quatro vezes mais do que os juízes que receberam apenas o seminário genérico: após 40 semanas, os juízes treinados registraram, em média, de 56 a 60 logins e mais de 200 prompts, contra 10 a 20 logins e menos de 50 prompts no grupo de comparação.

Os distritos com juízes treinados resolveram cerca de 1.848 processos adicionais por ano, um aumento de 6,3% sobre a linha de base, um número reportado de forma independente pelo veículo paquistanês DAWN.COM, e não apenas repassado de uma única fonte. Em uma verificação de qualidade, comparações cegas em pares avaliaram as decisões de juízes treinados como melhores em 59% das comparações, contra 42% para as decisões do grupo de controle; as taxas de recurso caíram ligeiramente, e o artigo relata nenhum aumento de viés relacionado a gênero ou religião na linguagem judicial, segundo a the-decoder.com. Os pesquisadores estimam um retorno de cerca de US$ 38,50 em economia de custos judiciais para cada dólar gasto na operação da ferramenta, com um piso conservador de “pelo menos US$ 10 por dólar”.

“Nós de fato encontramos um aumento nos casos resolvidos, e não encontramos nenhuma queda correspondente na qualidade das decisões”, disse o autor do estudo Sultan Mehmood.

O artigo, “Courts of Tomorrow”, é assinado por Mehmood (New Economic School, Moscou), Christoph Goessmann e Elliott Ash (ETH Zurich), e circula como working paper do NBER e como CEPR Discussion Paper No. 21783, datado de 14 de julho de 2026. Não há registro de que tenha passado por revisão por pares ou sido publicado em periódico.

O que isso significa (e o que não significa)

A diferença entre os dois grupos com acesso à IA é o achado central: dar a ferramenta aos juízes não foi suficiente, por si só, para mudar o quanto eles a usavam, e os ganhos de resolução são atribuídos especificamente ao grupo treinado. Apenas cerca de um quarto dos juízes participantes já havia usado um modelo de linguagem antes do experimento, em um sistema com menos de 2 juízes por 100 mil habitantes — contra 22 na UE e 30 na Inglaterra e no País de Gales — e 2,26 milhões de processos pendentes no final de 2024, 82% deles em tribunais de primeira instância, segundo a the-decoder.com.

O resultado não mostra que a IA possa substituir o julgamento judicial: os próprios pesquisadores alertam que as conclusões “não sustentam substituir juízes por IA” e enfatizam que os ganhos dependem de treinamento estruturado, não apenas do acesso à ferramenta. Também não estabelece que esses resultados se repetiriam em outro sistema judiciário, nem que foram produzidos em condições livres de interesses: os próprios autores do estudo têm interesse profissional em um resultado positivo digno de manchete antes da revisão por pares; o Judiciário do Paquistão e a Academia Judicial Federal, que co-desenharam o treinamento, têm interesse político em mostrar seu programa de modernização por IA funcionando contra o acúmulo de processos; e a OpenAI, cujo modelo GPT-4 é a base do JudgeGPT, se beneficia de um estudo de caso favorável para a IA generativa em geral, embora as fontes consultadas não listem a OpenAI como autora ou financiadora do estudo. Como resumiu o economista do MIT David Autor, que não participou do estudo: “Não é fácil fazer experimentos de campo em larga escala no serviço público.”

O que ainda não sabemos

O artigo ainda não passou por revisão por pares, portanto o número de 6,3% na resolução de processos e os achados de qualidade ainda não foram confirmados de forma independente. A janela medida vai até cerca de 40 semanas, e nenhuma das fontes consultadas informa se o efeito se mantém, cresce ou diminui em um horizonte mais longo. Nenhuma das fontes detalha o ganho por tipo de processo — criminal versus cível, simples versus complexo — nem por experiência e antiguidade dos juízes. A avaliação de qualidade se baseou em dois advogados paquistaneses e em uma comparação com o GPT-5-mini avaliando decisões em pares, mas não é descrito como esses avaliadores foram selecionados, se foram cegos quanto ao status de tratamento sob um protocolo documentado, nem quem escolheu os pares de casos. Nenhuma fonte revela a origem do financiamento do estudo. Os autores supostamente sugerem que seus resultados baseados no GPT-4 podem representar um piso, e não um teto, diante de modelos mais novos, mas essa é uma afirmação deles próprios sobre um cenário não testado, não um resultado medido. E se a estrutura dos tribunais do Paquistão, a gravidade do acúmulo de processos ou o desenho do treinamento se transfeririam para outros sistemas jurídicos é algo não testado e não reivindicado pelos próprios autores.

Fontes

Todas as fontes citadas neste artigo, num so lugar.

  1. https://elliottash.com/papers/Mehmood-Goessmann-Ash-Courts-of-Tomorrow-Evidence-Nationwide-Rollout-Generative-AI.pdf — elliottash.com
  2. https://the-decoder.com/an-ai-system-helped-pakistani-judges-clear-massive-backlogs-at-38-50-return-per-dollar-invested/ — the-decoder.com
  3. https://spectrum.ieee.org/judgegpt-experiment — spectrum.ieee.org
  4. https://www.dawn.com/news/2016213 — dawn.com
  5. https://conference.nber.org/conf_papers/f247308.pdf — conference.nber.org

Tambem disponivel em English

← Voltar a primeira pagina