Viés Político em Grandes Modelos de Linguagem (LLMs): Uma Revisão Crítica e uma Metodologia Responsável
viés político; grandes modelos de linguagem; PRISM; aprendizado de máquina; TF-IDF.
A auditoria de viés político em Grandes Modelos de Linguagem (LLMs) evoluiu de questionários de múltipla escolha para avaliações semânticas de respostas abertas. Na metodologia PRISM, um juiz LLM atribui escores a redações argumentativas geradas a partir de proposições do Political Compass Test etapa eficaz, porém computacionalmente onerosa em escala. Este trabalho de qualificação investiga se classificadores supervisionados leves podem replicar esses rótulos silver-standard produzidos pelo juiz após um bootstrap inicial de rotulação, amortizando o custo de inferência na fase de scoring do PRISM. Utilizando corpora no estilo PRISM (Stage 1: 3.703 redações, rótulos de 3 classes no eixo social; Stage 2: 22.979 redações, 5 classes multilíngues), avaliamos classificadores base e ensembles sob estratégias de redução de dimensionalidade. A acurácia reportada mede concordância com o juiz LLM de referência, não verdade absoluta anotada por humanos. Um Perceptron Multicamadas (MLP) com seleção χ² atinge 98,41% de concordância no Stage 1 e permanece competitivo no cenário mais difícil do Stage 2 (≈ 87% com ensembles). Os resultados sustentam a destilação do juiz como otimização de engenharia em pipelines PRISM: ela amortiza o custo de scoring, mas replica os comportamentos do juiz e os priors do PCT em vez de corrigi-los. A abordagem não elimina a necessidade de LLM-as-a-Judge na rotulação inicial nem generaliza a tarefas abertas arbitrárias sem dados rotulados, mas demonstra o potencial para classificação leve como uma etapa preliminar em pipelines no estilo PRISM, e destaca a possibilidade de reduzir o custo computacional da auditoria de viés político.