Skip navigation

Use este identificador para citar ou linkar para este item: https://repositorio.ufpb.br/jspui/handle/123456789/39398
Tipo: Dissertação
Título: Classificação de consultas fiscais na SEFAZ-PB: uma análise comparativa entre método estatístico e modelos baseados em transformers
Autor(es): Carvalho, Sarah Andrade Toscano de
Orientador: Rêgo, Thaís Gaudencio do
Membro da Banca: Araújo, Tiago Maritan Ugulino de
Membro da Banca: Silva Filho, Telmo de Menezes e
Membro da Banca: Barbosa, Yuri De Almeida Malheiros
Resumo: A classificação automática de consultas tributárias submetidas a sistemas públicos digitais, como o SefazVirtual da Secretaria de Estado da Fazenda da Paraíba (SEFAZ-PB), envolve mensagens em linguagem natural enviadas por contribuintes por meio de canais institucionais de atendimento. Essas consultas expressam dúvidas, perguntas ou solicitações relacionadas a tributos, legislação e procedimentos administrativos. O desafio central reside na sobreposição temática entre categorias, na ambiguidade linguística e na escassez de dados anotados para treinamento supervisionado. Sendo assim, esta pesquisa investiga e compara diferentes paradigmas de modelagem para mitigar essas dificuldades, incluindo um baseline estatístico clássico baseado em TF-IDF combinado com Regressão Logística, o fine-tuning supervisionado do BERT (Bidirectional Encoder Representations from Transformers) e estratégias de aprendizado em contexto (in-context learning) utili-zando o modelo LLAMA 70B. O conjunto de dados, composto por mensagens distribuídas em cinco categorias relacionadas ao Imposto sobre Circulação de Mercadorias e Serviços (ICMS) e ao Imposto sobre a Propriedade de Veículos Automotores (IPVA), passou por etapas de pré-processamento que incluíram anonimização, em conformidade com a Lei Geral de Proteção de Dados (LGPD), normalização textual, tokenização e remoção de stopwords. Foram conduzidas duas configurações experimentais de treinamento para o BERT (base e large), cada uma avaliada em duas versões do conjunto de dados a ori-ginal e uma versão enriquecida, obtida por meio da reescrita controlada das consultas com o apoio do ChatGPT e da expansão das definições dos rótulos. O modelo TF-IDF com Regressão Logística foi empregado como baseline para contextualizar os ganhos de desem-penho das arquiteturas neurais. A avaliação, baseada em acurácia, precisão, revocação e F1-score, mostrou que o aumento de dados elevou a acurácia do BERT-large de 0,62 para 0,77 e do BERT-base de 0,62 para 0,66, enquanto o baseline TF-IDF alinhado à regressão logística alcançou 0,80 de acurácia com dados enriquecidos e o LLAMA 70B atingiu até 0,87 em cenário few-shot com 20 exemplos. Esses resultados confirmam a viabilidade tanto de abordagens estatísticas quanto de modelos baseados em transformers, adapta-dos ao domínio tributário, como alternativas eficientes para otimizar o direcionamento de consultas e reduzir atrasos no atendimento.
Abstract: Automatic classification of tax queries submitted to public digital systems, such as SefazVirtual from the State Department of Finance of Para´ıba (SEFAZ-PB), involves natural language messages sent by taxpayers through institutional service channels. These queries express doubts, questions, or requests related to taxes, legislation, and administrative procedures. The main challenge lies in the thematic overlap between categories, linguistic ambiguity, and the scarcity of annotated data for supervised training. Therefore, this research investigates and compares different modeling paradigms to mitigate these difficulties, including a classical statistical baseline based on TF-IDF combined with Logistic Regression, supervised fine-tuning of BERT (Bidirectional Encoder Representations from Transformers), and in-context learning strategies using the LLaMA 3.3 70B model. The dataset, composed of messages distributed across five categories related to the Tax on the Circulation of Goods and Services (ICMS) and the Motor Vehicle Property Tax (IPVA), underwent preprocessing steps including anonymization in compliance with the Brazilian General Data Protection Law (LGPD), text normalization, tokenization, and stopword removal. Two experimental training configurations were conducted for BERT (base and large), each evaluated using two versions of the dataset — the original version and an enriched version obtained through controlled rewriting of the queries with the support of ChatGPT and the expansion of label definitions. The TF-IDF model combined with Logistic Regression was used as a baseline to contextualize the performance gains of neural architectures. The evaluation, based on accuracy, precision, recall, and F1-score, showed that data augmentation increased the accuracy of BERT-large from 0.62 to 0.77 and BERT-base from 0.62 to 0.66, while the TF-IDF baseline combined with Logistic Regression achieved an accuracy of 0.80 with enriched data, and LLaMA 70B reached up to 0.87 accuracy in a few-shot scenario with 20 examples. These results confirm the viability of both statistical approaches and transformer-based models adapted to the tax domain as effective alternatives for optimizing the routing of queries and reducing delays in public service responses.
Palavras-chave: TF-IDF
BERT
Processamento de linguagem natural
Classificação de texto
Aumento de dados
Sistemas públicos
Dados públicos
Natural language processing
Text classification
Data augmentation
Public systems
Public data
CNPq: CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO
Idioma: por
País: Brasil
Editor: Universidade Federal da Paraíba
Sigla da Instituição: UFPB
Departamento: Informática
Programa: Programa de Pós-Graduação em Informática
Tipo de Acesso: Acesso aberto
Attribution-NoDerivs 3.0 Brazil
URI: http://creativecommons.org/licenses/by-nd/3.0/br/
URI: https://repositorio.ufpb.br/jspui/handle/123456789/39398
Data do documento: 25-Fev-2026
Aparece nas coleções:Centro de Informática (CI) - Programa de Pós-Graduação em Informática

Arquivos associados a este item:
Arquivo Descrição TamanhoFormato 
SarahAndradeToscanoDeCarvalho_Dissert.pdf21,8 MBAdobe PDFVisualizar/Abrir


Este item está licenciada sob uma Licença Creative Commons Creative Commons