Use este identificador para citar ou linkar para este item:
https://repositorio.ufpb.br/jspui/handle/123456789/39398| Tipo: | Dissertação |
| Título: | Classificação de consultas fiscais na SEFAZ-PB: uma análise comparativa entre método estatístico e modelos baseados em transformers |
| Autor(es): | Carvalho, Sarah Andrade Toscano de |
| Orientador: | Rêgo, Thaís Gaudencio do |
| Membro da Banca: | Araújo, Tiago Maritan Ugulino de |
| Membro da Banca: | Silva Filho, Telmo de Menezes e |
| Membro da Banca: | Barbosa, Yuri De Almeida Malheiros |
| Resumo: | A classificação automática de consultas tributárias submetidas a sistemas públicos digitais, como o SefazVirtual da Secretaria de Estado da Fazenda da Paraíba (SEFAZ-PB), envolve mensagens em linguagem natural enviadas por contribuintes por meio de canais institucionais de atendimento. Essas consultas expressam dúvidas, perguntas ou solicitações relacionadas a tributos, legislação e procedimentos administrativos. O desafio central reside na sobreposição temática entre categorias, na ambiguidade linguística e na escassez de dados anotados para treinamento supervisionado. Sendo assim, esta pesquisa investiga e compara diferentes paradigmas de modelagem para mitigar essas dificuldades, incluindo um baseline estatístico clássico baseado em TF-IDF combinado com Regressão Logística, o fine-tuning supervisionado do BERT (Bidirectional Encoder Representations from Transformers) e estratégias de aprendizado em contexto (in-context learning) utili-zando o modelo LLAMA 70B. O conjunto de dados, composto por mensagens distribuídas em cinco categorias relacionadas ao Imposto sobre Circulação de Mercadorias e Serviços (ICMS) e ao Imposto sobre a Propriedade de Veículos Automotores (IPVA), passou por etapas de pré-processamento que incluíram anonimização, em conformidade com a Lei Geral de Proteção de Dados (LGPD), normalização textual, tokenização e remoção de stopwords. Foram conduzidas duas configurações experimentais de treinamento para o BERT (base e large), cada uma avaliada em duas versões do conjunto de dados a ori-ginal e uma versão enriquecida, obtida por meio da reescrita controlada das consultas com o apoio do ChatGPT e da expansão das definições dos rótulos. O modelo TF-IDF com Regressão Logística foi empregado como baseline para contextualizar os ganhos de desem-penho das arquiteturas neurais. A avaliação, baseada em acurácia, precisão, revocação e F1-score, mostrou que o aumento de dados elevou a acurácia do BERT-large de 0,62 para 0,77 e do BERT-base de 0,62 para 0,66, enquanto o baseline TF-IDF alinhado à regressão logística alcançou 0,80 de acurácia com dados enriquecidos e o LLAMA 70B atingiu até 0,87 em cenário few-shot com 20 exemplos. Esses resultados confirmam a viabilidade tanto de abordagens estatísticas quanto de modelos baseados em transformers, adapta-dos ao domínio tributário, como alternativas eficientes para otimizar o direcionamento de consultas e reduzir atrasos no atendimento. |
| Abstract: | Automatic classification of tax queries submitted to public digital systems, such as SefazVirtual from the State Department of Finance of Para´ıba (SEFAZ-PB), involves natural language messages sent by taxpayers through institutional service channels. These queries express doubts, questions, or requests related to taxes, legislation, and administrative procedures. The main challenge lies in the thematic overlap between categories, linguistic ambiguity, and the scarcity of annotated data for supervised training. Therefore, this research investigates and compares different modeling paradigms to mitigate these difficulties, including a classical statistical baseline based on TF-IDF combined with Logistic Regression, supervised fine-tuning of BERT (Bidirectional Encoder Representations from Transformers), and in-context learning strategies using the LLaMA 3.3 70B model. The dataset, composed of messages distributed across five categories related to the Tax on the Circulation of Goods and Services (ICMS) and the Motor Vehicle Property Tax (IPVA), underwent preprocessing steps including anonymization in compliance with the Brazilian General Data Protection Law (LGPD), text normalization, tokenization, and stopword removal. Two experimental training configurations were conducted for BERT (base and large), each evaluated using two versions of the dataset — the original version and an enriched version obtained through controlled rewriting of the queries with the support of ChatGPT and the expansion of label definitions. The TF-IDF model combined with Logistic Regression was used as a baseline to contextualize the performance gains of neural architectures. The evaluation, based on accuracy, precision, recall, and F1-score, showed that data augmentation increased the accuracy of BERT-large from 0.62 to 0.77 and BERT-base from 0.62 to 0.66, while the TF-IDF baseline combined with Logistic Regression achieved an accuracy of 0.80 with enriched data, and LLaMA 70B reached up to 0.87 accuracy in a few-shot scenario with 20 examples. These results confirm the viability of both statistical approaches and transformer-based models adapted to the tax domain as effective alternatives for optimizing the routing of queries and reducing delays in public service responses. |
| Palavras-chave: | TF-IDF BERT Processamento de linguagem natural Classificação de texto Aumento de dados Sistemas públicos Dados públicos Natural language processing Text classification Data augmentation Public systems Public data |
| CNPq: | CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO |
| Idioma: | por |
| País: | Brasil |
| Editor: | Universidade Federal da Paraíba |
| Sigla da Instituição: | UFPB |
| Departamento: | Informática |
| Programa: | Programa de Pós-Graduação em Informática |
| Tipo de Acesso: | Acesso aberto Attribution-NoDerivs 3.0 Brazil |
| URI: | http://creativecommons.org/licenses/by-nd/3.0/br/ |
| URI: | https://repositorio.ufpb.br/jspui/handle/123456789/39398 |
| Data do documento: | 25-Fev-2026 |
| Aparece nas coleções: | Centro de Informática (CI) - Programa de Pós-Graduação em Informática |
Arquivos associados a este item:
| Arquivo | Descrição | Tamanho | Formato | |
|---|---|---|---|---|
| SarahAndradeToscanoDeCarvalho_Dissert.pdf | 21,8 MB | Adobe PDF | Visualizar/Abrir |
Este item está licenciada sob uma
Licença Creative Commons
