Identificação de fraudes em licitações: uma abordagem utilizando agrupamento por interseção

Galvão Júnior, David Pereira

Use este identificador para citar ou linkar para este item: https://repositorio.ufpb.br/jspui/handle/123456789/29850

Tipo:	Dissertação
Título:	Identificação de fraudes em licitações: uma abordagem utilizando agrupamento por interseção
Autor(es):	Galvão Júnior, David Pereira
Orientador:	Sousa Filho, Gilberto Farias de
Resumo:	Fraudes em licitações causam prejuízos significativos à sociedade, diminuindo a eficácia de serviços públicos, como saúde e educação. Apesar do fato de que as autoridades buscam fazer uma intensa investigação para mitigar esse problema, a sua identificação não é uma tarefa trivial, uma vez que os agentes fraudadores empregam táticas sofisticadas. Muitos dos trabalhos anteriores procuraram identificar uma licitação fraudulenta por meio da análise de fatores, como por exemplo, os valores financeiros das propostas submetidas pelas empresas participantes e o comportamento dos participantes de uma licitação. Recentemente, surgiram trabalhos que buscam utilizar essa análise como entrada adicional de um algoritmo de aprendizagem de máquina, com fins de detecção automática de fraudes. Neste trabalho, propomos investigar a participação conjunta de empresas em licitações. Para tanto, introduzimos um novo modelo de agrupamento, que busca maximizar o uso de recursos em comum pelos membros do grupo. Desenvolvemos um conjunto de ferramentas para sua resolução: modelo de programação inteira e algoritmo branch-and-bound. Além disso, demonstramos que a versão de particionamento do modelo é um problema NP-Completo e propomos uma adaptação da função silhueta para medir a qualidade dos grupos gerados. Adicionalmente, introduzimos uma variação desse modelo para agrupamentos por cobertura. Para a resolução dessa versão, é proposto um algoritmo enumerativo e um modelo de programação inteira. Nos experimentos realizados, o novo modelo de agrupamento consegue ser superior em comparação a modelos da literatura baseados em distância e edição de arestas. Especificamente, em todos os casos testados, o novo modelo obteve uma soma de interseções igual ou superior. Dos grupos obtidos buscamos medir o quanto da participação em conjunto dos membros em licitações se deu ao acaso ou não. Para tanto, propomos um conjunto de métricas para descrever os grupos gerados. Essas métricas são utilizadas como entrada adicional de um modelo de aprendizagem de máquina. Em dados de licitações de diversos países, os modelos que fazem uso das métricas propostas neste trabalho conseguem superar os modelos que fazem uso das métricas da literatura. Em média, os modelos propostos obtiveram um ganho de aproximadamente 8% na correlação de validação, em comparação com as métricas da literatura.
Abstract:	Bid rigging in public procurement auctions causes significant harm to the society, reducing the effectiveness of public services such as health and education. Despite being object of intense scrutiny by the authorities to mitigate this problem, its identification is not a trivial task, since fraudsters employ sophisticated tasks. Many of the previous works sought to identify a fraudulent bidding process through the analysis of factors, such as, for example, the financial values of the proposals submitted and the behavior of the participants in a bidding process. Recently, several works have proposed using this analysis as an additional input to a machine learning algorithm, with the purpose of automatic detection of fraudulent bidding. In this work, we propose to investigate the joint participation of companies in bidding processes. With this goal, we introduce a new clustering model, which seeks to maximize the use of common resources by cluster members. We have developed a set of tools to solve it: integer programming model and branch-and-bound algorithm. Furthermore, we demonstrate that the partitioning version of this model is a NP-Complete problem and we propose an adaptation of the silhouette function to measure the quality of the generated clusters. Additionally, we introduce a variation of this model for coverage clustering. To solve this version, we propose an enumerative algorithm and an integer programming model. In the experiments performed, the new clustering model manages to be superior in relation to literature models based on distance and edge editing. Specifically, in all cases tested, the new model obtained an equal or greater sum of intersections. From the obtained clusters we sought to measure how much of the joint participation of the members in bids occurred by chance or not. To do so, we proposed a set of metrics to describe the clusters. These metrics are used as an additional input to a machine learning model. In public tender data from different countries, the models that make use of the metrics proposed in this work manage to outperform the models that make use of the metrics in the literature. On average, the proposed models obtained a gain of approximately 8% in the validation correlation, in comparison with the literature metrics.
Palavras-chave:	Licitações - Fraudes Aprendizagem de máquina Análise de grupos Cluster analysis Machine learning Bid rigging identification
CNPq:	CNPQ::CIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO
Idioma:	por
País:	Brasil
Editor:	Universidade Federal da Paraíba
Sigla da Instituição:	UFPB
Departamento:	Informática
Programa:	Programa de Pós-Graduação em Informática
Tipo de Acesso:	Acesso aberto Attribution-NoDerivs 3.0 Brazil
URI:	http://creativecommons.org/licenses/by-nd/3.0/br/
URI:	https://repositorio.ufpb.br/jspui/handle/123456789/29850
Data do documento:	13-Jul-2023
Aparece nas coleções:	Centro de Informática (CI) - Programa de Pós-Graduação em Informática

Arquivos associados a este item:

Arquivo	Descrição	Tamanho	Formato
DavidPereiraGalvãoJúnior_Dissert.pdf		6,13 MB	Adobe PDF	Visualizar/Abrir

Mostrar registro completo do item Visualizar estatísticas

Este item está licenciada sob uma Licença Creative Commons

Repositório Institucional da UFPB