Mostrar registro simples

dc.creatorGomes, Jefferson Nascimento
dc.date.accessioned2026-08-19T19:47:17Z
dc.date.available2026-08-19T19:47:17Z
dc.date.issued2026-07-09
dc.identifier.citationGOMES, Jefferson Nascimento. Análise comparativa de modelos de aprendizado de máquina para classificação de corridas rentáveis em plataformas de transporte. 2026. 34 f. Monografia (Tecnologia em Análise e Desenvolvimento de Sistemas) – Instituto Federal de Educação, Ciência e Tecnologia de Pernambuco, Campus Paulista, Paulista, 2026.pt_BR
dc.identifier.urihttps://repositorio.ifpe.edu.br/xmlui/handle/123456789/2293
dc.description.abstractThe growth of digital urban transportation platforms has increased the amount of data generated about trips, fares, distances, schedules and operational characteristics. Although these data are widely available, drivers and other actors involved in platform-based transportation still face difficulties in converting information into effective decision support, especially when the purpose is to evaluate whether a ride tends to be profitable or not. In this context, this study aims to analyze and compare machine learning (ML) models for classifying profitable and non-profitable rides using two distinct datasets: an Uber/NCR-type ride-booking dataset and a public New York City Yellow Taxi dataset. The methodology was structured according to the CRISP-DM process, covering problem understanding, data understanding, data preparation, modeling and evaluation. Derived variables for estimated cost, estimated profit and profitability were created, together with a methodological discussion of data leakage risks, especially regarding financial variables. Sensitivity analyses were also included to assess the impact of variables directly related to the profitability calculation. The evaluated models included Logistic Regression, Decision Tree, Random Forest, Extra Trees, Gradient Boosting, AdaBoost, baseline models and a simple TensorFlow/Keras neural network as a complementary experiment. For the Uber/NCR dataset, Gradient Boosting achieved an approximate F1-score of 0.99, a result strongly associated with the presence of booking_value and ride_distance. For the Yellow Taxi NYC dataset, the complementary neural network and Random Forest achieved F1-scores close to 0.93, decreasing to 0.7735 when duration_min and avg_speed_mph were removed. The results indicate that ML models can support the identification of patterns associated with ride profitability, provided that dataset limitations, the estimated nature of the target variable and variable availability at decision time are explicitly considered.pt_BR
dc.format.extent36 p.pt_BR
dc.languagept_BRpt_BR
dc.relationABADI, Martín et al. TensorFlow: large-scale machine learning on heterogeneous systems. 2016. Disponível em: https://www.tensorflow.org/. Acesso em: 25 maio 2026. ANTUNES, Ricardo. O privilégio da servidão: o novo proletariado de serviços na era digital. São Paulo: Boitempo, 2020. BREIMAN, Leo. Random forests. Machine Learning, v. 45, p. 5-32, 2001. CHAPMAN, Pete et al. CRISP-DM 1.0: step-by-step data mining guide. SPSS, 2000. DAVENPORT, Thomas H.; HARRIS, Jeanne G. Competing on analytics: the new science of winning. Boston: Harvard Business School Press, 2007. ELEMENTO. NYC Yellow Taxi Trip Data. Kaggle, s.d. Disponível em: https://www.kaggle.com/datasets/elemento/nyc-yellow-taxi-trip-data. Acesso em: 16 jun. 2026. FREUND, Yoav; SCHAPIRE, Robert E. A decision-theoretic generalization of on-line learning and an application to boosting. Journal of Computer and System Sciences, v. 55, n. 1, p. 119-139, 1997. DOI: https://doi.org/10.1006/jcss.1997.1504. FRIEDMAN, Jerome H. Greedy function approximation: a gradient boosting machine. The Annals of Statistics, v. 29, n. 5, p. 1189-1232, 2001. GEURTS, Pierre; ERNST, Damien; WEHENKEL, Louis. Extremely randomized trees. Machine Learning, v. 63, p. 3-42, 2006. DOI: https://doi.org/10.1007/s10994-006-6226 1. HAN, Jiawei; KAMBER, Micheline; PEI, Jian. Data mining: concepts and techniques. 3. ed. Waltham: Morgan Kaufmann, 2011. HASTIE, Trevor; TIBSHIRANI, Robert; FRIEDMAN, Jerome. The elements of statistical learning: data mining, inference, and prediction. 2. ed. New York: Springer, 2009. LADDHA, Yashdev. Uber Data Analytics Dashboard. Kaggle, s.d. Disponível em: https://www.kaggle.com/datasets/yashdevladdha/uber-ride-analytics-dashboard. Acesso em: 16 jun. 2026. MANGUINHO, Maria Letícia da Silva. Análise comparativa de redes neurais artificiais e algoritmos de ensemble para a predição de risco de crédito. Trabalho de Conclusão de Curso (Análise e Desenvolvimento de Sistemas) - Instituto Federal de Pernambuco, Campus Paulista, 2023. MITCHELL, Tom M. Machine learning. New York: McGraw-Hill, 1997. 34 NEW YORK CITY TAXI AND LIMOUSINE COMMISSION. TLC Trip Record Data. New York: NYC TLC, 2015. Disponível em: https://www.nyc.gov/site/tlc/about/tlc-trip-record data.page. Acesso em: 16 jun. 2026. PEDREGOSA, Fabian et al. Scikit-learn: machine learning in Python. Journal of Machine Learning Research, v. 12, p. 2825-2830, 2011. SANTOS, Mariana Lovato dos. Algoritmos de aprendizado de máquina supervisionados aplicados em transportes: comparativo com modelo Logit Multinomial para escolha modal. 2023. Dissertação (Mestrado em Engenharia de Produção) - Universidade Federal do Rio Grande do Sul, Porto Alegre, 2023. SUNDARARAJAN, Arun. The sharing economy: the end of employment and the rise of crowd-based capitalism. Cambridge: MIT Press, 2016. TAN, Pang-Ning; STEINBACH, Michael; KUMAR, Vipin. Introduction to data mining. Boston: Pearson, 2009.pt_BR
dc.rightsAcesso Abertopt_BR
dc.subjectAprendizado de máquinapt_BR
dc.subjectCRISP-DMpt_BR
dc.subjectClassificaçãopt_BR
dc.subjectCorridas de aplicativopt_BR
dc.subjectTáxipt_BR
dc.titleAnálise comparativa de modelos de aprendizado de máquina para classificação de corridas rentáveis em plataformas de transporte.pt_BR
dc.title.alternativeComparative Analysis of Machine Learning Models for Classifying Profitable Rides on Transportation Platformspt_BR
dc.typeArticlept_BR
dc.creator.Latteshttp://lattes.cnpq.br/1768877420785497pt_BR
dc.contributor.advisor1Barreto Neto, Antônio Correia de Sá
dc.contributor.advisor1Latteshttp://lattes.cnpq.br/2773609778338983pt_BR
dc.contributor.referee1Oliveira, Flávio Rosendo da Silva
dc.contributor.referee2Mialaret Júnior, Marco Aurélio Tomaz
dc.contributor.referee1Latteshttp://lattes.cnpq.br/6828380394080049pt_BR
dc.contributor.referee2Latteshttp://lattes.cnpq.br/7976399413510613pt_BR
dc.publisher.departmentPaulistapt_BR
dc.publisher.countryBrasilpt_BR
dc.subject.cnpqCIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::SISTEMAS DE COMPUTACAOpt_BR
dc.description.resumoO crescimento das plataformas digitais de transporte urbano ampliou a quantidade de dados gerados sobre deslocamentos, valores, distâncias, horários e características operacionais das corridas. Apesar desse volume de informações, motoristas e demais agentes envolvidos nesse tipo de serviço ainda enfrentam dificuldades para transformar dados em apoio efetivo à tomada de decisão, especialmente quando o objetivo é avaliar se uma corrida tende a ser rentável ou não. Diante desse contexto, este trabalho tem como objetivo analisar e comparar modelos de aprendizado de máquina (AM) para a classificação de corridas rentáveis e não rentáveis em duas bases de dados distintas: uma base de reservas de corridas do tipo Uber/NCR e uma base pública de corridas de táxi amarelo de Nova York. A metodologia foi estruturada com base no processo CRISP-DM, contemplando compreensão do problema, compreensão dos dados, preparação dos dados, modelagem e avaliação. Foram criadas variáveis derivadas de custo estimado, lucro estimado e rentabilidade, com discussão metodológica sobre o risco de vazamento de dados, especialmente em relação ao uso de variáveis financeiras. Também foram incluídas análises de sensibilidade para verificar o impacto do uso de variáveis diretamente relacionadas ao cálculo da rentabilidade. Foram avaliados modelos como Regressão Logística, Árvore de Decisão, Random Forest, Extra Trees, Gradient Boosting, AdaBoost, modelos de baseline e uma rede neural simples com TensorFlow/Keras como experimento complementar. Os resultados indicaram que, na base Uber/NCR, o Gradient Boosting obteve F1-score aproximado de 0,99, resultado fortemente associado à presença de booking_value e ride_distance. Na base Yellow Taxi NYC, a rede neural complementar e o Random Forest atingiram F1-score próximo de 0,93, com queda para 0,7735 quando removidas duration_min e avg_speed_mph. Conclui-se que modelos de AM podem apoiar a identificação de padrões associados à rentabilidade de corridas, desde que as limitações das bases, a natureza estimada da variável alvo e a disponibilidade das variáveis no momento da decisão sejam claramente consideradas.pt_BR


Arquivos deste item

Thumbnail

Este item aparece na(s) seguinte(s) coleção(s)

Mostrar registro simples