Mostrar registro simples

dc.creatorNascimento, Alexandre Henrique Silva do
dc.date.accessioned2026-08-07T12:05:48Z
dc.date.available2026-08-07T12:05:48Z
dc.date.issued2026-04-15
dc.identifier.citationNASCIMENTO, Alexandre Henrique Silva do. Análise comparativa de modelos em sistemas multi-agentes para geração de documentos analíticos. 2026. 21 f. Trabalho de Conclusão de Curso (Artigo) – Curso Superior de Tecnologia em Análise e Desenvolvimento de Sistemas, Instituto Federal de Educação, Ciência e Tecnologia de Pernambuco, Paulista, 2026.pt_BR
dc.identifier.urihttps://repositorio.ifpe.edu.br/xmlui/handle/123456789/2262
dc.description.abstractThe evolution of Large Language Models has driven significant advances in the automation of intellectual tasks. However, the reliability of their responses and their tendency to produce hallucinations remain relevant limitations for their use in professional contexts. This work presents a detailed comparative analysis of the performance of three models: GPT-4o-mini, Llama 3–8B, and Llama 3–70B. These models were applied to two distinct case studies: (i) the validation of an academic text with a focus on detecting inconsistencies and hallucinations, and (ii) the comparative financial analysis of multiple balance sheets. To conduct the experiments, a multi-agent system was developed using the CrewAI framework to orchestrate autonomous agents responsible for generating, reviewing, and validating documents. The methodology employs a structured verification pipeline based on manually created checklists, allowing the comparison of model outputs against the original documents and enabling the assessment of their accuracy. The results reveal significant differences among the three models in terms of content fidelity, textual clarity, analytical consistency, and hallucination rates, demonstrating that proprietary and open-source models exhibit distinct behaviors depending on the nature of the task.pt_BR
dc.format.extent21 p.pt_BR
dc.languagept_BRpt_BR
dc.relationCREWAI. CrewAI. Disponível em: https://crewai.com/. GUO, T. et al. Large Language Model based Multi-Agents: A Survey of Progress and Challenges. In: PROCEEDINGS OF THE THIRTY-THIRD INTERNATIONAL JOINT CONFERENCE ON ARTIFICIAL INTELLIGENCE (IJCAI 2024). 2024. p. 8048–8057. Disponível em: https://www.ijcai.org/proceedings/2024/890. Acesso em: 12 maio 2026. JI, Z. et al. Survey of Hallucination in Natural Language Generation. ACM Computing Surveys, v. 55, n. 12, 2023. Disponível em: https://dl.acm.org/doi/10.1145/3571730. Acesso em: 12 maio 2026. MUSUMECI, E.; BRIENZA, M.; SURIANI, V.; NARDI, D.; BLOISI, D. D. LLM Based Multi-Agent Generation of Semi-structured Documents from Semantic Templates in the Public Administration Domain. In: INTERNATIONAL CONFERENCE ON HUMAN-COMPUTER INTERACTION. Cham: Springer, 2024. p. 98–117. Disponível em: https://arxiv.org/abs/2402.14871. Acesso em: 12 maio 2026. OPENAI. GPT-4 Technical Report. 2023. Disponível em: https://cdn.openai.com/papers/gpt-4.pdf. Acesso em: 12 maio 2026. PERRINA, F.; MARCHIORI, F.; CONTI, M.; VERDE, N. V. AGIR: Automating Cyber Threat Intelligence Reporting with Natural Language Generation. arXiv preprint, arXiv:2310.02655, 2023. Disponível em: https://arxiv.org/abs/2310.02655. Acesso em: 12 maio 2026. TRAN, V. et al. 2025. Disponível em: https://arxiv.org/abs/2501.06322. Acesso em: 12 maio 2026. VASWANI, A. et al. Attention Is All You Need. In: ADVANCES IN NEURAL INFORMATION PROCESSING SYSTEMS. 2017. Disponível em: https://arxiv.org/abs/1706.03762. Acesso em: 12 maio 2026. WANG, L. et al. A Survey on Large Language Model based Autonomous Agents. arXiv preprint, arXiv:2308.11432, 2023. Disponível em: https://arxiv.org/abs/2308.11432. Acesso em: 12 maio 2026. WU, Q. et al. AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation. arXiv preprint, arXiv:2308.08155, 2023. Disponível em: https://arxiv.org/abs/2308.08155. Acesso em: 12 maio 2026. YAN, B. et al. Beyond Self-Talk: A Communication-Centric Survey of LLM-Based Multi-Agent Systems. arXiv preprint, 2025. Disponível em: https://arxiv.org/abs/2502.14321. Acesso em: 12 maio 2026.pt_BR
dc.rightsAcesso Abertopt_BR
dc.subjectInteligência artificialpt_BR
dc.subjectSistemas multi-agentespt_BR
dc.subjectGrandes modelos de linguagempt_BR
dc.subjectDocumentos analíticospt_BR
dc.titleAnálise comparativa de modelos em sistemas multi-agentes para geração de documentos analíticos.pt_BR
dc.title.alternativeComparative analysis of models in multi-agent systems for generating analytical documents.pt_BR
dc.typeArticlept_BR
dc.creator.Latteshttp://lattes.cnpq.br/3964130518030883pt_BR
dc.contributor.advisor1Oliveira, Flávio Rosendo da Silva
dc.contributor.advisor1Latteshttp://lattes.cnpq.br/6828380394080049pt_BR
dc.contributor.referee1Silva, Rodrigo Cesar Lira da
dc.contributor.referee2Moraes, Diogo Tavares Cavalcanti de
dc.contributor.referee1Latteshttp://lattes.cnpq.br/2442224050349612pt_BR
dc.contributor.referee2Latteshttp://lattes.cnpq.br/3445106750937471pt_BR
dc.publisher.departmentPaulistapt_BR
dc.publisher.countryBrasilpt_BR
dc.subject.cnpqCIENCIAS EXATAS E DA TERRA::CIENCIA DA COMPUTACAO::SISTEMAS DE COMPUTACAOpt_BR
dc.description.resumoA evolução dos Grandes Modelos de Linguagem impulsionou avanços significativos na automação de tarefas intelectuais. Entretanto, a confiabilidade das respostas e a propensão a alucinações ainda representam limitações relevantes para seu uso em contextos profissionais. Este trabalho apresenta uma análise comparativa do desempenho de três modelos: GPT-4o-mini, Llama 3–8B e Llama 3–70B. A comparação de desempenho entre os modelos ocorreu em dois estudos de caso distintos: (i) a validação de um texto acadêmico com foco em detecção de inconsistências e alucinações, e (ii) a análise financeira comparativa de múltiplos balancetes. Para conduzir os experimentos, desenvolveu-se um sistema multi-agente, utilizando o framework CrewAI para orquestrar agentes autônomos responsáveis pela geração, revisão e validação dos documentos. A metodologia emprega um pipeline estruturado de verificação por meio de checklists preenchidos manualmente, permitindo comparar as saídas dos modelos com os documentos originais e mensurar sua precisão. Os resultados evidenciam diferenças significativas entre os três modelos quanto à fidelidade ao conteúdo, clareza textual, consistência analítica e taxa de alucinações, demonstrando que modelos proprietários e de código aberto apresentam comportamentos distintos dependendo da natureza da tarefa analisada.pt_BR


Arquivos deste item

Thumbnail

Este item aparece na(s) seguinte(s) coleção(s)

Mostrar registro simples