Document details

Processamento de Linguagem Natural e Machine Learning na categorização de notícias

Author(s): Varanda, José ; Lacerda, Cristina ; Fialho, Joana

Date: 2026

Origin: Millenium

Subject(s): Engineering, Technology, Management and Tourism


Description

Introdução: O rápido aumento de conteúdos digitais, especialmente na área de notícias, tornou mais difícil organizar e analisar grandes volumes de informação não estruturada. A classificação automática de textos é uma solução importante, apoiada pelos avanços em Processamento de Linguagem Natural e Machine Learning, que tornam a categorização de notícias mais eficiente e precisa. Objetivo: Desenvolver e avaliar métodos de categorização automática de notícias em português que combinem bom desempenho com eficiência computacional, comparando técnicas tradicionais a modelos avançados de aprendizagem profunda. Métodos: Realizou-se uma investigação experimental, com base em revisão da literatura, análise exploratória de dados e na implementação de diferentes modelos de classificação. Foram comparadas abordagens clássicas de Machine Learning e de Mineração de Texto com modelos recentes de Processamento de Linguagem Natural, incluindo arquiteturas baseadas em Transformers, como o BERT. A avaliação foi efetuada com base em métricas de desempenho (Accuracy, Precision, Recall, F1-Score) e no custo computacional. Resultados: Os modelos baseados em Transformers demonstraram maior capacidade de compreensão contextual e desempenho superior na classificação de notícias. No entanto, apresentam requisitos computacionais mais elevados. Em contrapartida, modelos mais leves evidenciam um melhor equilíbrio entre eficiência e precisão, revelando-se adequados para cenários com recursos computacionais limitados. Conclusão: Soluções eficazes para a categorização automática de notícias em português podem equilibrar desempenho e eficiência computacional. O estudo ressalta a importância de selecionar o modelo adequado ao contexto, o que favorece o desenvolvimento de sistemas de classificação mais robustos e acessíveis.

Introduction: The rapid growth of digital content, especially in the news domain, has made more difficult to organize and analyze large volumes of unstructured information. Automatic text classification is an important solution, supported by advances in Natural Language Processing and Machine Learning, which make news categorization more efficient and accurate. Objective: To develop and evaluate methods for automatic categorization of news in Portuguese that combine strong performance with computational efficiency, comparing traditional techniques with advanced deep learning models. Methods: An experimental study was conducted, based on literature review, exploratory data analysis, and the implementation of different classification models. Classical Machine Learning and Text Mining approaches were compared with recent Natural Language Processing models, including Transformer-based architectures such as BERT. The evaluation was carried out using performance metrics (Accuracy, Precision, Recall, F1-Score) and computational cost. Results: Transformer-based models demonstrated greater contextual understanding and superior performance in news classification. However, they require higher computational resources. In contrast, lighter models showed a better balance between efficiency and accuracy, proving suitable for scenarios with limited computational resources. Conclusion: Effective solutions for automatic news categorization in Portuguese can balance performance and computational efficiency. The study highlights the importance of selecting the appropriate model for the context, supporting the development of more robust and accessible classification systems.

Introducción: El rápido aumento del contenido digital, especialmente en el ámbito informativo, ha dificultado la organización y el análisis de grandes volúmenes de información no estructurada. La clasificación automática de texto es una solución importante, respaldada por los avances en el procesamiento del lenguaje natural y el aprendizaje automático, que hacen que la categorización de notícias sea más eficiente y precisa. Objetivo: Desarrollar y evaluar métodos de categorización automática de noticias en portugués que combinen un buen rendimiento con eficiencia computacional, comparando técnicas tradicionales con modelos avanzados de aprendizaje profundo. Métodos: Se llevó a cabo una investigación experimental basada en la revisión de la literatura, el análisis exploratorio de datos y la implementación de diferentes modelos de clasificación. Se compararon enfoques clásicos de aprendizaje automático y minería de texto con modelos recientes de procesamiento del lenguaje natural, incluyendo arquitecturas basadas en Transformer como BERT. La evaluación se realizó en función de métricas de rendimiento (precisión, exactitud, exhaustividad, puntuación F1) y coste computacional. Resultados: Los modelos basados ​​en Transformer demostraron una mayor comprensión contextual y un rendimiento superior en la clasificación de noticias. Sin embargo, presentan mayores requisitos computacionales. En contraste, los modelos más ligeros muestran un mejor equilibrio entre eficiencia y precisión, demostrando ser adecuados para escenarios con recursos computacionales limitados. Conclusión: Las soluciones eficaces para la categorización automática de notícias en portugués logran un equilibrio entre rendimiento y eficiencia computacional. El estudio subraya la importancia de seleccionar el modelo adecuado para cada contexto, lo que favorece el desarrollo de sistemas de clasificación más robustos y accesibles.

Document Type Journal article
Language Portuguese
facebook logo  linkedin logo  twitter logo 
mendeley logo

Related documents