Influence of Textual Preprocessing Techniques on the Performance of LLMs
2026 (English)Independent thesis Advanced level (degree of Master (Two Years)), 20 credits / 30 HE credits
Student thesisAlternative title
Påverkan av textförbehandlingstekniker på prestandan hos stora språkmodeller (Swedish)
Abstract [en]
Large Language Models (LLMs) have become central to natural language processing, yet their performance in mental-health-related tasks can be influenced by how textual input is prepared before training and inference. This thesis investigates how different preprocessing strategies—specifically lowercasing, stopword removal, and lemmatization—influence model behaviour in multilabel emotion classification for depression-related social-media text. Although preprocessing is a standard step in many Natural Language Processing (NLP) workflows, its impact on modern transformer-based models remains insufficiently understood, particularly when combined with parameter-efficient finetuning methods.
The problem addressed in this thesis is to determine which preprocessing operations improve or degrade performance, and why. This question is important because linguistic patterns in mental-health-related text contain subtle stylistic and affective cues that may be erased by aggressive cleaning, while insufficient normalization can introduce noise and reduce generalization. Prior work in affective computing provides conflicting recommendations regarding the appropriate degree of text cleaning, and no existing study systematically evaluates preprocessing across architectures, fine-tuning strategies, and domain-specific datasets.
This study evaluates fifteen transformer models, eight preprocessing pipelines, and three fine-tuning strategies, resulting in 360 controlled experiments on the publicly available DepressionEmo dataset of annotated Reddit posts. Full fine-tuning and parameter-efficient methods such as Low-Rank Adaptation (LoRA) and Quantized Low-Rank Adaptation (QLoRA) are applied within a unified training pipeline, and model performance is assessed using macro- and micro-averaged F1, precision, and recall.
Results show that preprocessing has a measurable but modest influence on performance. Light normalization—especially lowercasing—generally shows small and comparatively stable effects, whereas more aggressive operations, particularly stopword removal and combined multi-step normalization, are more often associated with lower Macro-F1 because they may remove lin- guistic markers such as negation cues, function words, and self-referential pronouns that are important for identifying depressive expressions. The effect of lemmatization is more mixed and depends more strongly on model architecture. Within the selected experimental setup, model architecture appears to be the dominant factor: encoder models are the most robust, decoder models show moderate robustness, and encoder–decoder models are more sensitive to normalization and quantization. Parameter-efficient fine- tuning remains effective provided that input consistency is preserved.
These findings provide practical guidelines for constructing reliable and reproducible preprocessing pipelines for mental-health applications of large language models. The work also highlights the importance of balancing linguistic fidelity, computational efficiency, and ethical responsibility when processing sensitive user-generated text.
Abstract [sv]
Stora språkmodeller (Large Language Models) har blivit centrala inom språkteknologi, men deras prestanda i uppgifter relaterade till mental hälsa kan påverkas av hur text förbehandlas före träning och inferens. Denna avhandling undersöker hur olika förbehandlingsstrategier—specifikt normalisering till gemener, borttagning av stoppord och lemmatisering—påverkar modellbe- teende vid fleretikettsklassificering av känslor i depressionsrelaterade texter från sociala medier. Trots att textförbehandling är ett etablerat steg i många NLP-arbetsflöden är dess effekt på moderna transformerbaserade modeller fortfarande otillräckligt förstådd, särskilt i kombination med resurseffektiva finjusteringsmetoder.
Avhandlingens forskningsfråga är att identifiera vilka förbehandlingsoperationer som förbättrar respektive försämrar modellprestanda, och varför. Denna fråga är betydelsefull eftersom språkliga mönster i texter relaterade till mental ohälsa ofta innehåller subtila stilistiska och affektiva signaler som riskerar att gå förlorade vid alltför aggressiv rensning, medan otillräcklig normalisering kan introducera brus och minska generaliseringsförmågan. Tidigare forskning inom affektiv databehandling ger motstridiga rekommendationer om lämplig grad av textnormalisering, och ingen tidigare studie utvärderar preprocessering systematiskt över olika arkitekturer, finjusteringsstrategier och domänspecifika dataset.
Studien utvärderar femton transformer-modeller, åtta förbehandlingspipelines och tre finjusteringsstrategier, vilket resulterar i totalt 360 kontrollerade experiment på det offentligt tillgängliga DepressionEmo-datasettet med annoterade Reddit-inlägg. Både fullständig finjustering och resurseffektiva metoder såsom Low-Rank Adaptation (LoRA) och Quantized Low-Rank Adaptation (QLoRA) används inom en enhetlig träningspipeline, och modellerna utvärderas med makro- och mikro-F1, precision och recall.
Resultaten visar att förbehandling har en tydlig men relativt begränsad påverkan på modellprestanda. Lättare normalisering—särskilt konvertering till gemener—visar generellt små och relativt stabila effekter, medan mer aggressiva operationer, särskilt borttagning av stoppord och kombinerad flerstegsnormalisering, oftare är förknippade med lägre Macro-F1 eftersom de kan ta bort språkliga markörer såsom negationer, funktionsord och självrefererande pronomen som är viktiga för att identifiera depressiva uttryck. Effekten av lemmatisering är mer blandad och beror i högre grad på modellarkitektur. Inom den valda experimentella ramen framstår modellarkitekturen som den mest avgörande faktorn: encoder-modeller är mest robusta, decoder-modeller har måttlig robusthet, och encoder–decoder-modeller är mer känsliga för normalisering och kvantisering. Resurseffektiv finjustering förblir effektiv så länge preprocesseringen är konsekvent.
Arbetet ger praktiska rekommendationer för hur tillförlitliga och reproducerbara förbehandlingspipelines kan utformas för mentala hälsoapplikationer baserade på stora språkmodeller. Det betonar också vikten av att balansera språklig noggrannhet, beräkningsmässig effektivitet och etiska hänsyn vid hantering av känsliga användargenererade texter.
Place, publisher, year, edition, pages
2026. , p. 58
Series
TRITA-EECS-EX ; 2026:157
Keywords [en]
Textual Preprocessing, Large Language Models, Mental Health Classifi- cation, Transformer Architectures, Parameter-Efficient Fine-Tuning, Multi- Label Emotion Classification
Keywords [sv]
Textförbehandling, Stora språkmodeller, Klassificering av mental hälsa, Transformer-arkitekturer, Resurseffektiv finjustering, Fleretikettsklassifice- ring
National Category
Computer and Information Sciences
Identifiers
URN: urn:nbn:se:kth:diva-384995OAI: oai:DiVA.org:kth-384995DiVA, id: diva2:2084784
Subject / course
Communications Systems
Educational program
Master of Science -Communication Systems
Supervisors
Examiners
2026-08-252026-07-062026-08-25Bibliographically approved