Logotyp: till Uppsala universitets webbplats

uu.sePublikationer från Uppsala universitet
Ändra sökning
RefereraExporteraLänk till posten
Permanent länk

Direktlänk
Referera
Referensformat
  • apa
  • ieee
  • modern-language-association
  • vancouver
  • Annat format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annat språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf
Social Media Sentiment Analysis on Multilingual Dataset
Uppsala universitet, Teknisk-naturvetenskapliga vetenskapsområdet, Matematisk-datavetenskapliga sektionen, Institutionen för informationsteknologi.
2024 (Engelska)Självständigt arbete på avancerad nivå (masterexamen), 20 hpStudentuppsats (Examensarbete)
Abstract [en]

This thesis presents using unlabeled data and soft targets from a LLM to train a pre-trained model for sentiment analysis. Inspired by the study “What do LLMs Know about Financial Markets? A Case Study on Reddit Market Sentiment Analysis” by Deng et al. (2023), this thesis focuses on enhancing sentiment analysis in social media, particularly for YouTube comments that often lack actual labels. Throughout the thesis, three different approaches were tested: (i) We evaluated the performance of sentiment analysis using LLM. (ii) We use the LLM's results as hints for a fine- tuned model to make predictions and then evaluate those results. (iii) We use the LLM's results as soft targets to fine-tune a pre-trained model for improved sentiment analysis.

Our final implementation takes the best approach, and its results show that leveraging the knowledge from LLMs to fine-tune a pre-trained model, even with half the size of the dataset, yields similar sentiment analysis results to model using deep learning methods on the entire dataset or the LLM alone. Additionally, we establish an evaluation method to assessment of our approach.

Ort, förlag, år, upplaga, sidor
2024. , s. 45
Serie
IT ; mDA 24 011
Nyckelord [en]
Sentiment Analysis, Unsupervised learning, Social media, Nature Language Processing, Chain-of-Thought
Nationell ämneskategori
Språkbehandling och datorlingvistik
Identifikatorer
URN: urn:nbn:se:uu:diva-536121OAI: oai:DiVA.org:uu-536121DiVA, id: diva2:1888601
Externt samarbete
CreatorDB
Ämne / kurs
Språkteknologi
Utbildningsprogram
Masterprogram i dataanalys
Presentation
2024-06-07, Ångströmlaboratoriet, Uppsala University, Lägerhyddsvägen 1, 752 37 Uppsala, Sweden, Sweden, 10:00 (Engelska)
Handledare
Examinatorer
Tillgänglig från: 2024-08-16 Skapad: 2024-08-13 Senast uppdaterad: 2025-02-07Bibliografiskt granskad

Open Access i DiVA

fulltext(5080 kB)1606 nedladdningar
Filinformation
Filnamn FULLTEXT01.pdfFilstorlek 5080 kBChecksumma SHA-512
caf75f27ad96c99856b5e9c833d2b6f321d61684a3b0a2256281c9acff1387bd9de82167aea621b8661450a7dde20416cb0981800bdb21e54a87d388f40b9e94
Typ fulltextMimetyp application/pdf

Av organisationen
Institutionen för informationsteknologi
Språkbehandling och datorlingvistik

Sök vidare utanför DiVA

GoogleGoogle Scholar
Totalt: 1610 nedladdningar
Antalet nedladdningar är summan av nedladdningar för alla fulltexter. Det kan inkludera t.ex tidigare versioner som nu inte längre är tillgängliga.

urn-nbn

Altmetricpoäng

urn-nbn
Totalt: 1544 träffar
RefereraExporteraLänk till posten
Permanent länk

Direktlänk
Referera
Referensformat
  • apa
  • ieee
  • modern-language-association
  • vancouver
  • Annat format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annat språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf