Logotyp: till Uppsala universitets webbplats

uu.sePublikationer från Uppsala universitet
Ändra sökning
RefereraExporteraLänk till posten
Permanent länk

Direktlänk
Referera
Referensformat
  • apa
  • ieee
  • modern-language-association
  • vancouver
  • Annat format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annat språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf
RAG-based data extraction: Mining information from second-life battery documents
Uppsala universitet, Teknisk-naturvetenskapliga vetenskapsområdet, Matematisk-datavetenskapliga sektionen, Institutionen för informationsteknologi, Avdelningen för systemteknik.
2024 (Engelska)Självständigt arbete på avancerad nivå (yrkesexamen), 20 poäng / 30 hpStudentuppsats (Examensarbete)
Abstract [en]

With the constant evolution of Large Language Models (LLMs), methods for minimizing hallucinations are being developed to provide more truthful answers. By using Retrieval-Augmented Generation (RAG), external data can be provided to the model on which its answers should be based. This project aims at using RAG for a data extraction pipeline specified for second-life batteries. By pre-defining the prompts the user may only provide the documents that are wished to be analyzed, this is to ensure that the answers are in the correct format for further data processing. To process different document types, initial labeling takes place before more specific extraction suitable for the document can be applied. Best performance is achieved by grouping questions that allow the model to reason around what the relevant questions are so that no hallucinations occur. Regardless of whether there are two or three document types, the model performs equally well, and it is clear that a pipeline of this type is well suited to today's models. Further improvements can be achieved by utilizing models containing a larger context window and initially using Optical Character Recognition (OCR) to read text from the documents. 

Ort, förlag, år, upplaga, sidor
2024. , s. 43
Serie
UPTEC F, ISSN 1401-5757 ; 24025
Nyckelord [en]
RAG, Retrieval-Augmented Generation, LLM, AI, Data extraction, second-life battery, data extraction pipeline, data extraction
Nationell ämneskategori
Språkbehandling och datorlingvistik
Identifikatorer
URN: urn:nbn:se:uu:diva-533357OAI: oai:DiVA.org:uu-533357DiVA, id: diva2:1877456
Externt samarbete
Cling Systems AB
Utbildningsprogram
Civilingenjörsprogrammet i teknisk fysik
Presentation
2024-05-30, Zoom, Uppsala, 10:45 (Engelska)
Handledare
Examinatorer
Tillgänglig från: 2024-06-26 Skapad: 2024-06-25 Senast uppdaterad: 2025-02-07Bibliografiskt granskad

Open Access i DiVA

RAG_based_data_extraction_Mining_information_from_second_life_battery_documents(1373 kB)1021 nedladdningar
Filinformation
Filnamn FULLTEXT01.pdfFilstorlek 1373 kBChecksumma SHA-512
1f489468d57ed1350e04fadeeaa38b2e4f503c0a1902b9bbf0174a478cf252ac9ac41aec0585cbda0ad2ad4ce683c65aa85ae62ee8d6c01fa7101c9cf3ce03e2
Typ fulltextMimetyp application/pdf

Av organisationen
Avdelningen för systemteknik
Språkbehandling och datorlingvistik

Sök vidare utanför DiVA

GoogleGoogle Scholar
Totalt: 1028 nedladdningar
Antalet nedladdningar är summan av nedladdningar för alla fulltexter. Det kan inkludera t.ex tidigare versioner som nu inte längre är tillgängliga.

urn-nbn

Altmetricpoäng

urn-nbn
Totalt: 2068 träffar
RefereraExporteraLänk till posten
Permanent länk

Direktlänk
Referera
Referensformat
  • apa
  • ieee
  • modern-language-association
  • vancouver
  • Annat format
Fler format
Språk
  • de-DE
  • en-GB
  • en-US
  • fi-FI
  • nn-NO
  • nn-NB
  • sv-SE
  • Annat språk
Fler språk
Utmatningsformat
  • html
  • text
  • asciidoc
  • rtf