AI analyserar 1700-talets böneskrifter

Historiska arkiv rymmer enorma mängder information om människors vardag, men språklig variation, äldre stavning och brist på digitalt anpassat material försvårar datorbaserad analys. Avhandlingen Humble Pleas from the Archives undersöker tillämpningen av språkteknologiska metoder på historiska texter, med särskilt fokus på svenska suppliker från 1700-talet. Studien utforskar hur olika modelleringsparadigm kan användas för att stödja både genreidentifiering och extraktion av historiskt meningsfull information.

Forskningen följer en stegvis metodik genom fyra studier. Först klassificeras suppliker tillsammans med fyra andra historiska genrer med hjälp av metoder som sträcker sig från traditionella maskininlärningsmodeller till en svensk BERT-baserad klassificerare, med goda resultat på data från samma typ av arkivmaterial. Därefter genomförs en särdragsanalys för att identifiera centrala språkliga markörer för supplikgenren, inklusive tematiskt ordförråd och uttryck för social hierarki. Vidare utforskas automatiska metoder för att identifiera retoriska komponenter såsom hälsningsfraser och begäran med hjälp av både lågresursmetoder och stora språkmodeller (LLM:er). Resultaten visar att standardiserade delar kan identifieras på ett tillförlitligt sätt, medan andra delar är alltjämt tvetydiga till sin natur.

Slutligen behandlar avhandlingen extraktion och normalisering av arbetsrelaterade uttryck inom ramen för Gender and work-projektets annoteringsschema. Resultaten indikerar att denna uppgift är genomförbar: även om resultatet för exakt frasmatchning är lågt, visar jämförelser på strängnivå och semantisk likhet att modellerna kan identifiera relevanta tematiska textpartier. Den kvalitativa analysen visar vidare att modellerna kan identifiera möjliga arbetsrelaterade uttryck som inte finns representerade i gulddata, vilket pekar på potentialen i ett samspel mellan mänsklig och maskinell analys.

Ett centralt bidrag i avhandlingen är tillämpningen av utvärderingsstrategier som går bortom exakt frasmatchning genom att även inkludera strängbaserad och semantisk likhet, vilket möjliggör en mer nyanserad bedömning av modellernas prestanda på historiska texter. Sammantaget belyser resultaten både potentialen och begränsningarna hos nuvarande språkteknologiska metoder för historiska texter, och visar hur datorbaserade angreppssätt kan bidra till analys av komplext arkivmaterial.

Ellinor Lindqvist:
Humble pleas from the archives. Automatic analysis and information extraction from historical petitions
Institutionen för lingvistik och filologi, Uppsala universitet
Disputation: 12 juni 2026