Topic Classification of Historical Finnish Newspapers

Ladataan...
suljettu
Julkaisu on tekijänoikeussäännösten alainen. Teosta voi lukea ja tulostaa henkilökohtaista käyttöä varten. Käyttö kaupallisiin tarkoituksiin on kielletty.
Lataukset6

Verkkojulkaisu

DOI

Tiivistelmä

This study examines the feasibility of using a cost-efficient language model trained on modern news to classify historical newspaper articles by topic. The analysis focuses on challenges posed by archaic language and OCR errors. Previous research has shown that OCR-digitized texts can be successfully combined with LLM-based classifiers for tasks such as topic modeling, achieving promising results; however, this approach has not been widely explored with Finnish-language material. The study was conducted by fine-tuning a FinBERT model to classify news articles by topic using modern training data consisting of Yle news articles from the 2010s, labeled according to ten high-level categories (e.g., politics). The model was then evaluated on a test set of 63 historical newspaper documents, which were prepared in three versions: (1) with both OCR errors and archaic language, (2) with archaic language only, and (3) a modernized version of the same texts. The results show that classification remains reasonably effective despite the temporal gap between training and test data. While both archaic language and OCR errors reduce performance, OCR noise has a more pronounced negative effect, whereas archaic language alone leads to less consistent but still usable results. However, the findings are limited by a small, single-source dataset, manual labeling, and the use of only one model. OCR errors were not systematically analyzed and could not be fully separated from linguistic effects. Despite these limitations, the results suggest that relatively cheap (in terms of computational resources) language models can be used for classifying historical documents even if the input data is quite noisy. Future work should use larger and more diverse datasets, compare multiple models, and further investigate the trade-offs between model complexity and performance in historical text classification.
Tämä tutkimus tarkastelee, kuinka hyvin kustannustehokas, nykyaikaisella uutisaineistolla koulutettu kielimalli soveltuu historiallisten sanomalehtiartikkeleiden aiheluokitteluun. Analyysi keskittyy erityisesti vanhan kielen ja OCR-virheiden aiheuttamiin haasteisiin. Aiempi tutkimus on osoittanut, että OCR-digitoituja tekstejä voidaan yhdistää menestyksekkäästi suuriin kielimalleihin perustuviin luokittelijoihin esimerkiksi aiheiden mallintamisessa, ja tulokset ovat olleet lupaavia. Tätä lähestymistapaa ei kuitenkaan ole juurikaan tutkittu suomenkielisellä aineistolla. Tutkimus toteutettiin hienosäätämällä FinBERT-mallia luokittelemaan uutisartikkeleita aiheittain käyttäen modernia opetusaineistoa, joka koostui 2010-luvun Ylen uutisartikkeleista. Aineisto oli jaettu kymmeneen yläluokkaan (esim. politiikka). Mallin suorituskykyä arvioitiin 63 historiallisesta sanomalehtiartikkelista koostuvalla testijoukolla, josta luotiin kolme versiota: (1) sisältäen sekä OCR-virheet että arkaaisen kielen, (2) sisältäen vain arkaaisen kielen sekä (3) modernisoitu versio, jossa kieli oli päivitetty. Tulokset osoittavat, että luokittelu toimii kohtuullisen hyvin huolimatta koulutus- ja testiaineistojen ajallisesta erosta. Sekä vanha kieli että OCR-virheet heikentävät suorituskykyä, mutta OCR-virheiden vaikutus on selvästi suurempi, kun taas pelkkä vanha kieli johtaa lähinnä epätasaisempaan, mutta edelleen käyttökelpoiseen suorituskykyyn. Tutkimuksen tuloksia rajoittavat kuitenkin pieni ja yksilähteinen aineisto, manuaalinen annotointi sekä se, että arviointi tehtiin vain yhdellä mallilla. OCR-virheitä ei analysoitu systemaattisesti, eikä niiden vaikutusta voitu täysin erottaa kielellisistä tekijöistä. Näistä rajoitteista huolimatta tulokset viittaavat siihen, että suhteellisen kevyitä kielimalleja voidaan käyttää historiallisten tekstien luokitteluun myös silloin, kun syötedata on melko meluista. Jatkotutkimuksessa tulisi hyödyntää laajempia ja monipuolisempia aineistoja, vertailla useita eri malleja sekä tarkastella tarkemmin mallin monimutkaisuuden ja suorituskyvyn välistä suhdetta historiallisten tekstien luokittelussa.

item.page.okmtext