Developing methods for predictive data science: with applications to Bayesian inference, cross-validation, and Kernel methods
| dc.contributor.author | Numminen, Riikka | |
| dc.contributor.faculty | fi=Teknillinen tiedekunta|en=Faculty of Technology| | |
| dc.date.accessioned | 2026-08-05T08:03:02Z | |
| dc.date.issued | 2026-09-08 | |
| dc.description.abstract | Utilizing large amounts of data requires high-quality and efficient data analytics methods. However, the methods are not universal nor ready-to-use in every case, but instead, existing methods often need to be modified or developed to be suitable for the case. The quality of methods can be assessed by several criteria and the practical utility of the methods is determined by the amount of resources needed for using them. Method development is often balancing between different characteristics, i.e. some need to be weakened in order to achieve an improvement in another.This thesis consists of three publications, in which methods of predictive data science were developed. The first method was developed for predicting the profitability of free-to-play mobile games using data collected within a short time interval, and is based on Bayesian inference, survival analysis, and a mixture model. The second method is a quicksort-based acceleration of the tournament leave-pair-out cross-validation for estimating binary classification performance via Receiver Operating Characteristics (ROC) curve analysis. The third method is a learning algorithm that was developed based on the learning algorithm referred to as CGKronRLS by using nonsmooth multiobjective optimization, and its goal is to learn sparse (easier to interpret) hypotheses on pairwise data. The results obtained with simulated and available real-world data sets were consistent in every research study. The profitability prediction model was observed to be able to predict the monetization percentage, but it was noticed that badly selected prior distribution might lead to biased estimates. The cross-validation method produced equally good estimates of the ROC curves and the areas under them as the earlier, slower method, but it was noticed that the ranking of the data may not be unequivocal with the presented method. The learning algorithm was noticed to learn sparse hypotheses when the decrease in the performance measure was restricted to five percents in comparison to the prediction performance of the reference method, and even sparser when the decrease in prediction performance was not limited. All the methods presented in this thesis improve the existing methods or serve as an alternative for solving these tasks. | |
| dc.description.abstract | Suurten tietomäärien hyödyntäminen vaatii laadukkaita ja tehokkaita data-analytiikan menetelmiä. Ne eivät kuitenkaan ole yleispäteviä, joka tilanteeseen sopivia, vaan usein olemassa olevia menetelmiä joudutaan muokkaamaan tai kehittämään tilanteeseen sopiviksi. Menetelmien laatua voidaan arvioida useilla eri kriteereillä ja niiden vaatimien resurssien määrä vaikuttaa niiden käytännöllisyyteen. Menetelmäkehitys on usein tasapainoilua eri ominaisuuksien välillä, eli jotakin ominaisuutta joudutaan heikentämään, jotta saavutetaan parannus toiseen ominaisuuteen. Tämän väitöskirjan koostuu kolmesta osajulkaisusta, joissa kehitettiin ennustavan datatieteen menetelmiä. Ensimmäinen menetelmä kehitettiin ennustamaan ilmaisten mobiilipelien tuottavuutta lyhyellä seuranta-ajalla kerätystä datasta ja se pohjautuu Bayes-päättelyyn, elinaika-analyysiin sekä sekamalleihin. Toinen menetelmä on pikaluokitteluun perustuva opetus turnajais-pari-pors-intvalidoinnista, jota voidaan käyttää binääriluokittelijan ennustuskykyä kuvaavan erottelukyvykkyysarjan estimointiin. Kolmantena menetelmänä on CGKronRLS-nimisen oppimisalgoritmin pohjalta, epäsilaan monitoiteoptimointia käyttämällä kehitetty oppimisalgoritmi, jonka tavoitteena on oppia harvoja (helpommin ymmärrettäviä) hypoteeseja parittaisella datalla. Kussakin osatutkimuksessa saatiin yhteneviä tuloksia simuloiduilla ja valmiiksi olemassa olevilla todellisilla havaintoaineistoilla. Numeerisilla kokeilla osoitettiin menetelmien toimivuus, mutta vaadittiin myös jatkokehitystä vaativia asioita. Tuottavuutta ennustavan mallin havaittiin pystyvän arvioimaan todellista maksavien käyttäjien osuutta, mutta huomattiin myös huonosti valitun priorijakauman vaikutus estimattien harhaan. Ristiinvalidointimenetelmät tuotti yhtä tarkkoja arvioita erottelukyvykkyysarjasta ja sen alle jäävästä pinta-alasta kuin alkuperäinen, hitaampi menetelmä, mutta huomattiin, että tällä menetelmällä saatava havaintojen järjestys ei välttämättä ole yksikäsitteinen. Oppimisalgoritmin havaittiin tuottavan harvoja hypoteeseja silloin, kun ennustuskyvyn heikkeneminen oli rajoitettu viiteen prosenttiin tienaen verrokkimallin ennustuskyvystä, sekä vielä harvempia silloin, kun ennustuskyvyn heikkenemistä ei ollut rajoitettu. Jokainen tässä väitöskirjassa kehitetty menetelmä parantaa olemassa olevia ratkaisuvaihtoehtoja tai tarjoaa uusia näkökulmia näiden ongelmien ratkaisuun. | |
| dc.description.accessibilityfeature | fi=kuvilla vaihtoehtoiset kuvaukset|sv=alternativa textuella beskrivningar för bilder|en=alternative textual descriptions for images| | |
| dc.description.accessibilityfeature | fi=looginen lukemisjärjestys|sv=logisk läsordning|en=logical reading order| | |
| dc.format.content | fulltext | |
| dc.identifier.uri | https://www.utupub.fi/handle/11111/62900 | |
| dc.identifier.urn | URN:ISBN:978-952-02-0776-2 | |
| dc.language.iso | eng | |
| dc.publisher | fi=Turun yliopisto|en=University of Turku| | |
| dc.relation.ispartofseries | Turun yliopiston julkaisuja. Sarja F, Technica – Informatica | |
| dc.relation.issn | 2736-9684 | |
| dc.relation.numberinseries | 90 | |
| dc.title | Developing methods for predictive data science: with applications to Bayesian inference, cross-validation, and Kernel methods | |
| dc.type.ontasot | fi=Artikkeliväitöskirja|en=Doctoral dissertation (article-based)| |
Tiedostot
1 - 1 / 1
Ladataan...
- Name:
- Annales F 90 Numminen DISS.pdf
- Size:
- 3.85 MB
- Format:
- Adobe Portable Document Format