Ermittlung charakteristischer Datensätze durch Data Mining

Ermittlung charakteristischer Datensätze durch Data Mining

mastersthesis
Bedingt durch den technologischen Fortschritt der letzten Jahrzehnte und der stetig zunehmenden globalen Vernetzung sind im heutigen Informationszeitalter deutlich mehr Informationen verfügbar als der Mensch wahrnehmen und verarbeiten kann. Statt von der Informationstechnik entlastet zu werden, wird der Benutzer durch diese Flut an Informationen überfordert. In dieser Arbeit werden daher Methoden entwickelt, um typische Datensätze eines beliebigen Datenbestandes zu ermitteln. Diese Repräsentanten können stellvertretend für die Gesamtmenge dem Benutzer präsentiert werden, womit er sich schneller ein Bild über die Charakteristik einer Datensammlung machen kann. Es werden drei verschiedene Verfahren vorgestellt, die sich für die Ermittlung charakteristischer Datensätze eignen. Zwei davon basieren auf Clustering Algorithmen, während das dritte Verfahren anhand des Apriori-Algorithmen häufige Teilmengen im Datenbestand lokalisiert, um daraus auf typische Datensätze zu schliessen. Die Verfahren sind anhand von realen Datenbeständen auf ihre Zweckmässigkeit überprüft worden. Dazu wurde eine in Java geschriebene Applikaton entwickelt, welche die Algorithmen implementiert und eine grafische Benutzeroberfläche bereitstellt.
Mathias Ruoss
Klaus Dittrich
Caused by the technological progress over the last decades and the permanent increase of the global interconnectedness, today we are faced with much more information that we are able to perceive and to handle. Instead of being spported by the information technology this information overload may overhelm a user and impair its productivity. In the context of this thesis new methods are developed for determining representative records from a given dataset. These records help a user in getting an idea of the characteristics of the underlying dataset without having to examine all the data. In this thesis three different approaches for determining representative records will be proposed. Two of them are based on clustering algorithms. The last methed uses the Apriori algorithm in order to find large itemsets in the given data for deriving representative records. The presented methods have been validated against existing datasets. For this purpose a Java based tool was written that implements the proposed algorithms.
Ermittlung charakteristischer Datensätze durch Data Mining
2006
University of Zurich
dbtg