Publication details
- Quantifizierung von Unsicherheiten in der Duplikaterkennung (Shawn Ray Söker), Bachelor's Thesis, School: Universität Hamburg, 2025-09-13
Publication details
Abstract
Diese Arbeit untersucht die Unsicherheit in der Duplikaterkennung, einer wichtigen Problemstellung der Datenqualität im Kontext von Big Data. Moderne Verfahren wie Ditto, HierGAT und Unicorn wurden bereits mit klassischen Metriken wie Precision, Recall und F1-Score umfangreich evaluiert, aber bislang blieb unklar, wie konsistent ihre Vorhersagen tatsächlich sind, also wie häufig sie sich selbst widersprechen. Hier setzt die Arbeit an. Es wurde ein Unsicherheitsin- dex definiert, der auf der Übereinstimmung verschiedener Modellinstanzen mit unabhängigem Training basiert. In verschiedenen Experimenten wurden die Effekte von mehrfacher Ausführung, Variation der Hardware und Parametern und dem Vergleich mehrerer Verfahren analysiert. Des Weiteren wurde untersucht, ob Unsicherheit als Größe genutzt werden kann, um durch gezielte manuelle Klassifikation die Performance effizient zu steigern, und ob die Konfidenz, die Ditto ausgibt, genutzt werden kann, um die Unsicherheit vorherzusagen. Außerdem wurden die Schnittmengen verschiedener Verfahren betrachtet und besonders unsichere Datenpaare manuell und durch ChatGPT charakterisiert. Die Ergebnisse zeigen, dass die untersuchten modernen Verfahren in ihren Vorhersagen recht konsistent, aber nicht vollständig zuverlässig sind. Die experimentell bestimmte Unsicherheit erwies sich als nützliche Größe, um besonders Datenpunkte zu identifizieren, die für eine manuelle Klassifikation besonders geeignet sind. So kann die Effizienz in einem praktischen Einsatz erhöht werden. Damit liefert die Arbeit eine methodische Grundlage zur Quantifizierung von Unsicherheit und praktische Hinweise zur Nutzung unsicherer Daten in der Duplikaterkennung.
BibTeX
@misc{QVUIDDS25,
author = {Shawn Ray Söker},
title = {{Quantifizierung von Unsicherheiten in der Duplikaterkennung}},
advisors = {Fabian Panse},
year = {2025},
month = {09},
school = {Universität Hamburg},
howpublished = {{Online \url{https://wr.informatik.uni-hamburg.de/_media/research:theses:shawn_ray_soeker_quantifizierung_von_unsicherheiten_in_der_duplikaterkennung.pdf}}},
type = {Bachelor's Thesis},
abstract = {Diese Arbeit untersucht die Unsicherheit in der Duplikaterkennung, einer wichtigen
Problemstellung der Datenqualität im Kontext von Big Data. Moderne Verfahren wie Ditto,
HierGAT und Unicorn wurden bereits mit klassischen Metriken wie Precision, Recall und F1-Score
umfangreich evaluiert, aber bislang blieb unklar, wie konsistent ihre Vorhersagen tatsächlich
sind, also wie häufig sie sich selbst widersprechen. Hier setzt die Arbeit an. Es wurde ein
Unsicherheitsin- dex definiert, der auf der Übereinstimmung verschiedener Modellinstanzen mit
unabhängigem Training basiert. In verschiedenen Experimenten wurden die Effekte von mehrfacher
Ausführung, Variation der Hardware und Parametern und dem Vergleich mehrerer Verfahren
analysiert. Des Weiteren wurde untersucht, ob Unsicherheit als Größe genutzt werden kann, um
durch gezielte manuelle Klassifikation die Performance effizient zu steigern, und ob die
Konfidenz, die Ditto ausgibt, genutzt werden kann, um die Unsicherheit vorherzusagen. Außerdem
wurden die Schnittmengen verschiedener Verfahren betrachtet und besonders unsichere Datenpaare
manuell und durch ChatGPT charakterisiert. Die Ergebnisse zeigen, dass die untersuchten
modernen Verfahren in ihren Vorhersagen recht konsistent, aber nicht vollständig zuverlässig
sind. Die experimentell bestimmte Unsicherheit erwies sich als nützliche Größe, um besonders
Datenpunkte zu identifizieren, die für eine manuelle Klassifikation besonders geeignet sind.
So kann die Effizienz in einem praktischen Einsatz erhöht werden. Damit liefert die Arbeit
eine methodische Grundlage zur Quantifizierung von Unsicherheit und praktische Hinweise zur
Nutzung unsicherer Daten in der Duplikaterkennung.},
}