User Tools

Site Tools


publication

Publication details

  • Quantifizierung von Unsicherheiten in der Duplikaterkennung (Shawn Ray Söker), Bachelor's Thesis, School: Universität Hamburg, 2025-09-13
    Publication details

Abstract

Diese Arbeit untersucht die Unsicherheit in der Duplikaterkennung, einer wichtigen Problemstellung der Datenqualität im Kontext von Big Data. Moderne Verfahren wie Ditto, HierGAT und Unicorn wurden bereits mit klassischen Metriken wie Precision, Recall und F1-Score umfangreich evaluiert, aber bislang blieb unklar, wie konsistent ihre Vorhersagen tatsächlich sind, also wie häufig sie sich selbst widersprechen. Hier setzt die Arbeit an. Es wurde ein Unsicherheitsin- dex definiert, der auf der Übereinstimmung verschiedener Modellinstanzen mit unabhängigem Training basiert. In verschiedenen Experimenten wurden die Effekte von mehrfacher Ausführung, Variation der Hardware und Parametern und dem Vergleich mehrerer Verfahren analysiert. Des Weiteren wurde untersucht, ob Unsicherheit als Größe genutzt werden kann, um durch gezielte manuelle Klassifikation die Performance effizient zu steigern, und ob die Konfidenz, die Ditto ausgibt, genutzt werden kann, um die Unsicherheit vorherzusagen. Außerdem wurden die Schnittmengen verschiedener Verfahren betrachtet und besonders unsichere Datenpaare manuell und durch ChatGPT charakterisiert. Die Ergebnisse zeigen, dass die untersuchten modernen Verfahren in ihren Vorhersagen recht konsistent, aber nicht vollständig zuverlässig sind. Die experimentell bestimmte Unsicherheit erwies sich als nützliche Größe, um besonders Datenpunkte zu identifizieren, die für eine manuelle Klassifikation besonders geeignet sind. So kann die Effizienz in einem praktischen Einsatz erhöht werden. Damit liefert die Arbeit eine methodische Grundlage zur Quantifizierung von Unsicherheit und praktische Hinweise zur Nutzung unsicherer Daten in der Duplikaterkennung.

BibTeX

@misc{QVUIDDS25,
	author	 = {Shawn Ray Söker},
	title	 = {{Quantifizierung von Unsicherheiten in der Duplikaterkennung}},
	advisors	 = {Fabian Panse},
	year	 = {2025},
	month	 = {09},
	school	 = {Universität Hamburg},
	howpublished	 = {{Online \url{https://wr.informatik.uni-hamburg.de/_media/research:theses:shawn_ray_soeker_quantifizierung_von_unsicherheiten_in_der_duplikaterkennung.pdf}}},
	type	 = {Bachelor's Thesis},
	abstract	 = {Diese Arbeit untersucht die Unsicherheit in der Duplikaterkennung, einer wichtigen
			Problemstellung der Datenqualität im Kontext von Big Data. Moderne Verfahren wie Ditto,
			HierGAT und Unicorn wurden bereits mit klassischen Metriken wie Precision, Recall und F1-Score
			umfangreich evaluiert, aber bislang blieb unklar, wie konsistent ihre Vorhersagen tatsächlich
			sind, also wie häufig sie sich selbst widersprechen. Hier setzt die Arbeit an. Es wurde ein
			Unsicherheitsin- dex definiert, der auf der Übereinstimmung verschiedener Modellinstanzen mit
			unabhängigem Training basiert. In verschiedenen Experimenten wurden die Effekte von mehrfacher
			Ausführung, Variation der Hardware und Parametern und dem Vergleich mehrerer Verfahren
			analysiert. Des Weiteren wurde untersucht, ob Unsicherheit als Größe genutzt werden kann, um
			durch gezielte manuelle Klassifikation die Performance effizient zu steigern, und ob die
			Konfidenz, die Ditto ausgibt, genutzt werden kann, um die Unsicherheit vorherzusagen. Außerdem
			wurden die Schnittmengen verschiedener Verfahren betrachtet und besonders unsichere Datenpaare
			manuell und durch ChatGPT charakterisiert. Die Ergebnisse zeigen, dass die untersuchten
			modernen Verfahren in ihren Vorhersagen recht konsistent, aber nicht vollständig zuverlässig
			sind. Die experimentell bestimmte Unsicherheit erwies sich als nützliche Größe, um besonders
			Datenpunkte zu identifizieren, die für eine manuelle Klassifikation besonders geeignet sind.
			So kann die Effizienz in einem praktischen Einsatz erhöht werden. Damit liefert die Arbeit
			eine methodische Grundlage zur Quantifizierung von Unsicherheit und praktische Hinweise zur
			Nutzung unsicherer Daten in der Duplikaterkennung.},
}

publication.txt · Last modified: 2019-01-23 10:26 by 127.0.0.1

Donate Powered by PHP Valid HTML5 Valid CSS Driven by DokuWiki