Zum Hauptinhalt springen
Nicht aus der Schweiz? Besuchen Sie lehmanns.de

Partitionierung zur effizienten Duplikaterkennung in relationalen Daten (eBook)

(Autor)

eBook Download: PDF
2012 | 2012
XIV, 91 Seiten
Vieweg & Teubner (Verlag)
978-3-8348-8289-9 (ISBN)

Lese- und Medienproben

Partitionierung zur effizienten Duplikaterkennung in relationalen Daten - Uwe Draisbach
Systemvoraussetzungen
47,65 inkl. MwSt
(CHF 46,55)
Der eBook-Verkauf erfolgt durch die Lehmanns Media GmbH (Berlin) zum Preis in Euro inkl. MwSt.
  • Download sofort lieferbar
  • Zahlungsarten anzeigen

Duplikate bzw. Dubletten sind mehrere Datensätze, die das gleiche Realweltobjekt beschreiben, etwa mehrfach erfasste Kunden in einem CRM-System oder unterschiedliche Repräsentationen eines Produkts. Das Auffinden dieser Duplikate ist auch für moderne Computer eine komplexe und zeitintensive Aufgabe. Uwe Draisbach vergleicht zwei der einschlägigen Partitionierungsstrategien, die eine intelligente Auswahl von zu vergleichenden Datensatzpaaren treffen. Daraus entwickelt er ein verallgemeinertes Verfahren und zeigt, dass eine intelligente Auswahl der Datensatzpaare den Aufwand signifikant reduzieren kann, ohne die Qualität der Duplikaterkennung wesentlich zu verringern.

 

Die Arbeit wurde mit dem 'Information Quality Best Master Degree Award' der Deutschen Gesellschaft für Informations- und Datenqualität ausgezeichnet.



Uwe Draisbach studierte Informatik an der FernUniversität Hagen und ist wissenschaftlicher Mitarbeiter am Hasso-Plattner-Institut in Potsdam.

Uwe Draisbach studierte Informatik an der FernUniversität Hagen und ist wissenschaftlicher Mitarbeiter am Hasso-Plattner-Institut in Potsdam.

Duplikaterkennung.- Blocking-Verfahren.- Windowing-Verfahren.- Vergleich Blocking- und Sorted-Neighborhood-Methode.- Verallgemeinertes Verfahren

Erscheint lt. Verlag 9.3.2012
Reihe/Serie Ausgezeichnete Arbeiten zur Informationsqualität
Ausgezeichnete Arbeiten zur Informationsqualität
Zusatzinfo XIV, 91 S. 28 Abb., 6 Abb. in Farbe.
Verlagsort Wiesbaden
Sprache deutsch
Themenwelt Mathematik / Informatik Informatik Datenbanken
Schlagworte nn
ISBN-10 3-8348-8289-5 / 3834882895
ISBN-13 978-3-8348-8289-9 / 9783834882899
Informationen gemäß Produktsicherheitsverordnung (GPSR)
Haben Sie eine Frage zum Produkt?
PDFPDF (Wasserzeichen)

DRM: Digitales Wasserzeichen
Dieses eBook enthält ein digitales Wasser­zeichen und ist damit für Sie persona­lisiert. Bei einer missbräuch­lichen Weiter­gabe des eBooks an Dritte ist eine Rück­ver­folgung an die Quelle möglich.

Dateiformat: PDF (Portable Document Format)
Mit einem festen Seiten­layout eignet sich die PDF besonders für Fach­bücher mit Spalten, Tabellen und Abbild­ungen. Eine PDF kann auf fast allen Geräten ange­zeigt werden, ist aber für kleine Displays (Smart­phone, eReader) nur einge­schränkt geeignet.

Systemvoraussetzungen:
PC/Mac: Mit einem PC oder Mac können Sie dieses eBook lesen. Sie benötigen dafür einen PDF-Viewer - z.B. den Adobe Reader oder Adobe Digital Editions.
eReader: Dieses eBook kann mit (fast) allen eBook-Readern gelesen werden. Mit dem amazon-Kindle ist es aber nicht kompatibel.
Smartphone/Tablet: Egal ob Apple oder Android, dieses eBook können Sie lesen. Sie benötigen dafür einen PDF-Viewer - z.B. die kostenlose Adobe Digital Editions-App.

Buying eBooks from abroad
For tax law reasons we can sell eBooks just within Germany and Switzerland. Regrettably we cannot fulfill eBook-orders from other countries.

Mehr entdecken
aus dem Bereich
Der Leitfaden für die Praxis

von Christiana Klingenberg; Kristin Weber

eBook Download (2025)
Carl Hanser Fachbuchverlag
CHF 48,80