<?xml version="1.0" encoding="utf-8"?>
<export-example>
  <doc>
    <id>4046</id>
    <completedYear>2016</completedYear>
    <publishedYear/>
    <thesisYearAccepted/>
    <language>eng</language>
    <pageFirst/>
    <pageLast/>
    <pageNumber/>
    <edition/>
    <issue/>
    <volume/>
    <type>doctoralthesis</type>
    <publisherName/>
    <publisherPlace/>
    <creatingCorporation/>
    <contributingCorporation/>
    <belongsToBibliography>0</belongsToBibliography>
    <completedDate>2016-08-12</completedDate>
    <publishedDate>--</publishedDate>
    <thesisDateAccepted>2016-04-11</thesisDateAccepted>
    <title language="eng">Efficient and flexible lineage construction for probabilistic databases</title>
    <title language="deu">Effiziente und flexible Konstruktion von Abstammungsformeln für probabilistische Datenbanken</title>
    <abstract language="eng">In contrast to traditional data applications, many real-world scenarios nowadays depend on managing and querying huge volumes of uncertain and incomplete data. This new type of applications emerge, for example, when we integrate data from various sources, analyse social/biological/chemical networks or conduct privacy-preserving data mining.&#13;
A very promising concept addressing this new kind of probabilistic data applications has been proposed in the form of probabilistic databases. Here, a tuple only belongs to its table or query answer with a specific likelihood. That probability expresses the uncertainty about the given data or the confidence in the answer. The most challenging task for probabilistic databases is query evaluation. In fact, there are even simple relational queries for which determining the occurrence probability of a single answer tuple is hard for #P.&#13;
Lineage formulas constitute the central concept under investigation in this work. In short, the mechanism behind lineage formulas facilitates the representation and evaluation of events of the probability space, which is defined by a probabilistic database. On the basis of lineage formulas, we devise a framework that is designed as a combination of a relational database layer and an additional probabilistic query engine.&#13;
In particular, the following three aspects are studied:&#13;
(i) an efficient construction of lineage formulas,&#13;
(ii) an orthogonal combination of lineage optimization techniques, which are performed within the relational database layer and the probabilistic query engine, and&#13;
(iii) effective and compact data structures to represent lineage formulas within a probabilistic query engine.&#13;
The developed framework provides a novel lineage construction method that is able to construct nested lineage formulas, to avoid large tuple sets within the relational database layer tuples, and to provide full relational algebra support. In addition, the proposed system completely resolves the conflict between the contradicting query plans optimized for the relational database layer and the probabilistic query engine.</abstract>
    <abstract language="deu">Probabilistische Datenbanken standen in den letzten Jahren im Fokus intensiver Forschungsaktivitäten. Dies wurde durch eine Vielzahl von Anwendungsszenarien motiviert, in denen eine effiziente Verwaltung von großen, unsicheren Datenbeständen unabdingbar ist. Typische Anwendungsgebiete lassen sich leicht in den Bereichen der Datenextraktion und -integration, der wissenschaftlichen Datenauswertung und der Analyse von sensorischen und sozialen Netzwerken finden.&#13;
In einer probabilistischen Datenbank wird jedes Datentupel mit einer Eintrittswahrscheinlichkeit annotiert. Diese verdeutlicht, mit welcher Wahrscheinlichkeit das jeweilige Tupel zu einer bestimmten Datentabelle bzw. zu einem berechneten Anfrageergebnis gehört. Für probabilistische Datenbanken ist die Berechnung der Eintrittswahrscheinlichkeit für ein Ergebnistupel die größte Herausforderung, da dieses Problem in der Komplexitätsklasse #P liegt. Diese Klasse beinhaltet alle Probleme, die mindestens so schwer sind wie das Zählen aller erfüllenden Modelle einer aussagenlogischen Formel. Es gilt NP ⊆ #P.&#13;
Traditionell werden Auswertungsverfahren für probabilistische Datenbanken in intensionale und extensionale Ansätze unterteilt. Intensionale Ansätze greifen auf die Konstruktion und Auswertung von Abstammungsformeln zurück. Auf der Basis von Abstammungsformeln, die das zentrale Untersuchungsobjekt dieser Arbeit darstellen, können Ereignisse des Wahrscheinlichkeitsraumes einer probabilistischen Datenbank repräsentiert werden.&#13;
In der vorliegenden Dissertation wird ein System entworfen, welches als Kombination einer relationalen Datenbank-Schicht und einer zusätzlichen probabilistischen Auswertungskomponente konzipiert ist. Hierbei werden folgende drei Hauptaspekte untersucht:&#13;
(i) die effiziente Konstruktion von Abstammungsformeln,&#13;
(ii) die orthogonale Kombination von Optimierungstechniken und&#13;
(iii) die Entwicklung von effektiven und kompakten Datenstrukturen für die Kodierung von Abstammungsformeln für die probabilistische Auswertungskomponente.&#13;
Die entwickelten Techniken ermöglichen die schnelle Generierung von geschachtelten Abstammungsformeln, die Vermeidung von großen Tupel-Mengen innerhalb der relationen Datenbank-Schicht und die Unterstützung aller relationalen Anfrage-Operatoren.</abstract>
    <identifier type="urn">urn:nbn:de:kobv:co1-opus4-40460</identifier>
    <licence>Keine Lizenz vergeben. Es gilt das deutsche Urheberrecht.</licence>
    <author>Sebastian Lehrack</author>
    <subject>
      <language>eng</language>
      <type>uncontrolled</type>
      <value>Probabilistic database</value>
    </subject>
    <subject>
      <language>eng</language>
      <type>uncontrolled</type>
      <value>Lineage formula</value>
    </subject>
    <subject>
      <language>eng</language>
      <type>uncontrolled</type>
      <value>Query evaluation</value>
    </subject>
    <subject>
      <language>eng</language>
      <type>uncontrolled</type>
      <value>Uncertainty</value>
    </subject>
    <subject>
      <language>eng</language>
      <type>uncontrolled</type>
      <value>Query optimization</value>
    </subject>
    <subject>
      <language>deu</language>
      <type>uncontrolled</type>
      <value>Probabilistische Datenbank</value>
    </subject>
    <subject>
      <language>deu</language>
      <type>uncontrolled</type>
      <value>Abstammungsformel</value>
    </subject>
    <subject>
      <language>deu</language>
      <type>uncontrolled</type>
      <value>Anfrageauswertung</value>
    </subject>
    <subject>
      <language>deu</language>
      <type>uncontrolled</type>
      <value>Unsicherheit</value>
    </subject>
    <subject>
      <language>deu</language>
      <type>uncontrolled</type>
      <value>Anfrageoptimierung</value>
    </subject>
    <subject>
      <language>deu</language>
      <type>swd</type>
      <value>Probabilistisches Datenbanksystem</value>
    </subject>
    <subject>
      <language>deu</language>
      <type>swd</type>
      <value>Unsicherheit</value>
    </subject>
    <collection role="ddc" number="0">Informatik, Informationswissenschaft, allgemeine Werke</collection>
    <collection role="collections" number="">Wiss. Publikationen</collection>
    <collection role="institutes" number="">FG Datenbanken und Informationssysteme</collection>
    <thesisPublisher>BTU  Cottbus - Senftenberg</thesisPublisher>
    <thesisGrantor>BTU Cottbus - Senftenberg</thesisGrantor>
    <file>https://opus4.kobv.de/opus4-btu/files/4046/Dissertation_Sebastian_Lehrack.pdf</file>
  </doc>
</export-example>
